Unsloth 发布本地训练决策模型教程与开源仓库
Unsloth 发布本地训练教程与开源仓库,可将 Qwen3.8、Gemma 4 等 LLM 微调为输出选项概率的决策模型。Unsloth 报告,Qwen3.5 0.8B 在三个决策基准上的合计准确率从 20.7% 提升至 74.3%,并称仅需 4GB 显存。
Unsloth 发布本地训练教程与开源仓库,可将 Qwen3.8、Gemma 4 等 LLM 微调为输出选项概率的决策模型。Unsloth 报告,Qwen3.5 0.8B 在三个决策基准上的合计准确率从 20.7% 提升至 74.3%,并称仅需 4GB 显存。
逛逛GitHub 汇总了三款最近爆火的个人 Agent 的开源平替项目。Rakazo 定位 Grok Bot 的开源替代,每个 Bot 拥有独立对话、记忆和例行任务,可接入模型并配置浏览器、终端、文件和图形桌面环境,支持多 Bot 分工与子 Agent。
谷歌于 10 月 6 日开源 EmbeddingGemma 2,这是其首个原生多模态开源嵌入模型,可把文字、代码、图片、视频、音频放进同一个 768 维空间并用一句话检索。
Cloudflare 在 Birthday Week 期间发布开源权重决策模型 Clef,包含 27B 多模态模型和面向延迟敏感场景的 9B 模型 Clef-Flash,输入为状态与带类型问题的 schema,输出每个候选项的概率,不生成自由文本。
OpenAI 在 DevDay 发布的 Dots 回到 ChatGPT 式聊天形态,但存在记忆不共享、语音聊天要响两声才接、云电脑完全不开放等缺口;Meta 的 Muse 则提供 SDK 和适配 ESP32 的 AgentReady 通用固件,可直刷设备。
OpenAI宣布搭载智能界面(Intelligent UI)的GPT-6面向全球ChatGPT用户推出,Plus、Pro、Business和Enterprise用户先行,Free和Go用户次日起可用;其作答改为边想边答,联网搜索问题平均比上一代提前44%开始作答。
海洋具身智能公司卫澜深海在 9 个月内完成 5 轮融资,轮次推进至天使++++轮,核心股东包括深创投、元禾原点,资金用于训练水下具身智能模型、建设水下具身智能训练中心及深化海洋油气能源场景应用。
Mistral 发布原生多模态 MoE 模型 Mistral Large 4(昵称“Le Chonk”)公开预览,总参数 1 万亿、激活约 490 亿,可通过 Mistral Studio API 试用,权重计划月底发布。
Nous Research 以 15 亿美元估值完成 9000 万美元 B 轮融资,本轮由 Robot Ventures 领投,Nvidia、Union Square Ventures、Menlo Ventures、Samsung 等参投,公司累计融资达 1.58 亿美元。
LangChain 的 Interrupt London 将于下周二举行,Orange 和 OVO 将到场分享智能体在生产环境中的实际落地经验。活动还设有 Deep Agents 与 Engine 的动手实践工作坊。
在智能体搜索中,GPT-OSS-120B 智能体调用 9B 模型正确回答了 BrowseComp+ 上 64.0% 的问题,比次优的 ColBERT 模型高出 4.9 个百分点,且搜索次数少于所有基线。
微软亚洲研究院开源 Agent Lightning v1.0,一个约 3500 行的轻量智能体强化学习框架,提出 Harnessed Agentic RL 范式,让部署时使用的同一套 agent harness 直接参与训练,只需把模型端点指向其 LLM 代理即可接入。
Milvus 面向题库检索提出一套五步架构,将语义检索、BM25 关键词搜索和标量过滤结合:用教育领域微调的嵌入向量做语义匹配,用内置 BM25 函数做关键词检索,再以 HNSW/COSINE 稠密向量索引、稀疏索引和标量索引组合,通过 WeightedRanker 或 RRFRanker 合并结果,最后用 Cross-Encoder 重排,支持组卷、错题复习推荐和题目搜索。
Latent Space 文章讨论 Stacklok 提出的“云原生 harness”思路,认为编码智能体可像容器一样由 Kubernetes 式控制循环管理。
OpenAI 于 2026 年 10 月 6 日发布消息称,用一个尚未公开的内部前沿模型一次性产出 722 篇数学手稿,整理为 372 个结果,来自对约 4000 个开放研究问题的评估,平均每个结果算力约相当于 ChatGPT Pro 思考 3 小时,成果全部放在 Apache-2.0 协议的 GitHub 仓库 openai/math 中。
OpenAI 以 GitHub 仓库而非期刊公开内部模型的数学产出,读者可了解其披露方式与研究协作的新变化。
橘AI 发布开源 MIT 许可的「播客转文章」Skill,用于把播客逐字稿改写成文章。其核心做法是按话题而非时间线重新梳理内容,并规定数字和原话一条都不砍,只删掉与本节无关的段子、蹭新闻和举例。作者称实测阅读量与互动不错,用户反馈没有人吐槽 AI 味儿。
Mistral 发布新旗舰 Mistral Large 4,总参数 1 万亿,采用混合专家架构,每个 token 激活 490 亿参数,权重将于月底全部开源。
通过第三方智能指数与多项细分基准的横向对比,读者可以看到开源万亿参数模型与闭源旗舰之间的实际差距。
Mistral 发布旗舰模型 Mistral Large 4 公开预览版,采用 MoE 架构、总参数 1 万亿、每次推理激活 490 亿参数,支持 100 万 Token 上下文窗口,权重计划 10 月 27 日开放。派拉蒙天空之舞以约 1100 亿美元完成对华纳兄弟探索的收购,合并后更名 Skydance。月之暗面完成最后一轮私募融资,估值约 500 亿美元,拟明年第一季度在香港 IPO。
OpenAI 在 28 天挑战中为 GPT-6 Astra 和 Sol 提速 50% 至 50 tokens/s,并上线免费 auto-review 与 ChatGPT Meetings 插件;Gemini 4 Argon 发布,主打长时间多步骤编码与网络防御,输出上限 100 万 token。
美国创业公司 Reflection 发布首款开放权重模型 Beam,一天后 Mistral 推出 Mistral Large 4,两家公司发布时的主要比较对象均为 GLM、Kimi、DeepSeek、Qwen 等中国模型。
OpenAI 从一个未发布内部前沿模型公开了 722 篇数学手稿,归入 372 个结果族,来自约 4000 个研究问题的评测,平均每个结果约消耗 3 小时 ChatGPT Pro 推理算力,同时发布论文、证明工件与部分推理摘要,模型本身仍未公开。
汇总了 OpenAI 内部数学模型的稿件规模与算力投入,以及 Mistral、Google 等多个同期发布的对照信息。
xAI Cookbook 更新了 5 个新 App,加上原先的 5 个,组成 Grok API 示例集,每个围绕一个真实可跑的产品级场景,覆盖实时语音智能体(4 个)、多模态生成流水线(4 个)、X 实时数据分析(2 个)四条主线,开源地址为 github.com/xai-org/xai-co。
Naval 认为模型是软件最后的护城河:AI 能用文章训练后重写文章、能反编译软件并重新编码、能吸收艺术再创作。但 AI 自身不愿被"蒸馏",预计更多软件会退守服务器端以抵抗"蒸馏"。
Google 开源 EmbeddingGemma 2,这是一个可在手机和电脑本地运行的多模态嵌入模型,文字、图片、视频、音频和代码可放进同一套坐标系,不联网也能用一句话检索内容。
OpenAI 发布了 722 篇由 AI 撰写的数学论文,成果已打包上传至 GitHub 仓库,但这些声明尚未得到外部数学家证实。平均每道难题的解法消耗 ChatGPT Pro 深度思考约三小时算力,OpenAI 同步给出大量 Lean 代码用于机器核验证明,并开源技术细节与模型推理过程。
OpenAI 将内部未发布模型产出的 722 篇数学论文归成 372 组结果,全部放在 GitHub 仓库 openai/math 公开。该模型从 8 月 28 日开始训练,能力比已发布的 GPT-6 Astra 更强且尚未对外开放;约 160 篇主要结论附带 Lean 形式化证明,其余论文尚未形式化,OpenAI 承认其中可能有错并保留修订历史。
GitHub 表示 2025 年 9 月至 2026 年 8 月间 Git 活动翻了一倍以上,达到每月 473.3B 次事件。GitHub 正在服务持续运行的同时重建 Git 基础设施,为智能体规模的软件开发打基础。
Google DeepMind 的 EmbeddingGemma 2 现已上线 Ollama,可通过 `ollama pull embeddinggemma-2` 获取。该模型面向消费级设备,是 Google DeepMind 首个原生多模态开源端侧嵌入模型,除文本外还将代码、图像、音频和视频统一到同一嵌入空间。
小米发现只以通过测试为目标的模型会添加未被要求的代码并让错误静默通过,于是将每项测试结果乘以质量清单评分来修正。结果 MiMo-V2.6-Pro RL 在 Artificial Analysis 的 Intelligence Index 上以 46 分领先开源权重模型。
Google DeepMind 发布 EmbeddingGemma 2,基于 Gemma 4 架构、740M 参数、Apache 2.0 许可,将文本、代码、图像、视频和音频映射到统一嵌入空间。
Google 发布 EmbeddingGemma 2,这是其首个原生多模态嵌入模型,基于 Gemma 4 构建,采用 Apache 2.0 许可。它可将 100 多种语言以及代码、图像、音频和视频嵌入同一个向量,上下文长度 8,192,提供 740M omni、440M text+vision、570M text+audio 和 270M text-only 四种规格。
Mistral 发布 Mistral Large 4(Le Chonk),1T 参数、原生多模态、49B 激活参数,官方称其是欧美聚合基准上最好的开放权重模型,在视觉 grounding 上超过闭源前沿模型。
作者推荐开源项目 Overmind,认为应通过挖掘 agent traces 中的知识来掌控自己的智能栈。Overmind 能从代码和 traces 构建上下文图、整理训练与评估数据集、评估提示词和模型,并训练出用户自己拥有的更小专用模型。项目地址为 github.com/overmind-core/。
NVIDIA 的 Nemotron Labs 发布新一期内容,介绍如何借助 Artificial Analysis 评测开源模型,并附上直播回放链接。
Google DeepMind 发布 EmbeddingGemma 2,称这是其首个原生多模态的端侧嵌入开源模型。该模型在文本之外统一了代码、图像、音频和视频,把它们映射到同一个共享空间。
Datawhale 发布开源中文教程《Jev Cookbook》,面向 System One 决策模型,包含 11 章系统讲解与 18 篇可运行的 Jupyter Notebook,从 Choice、Score、Noul 三种核心原语讲起,覆盖 RAG 引用过滤、动态工具路由、风险拦截等接入场景。
Google DeepMind 发布 EmbeddingGemma 2,一个将文本、代码、图像、视频和音频映射到统一嵌入空间的轻量多模态嵌入模型,基于 Gemma 4 架构、Apache 2.0 许可,参数量 7.4 亿。
Mistral 发布 Mistral Large 4(代号 Le Chonk),1T 参数、原生多模态、49B 激活参数,官方称其是美国或欧洲聚合基准上最好的开源权重模型。
Mistral AI 发布 Mistral Large 4(代号 Le Chonk),1T 参数、原生多模态,49B 激活。官方称其在美国或欧洲开源权重模型中聚合基准表现最佳,在网络安全、制造和金融等关键负载上达到 SOTA,并在视觉 grounding 上超过闭源前沿模型。该模型由欧洲端到端打造,可通过 Mistral Cloud 部署,即日起开放 API,开放权重版本将于 10 月底发布。
Mistral AI 发布 Mistral Large 4(代号 Le Chonk),1T 参数、原生多模态、49B 激活,号称是美欧聚合基准上最好的开放权重模型。该模型在网络防御、制造和金融等关键负载达到 SOTA,视觉 grounding 超过闭源前沿模型,端到端在欧洲锻造并可通过 Mistral Cloud 从欧洲部署,今日起 API 全面可用,开放权重将于十月底发布。
Mistral Large 4 以 1T 参数、49B 激活的开放权重形态发布,可对照其与闭源前沿模型的基准位置。