Google Gemini 4 "Carbon" 模型据称编码性能追平 Anthropic Opus 5.5
据 Business Insider 看到的内部文件与聊天记录,Google 正在测试 Argon、Barium、Carbon 三个 Gemini 4 变体,其中 Carbon 已部署在内部编码平台 Jetski 上,被认为在编程任务上强于 Argon,有员工将其比作 Anthropic 最强的编码模型 Opus 5.5,但仍需更多测试。
据 Business Insider 看到的内部文件与聊天记录,Google 正在测试 Argon、Barium、Carbon 三个 Gemini 4 变体,其中 Carbon 已部署在内部编码平台 Jetski 上,被认为在编程任务上强于 Argon,有员工将其比作 Anthropic 最强的编码模型 Opus 5.5,但仍需更多测试。
OpenAI 发布了一款未公开内部模型生成的 722 篇数学手稿,按 372 个相关结果族归类,来自约 4000 道研究问题的评测。OpenAI 称标准流程每条结果平均消耗约三小时 ChatGPT Pro 的思考算力,此次发布包含论文、证明产物和部分推理摘要,模型本身仍未发布。
微软新模型 Microsoft-Decision-1 上线 OpenRouter,由 Qwen3.5-9B 后训练而来,主打快速决策任务。微软给出的数据是:在 36 个盲测基准(约 15 万道题)上准确率最高,比第二名快 4.5 倍,比 GPT-6 Sol 快 35 倍,扰动输入下仅 1.3% 的决策发生翻转。
Microsoft 发布新的快速决策模型 Microsoft-Decision-1,官方称其在结构化决策任务上表现领先,延迟和质量均优于 LLM 与其他决策模型。该模型已在 Microsoft 内部用于事件响应、质量控制和科学发现等场景。作者表示会将其加入自己的评测清单,并指出这类决策模型在一致性和更复杂决策上仍存在困难。
微软发布新模型 Microsoft-Decision-1,面向快速决策场景,在结构化决策任务上性能领先,在延迟和质量上优于 LLM 及其他决策模型。该模型已在微软内部测试,应用范围涵盖事件响应、质量控制和科学发现。
AutoTrust AI Lab 开源基于 Qwen3.8-27B 的多模态决策模型 JEV-27B-VL,融合 System 1 快速决策与 System 2 深度推理,可视为能“看见”的 JEV-27B。
OpenAI 发布数学成果,被 Opus 称为"史上影响最深远的一次数学成果发布"。LLM 已在 7 个千禧年大奖难题中的 4 个上取得实质性进展,但该判断的前提是相关结果需要通过验证。
Anthropic 的 Claude Haiku 5.5 已在 OpenRouter 上线。OpenRouter 称这是首个支持 reasoning efforts 的 Haiku 模型,价格比上一代便宜约 75%,速度实测 100+ TPS,基准测试中能力也有明显提升,可通过 openrouter.ai/anthropic/clau… 使用。
Anthropic 发布 Claude Haiku 5.5,10 万 Token 以内请求每百万 Token 输入 0.1 美元、输出 0.5 美元,比 Haiku 4.5 便宜 90%,官方估算平均运行成本降约 75%。
Anthropic 发布 Claude Haiku 5.5,OSWorld 2.1 评测从上一代 15.7% 提升到 72.4%,平均运行成本下降约 75%,并首次支持可调节推理强度的 Adaptive Thinking 与 100 万 Token 上下文。
Anthropic 发布 Claude Haiku 5.5,这是 Haiku 系列约一年来的首次更新,定价与 OpenAI 的 GPT-6 Luna 持平,同日 Sonnet 5.5 缓存读取价格减半并推出订阅 API 额度。
汇总了 Haiku 5.5 的定价、第三方评测与 token 消耗代价,读者可据此判断小型模型在智能体工作流中的实际位置。
Mistral 发布原生多模态 MoE 模型 Mistral Large 4(昵称“Le Chonk”)公开预览,总参数 1 万亿、激活约 490 亿,可通过 Mistral Studio API 试用,权重计划月底发布。
DeepSeek 针对智能体"读多写少"的特点压缩了其记忆机制,每 token 仅占 890 字节缓存,比 DeepSeek-V1 小 437 倍。输入从 4K 扩展到 1M 时,每输出 token 的算力增加 25%。Flash 在 AA Index 上以 39 比 36 超过 V4-Pro,价格为每百万 token 0.27 美元对 0.67 美元。
Anthropic 发布快速低价模型 Claude Haiku 5.5,价格与 OpenAI 上月发布的 GPT-6 Luna 完全一致,为每百万 token 输入 0.10 美元。
在 Harvey 的法律智能体基准 LAB(Legal Agent Benchmark)上,Mistral Large 4 成为排名第一的开源模型(oss model)。该结果由 Mistral AI 公布,评测针对法律领域的智能体任务。
美国创业公司 Reflection 发布首款开放权重模型 Beam,一天后 Mistral 推出 Mistral Large 4,两家公司发布时的主要比较对象均为 GLM、Kimi、DeepSeek、Qwen 等中国模型。
Vercel 在 AI Gateway 上线隐身模型 Glyph Cluster,Pro 和 Enterprise 套餐且购买了 AI Gateway 额度的团队在隐身期可免费使用。
OpenAI 发布一批由内部前沿模型产出的新数学结果,相关代码与内容放在 github.com/openai/math。OpenAI 表示在发布过程中咨询了 Institute for Advanced Study 的数学与人工智能独立顾问组,并参考其建议与公开推荐来确定发布方式。
Mistral AI 发布 Mistral Large 4,并以其在 CTF 挑战中的表现展示推理能力。官方称在包含工具调用、解题时间均来自真实运行记录的 CTF speedrun 中,该模型解出 19 道题中的 18 道。
Reflection 预告其首个西方开源模型 Beam,采用 MoE 架构,总参数 501B、激活参数 23B,推理效率比 GLM 5.2 高 3–4 倍,官方称以 GLM 5.2 三分之一到四分之一的推理成本达到相当能力水平。
Reflection 发布 Beam,一个面向智能体的开源权重模型,总参数 501B、激活参数 23B,从零端到端训练,完整权重本月发布。转发的评价称其推理效率比 GLM 5.2 等竞品高 3-4 倍,在编码与智能体任务上推进了西方开源前沿。
StartLux(原点星辉)开源决策模型 StartLux-Decision,一次推出 0.8B、2B、4B、9B 和 27B 五档版本,并提供支持本地部署的量化模型。
蚂蚁百灵新一代大模型 Ling-3.1-Flash 在「Teenage Engineering 风格信息卡」提示词测试中一把过,输出效果达标。该模型为 560B/A25B MoE 架构,支持 1M token 上下文,输出速度基本维持在 100+ tokens/s,整个推理生成与校验流程约 2-3 分钟完成。
Google 发布 Gemini 4 Argon,目前仅通过 Fairwind 计划对少量网络安全合作伙伴开放,后续先向付费 API 用户和 Google AI Ultra 订阅者开放。
谷歌宣布推出新一代模型 Gemini 4 Argon,重点面向长流程软件工程、法律与金融等企业知识工作以及网络安全防御;输出 Token 上限从此前 64K 提升至 100 万。
Google 今天预告 Gemini 4 Argon,称其在真实软件工程、知识工作和网络安全防御等复杂工作流中达到前沿性能,并具备行业领先的 1M token 输出上限。Google 表示将尽快且尽可能安全地开放该模型,发布前仍会快速迭代。
Google 宣布推出新前沿模型 Gemini 4 Argon,定位于在复杂长程工作流中维持深度推理,并在真实软件工程、法律与金融等企业知识工作以及网络安全防御中提供前沿性能。该模型输出 token 上限提升至业界领先的 1M tokens,目前正通过 Fairwind Program 向一批受信任的网络防御者开放,并将尽快扩大可用范围。
Google DeepMind 发布 Argon,具备 1M token 输出上限,并加入更深层的推理能力,用于一次性处理长链路、多步骤问题。官方表示将参考早期测试者的反馈完善系统,随后会逐步向开发者、企业和消费者开放。
Google DeepMind 发布新前沿模型 Gemini 4 Argon,通过 Fairwind Program 先向受信任的网络安全防御方开放,后续将逐步提供给开发者、企业和消费者,起价为每百万输入 token 2 美元、每百万输出 token 10 美元,缓存输入按输入价 95% 折扣计费。
原文给出了输出上限、基准成绩与定价,读者可以据此判断它在长程工程与网络安全任务上的定位。
Fireworks 的 Ember-1 已可在 Fireworks Serverless 上调用,Vals AI 的独立测试显示其在金融和法律基准上表现接近 Kimi K3,同时每轮推理 token 用量更少。每轮 token 更少意味着单次调用成本更低、智能体循环更快。
对 GPT-6.1 Sol 在文档 OCR 任务上的综合基准测试显示,其表格解析能力与阅读顺序较一周前的 GPT-6 Sol 有明显提升,表格解析水平已接近 GPT-6 Astra。前沿模型在文档解析上仍通常比高性价比方案贵一个数量级,但这也意味着"高端"档位(每页超过 1 美分)的能力提升空间很大。
InclusionAI 的 Ling 3.1 Flash 已在 AI Gateway 上线,10 月 13 日前免费使用。该模型为混合推理语言模型,总参数 560B、每 token 激活 25B,在 AI Gateway 上支持 262K token 上下文窗口,面向编码、多步分析与工具调用智能体。
6.1 Sol 发布,据 Tibo 介绍,其智能水平接近 Astra,价格仅为 Astra 的五分之一,并提供 95% 的缓存读取折扣。该模型被形容为绝对的主力机型,配合 ultrafast 可在 Astra 上实现 8 倍速度,该加速也即将支持 6.1 Sol。
OpenAI 发布 GPT-6.1 Sol,主打让前沿智能更可负担,开发者可以更大规模地构建和运行应用。缓存输入价格为每百万 tokens 0.10 美元,比标准输入价格低 95%,比 GPT-6 Sol 的缓存输入价格低 50%。
Anthropic 发布 Claude Sonnet 5.5,API 单价没变、生成速度更快,Terminal-Bench、CursorBench 等 Agent benchmark 成绩明显上涨。
Qdrant 的 /4 Nano 和 Zero 专门训练用于生成与 Stella 文档嵌入兼容的向量,因此无需重建文档索引即可在两者间切换,权衡检索质量与查询延迟。其中 Zero 极其轻量,Nano 是小型 Transformer,检索质量更接近 Stella。
Anthropic 的 Claude 账号发帖询问用户正在用 Sonnet 5.5 探索什么,该帖获得 179 个点赞、44 条回复和 52626 次浏览。帖子未披露 Sonnet 5.5 的任何新功能、参数或发布信息。
Fireworks Research 发布 Ember-1,一个基于 Kimi K3 构建的专用模型,目标是让每个 token 发挥更大作用。官方称其推理链更短,token 用量约减少 40%,同时保持顶级质量,模型页面见 fireworks.ai/models/firewor…。
小米发布 MiMo-V2.6,包含 Pro 和 Flash 两个全模态模型,通过规模化强化学习推进,并可开放获取模型权重、技术报告、强化学习环境与训练代码。Pro 在多数智能体基准上与 Claude Opus 5 和 GPT-5.6 Sol 表现相当,在 Artificial Analysis 智能指数上得分 46,为开源模型中最高,同时在编码、电脑操作、3D 推理和创作能力上更强。
小米发布 MiMo-V2.6 双版本开源权重模型,并给出与闭源前沿模型在智能体基准上的对照成绩。
Simon Willison 指出 GPT-6 Luna 的价格是 5.6 Luna 的一半,而后者在能力表现下已经相当便宜。他称 Luna 因成本与速度是自己构建产品功能时最喜欢的模型。所引 OpenAI 内容称 GPT-6 Sol 与 GPT-6 Luna 基于 GPT-6 Astra 的技术进展,相比 GPT-5.6 促销价 API 价格降低 50%,同时提升了缓存与推理效率。