Google Gemini 4 "Carbon" 模型据称编码性能追平 Anthropic Opus 5.5
据 Business Insider 看到的内部文件与聊天记录,Google 正在测试 Argon、Barium、Carbon 三个 Gemini 4 变体,其中 Carbon 已部署在内部编码平台 Jetski 上,被认为在编程任务上强于 Argon,有员工将其比作 Anthropic 最强的编码模型 Opus 5.5,但仍需更多测试。
据 Business Insider 看到的内部文件与聊天记录,Google 正在测试 Argon、Barium、Carbon 三个 Gemini 4 变体,其中 Carbon 已部署在内部编码平台 Jetski 上,被认为在编程任务上强于 Argon,有员工将其比作 Anthropic 最强的编码模型 Opus 5.5,但仍需更多测试。
OpenAI 发布了一款未公开内部模型生成的 722 篇数学手稿,按 372 个相关结果族归类,来自约 4000 道研究问题的评测。OpenAI 称标准流程每条结果平均消耗约三小时 ChatGPT Pro 的思考算力,此次发布包含论文、证明产物和部分推理摘要,模型本身仍未发布。
Google 内部正在测试新模型 Carbon,部署在内部 AI 编程工具 Jetski 上,有员工称其编码能力“感觉像 Opus 5.5”。Carbon 是在 9 月 30 日发布的 Gemini 4 Argon(内部版本 Barium-B)之后训练出的新版本,将作为 Argon 升级还是独立发布尚不清楚。
微软新模型 Microsoft-Decision-1 上线 OpenRouter,由 Qwen3.5-9B 后训练而来,主打快速决策任务。微软给出的数据是:在 36 个盲测基准(约 15 万道题)上准确率最高,比第二名快 4.5 倍,比 GPT-6 Sol 快 35 倍,扰动输入下仅 1.3% 的决策发生翻转。
微软推出新模型 Microsoft-Decision-1,专做选择题式判断,不生成文章也不聊天,给定选项后快速判断该选哪个并给每个选项打概率分,已在 Microsoft Foundry 上线,之后会上 OpenRouter。
Cloudflare 发布 Clef-omni,在文本和图像之外新增音频(wav/mp3)与视频(mp4/webm)输入,基于 Qwen3-Omni-30B-A3B-Instruct MoE 构建并已在 Hugging Face 开放权重,定价为每百万输入 token 0.15 美元。
Microsoft 发布新的快速决策模型 Microsoft-Decision-1,官方称其在结构化决策任务上表现领先,延迟和质量均优于 LLM 与其他决策模型。该模型已在 Microsoft 内部用于事件响应、质量控制和科学发现等场景。作者表示会将其加入自己的评测清单,并指出这类决策模型在一致性和更复杂决策上仍存在困难。
微软发布新模型 Microsoft-Decision-1,面向快速决策场景,在结构化决策任务上表现领先,在延迟和质量上优于 LLM 及其他决策模型。该模型已在微软内部多个场景测试,涵盖事件响应、质量控制和科学发现。
Ideogram 4.5 在 Artificial Analysis 的 30 轮连续编辑测试中保持了原图稳定,而 GPT Image 2.5 Sunburst 出现明显漂移。
OpenAI 推出 GPT-6.1 Sol 的 Ultrafast 版本,速度是标准版的 8 倍,官方称智能水平与标准版一致且逼近旗舰 Astra。
阶跃星辰的 Step 5 Preview 发布一天后登上 OpenRouter Trending 第一名,并已在 Kilo Code、Cline、Hermes Agent 和 OpenCode 中可用。
Fish Audio 开放 Drama 3 Preview 的使用入口:API 调用时需将模型设为 [drama-3-preview],文档见 docs.fish.audio/api-reference/;网页端可在 fish.audio/app/text-to-sp… 选择 Fish Audio Drama 3(Preview)模型使用。
HeyGen 推出语音模型 HeyGen Voice,在 Artificial Analysis TTS 排行榜盲测中超越所有主流模型登顶第一,现已在 HeyGen 平台和 API 上线。10 月 31 日前 API 用户自动享受五折优惠,价格从 $30 降至 $15 每百万字符。
Anthropic 发布小型模型 Claude Haiku 5.5,平均价格比 Haiku 4.5 低约 75%,10 万 token 以内的提示词最高降价 90%,同时 Sonnet 5.5 的缓存读取价格减半。
Qwen 发布一条以「Pics」为主题的内容,附带 4 条回复、4 次转发、112 次点赞和 20624 次浏览的数据,互动数据由 xgo.ing 提供支持。
阿里 Qwen 团队发布 Qwen-Image-2.1-Turbo,称只需 8 个去噪步骤即可生成和编辑图像,并已开放权重。该模型基于 Qwen-Image-2.1,是在同一 7B 视觉生成架构上的加速检查点,官方称仍能由文本生成 2K 图像,并支持通过自然语言编辑继续创作,例如添加配饰或更换场景。
Aether AI 发布 CRIS-0,把因果智能体与因果世界模型在统一因果状态表示下打通,通过统一工具接口调度机械臂完成家庭任务。在咖啡、微波炉、垃圾分拣等真机测试中,系统面对物体移位等扰动平均 2 秒内重置规划,10 次强干扰测试成功恢复 9 次,长程任务靠阶段验证制切断误差累积。公司称目前跑通技术四层金字塔的前两层,后续需补上消融实验数据与更复杂环境下的泛化验证。
Google AI Studio 推出最新图像生成模型 NanoBanana 2.1,官方称其在视觉设计、基于 mask 的编辑、主体一致性和图像自然度上全面优于此前模型,并已在 ai.studio 上线。LovartAI 转发了这条发布信息,并配文称用 Lovart 制作的效果出色。
AutoTrust AI Lab 开源基于 Qwen3.8-27B 的多模态决策模型 JEV-27B-VL,融合 System 1 快速决策与 System 2 深度推理,可视为能“看见”的 JEV-27B。
OpenAI 在疯狂 28 天计划的 Day 3 推出 GPT-6.1 Sol ultrafast。
谷歌下一代模型 Gemini 4 Argon 尚未官宣,已被曝密集现身多个平台,最快将于本周甚至数小时内发布。爆料称其发布卡片已上线谷歌内部系统及部分 Pro 用户界面,并已进入 Google Cloud 控制台,在编程工具 Antigravity 中被设为默认模型,还出现了真实的代码提交记录。
OpenAI 宣布在 ChatGPT 中推出 GPT-6,并引入智能 UI。
针对有人不理解为何大家对 Opus 生成的视频如此着迷,这条推文提出了这一疑问,并附上视频引发讨论。原文未披露 Opus 的版本、参数或视频生成的具体能力细节。
OpenAI 发布数学成果,被 Opus 称为"史上影响最深远的一次数学成果发布"。LLM 已在 7 个千禧年大奖难题中的 4 个上取得实质性进展,但该判断的前提是相关结果需要通过验证。
Notion 宣布其平台已可调用 Claude Haiku 5.5。引用 Anthropic 的介绍,Haiku 5.5 是其发布的最便宜、最快且能力最强的小模型,平均运行成本比 Claude Haiku 4.5 低约 75%。
Anthropic 的 Claude Haiku 5.5 已在 OpenRouter 上线。OpenRouter 称这是首个支持 reasoning efforts 的 Haiku 模型,价格比上一代便宜约 75%,速度实测 100+ TPS,基准测试中能力也有明显提升,可通过 openrouter.ai/anthropic/clau… 使用。
Perplexity Decider v1.1 现已上线 OpenRouter,这是 Perplexity 的开源权重多模态决策模型,可接收文本、JSON 或图像并返回带概率的类型化答案,输入价格 $0.02/M,输出免费。
阶跃星辰(StepFun)的 Step 5 Preview 已在 OpenRouter 上线,官方称其为面向智能体任务的新旗舰模型。该模型采用稀疏 MoE 架构,激活参数 27B、总参数 600B,支持 1M 上下文以及文本、图像和视频输入,官方称其在编码和专业领域知识工作上表现较强,尤其是金融场景。
在 StepFun 的 8 项基准评测中,Step 5 Preview 在 6 项上超过 Kimi K3 和 GLM-5.3,包括 DeepSWE(67.7)、ProgramBench(80.5)、StepCodeBench(49.0)和 FrontierFinance(66.4)。该结果由 StepFun 自家评测给出。
StepFun 的 Step 5 Preview 已在 OpenRouter 上线,定价为输入 $1.00/M、输出 $2.70/M,发布期缓存命中价再打五折至 $0.05/M。发布方称该模型面向智能体与专业工作场景,并提供为期一周的免费访问,逐步覆盖 opencode、cline、NousResearch、kilocode 等平台。
Qwen-Image-2.1-Multiple-Angles-LoRA 模型已上线 Hugging Face,可通过 huggingface.co/akhaliq 访问。该模型以 LoRA 形式为 Qwen-Image-2.1 提供多角度图像生成能力,具体参数与效果未在原文披露。
Anthropic 发布 Haiku 5.5,作者对比其与几款中国竞品的价格和测试评分:价格上比 DeepSeek-V4.1 flash 和智谱 GLM 5.3 flash 都便宜。在 Terminal Bench 4.0 上,作者称其分数比 GLM 5.3 flash 高一分,与另一竞品相同,比其他两个更高。
Simon Willison 发布了一篇关于 Claude Haiku 5.5 定价的笔记,标题中同时提到 Pelicans,附有 simonwillison.net 的链接。材料仅有推文摘要,未提供具体定价数字或分析内容。
Haiku 5.5 在绘制骑自行车的鹈鹕上明显优于近一年前发布、成本贵 10 倍的 Claude Haiku 4.5。作者同时贴出了 Haiku 4.5 的生成结果作对比。
Anthropic 发布 Claude Haiku 5.5,称其为该公司迄今最便宜、最快、能力最强的小模型。该模型相较上一代有大幅提升,在多项基准上超过 OpenAI 的同类模型 GPT-6 Luna,起售价为每百万输入 token 0.10 美元,运行成本比 Haiku 4.5 低约 75%,与 Luna 持平。
Anthropic 发布 Claude Haiku 5.5,称其是目前最便宜、最快且能力最强的小模型。官方表示其运行成本平均比 Claude Haiku 4.5 低约 75%。
Claude Haiku 5.5 在编码、计算机使用和知识工作三类任务上较 Haiku 4.5 实现显著提升。该消息未披露具体参数规模、benchmark 分数或可用性细节。
Anthropic 发布 Haiku 5.5,这是其首个带可调 effort 设置的 Haiku 模型,用户可按任务自行选择偏向成本还是智能。原文未披露具体版本参数与定价信息。
Claude Haiku 5.5 在 10 万 token 以下任务上性价比尤为突出,这类任务占前代 Haiku 模型约 90% 的请求量。该说法来自 Claude 官方账号,未披露具体价格或 benchmark 数据。
Anthropic 宣布 Haiku 5.5 现已在所有平台上线,包括 Amazon Web Services、Google Cloud 和 Microsoft Azure。官方给出详情链接 anthropic.com/claude-haiku-5。