Google Gemini 4 "Carbon" 模型据称编码性能追平 Anthropic Opus 5.5
据 Business Insider 看到的内部文件与聊天记录,Google 正在测试 Argon、Barium、Carbon 三个 Gemini 4 变体,其中 Carbon 已部署在内部编码平台 Jetski 上,被认为在编程任务上强于 Argon,有员工将其比作 Anthropic 最强的编码模型 Opus 5.5,但仍需更多测试。
据 Business Insider 看到的内部文件与聊天记录,Google 正在测试 Argon、Barium、Carbon 三个 Gemini 4 变体,其中 Carbon 已部署在内部编码平台 Jetski 上,被认为在编程任务上强于 Argon,有员工将其比作 Anthropic 最强的编码模型 Opus 5.5,但仍需更多测试。
Mistral 推出 Le Chonk,加入西方开源模型竞赛;OpenAI 的数学成果持续爆发,已发布 700 多篇论文。GPT-6 Astra 现可帮用户直接比较不同网站,Brett Adcock 的 Hark 则推出主动型 AI 助手。
The Rundown AI 汇总今日 AI 要闻:OpenAI 相关数学研究论文已超 700 篇,Mistral 的 Le Chonk 加入西方开源模型浪潮,OpenAI 的 GPT-6 Astra 可帮用户比较网站,Brett Adcock 的 Hark 推出主动式 AI 助手。
Google 内部正在测试新模型 Carbon,部署在内部 AI 编程工具 Jetski 上,有员工称其编码能力“感觉像 Opus 5.5”。Carbon 是在 9 月 30 日发布的 Gemini 4 Argon(内部版本 Barium-B)之后训练出的新版本,将作为 Argon 升级还是独立发布尚不清楚。
微软新模型 Microsoft-Decision-1 上线 OpenRouter,由 Qwen3.5-9B 后训练而来,主打快速决策任务。微软给出的数据是:在 36 个盲测基准(约 15 万道题)上准确率最高,比第二名快 4.5 倍,比 GPT-6 Sol 快 35 倍,扰动输入下仅 1.3% 的决策发生翻转。
微软推出新模型 Microsoft-Decision-1,专做选择题式判断,不生成文章也不聊天,给定选项后快速判断该选哪个并给每个选项打概率分,已在 Microsoft Foundry 上线,之后会上 OpenRouter。
Cloudflare 发布 Clef-omni,在文本和图像之外新增音频(wav/mp3)与视频(mp4/webm)输入,基于 Qwen3-Omni-30B-A3B-Instruct MoE 构建并已在 Hugging Face 开放权重,定价为每百万输入 token 0.15 美元。
Microsoft 发布新的快速决策模型 Microsoft-Decision-1,官方称其在结构化决策任务上表现领先,延迟和质量均优于 LLM 与其他决策模型。该模型已在 Microsoft 内部用于事件响应、质量控制和科学发现等场景。作者表示会将其加入自己的评测清单,并指出这类决策模型在一致性和更复杂决策上仍存在困难。
微软发布新模型 Microsoft-Decision-1,面向快速决策场景,在结构化决策任务上表现领先,在延迟和质量上优于 LLM 及其他决策模型。该模型已在微软内部多个场景测试,涵盖事件响应、质量控制和科学发现。
Ideogram 4.5 在 Artificial Analysis 的 30 轮连续编辑测试中保持了原图稳定,而 GPT Image 2.5 Sunburst 出现明显漂移。
OpenAI 推出 GPT-6.1 Sol 的 Ultrafast 版本,速度是标准版的 8 倍,官方称智能水平与标准版一致且逼近旗舰 Astra。
Simon Willison 表示在某个用途上偏好 Qwen3.5-35B-A3B,并询问是否有更新、性能更强的模型可选。该帖获得 47 个点赞、8994 次浏览,由 xgo.ing 提供数据。
阶跃星辰的 Step 5 Preview 发布一天后登上 OpenRouter Trending 第一名,并已在 Kilo Code、Cline、Hermes Agent 和 OpenCode 中可用。
Fish Audio 开放 Drama 3 Preview 的使用入口:API 调用时需将模型设为 [drama-3-preview],文档见 docs.fish.audio/api-reference/;网页端可在 fish.audio/app/text-to-sp… 选择 Fish Audio Drama 3(Preview)模型使用。
HeyGen 推出语音模型 HeyGen Voice,在 Artificial Analysis TTS 排行榜盲测中超越所有主流模型登顶第一,现已在 HeyGen 平台和 API 上线。10 月 31 日前 API 用户自动享受五折优惠,价格从 $30 降至 $15 每百万字符。
Anthropic 发布小型模型 Claude Haiku 5.5,平均价格比 Haiku 4.5 低约 75%,10 万 token 以内的提示词最高降价 90%,同时 Sonnet 5.5 的缓存读取价格减半。
Qwen 发布一条以「Pics」为主题的内容,附带 4 条回复、4 次转发、112 次点赞和 20624 次浏览的数据,互动数据由 xgo.ing 提供支持。
阿里 Qwen 团队发布 Qwen-Image-2.1-Turbo,称只需 8 个去噪步骤即可生成和编辑图像,并已开放权重。该模型基于 Qwen-Image-2.1,是在同一 7B 视觉生成架构上的加速检查点,官方称仍能由文本生成 2K 图像,并支持通过自然语言编辑继续创作,例如添加配饰或更换场景。
正行创新发布面向零售场景的Physical AI解决方案,公开双足人形机器人H1和轮式双臂搬运理货机器人C1两款自研本体,以及世界动作模型SLM-0.5、强化学习体系STEAM和智能体Rpent组成的具身大脑。
Aether AI 发布 CRIS-0,把因果智能体与因果世界模型在统一因果状态表示下打通,通过统一工具接口调度机械臂完成家庭任务。在咖啡、微波炉、垃圾分拣等真机测试中,系统面对物体移位等扰动平均 2 秒内重置规划,10 次强干扰测试成功恢复 9 次,长程任务靠阶段验证制切断误差累积。公司称目前跑通技术四层金字塔的前两层,后续需补上消融实验数据与更复杂环境下的泛化验证。
AutoTrust AI Lab 开源基于 Qwen3.8-27B 的多模态决策模型 JEV-27B-VL,融合 System 1 快速决策与 System 2 深度推理,可视为能“看见”的 JEV-27B。
OpenAI 在疯狂 28 天计划的 Day 3 推出 GPT-6.1 Sol ultrafast。
OpenAI 宣布在 ChatGPT 中推出 GPT-6,并引入智能 UI。
针对有人不理解为何大家对 Opus 生成的视频如此着迷,这条推文提出了这一疑问,并附上视频引发讨论。原文未披露 Opus 的版本、参数或视频生成的具体能力细节。
OpenAI 发布数学成果,被 Opus 称为"史上影响最深远的一次数学成果发布"。LLM 已在 7 个千禧年大奖难题中的 4 个上取得实质性进展,但该判断的前提是相关结果需要通过验证。
Perplexity Decider v1.1 现已上线 OpenRouter,这是 Perplexity 的开源权重多模态决策模型,可接收文本、JSON 或图像并返回带概率的类型化答案,输入价格 $0.02/M,输出免费。
阶跃星辰(StepFun)的 Step 5 Preview 已在 OpenRouter 上线,官方称其为面向智能体任务的新旗舰模型。该模型采用稀疏 MoE 架构,激活参数 27B、总参数 600B,支持 1M 上下文以及文本、图像和视频输入,官方称其在编码和专业领域知识工作上表现较强,尤其是金融场景。
在 StepFun 的 8 项基准评测中,Step 5 Preview 在 6 项上超过 Kimi K3 和 GLM-5.3,包括 DeepSWE(67.7)、ProgramBench(80.5)、StepCodeBench(49.0)和 FrontierFinance(66.4)。该结果由 StepFun 自家评测给出。
Qwen-Image-2.1-Multiple-Angles-LoRA 模型已上线 Hugging Face,可通过 huggingface.co/akhaliq 访问。该模型以 LoRA 形式为 Qwen-Image-2.1 提供多角度图像生成能力,具体参数与效果未在原文披露。
Anthropic 发布 Haiku 5.5,作者对比其与几款中国竞品的价格和测试评分:价格上比 DeepSeek-V4.1 flash 和智谱 GLM 5.3 flash 都便宜。在 Terminal Bench 4.0 上,作者称其分数比 GLM 5.3 flash 高一分,与另一竞品相同,比其他两个更高。
Haiku 5.5 在绘制骑自行车的鹈鹕上明显优于近一年前发布、成本贵 10 倍的 Claude Haiku 4.5。作者同时贴出了 Haiku 4.5 的生成结果作对比。
Anthropic 发布 Claude Haiku 5.5,称其为该公司迄今最便宜、最快、能力最强的小模型。该模型相较上一代有大幅提升,在多项基准上超过 OpenAI 的同类模型 GPT-6 Luna,起售价为每百万输入 token 0.10 美元,运行成本比 Haiku 4.5 低约 75%,与 Luna 持平。
Anthropic 发布 Claude Haiku 5.5,称其是目前最便宜、最快且能力最强的小模型。官方表示其运行成本平均比 Claude Haiku 4.5 低约 75%。
Claude Haiku 5.5 在编码、计算机使用和知识工作三类任务上较 Haiku 4.5 实现显著提升。该消息未披露具体参数规模、benchmark 分数或可用性细节。
Anthropic 发布 Haiku 5.5,这是其首个带可调 effort 设置的 Haiku 模型,用户可按任务自行选择偏向成本还是智能。原文未披露具体版本参数与定价信息。
Claude Haiku 5.5 在 10 万 token 以下任务上性价比尤为突出,这类任务占前代 Haiku 模型约 90% 的请求量。该说法来自 Claude 官方账号,未披露具体价格或 benchmark 数据。
Anthropic 宣布 Haiku 5.5 现已在所有平台上线,包括 Amazon Web Services、Google Cloud 和 Microsoft Azure。官方给出详情链接 anthropic.com/claude-haiku-5。
GPT-6 开始面向每周超过 12 亿 ChatGPT 用户全面推送,并带来全新的 Intelligent UI 能力。该能力让回复可用文本、图形、按钮、表单、图表乃至交互式工具共同组织:对比类问题并排呈现,原理类问题用交互式图解,简单问题仍用纯文本。
GPT-6 把回复从纯文本扩展到可交互界面,文中给出了组件库和界面编译器两层实现思路。
Claude Haiku 5.5 的 benchmark 全面领先 GPT-6 Luna,OpenRouter 观测到的 token 输出速度也是 2 倍。Anthropic 官方称 Claude Haiku 5.5 是迄今最便宜、最快、最强的小模型,运行成本比 Claude Haiku 4.5 低约 75%。
Anthropic 发布 Claude Haiku 5.5,10 万 Token 以内请求每百万 Token 输入 0.1 美元、输出 0.5 美元,比 Haiku 4.5 便宜 90%,官方估算平均运行成本降约 75%。