Google Gemini 4 "Carbon" 模型据称编码性能追平 Anthropic Opus 5.5
据 Business Insider 看到的内部文件与聊天记录,Google 正在测试 Argon、Barium、Carbon 三个 Gemini 4 变体,其中 Carbon 已部署在内部编码平台 Jetski 上,被认为在编程任务上强于 Argon,有员工将其比作 Anthropic 最强的编码模型 Opus 5.5,但仍需更多测试。
据 Business Insider 看到的内部文件与聊天记录,Google 正在测试 Argon、Barium、Carbon 三个 Gemini 4 变体,其中 Carbon 已部署在内部编码平台 Jetski 上,被认为在编程任务上强于 Argon,有员工将其比作 Anthropic 最强的编码模型 Opus 5.5,但仍需更多测试。
Business Insider 援引知情人士称,Google 内部正在测试新模型 Carbon,部署在内部 AI 编程工具 Jetski 上,有员工评价其编码能力“感觉像 Opus 5.5”。
微软发布面向快速决策的模型 Microsoft-Decision-1,并已在 OpenRouter 上线。按微软给出的数字,它在 36 项盲测(约 15 万道题)上准确率最高,比第二名快 4.5 倍,比 GPT-6 Sol 快 35 倍,扰动输入下仅有 1.3% 的决策发生翻转。
微软推出新模型 Microsoft-Decision-1,专做选择题式判断,不生成文章也不聊天,给定选项后快速判断该选哪个并给每个选项打概率分,已在 Microsoft Foundry 上线,之后会上 OpenRouter。
Cloudflare 发布 Clef-omni,在文本和图像之外新增音频(wav/mp3)与视频(mp4/webm)输入,基于 Qwen3-Omni-30B-A3B-Instruct MoE 构建并已在 Hugging Face 开放权重,定价为每百万输入 token 0.15 美元。
微软发布系统一模型 Microsoft-Decision-1,用于快速决策,在结构化决策任务上表现最优,延迟和质量均优于 LLM 与其他决策模型。微软已在内部将其用于事件响应、质量控制和科学发现等场景。发布者还提到,决策模型可用于驱动 LLM 评判和科研流程中的候选假设筛选,并称在自己的评测中这类模型在一致性和更复杂决策上仍存在困难。
微软发布新模型 Microsoft-Decision-1,面向快速决策场景,在结构化决策任务上性能领先,在延迟和质量上优于 LLM 及其他决策模型。该模型已在微软内部测试,应用范围涵盖事件响应、质量控制和科学发现。
Logan Kilpatrick 回应 @StatsWire 时表示 Argon 即将到来,并称"不必担心"。该帖获 1458 点赞、59 次转发、408 条回复及 27.9 万次浏览。
OpenAI 推出 GPT-6.1 Sol 的 Ultrafast 版本,速度是标准版的 8 倍,官方称智能水平与标准版一致且逼近旗舰 Astra。
阶跃星辰(StepFun)的 Step 5 Preview 发布一天后登上 OpenRouter Trending 第一,并已接入 Kilo Code、Cline、Hermes Agent 和 OpenCode。
Anthropic 发布小型模型 Claude Haiku 5.5,平均价格比 Haiku 4.5 低约 75%,10 万 token 以内的提示词最高降价 90%,同时 Sonnet 5.5 的缓存读取价格减半。
Nano Banana 2.1 在三项 Image Arena 模式中均进入前六:Multi-Image Edit 第 4(1431 分)、Text-to-Image 第 5(1328 分)、Image Edit 第 6(1428 分)。
阿里 Qwen 发布 Qwen-Image-2.1-Turbo,只需 8 步去噪即可生成和编辑图像,开放权重已上线。该模型基于 Qwen-Image-2.1,是同一 7B 视觉生成架构上的加速 checkpoint,仍可从文本生成 2K 图像,并支持通过自然语言编辑继续创作,例如添加配饰或更换场景。
Aether AI 发布 CRIS-0,把因果智能体与因果世界模型在统一因果状态表示下打通,通过统一工具接口调度机械臂完成家庭任务。在咖啡、微波炉、垃圾分拣等真机测试中,系统面对物体移位等扰动平均 2 秒内重置规划,10 次强干扰测试成功恢复 9 次,长程任务靠阶段验证制切断误差累积。公司称目前跑通技术四层金字塔的前两层,后续需补上消融实验数据与更复杂环境下的泛化验证。
AutoTrust AI Lab 开源基于 Qwen3.8-27B 的多模态决策模型 JEV-27B-VL,融合 System 1 快速决策与 System 2 深度推理,可视为能“看见”的 JEV-27B。
OpenAI 在疯狂 28 天计划的 Day 3 推出 GPT-6.1 Sol ultrafast。
OpenAI 宣布在 ChatGPT 中推出 GPT-6,并引入智能 UI。
针对有人不理解为何大家对 Opus 生成的视频如此着迷,这条推文提出了这一疑问,并附上视频引发讨论。原文未披露 Opus 的版本、参数或视频生成的具体能力细节。
OpenAI 发布数学成果,被 Opus 称为"史上影响最深远的一次数学成果发布"。LLM 已在 7 个千禧年大奖难题中的 4 个上取得实质性进展,但该判断的前提是相关结果需要通过验证。
Anthropic 的 Claude Haiku 5.5 已在 OpenRouter 上线,这是首个支持 reasoning effort 的 Haiku 模型。OpenRouter 称其比前代便宜约 75%,速度更快(实测 100+ TPS),基准测试中能力有明显提升。
Perplexity Decider v1.1 已在 OpenRouter 上线,这是一款开放权重的多模态决策模型,可接收文本、JSON 或图像输入,返回带概率的类型化答案。输入价格为 $0.02/M,输出免费。
阶跃星辰的 Step 5 Preview 已在 OpenRouter 上线,是其面向智能体任务的新旗舰模型。该模型采用稀疏 MoE 架构,激活参数 27B、总参数 600B,支持 1M 上下文以及文本、图像和视频输入,在编码和专业领域(尤其是金融)表现较强。
Qwen-Image-2.1-Multiple-Angles-LoRA 模型已上线 Hugging Face,可通过 huggingface.co/akhaliq 访问。该模型以 LoRA 形式为 Qwen-Image-2.1 提供多角度图像生成能力,具体参数与效果未在原文披露。
Anthropic 的 Haiku 5.5 价格低于 DeepSeek-V4.1 flash 和智谱 GLM 5.3 flash。在 Terminal Bench 4.0 上,其 AA 测试评分比 GLM 5.3 flash 高一分,与另一竞品持平,且高于其余两个中国竞品。该对比由歸藏整理发布。
Haiku 5.5 在绘制骑自行车的鹈鹕上远好于 Claude Haiku 4.5。Claude Haiku 4.5 发布于近一年前,价格是它的 10 倍。
Anthropic 发布小模型 Claude Haiku 5.5,官方称其是迄今最便宜、最快、最强的小模型。相比上一代 Haiku 4.5 有大幅提升,并在多项基准上超过 OpenAI 的同类模型 GPT-6 Luna。输入价格从每百万 token 0.10 美元起,运行成本比 Haiku 4.5 低约 75%,与 Luna 持平。
Anthropic 小模型迭代给出价格与跑分对比,可据此判断小模型市场的性价比走向。
Anthropic 发布 Claude Haiku 5.5,称其是迄今最便宜、最快且能力最强的小模型。官方表示其平均运行成本比 Claude Haiku 4.5 低约 75%。
Anthropic 发布 Claude Haiku 5.5,官方称其在编码、computer use 和知识工作方面较 Haiku 4.5 有显著提升。目前可获取的信息仅为这一结论,官方未在原文中给出具体评测数据、价格或可用范围。
Anthropic 发布 Haiku 5.5,这是首个带有可调 effort 设置的 Haiku 模型,用户可针对每个任务自行决定侧重成本还是智能表现。
Anthropic 的 Claude 官方账号表示,Haiku 5.5 在 10 万 token 以下的任务中性价比尤其突出。这类任务占其上一代 Haiku 模型约 90% 的请求量。
Anthropic 宣布 Haiku 5.5 现已在所有平台上线,包括 Amazon Web Services、Google Cloud 和 Microsoft Azure。官方同时给出详情链接 anthropic.com/claude-haiku-5。
GPT-6 开始面向每周超过 12 亿 ChatGPT 用户全面推送,并带来全新的 Intelligent UI 能力。该能力让回复可用文本、图形、按钮、表单、图表乃至交互式工具共同组织:对比类问题并排呈现,原理类问题用交互式图解,简单问题仍用纯文本。
GPT-6 把回复从纯文本扩展到可交互界面,文中给出了组件库和界面编译器两层实现思路。
Claude Haiku 5.5 的 benchmark 全面领先 GPT-6 Luna,OpenRouter 观测到的 token 输出速度也是 2 倍。Anthropic 官方称 Claude Haiku 5.5 是迄今最便宜、最快、最强的小模型,运行成本比 Claude Haiku 4.5 低约 75%。
Anthropic 发布 Claude Haiku 5.5,处理 10 万 Token 以内请求时每百万 Token 输入 0.1 美元、输出 0.5 美元,比 Haiku 4.5 便宜 90%。
原文给出了新模型的价格、实测成绩与推荐用法,读者可据此判断小模型在成本敏感任务中的位置。
Perplexity 开源 pplx-embed-v2-late,包含 9B 和 0.6B 两个晚期交互多向量嵌入模型,用于检索文本、图像和页面,二者共享同一嵌入空间以支持跨模型查询。
Mistral Large 4 预览版在 Code Arena: WebDev 以 1534 分位列第 45 名,比 Mistral Large 3 提升 304 分,使 MistralAI 进入该榜前 15 实验室,是唯一上榜的欧洲实验室。
Anthropic 发布 Claude Haiku 5.5,官方称这是其推出的最便宜、最快、能力最强的小模型,平均运行成本比 Claude Haiku 4.5 低约 75%。该模型现已加入 Agent Arena,可在其中使用网页搜索、文件系统和终端工具完成长流程智能体任务,成绩尚未公布;同时也在 Code Arena 的 WebDev、Text、Document 和 Vision 板块上线。
Mistral AI 的 Mistral Large 4 是一个 1T 参数、49B 激活的模型,权重将于月底开放。
Claude Haiku 5.5 在 Code Arena 得分 1587 分,比 Haiku 4.5 的 1330 分提升 257 分,且各分类均有明显进步。相关榜单可在 Code Arena: WebDev(arena.ai/leaderboard/co…)查看。
Anthropic 在 X 上宣布推出最新模型 Claude Haiku 5.5。该帖未披露参数、能力指标或开放范围等细节。