Claude Haiku 5.5 上线 Devin
Claude Haiku 5.5 已在 Devin 上线,在 FrontierCode 1.1 上得分 58.4%,超过 Sonnet 5,且每任务成本约为其八分之一。它还可作为 Fusion 中的辅助模型,搭配 Opus 5.5 作为 Lead 在 Devin Desktop 和 CLI 中使用。
Claude Haiku 5.5 已在 Devin 上线,在 FrontierCode 1.1 上得分 58.4%,超过 Sonnet 5,且每任务成本约为其八分之一。它还可作为 Fusion 中的辅助模型,搭配 Opus 5.5 作为 Lead 在 Devin Desktop 和 CLI 中使用。
Anthropic 发布快速低价模型 Claude Haiku 5.5,价格与 OpenAI 上月发布的 GPT-6 Luna 完全一致,为每百万 token 输入 0.10 美元。
ChatGPT 官方宣布 GPT‑6 with Intelligent UI 今日起在 Chat 标签页面向 ChatGPT Plus、Pro、Business 和 Enterprise 档位全球上线,明天起扩展至 Free 和 Go 档位。
官方账号给出 GPT‑6 在 ChatGPT 各订阅档位的上线节奏与对应模型,读者可据此确认自己何时能用上。
Claude Haiku 5.5 在编码、computer use 和知识工作方面相比 Haiku 4.5 有显著提升,同时速度更快、价格便宜 75%。作者提到 Haiku 4.5 发布于 2025 年 10 月 15 日,两代间隔不到一年。
AWS 宣布 Claude Haiku 5.5 已在 Amazon Bedrock 和 Claude Platform on AWS 上线。据 Anthropic 介绍,它是 Claude 5.5 家族中速度最快、效率最高的模型,面向子智能体和高并发成本敏感场景,多数任务成本比 Claude Haiku 4.5 低约 75%。
GPT-6 with Intelligent UI 今日面向 Plus、Pro、Business 和 Enterprise 用户全球推送,明天起扩展至 Free 和 Go 用户。
官方给出 GPT-6 在各订阅档位的模型分配与分层推送时间,可据此判断自己何时能用上。
Anthropic 发布 Claude Haiku 5.5,加入 5.5 系列,官方称其为迄今最便宜、最快且能力最强的小模型。它在运行时平均成本约为 Claude Haiku 4.5 的 25%,即低约 75%。Mike Krieger 表示 Opus 负责重推理,Haiku 承担高吞吐工作。
AI SDK 宣布支持使用 Claude Haiku 5.5。其引用的 Anthropic 介绍称,Claude Haiku 5.5 是该方发布过的最便宜、最快且能力最强的小模型,运行成本平均比 Claude Haiku 4.5 低约 75%。
Perplexity 将两款模型发布到 Hugging Face,可通过其 Hugging Face 集合页面获取。原文未披露模型名称、参数规模及具体开放方式。
在 Q2D-Web 上约 7 万条生产环境搜索查询、1.9 亿网页文档的测试中,9B 和 0.6B 模型分别取得 74.8% 和 73.6% 的 Recall @1000,高于 nemotron-embed-8b 的 69.3%。
Perplexity 发布 pplx-embed-v2-late,包含两个延迟交互嵌入模型,可在共享嵌入空间中检索文本、图像和页面,实现跨模态查询;两个模型均达到前沿性能,并已在 Hugging Face 公开可用。
Google 发布 Gemini 3.8 Live 语音到语音模型,将听、推理和回应放在一个系统中,跳过语音转文字再转语音的接力流程。Extended Thinking 版本在 Artificial Analysis 的 Speech to Speech Index 排名第一,标准版在真人盲测实时对话中排名第二。
在 Harvey 的法律智能体基准 LAB(Legal Agent Benchmark)上,Mistral Large 4 成为排名第一的开源模型(oss model)。该结果由 Mistral AI 公布,评测针对法律领域的智能体任务。
Mistral Large 4 在 AutomationBench 上完成 657 个覆盖 Gmail、Google Sheets、Slack、Salesforce 等模拟办公应用的业务工作流,成绩领先 Kimi K3、MiMo-V2.6-Pro 和 DeepSeek V4 Pro。
Mistral AI 发布 Mistral Large 4,称其可运行通用智能体,在复杂工作流中收集信息并产出成品交付物。官方未披露该模型的具体参数、可用入口或评测数据。
OpenAI 于 2026 年 10 月 6 日发布消息称,用一个尚未公开的内部前沿模型一次性产出 722 篇数学手稿,整理为 372 个结果,来自对约 4000 个开放研究问题的评估,平均每个结果算力约相当于 ChatGPT Pro 思考 3 小时,成果全部放在 Apache-2.0 协议的 GitHub 仓库 openai/math 中。
OpenAI 以 GitHub 仓库而非期刊公开内部模型的数学产出,读者可了解其披露方式与研究协作的新变化。
Mistral 发布新旗舰 Mistral Large 4,总参数 1 万亿,采用混合专家架构,每个 token 激活 490 亿参数,权重将于月底全部开源。
通过第三方智能指数与多项细分基准的横向对比,读者可以看到开源万亿参数模型与闭源旗舰之间的实际差距。
AICodeKing 对 Mistral Large 4(代号 Le Chonk)进行了完整实测,围绕它是否是目前最好的开源模型展开评测。
Nano Banana 2.1 展示了一组图像生成效果:一只完全倒满的红酒杯,以及一个指针停在 3:30 的时钟。该内容由 Philipp Schmid 发布,互动数据显示 231 次点赞、16 条评论和 9109 次浏览。
Mistral Large 4 进入 Code Arena WebDev 榜单位列第 45 名,得分 1534 分,比第 130 名的 Mistral Large 3 提升 304 分,比第 122 名的 Mistral Medium 3.5 高出 271 分。
美国创业公司 Reflection 发布首款开放权重模型 Beam,一天后 Mistral 推出 Mistral Large 4,两家公司发布时的主要比较对象均为 GLM、Kimi、DeepSeek、Qwen 等中国模型。
OpenAI 从一个未发布内部前沿模型公开了 722 篇数学手稿,归入 372 个结果族,来自约 4000 个研究问题的评测,平均每个结果约消耗 3 小时 ChatGPT Pro 推理算力,同时发布论文、证明工件与部分推理摘要,模型本身仍未公开。
汇总了 OpenAI 内部数学模型的稿件规模与算力投入,以及 Mistral、Google 等多个同期发布的对照信息。
Google 发布图像模型 Nano Banana 2.1,官方称其画面生成更自然,改图衔接更连贯。原文未披露参数规模、benchmark 分数与开放方式等具体细节。
OpenCode 出现一款新的隐身模型 Exo Free,目前已在平台上可供试用。该消息来自 Hakm 的推文,附带 Quoted Tweet 链接,未披露模型规模、上下文长度或基准分数等细节。
Google DeepMind 开源发布原生多模态、专为端侧设计的 740M 参数嵌入模型 EmbeddingGemma 2,把文本、代码、图像、视频、音频映射进同一个 768 维向量空间。
Google 开源 EmbeddingGemma 2,这是一个可在手机和电脑本地运行的多模态嵌入模型,文字、图片、视频、音频和代码可放进同一套坐标系,不联网也能用一句话检索内容。
Vercel 在 AI Gateway 上线隐身模型 Glyph Cluster,Pro 和 Enterprise 套餐且购买了 AI Gateway 额度的团队在隐身期可免费使用。
Vercel AI Gateway 现已上线 Anthropic 的 Claude Haiku 5.5,这一版本面向摘要、上下文压缩、数据库查询和分类等高频、成本敏感任务,也可作为子智能体配合更大的 Claude 模型处理编码工作。
OpenAI 发布由内部前沿模型产出的一批新数学结果,并公开了 github.com/openai/math 仓库。OpenAI 称在发布过程中咨询了普林斯顿高等研究院的数学与人工智能独立咨询小组,并参考其建议和公开推荐意见来确定发布方式。Thomas Wolf 转引该消息时评价没有炒作、只有结果。
OpenAI 发布一批由内部前沿模型产出的新数学结果,相关代码与内容放在 github.com/openai/math。OpenAI 表示在发布过程中咨询了 Institute for Advanced Study 的数学与人工智能独立顾问组,并参考其建议与公开推荐来确定发布方式。
Google DeepMind 的 EmbeddingGemma 2 现已上线 Ollama,可通过 `ollama pull embeddinggemma-2` 获取。该模型面向消费级设备,是 Google DeepMind 首个原生多模态开源端侧嵌入模型,除文本外还将代码、图像、音频和视频统一到同一嵌入空间。
Google 的 Nano Banana 2.1 已上线 LMArena 的文生图、图像编辑和多图编辑三个竞技场。它在多图编辑以 1431 分排第 4,文生图以 1328 分排第 5,图像编辑以 1428 分排第 6。
Google 的 Nano Banana 2.1 已进入 Text-to-Image Arena、Image Edit Arena 和 Multi-Image Edit Arena 三个榜单。
Google DeepMind 发布 EmbeddingGemma 2,基于 Gemma 4 架构、740M 参数、Apache 2.0 许可,将文本、代码、图像、视频和音频映射到统一嵌入空间。
Justine Moore 实测了 Tavus 引发热议的新模型,认为其在实时交互视频上进步明显,全程无剪辑或加速,一些举止神态真实得令人意外。
Google Nano Banana 2.1 已在 OpenRouter 上线,以 Flash 速度提供 Pro 级图像生成与编辑。该模型超越此前所有 Nano Banana 版本,在视觉设计、基于蒙版的编辑和主体一致性上有大幅提升。
Google 发布 EmbeddingGemma 2,这是其首个原生多模态嵌入模型,基于 Gemma 4 构建,采用 Apache 2.0 许可。它可将 100 多种语言以及代码、图像、音频和视频嵌入同一个向量,上下文长度 8,192,提供 740M omni、440M text+vision、570M text+audio 和 270M text-only 四种规格。
Nano Banana 2.1 已发布,面向图像生成与编辑用户,带来更高质量的图像和对前代模型的诸多 bug 修复,并采用更低的价格。该模型已在 API、AI Studio 和 Gemini app 中提供使用。
Mistral AI 表示 Mistral Large 4 是全球最强的网络安全 AI 模型之一。该说法由 Mistral AI 官方账号发布,未披露具体评测分数或技术细节。
Mistral AI 发布 Mistral Large 4,并以其在 CTF 挑战中的表现展示推理能力。官方称在包含工具调用、解题时间均来自真实运行记录的 CTF speedrun 中,该模型解出 19 道题中的 18 道。