Claude Haiku 5.5 benchmark 领先 GPT-6 Luna,用户从 CodeX 迁移到 Claude Code
Claude Haiku 5.5 的 benchmark 全面领先 GPT-6 Luna,OpenRouter 观测到的 token 输出速度也是 2 倍。Anthropic 官方称 Claude Haiku 5.5 是迄今最便宜、最快、最强的小模型,运行成本比 Claude Haiku 4.5 低约 75%。
Claude Haiku 5.5 的 benchmark 全面领先 GPT-6 Luna,OpenRouter 观测到的 token 输出速度也是 2 倍。Anthropic 官方称 Claude Haiku 5.5 是迄今最便宜、最快、最强的小模型,运行成本比 Claude Haiku 4.5 低约 75%。
宝玉指出 Haiku 5.5 的价格看似很低,但上下文一旦超过 100K,价格会上涨 5 倍,这一细节在价格页被隐藏起来。他引用其他用户的说法称这是阶梯定价,对比之下 GPT 的分界线是 272K,并认为这种设计相当于面向 Benchmark 的特化优化。
OpenAI 发布由内部前沿模型产出的一批新数学结果,并公开了 github.com/openai/math 仓库。OpenAI 称在发布过程中咨询了普林斯顿高等研究院的数学与人工智能独立咨询小组,并参考其建议和公开推荐意见来确定发布方式。Thomas Wolf 转引该消息时评价没有炒作、只有结果。
Simon Willison 指出,Sonnet 5.5 最重要的变化是它现在为 claude.ai 免费版提供支持,因此免费用户也能使用这些能力。他同时对比称,ChatGPT 免费版目前仍是能力弱得多的 GPT-5.6 Luna。该推文还引用了一组 Sonnet 5.5 的早期实验,其中包括用 Sonnet 5 与 Sonnet 5.5 制作的秋叶模拟器。
GLM 5.3 FlashX 表现已相当出色,但价格明显更贵,同时被 DeepSeek v4.1 Flash 比下去。该帖获 340 点赞、30059 次浏览。
社区多位用户发现请求 GPT-5.6 Sol 时返回模型名显示为 GPT-6 Sol,调用记录出现模型不一致提示;V2EX 用户通过 sub2api 反代也报告了相同现象。
DeepLearning.AI 指出 GPT-6 Astra 登顶 ARC-AGI-3 榜单,同时降低 token 成本。它在 Artificial Analysis 的 Intelligence Index 上与 Claude Fable 5.1 持平,并具备异步工具调用以支持并行执行、跨 API 调用保留推理记忆等特性。
Arena.ai 公布 Image-to-WebDev Arena 榜单,阿里 Qwen3.8-27B 在开放模型中排名第一、总榜第七,得分 1574,定价为每百万输入/输出 token 0.40/3 美元。Qwen 官方回应称该模型仅 27B 参数,性能与参数量约为其 100 倍的模型相当,并预告当晚将有新发布。
Grok 4.6 接入 Augment Code 的 Cosmos 后,头三天成为 Cosmos 至今采用速度最快的模型。用户可通过 augmentcode.com 试用。 (说明:原文正文仅给出"前三天采用曲线最快"与试用入口两项事实,未披露参数规模、benchmark 分数或价格,故摘要按 50 字左右处理,未做任何补充。)
Moonshot AI 于 7 月 16 日发布旗舰模型 Kimi K3,这是一个 2.8T 参数的 MoE 模型,权重将于 7 月 27 日发布。在 Vals AI 指数上排名第 2,在 Artificial Analysis 智能指数上排名第 3,仅次于 Claude Fable 和 GPT-5.6 Sol Max,同时价格更低,并在前端代码竞技场排名第 1。
从 K3 发布切入,梳理开放权重与闭源前沿差距收窄后的经济与政策连锁影响。
Grok 4.5 在 Proximal 的 FrontierSWE 基准上综合实现与性能排名第 2,研究能力排名第 1,仅次于 Claude Fable 5,领先 Opus 4.8、GPT-5.5 和 GLM-5.2。
一段演示显示,速度参照眨眼约 0.4 秒,一本完整小说约 7 秒、Harry Potter and the Goblet of Fire 约 16 秒、一部电影长片剧本约 2 秒、10 万行代码约 38 秒。该演示由 xgo.ing 提供支持。