Sonnet 5.5 在比拼中胜过 Asta 和 Sol
Sonnet 5.5 在比拼中胜过 Asta 和 Sol,发帖者对此表示意外。
Sonnet 5.5 在比拼中胜过 Asta 和 Sol,发帖者对此表示意外。
Anthropic 发布小型模型 Claude Haiku 5.5,平均价格比 Haiku 4.5 低约 75%,10 万 token 以内的提示词最高降价 90%,同时 Sonnet 5.5 的缓存读取价格减半。
Nano Banana 2.1 在三项 Image Arena 模式中均进入前六:Multi-Image Edit 第 4(1431 分)、Text-to-Image 第 5(1328 分)、Image Edit 第 6(1428 分)。
OpenAI 发布数学成果,被 Opus 称为"史上影响最深远的一次数学成果发布"。LLM 已在 7 个千禧年大奖难题中的 4 个上取得实质性进展,但该判断的前提是相关结果需要通过验证。
StepFun 的 8 项基准评测显示,Step 5 Preview 在其中 6 项超过 Kimi K3 和 GLM-5.3,包括 DeepSWE(67.7)、ProgramBench(80.5)、StepCodeBench(49.0)和 FrontierFinance(66.4)。
GPT-6 Luna 成为当前最快的 Decisions 模型,全球请求延迟为 180ms。其后依次为 Jev 和 Perplexity Decider。
Mistral Large 4 预览版在 Code Arena: WebDev 以 1534 分位列第 45 名,比 Mistral Large 3 提升 304 分,使 MistralAI 进入该榜前 15 实验室,是唯一上榜的欧洲实验室。
Claude Haiku 5.5 在 Code Arena 得分 1587 分,比 Haiku 4.5 的 1330 分提升 257 分,且各分类均有明显进步。相关榜单可在 Code Arena: WebDev(arena.ai/leaderboard/co…)查看。
Arena.ai 公布 Claude Haiku 5.5 (High) 在 Code Arena: WebDev 的真实评测结果,首秀以 1587 分排在第 30 位,略在帕累托前沿之外,但仍然具备很强的成本效率。
Mistral Large 4 在 Agent Arena 超过 5000 场真实智能体会话中录得 -6.6% 的净提升分数,位列总榜第 43,比上一版本 Mistral Medium 3.5(-12.60%)高 11 个名次。
LovartAI 发布 Nano Banana 2.1 与 GPT Image 2.5 的人像生成对比图,称 Nano Banana 2.1 在光影和皮肤质感上大幅领先。
Anthropic 的 Haiku 5.5 定价低于 DeepSeek-V4.1 flash 和智谱 GLM 5.3 flash,在 Terminal Bench 4.0 上比 GLM 5.3 flash 高一分,与其他两个中国竞品相当或更高。Anthropic 还向每个 Max 和 Team 用户赠送对应额度的 API 金额,该 API 可在任何支持输入 API 的产品中使用。
Haiku 5.5 在 Browser Use Bench v2.1 上跑出与 Luna 相同的性能,但价格是后者的 2.8 倍。Haiku 在上下文超过 100k 后价格再涨 5 倍,且缓存 token 也计入其中;而 BU Bench 2.1 多为极长时程任务,会频繁触及该定价档位。
Cursor 公布 Claude Haiku 5.5 定价为 $0.10/M 输入与 $0.50/M 输出 tokens,输入超过 100k tokens 后升至 $0.50/M 和 $2.50/M。
在 Q2D-Web 上,约 7 万条生产环境搜索查询、覆盖 1.9 亿篇网页文档的条件下,9B 和 0.6B 模型分别达到 74.8% 和 73.6% 的 Recall @1000,高于 nemotron-embed-8b 的 69.3%。
在 Harvey 的法律智能体基准 LAB(Legal Agent Benchmark)上,Mistral Large 4 成为排名第一的开源模型(oss model)。该结果由 Mistral AI 公布,评测针对法律领域的智能体任务。
Mistral Large 4 在 AutomationBench 上跑了 657 条业务流程,覆盖 Gmail、Google Sheets、Slack、Salesforce 等模拟办公应用,成绩超过 Kimi K3、MiMo-V2.6-Pro 和 DeepSeek V4 Pro。该基准围绕周一典型工作流设计,四个应用全部纳入测试。
AICodeKing 对 Mistral Large 4(代号 Le Chonk)进行了完整实测,围绕它是否是目前最好的开源模型展开评测。
Google 的 Nano Banana 2.1 已上线 LMArena 的文生图、图像编辑和多图编辑三个竞技场。它在多图编辑以 1431 分排第 4,文生图以 1328 分排第 5,图像编辑以 1428 分排第 6。
Google 的 Nano Banana 2.1 已进入 Text-to-Image Arena、Image Edit Arena 和 Multi-Image Edit Arena 三个榜单。
Justine Moore 实测了 Tavus 引发热议的新模型,认为其在实时交互视频上进步明显,全程无剪辑或加速,一些举止神态真实得令人意外。
Google Nano Banana 2.1 已在 OpenRouter 上线,以 Flash 速度提供 Pro 级图像生成与编辑。该模型超越此前所有 Nano Banana 版本,在视觉设计、基于蒙版的编辑和主体一致性上有大幅提升。
Perplexity 在 Hugging Face Decision Index(决策模型基准)上排名第一。该模型采用开放权重,所有人均可访问。
NVIDIA Nemotron Labs 与 Artificial Analysis 合作,对开源模型展开评测。相关内容以直播形式发布。
flow-1 是用 RL 训练的新模型,用于在 agent trace 中查找错误,其 trace intelligence 与 GPT-6-sol 相当,但成本低 23 倍,运行成本也比 GPT-6-luna 低 25%。它让监控和理解每一次 agent 运行、且无需采样成为可能。
Agent Arena 按解决跨领域实际任务的智能体能力对模型排名,美国实验室在所有领域领先:Anthropic 模型在 Code、Work、Chat 均居第一,OpenAI 的 GPT 6 Astra(Max)在三个类别都进入前四,Code 第 2、Work 与 Chat 均第 4。
外网博主 @imjustnewatai 用 Fable 5.5 输入一句提示词,生成了一部 3 分钟人类数万年进化史短片,把人类发明史压缩成一天 24 小时,从 23:40 的洞穴壁画到 00:00:00 的 2026 年,再以指数速度想象 2031 年之后。
据 Anthropic 数据,开源模型 GLM-5.3 解决了 ExploitBench 漏洞利用任务中的 12%,Claude Mythos 解决 14%。本周通讯中还提到,仅花 20.40 美元的 token 就找到了 Google Chrome 的一个近期安全漏洞;Andrew Ng 对担忧这些能力落入坏人之手的人持不同看法,他认为这是工程问题,防御方长期占优。
Cohere 使用 WMT26 基准测试其翻译模型 North Small Translate,该基准在模型创建之后才发布,因此模型无法针对其指标进行训练。
智东西实测 MiniMax M3.1-Flash 在动效视频、鸡尾酒动画和像素巫师等前端任务上的表现,并与 Claude Opus 5.5 对比,部分细节处理甚至更丰富。M3.1-Flash 基于 M3 系列的 1M 上下文窗口和原生多模态训练路线,能主动补全设计细节并直接交付完整可用的交互成品。该模型国庆前夕上线并开启公测,目前仍处于公测阶段。
蚂蚁百灵新一代大模型 Ling-3.1-Flash 在「Teenage Engineering 风格信息卡」提示词测试中一把过,输出效果达标。该模型为 560B/A25B MoE 架构,支持 1M token 上下文,输出速度基本维持在 100+ tokens/s,整个推理生成与校验流程约 2-3 分钟完成。
OpenAI 的 GPT-6.1 Sol (Max) 进入 Agent Arena 榜单第 5 名,成绩提升 11.23%,并改写了帕累托前沿。其单任务成本中位数为 $0.56,性能与 GPT-6 Sol 相差 2 个百分点以内,成本低 39%。
Cohere 的 Embed 5 成为首个使用 RCP-nDCG @10 评测的模型家族。这一最新评测方法改进了对真实检索质量的评估,因此 Embed 5 的基准分数看起来与以往不同。
Claude Sonnet 5.5 在 Agent Arena 排名第 3,单任务中位成本 2.74 美元,净提升分数 +12.5%。Claude Opus 5.5 排名第 2,单任务成本 1.58 美元且得分更高,这一权衡使 Sonnet 5.5 未能进入 Agent Arena 的帕累托前沿。
Arena.ai 公布 Claude Sonnet 5.5 (Max) 在 Agent Arena 首次登榜即排名第 3,净提升 +12.5%,比排名第 13 的 Claude Sonnet 5 (High)(+4.4%)高出 8.1 个百分点。
OpenAI DevDay 后 GPT-6.1 Sol (Max) 进入 Code Arena: WebDev 排第 3,以 $8/MToken 进入帕累托前沿;同日 Sonnet 5.5 上榜后 Sol 降至第 4 并跌出前沿,Sonnet 现以低 80% 成本落后第 2 名 GPT-6 Astra (Max) 2 分。
作者在 MiniMax Code 里沿用 Claude Opus 5.5 公开案例的提示词,用 MiniMax M3.1 Flash Preview 同题生成动态设计作品集。
GPT-6.1 Sol 在 Browser Use Bench 2.1 上跑出该基准测得的最高分,超过 Astra,估算成本低 7.8 倍。其便宜的原因是 95% 的提示词 token 被缓存,而缓存 token 单价是 Astra 的 1/10。Opus 5.5 与 Grok 4.7 得分更低且成本更高。
Gemini 4 Argon 在 AA Coding Agent Index 上使用 Antigravity harness 取得不错成绩,不过真实世界使用情况更为重要。发布者表示后续还有更多进展。
Google 发布 Gemini 4 Argon,在 Google 公布的 19 项基准中拿下 13 项第一,对比对象为 GPT-6 Astra 和 Claude Opus 5.5。