Mistral Large 4 在 AutomationBench 上登顶,领先 Kimi K3、DeepSeek V4 Pro
Mistral Large 4 在 AutomationBench 上跑了 657 条业务流程,覆盖 Gmail、Google Sheets、Slack、Salesforce 等模拟办公应用,成绩超过 Kimi K3、MiMo-V2.6-Pro 和 DeepSeek V4 Pro。该基准围绕周一典型工作流设计,四个应用全部纳入测试。
Mistral Large 4 在 AutomationBench 上跑了 657 条业务流程,覆盖 Gmail、Google Sheets、Slack、Salesforce 等模拟办公应用,成绩超过 Kimi K3、MiMo-V2.6-Pro 和 DeepSeek V4 Pro。该基准围绕周一典型工作流设计,四个应用全部纳入测试。
AICodeKing 对 Mistral Large 4(代号 Le Chonk)进行了完整实测,围绕它是否是目前最好的开源模型展开评测。
LMArena 推出 Code Arena WebDev 排行榜,可通过 arena.ai/leaderboard/co… 查看。原文未披露上榜模型、分数及评测方法等细节。
Epoch AI 对比两轮 Ipsos 民调发现,报告过去 12 个月遭遇至少一次网络事件的美国成年人比例从 6 月的 46% 变为 9 月的 45%,总体无变化,也没有可统计检出的具体事件类型上升。
Epoch AI 更新了其用桌游 Earthborne Rangers 测试模型长任务学习能力的 EBR-bench:GPT-6 Astra 曾多次拿到满分,但所有最高分都依赖一张可绕过游戏回合限制的卡牌,官方因此在该基准默认设置中禁用此卡。
Epoch AI 发布 InnovationEval 评测,用一篇已发表的在线策略自蒸馏(SDPO)论文作基准,测试 AI 能否独立提出有同等效果的新后训练算法。
a16z 分享的 Top 50 消费级 AI 应用收入榜单显示,Replit 按支出位列 Top 10,按流量却排在倒数 5 名,流量与收入呈现出两套不同的叙事。榜单由 @omooretweets 在 Cosign 发布,反映出 AI 重度用户的付费集中在轻度用户不活跃的地方。
ArizeAI 的 Fuad Ali 展示了一套方法:把 AI 智能体的生产环境失败案例转化为 evals,用于测试修复是否引入回归,并加入人工审核环节。相关内容将在 10 月 12 日 AI Engineer New York Workshops 上讲解,该工作坊为会议附加环节。
LMArena 推出 Multi-Image Edit Arena,并在 arena.ai/leaderboard 上线对应榜单,用于比较多图编辑能力。原文未披露参与模型、评分指标或具体排名的更多细节。
Google 的 Nano Banana 2.1 已上线 LMArena 的文生图、图像编辑和多图编辑三个竞技场。它在多图编辑以 1431 分排第 4,文生图以 1328 分排第 5,图像编辑以 1428 分排第 6。
Google 的 Nano Banana 2.1 已进入 Text-to-Image Arena、Image Edit Arena 和 Multi-Image Edit Arena 三个榜单。
有观点指出,如果能在现有模型之上构建出好的 eval,就能迅速在所属领域或任务上站到前沿,这正是 eval 能带来的优势。Garry Tan 此前表示,如今可以借助智能体编写 markdown 技能并挂到 cron job 上,几乎完成所有有用的知识工作类型。
Justine Moore 实测了 Tavus 引发热议的新模型,认为其在实时交互视频上进步明显,全程无剪辑或加速,一些举止神态真实得令人意外。
Google Nano Banana 2.1 已在 OpenRouter 上线,以 Flash 速度提供 Pro 级图像生成与编辑。该模型超越此前所有 Nano Banana 版本,在视觉设计、基于蒙版的编辑和主体一致性上有大幅提升。
GitHub 推出开源基准 ReviewBench,用于评测 AI 代码审查工具能否发现真正重要的问题而不引入噪音。该基准基于对 1.039 亿个 GitHub pull request 的分析构建,包含横跨 19 种语言的 219 个 PR,支持开发者自带代码审查智能体进行评测并提交结果。
Parsewave 审查了 Zapier AutomationBench 全部 600 个公开任务,用智能体写出逼真的错误答案来诱导验证器,人工复核确认 206 个真实 bug,并全部修复,发布 AutomationBench Verified。
Parsave 对 Zapier AutomationBench 全部 600 个公开任务逐一审计验证器,智能体标记出 323 个可疑验证器,人工复核确认 206 个真实 bug,并已全部修复,发布 AutomationBench Verified。
Perplexity 在 Hugging Face Decision Index(决策模型基准)上排名第一。该模型采用开放权重,所有人均可访问。
GPT-6 Astra 在 Lilypond Bach Benchmark 上取得迄今最佳结果,其四声部众赞歌没有声部进行错误,和声语汇复杂到包含那不勒斯六和弦,并且是首个在该 benchmark 上写出经过音的模型。测试使用 Extra High effort,提示词要求在 LilyPond 2.24 中按巴赫风格写 G 小调 3/4 拍四声部众赞歌并只返回代码块。
NVIDIA Nemotron Labs 与 Artificial Analysis 合作,对开源模型展开评测。相关内容以直播形式发布。
Microsoft Research 新一期播客中,Jennifer Neville 讲述自己辗转多轮才走入计算机科学的经历,以及如何用更实用的评估方法推动当今 AI 系统。她认为研究进展往往是一条曲折的路。
作者称 Jev 的一个有趣之处是其一致性(consistent property),这对为智能体工作流构建可靠的评审器很有用。目前作者正在做一个小型 benchmark,以更广泛地测试这一点,并与其他决策 API 进行比较,更多内容将很快公布。
Perplexity Decider 在一项对标测试中被评为最佳决策模型,测试让 8 款决策模型对战俄罗斯方块,Decider 成绩始终位居榜首。该测试由 Alok Bishoyi 分享,并可在 app.routerplus.com 的 playground 中体验。
Jev-as-a-Judge 通过一致性提升 LLM judge 的可靠性,适合用作评判器、验证器和持续监控。该用例被评价为 Jev 最亮眼的应用之一,作者长期从事 agent evals、judges 和 verifiers 相关工作。
SemiAnalysis 对 Anthropic、OpenAI、Meta、MiniMax、月之暗面、智谱等厂商的订阅套餐做极限压力测试,结论是同等月费下 Anthropic 给用户的 Token 实际价值是 OpenAI 的 5 倍以上。
a16z 发布第七版 Top 100 消费级 AI 应用榜,首次加入收入榜,同时保留网页与移动端流量排名。ChatGPT 仍居第一,移动端月活超 1B;Claude 升至网页端第三,月访问量近 1B。
flow-1 是用 RL 训练的新模型,用于在 agent trace 中查找错误,其 trace intelligence 与 GPT-6-sol 相当,但成本低 23 倍,运行成本也比 GPT-6-luna 低 25%。它让监控和理解每一次 agent 运行、且无需采样成为可能。
Google DeepMind 发布开源嵌入模型 EmbeddingGemma 2,基于 Gemma 4,把文本、代码、图像、视频、音频映射到同一 768 维空间,文本路径为 270M 参数,支持 8K token 上下文,代码检索较初代提升 14%。
Pangram 不评估 50 词以下的帖子,因此作者推测这类短帖中由 AI 生成的比例可能更高。该帖互动数据为 4 条评论、46 次点赞、8782 次浏览。
半导体和 AI 产业研究机构 SemiAnalysis 实测了 Anthropic、OpenAI 等九家的 AI 订阅套餐,在两家主推的日常主力模型上,Claude 订阅折算出的价值约为 OpenAI 的 5 倍。
Thomas Wolf 表示希望 Opus 4.6 能长期保留,起因是 David Holz 让 LLM 自由玩耍并自评谁玩得最开心,结果较新的模型似乎乐趣更少。多数模型选择了文字游戏,而 Opus 4.6 反复胜出,方式是想象由矛盾构成、存在于下落水滴中的短暂世界。
Agent Arena 现已按类别提供智能体排行榜,用户可通过 arena.ai/leaderboard/ag 查看各分类下的排名情况。该榜单由 lmarena.ai 发布。
Agent Arena 按解决跨领域实际任务的智能体能力对模型排名,美国实验室在所有领域领先:Anthropic 模型在 Code、Work、Chat 均居第一,OpenAI 的 GPT 6 Astra(Max)在三个类别都进入前四,Code 第 2、Work 与 Chat 均第 4。
Simon Willison 重跑了 Colin Fraser 早前针对 GPT-4o 的长数字加法实验,这次改用本地运行的 Qwen 3.8 27B,并分别测试推理模式与非推理模式。原帖未给出具体得分,仅附上实验记录链接。
为给无字幕的 Youtube 和 B 站视频做转写,作者实测了豆包语音(极速)、硅基流动上的 Qwen3-ASR、GLM-ASR-2512、阶跃 2.5 ASR 和小米 MiMo-ASR 多家 ASR。豆包语音表现最完善,自带毫秒时间轴且速度较快。相关功能将上线乔木剪藏插件,新增本地 Whisper 与本地 Qwen3 ASR,并支持各类云端语音转文本 API。
MiniMax M3.1 Flash Preview 于 9 月 27 日上线 MiniMax Code 并开启公测,作者用动态简历、相机拆解实验台和纸艺项目复刻三个案例实测其前端能力。
Judith Dada 发布可视化后,Anton Osika 提出质疑:"饱和"是否意味着 benchmark 只对人类有效,对 ASI 并不适用?Dada 回应称这是合理批评,她此前被过去的锯齿状可视化所影响,并表示现在的图形应更接近新的样子。
外网博主 @imjustnewatai 用 Fable 5.5 输入一句提示词,生成了一部 3 分钟人类数万年进化史短片,把人类发明史压缩成一天 24 小时,从 23:40 的洞穴壁画到 00:00:00 的 2026 年,再以指数速度想象 2031 年之后。
据 Anthropic 数据,开源模型 GLM-5.3 解决了 ExploitBench 漏洞利用任务中的 12%,Claude Mythos 解决 14%。本周通讯中还提到,仅花 20.40 美元的 token 就找到了 Google Chrome 的一个近期安全漏洞;Andrew Ng 对担忧这些能力落入坏人之手的人持不同看法,他认为这是工程问题,防御方长期占优。
W&B 的 Zubin Aysola 演示了把 ARIA 的一次生产 trace 转成 eval,并用它来基准测试修复效果。这是「智能体出错后能否变成测试」的实操分享,完整录播见 youtu.be/XyV6bSMyq-I。相关活动将于 10 月 12–14 日在纽约举行,报名入口 ai.engineer/nyc/2026。