Ling-3.1-Flash 实测:蚂蚁百灵 1M 上下文模型一把过 TE 风格信息卡
蚂蚁百灵新一代大模型 Ling-3.1-Flash 在「Teenage Engineering 风格信息卡」提示词测试中一把过,输出效果达标。该模型为 560B/A25B MoE 架构,支持 1M token 上下文,输出速度基本维持在 100+ tokens/s,整个推理生成与校验流程约 2-3 分钟完成。
蚂蚁百灵新一代大模型 Ling-3.1-Flash 在「Teenage Engineering 风格信息卡」提示词测试中一把过,输出效果达标。该模型为 560B/A25B MoE 架构,支持 1M token 上下文,输出速度基本维持在 100+ tokens/s,整个推理生成与校验流程约 2-3 分钟完成。
ValsAI 的 Rayan Krishnan 将在 AI Engineer New York(10 月 12–14 日,纽约)分享构建 benchmark 的经验,主题是哪个 AI 模型最适合金融工作流。其核心结论是:没有任何单一模型在所有任务上都领先。
OpenRouter 为每个 benchmark 给出 Router Index 评分,权重为 60% 质量、20% 每任务耗时、20% 成本。页面提供滑块,用户可拖动调整权重,找出符合自身优先级的领先模型。
OpenRouter 上线 Model Router Benchmarks,可在 6 项基准上并排对比 7 款模型路由器的质量、速度与成本,Jev Router、Unbiased Pareto、NVIDIA Switchyard 等已可直接使用。
Agent Arena 的实时结果与帕累托前沿现已可通过 arena.ai/leaderboard/ag 查看。该页面用于展示各 AI 智能体在 Arena 评测中的实时排名与前沿分布。
OpenAI 的 GPT-6.1 Sol (Max) 进入 Agent Arena 榜单第 5 名,成绩提升 11.23%,并改写了帕累托前沿。其单任务成本中位数为 $0.56,性能与 GPT-6 Sol 相差 2 个百分点以内,成本低 39%。
Cohere 提出 RCP-nDCG@10,替代传统 nDCG 只给答案键内结果记分的做法,对每条结果按其真实相关性打分。该指标结果由人工审核员与 MTEB 背书。
Cohere 的 Embed 5 成为首个使用 RCP-nDCG @10 评测的模型家族。这一最新评测方法改进了对真实检索质量的评估,因此 Embed 5 的基准分数看起来与以往不同。
Agent Arena 帕累托前沿的实时结果已可查看,访问 arena.ai/leaderboard/ag 即可查看该排行榜。
Claude Sonnet 5.5 在 Agent Arena 排名第 3,单任务中位成本 2.74 美元,净提升分数 +12.5%。Claude Opus 5.5 排名第 2,单任务成本 1.58 美元且得分更高,这一权衡使 Sonnet 5.5 未能进入 Agent Arena 的帕累托前沿。
Code Arena 上线 WebDev 排行榜,可在 arena.ai/leaderboard/co… 查看。该榜单由 xgo.ing 提供支持。
Arena.ai 公布 Claude Sonnet 5.5 (Max) 在 Agent Arena 首次登榜即排名第 3,净提升 +12.5%,比排名第 13 的 Claude Sonnet 5 (High)(+4.4%)高出 8.1 个百分点。
OpenAI DevDay 后 GPT-6.1 Sol (Max) 进入 Code Arena: WebDev 排第 3,以 $8/MToken 进入帕累托前沿;同日 Sonnet 5.5 上榜后 Sol 降至第 4 并跌出前沿,Sonnet 现以低 80% 成本落后第 2 名 GPT-6 Astra (Max) 2 分。
LMArena 研究指出人类偏好奖励对后训练图像模型必要但不充分,模型仍会奖励好看却丢细节或引入无关内容的输出,因此提出复合奖励:约 560 万对人工投票训练的 Bradley-Terry 奖励模型、由视觉语言模型评估自动生成提示词清单的忠实度奖励、约束奖励与反奖励黑客评分奖励。
作者在 MiniMax Code 里沿用 Claude Opus 5.5 公开案例的提示词,用 MiniMax M3.1 Flash Preview 同题生成动态设计作品集。
GPT-6.1 Sol 在 Browser Use Bench 2.1 上跑出该基准实测最高分,得分超过 Astra,估算成本低 7.8 倍。其 95% 的 prompt token 命中缓存,缓存 token 价格比 Astra 便宜 10 倍。Opus 5.5 与 Grok 4.7 得分更低且成本更高。
HeyGen 9 月面向开发者推出三款工具:基于 OpenAI GPT-Live-1 的开源实时数字人栈、与 Kaggle 合作的 Code2Video 基准(用于衡量 AI 生成视频质量),以及面向 API 的专业语音克隆。
Halluminate 正在构建强化学习环境与基准,让 AI 模型掌握编程之外的知识工作,首个落地领域为金融。团队不足 10 人,已与 5 家美国头部闭源 AI 实验室中的 4 家合作,并完成 3000 万美元 A 轮融资。其路径从浏览器智能体测试延伸到金融建模等训练环境,并强调更好的验证机制比更多训练任务更关键,未来目标是构建 AI 智能体团队协作的模拟公司。
LangChain 在两个自研智能体上测试 OpenSWE Review,其精度从 62.9% 提升至 81.5%,每次审查的工具调用减少 29%。基于 Kimi K3 微调的 Engine 在问题检出基准上超过了基座模型与 GPT-5.6 Sol。相关细节见 LangChain 博客。
AbridgeHQ 把临床医生反馈构建进评估系统,帮助团队衡量智能体质量、识别改进点并支持更快发布。这是医疗机构从主观评审转向可重复的生产级 AI 评估系统的一个案例。LangChain 免费指南中有更多相关内容。
Logan Kilpatrick 表示,Google 现在在大规模模型测试上已有明显改进,多数新的 Gemini 版本在发布前会经过数千名软件工程师(SWE)为期数周的测试。他认为这有望以可观幅度缩小 benchmark 与真实表现之间的差距。
Varun Mohan 表示,Gemini 4 Argon 搭配 Antigravity harness 在 AA Coding Agent Index 上表现不错,并强调真实世界使用更重要,后续还有更多进展。他同时回复网友称竞争相当激烈。
Gemini 4 Argon 在 AA Coding Agent Index 上使用 Antigravity harness 取得不错成绩,不过真实世界使用情况更为重要。发布者表示后续还有更多进展。
Convai Innovations 的评估/决策模型 Laya 现已上线 AI Gateway,通过 Boundless 提供服务,2026 年 10 月 31 日前免费。
Google 发布 Gemini 4 Argon,在 Google 公布的 19 项基准中拿下 13 项第一,对比对象为 GPT-6 Astra 和 Claude Opus 5.5。
Perplexity 开源其上下文嵌入模型,其中 pplx-embed-v2-context-9b-preview 在 ConTEB 和 turbopuffer 新推出的非公开 context-bench 上均刷新 SOTA。该模型采用新训练方式,编码文档每个片段时会以整篇文档为上下文。官方称其在 turbopuffer 的 context-bench 上表现最佳。
在 ConTEB 基准上,该预览版模型取得所测模型中最高的平均 nDCG@10,但并非每个任务都领先。它在 chunk retrieval 上超过 voyage-context-4,且每个向量仅占 1 KB(1024 维、int8),相比后者的 8 KB(2048 维、float32)存储占用降低 8 倍。
Fireworks 的 Ember-1 已可在 Fireworks Serverless 上调用,Vals AI 的独立测试显示其在金融和法律基准上表现接近 Kimi K3,同时每轮推理 token 用量更少。每轮 token 更少意味着单次调用成本更低、智能体循环更快。
Ideogram 4.5 在 Image Editing 榜单以 1250 的 Elo 排名第 15,与微软 MAI-Image-2.6 和 Google DeepMind 的 Gemini 3 Pro Image Preview 处于同一性能区间。该模型虽专为精准定向编辑打造,但在通用编辑任务上表现同样出色,尤其在排版类编辑(如修改信息图中的文字)上优势明显。
Ideogram 4.5 与 GPT Image 2.5 Sunburst、Nano Banana Pro、Nano Banana 2 进行了同一组编辑的逐轮对比。Ideogram 4.5 在多次编辑后仍保持画面干净,而 GPT Image 与 Nano Banana 的输出在几轮编辑后就变得不可用。
Recraft V4.1 Flash 在 Design Arena 榜单上成为速度最快的模型,生成质量还优于许多耗时十倍于它的模型。该成绩由 Recraft 公布。
Towards AI 联合创始人兼 CTO 将在 AI Engineer New York 分享:因不满 AI 生成的流水线内容,他基准测试了 148 个模型,寻找能模仿自己文风的模型,并发现衡量"品味"必须依赖人工评分。活动时间为 10 月 12 日至 14 日。
Cohere 发布高吞吐、高速选项 Embed 5 Fast,在 fast-tier 模型中领先 6 分以上,成本比 Pro 低三分之一。Embed 5 也是首个采用 RCP-nDCG @10 检索评测方法评估的模型家族。
Umesh 获得 Kling 4.0 Flash 早期访问权限并进行了首批尝试,称其提示词理解能力出色。他同时公开了所使用的提示词,并带上 #Kling4 标签。
腾讯 WorkBuddy 上线微信小程序发布能力,把代码生成、预览、调试、发布、云服务、数据库调用打包进同一流程。十字路口团队用它做了校园流浪猫图鉴和一句话情绪日记两个小程序,后者从提示词到真机预览约半个多小时,算上开发可控制在 3 小时内。流程中 WorkBuddy 会查询内置 wechatide-skill、自动安装微信开发者工具并生成真机预览二维码。
MiniMax 于 9 月 27 日在 MiniMax Code 上线 M3.1-Flash-Preview,1M 上下文,原生支持文字、图片、视频输入,思考强度五档可调,主力场景是 Coding。
Anthropic 为 Claude Code 发布新的评测工具,claude-api 插件新增 build_eval 和 hill-climb 命令,用于构建评测、检查评分器并据此改进应用。
LlamaIndex 对 Jev 与其他开源模型(含通用分类器和文档专用模型)在方向检测、语言检测、分类、切分等文档任务上做了基准测试,衡量准确率、成本和延迟三个维度。Jev 在多数基准和这三个维度上领先。相关代码已开源于 github.com/run-llama/jev_。
对 GPT-6.1 Sol 在文档 OCR 任务上的综合基准测试显示,其表格解析能力与阅读顺序较一周前的 GPT-6 Sol 有明显提升,表格解析水平已接近 GPT-6 Astra。前沿模型在文档解析上仍通常比高性价比方案贵一个数量级,但这也意味着"高端"档位(每页超过 1 美分)的能力提升空间很大。
LangChain 宣布 Jev 已可作为 LangSmith 评测中的评审模型(judge)使用,团队可以在任意 tracing 项目的 Evaluators 选项卡中配置。