Qwen 发布 E-Commerce Bench:面向长周期自主商业运营的新基准
阿里 Qwen 推出 E-Commerce Bench,用于评测智能体长周期自主商业运营能力:智能体以 ¥100,000 本金经营网店 365 天,负责选品、谈判、定价、促销、库存与现金流。
阿里 Qwen 推出 E-Commerce Bench,用于评测智能体长周期自主商业运营能力:智能体以 ¥100,000 本金经营网店 365 天,负责选品、谈判、定价、促销、库存与现金流。
Proximal 发布超长程编程基准 FrontierSWE v2,新版本扩展了任务集并改进评测方法。各前沿模型在该基准上存在明显性能差距,Claude Fable 5.1 以较大优势领先。
Cursor 发布 CursorBench 完整评测结果,详情见 cursor.com/cursorbench。官方未在推文中披露具体模型版本、分数或价格等信息。
Gemini 3.8 Flash 在 cursor bench 上达到 69.9%,单任务成本为 2.38 美元。该信息来自一条简短的 X 推文,未给出评测设置或对比数据。
Firecrawl 的 Developer Index 在仓库检索评测中以 63.1% 平均分位居整体第一,拿下 issues/PRs 和 docs 两个赛道。原生网页搜索在查找仓库上表现良好,达 80.7%,但 docs 是最难的赛道,没有系统超过 50%,Developer Index 以 47.2% 领先该赛道。
LlamaIndex 的 ExtractBench 已在 Kaggle 上线,针对最容易击溃下游智能体与工作流的长记录列表、噪声扫描件、手写体和复杂表格,评测 schema 引导的文档抽取。该基准覆盖 8 个业务领域、67 种文档类型、共 370 份企业文档,并对比 LlamaParse、Codex、Claude Code 等方案的表现。
Gemini 3.8 Flash 在 DeepSWE 1.1 上取得 73.7% 的分数。该结果由 Logan Kilpatrick 在社交平台公布,帖文获得 3634 次点赞、551411 次浏览。
作者发布开源的 SBX AI Evaluation Kit,一个基于 Docker Sandboxes 的 Mixin Kit,用于让 AI 评测工作流更容易重跑、检查和对比。
阿里 Qwen 发布 Qwen3.8-Max-0902,在 Code Arena 的 WebDev 榜以 1,691 分登顶总榜第一,并以 $5/MToken 成为性价比前沿上得分最高的模型。
Claude Fable 5.1 现已登陆 Cursor,在 CursorBench 3.2 上以 max effort 取得 73.4%,是 Cursor 运行过的最强模型。该模型尤其擅长自我验证,可端到端承担高难度编码任务。
LatchBio 发布博客,评估 Grok 4.6 在生物领域的能力与安全防护措施。xAI 官方推荐阅读该评估内容。
LatchBio 对 Grok 4.6 在生物安全监控和对抗性生物任务上的评估显示,该模型能正确识别并拒绝危险查询,包括经过恶意混淆的生物任务,同时仍可回答有益的科研问题。xAI 在博客中公布了这一结果。
Z.ai 的 GLM-5.3 在 CyberGym 漏洞基准上达到 84.5%,超过多家头部闭源模型,也明显高于前代 GLM-5.2。据 DeepLearning.AI 介绍,这一提升完全来自对模型智能体能力的微调与优化,未改动基座模型;由于该模型在寻找和定位潜在漏洞方面能力过强,Z.ai 暂缓开放权重以进行安全测试。
HuggingFace 的检索基准包含 120,000 条查询,覆盖稠密、稀疏和过滤搜索三类场景。该基准用精确答案衡量深度检索与过滤效果,而非在合成语料上测 90% recall @10。
Qdrant-FineWeb-10B 已在 Hugging Face 上线,号称最大的开源向量检索基准数据集。该数据集包含 10B 篇 FineWeb 文档、gte-multilingual-base 生成的稠密与稀疏向量,向量规模 24.47 TB,文本与元数据 28.66 TB,并为 120,000 条查询提供精确 top-1,000 真值。
CommerceAgentBench 已开源,这是一个面向真实商业运营的智能体基准,最佳整体完成率约 62%。在评测的开放权重模型中,Qwen3.8-Max 在复杂商业工作流上取得最强综合表现。
Epoch AI 数据显示,自推理模型出现以来,其 ECI(AI 能力指数)前沿水平以每年 14 分的速度提升。该机构此前在报告《Have AI capabilities accelerated?》中指出,ECI 等 AI 能力指标在推理模型出现后发生了趋势断点。相关趋势线、90% 预测区间及 bootstrap 样本数据已于 9 月 1 日更新。
Qdrant 与 Vultr 合作发布开源向量检索基准 Qdrant-FineWeb-10B,含 24.47 TB 向量和 28.66 TB 源文本元数据,用 gte-multilingual-base 在 FineWeb 语料上生成 10.07B 稠密与稀疏向量,并为 10 万条查询算出精确 top-1000 真实近邻。
Qdrant 将举办一场关于混合检索调优的分享,其工作在 5 个数据集上评测混合检索流水线,用以判断哪些调优参数真正影响检索质量。重点不只是每个参数各自的作用,而是在真实数据上哪些参数真正重要。
Ollama 推荐试用 GLM 5.3,该模型与 Terminal-Bench 4.0 一同亮相,后者刚发布。帖子称基准测试的迭代速度正在追上模型开发。
腾讯混元发布新一代模型 Hy4 preview,总参数 770B、激活参数 49B、上下文长度 1M,属 MoE 架构,相比上一代强化了多步骤 Agent、代码开发和生产力任务能力。
Arena.ai 公布,腾讯混元 Hy4 preview 在 Code Arena WebDev 榜单以 1633 分(AutoEval)位列约第 5,较 Hy3 整体第 31 名提升 115 分;在开源模型中排约第 3,Hy3 当时为第 7。
Stanford 联合全球科研机构专家发布 Terminal-Bench-Science,用于评估 AI 智能体在跨科学领域科研工作流中的表现,v0.1 版本包含 70 项任务。Claude Opus 5 在该基准上仅解出约 30%。该基准由 Terminal-Bench 团队打造,是一项持续进行的 Stanford 主导社区项目。
Google DeepMind 正在试点前沿 AI 的双盲评估,为行业首创。该方法构建安全环境,测试提示词与模型权重均不公开,使外部对模型的安全与性能评估保持私密、稳健且可信。
Podium 借助 LangSmith 优化其 AI Employee 智能体,将工程介入减少 90%。团队用 LangSmith 追踪每次交互中 20-30 次 LLM 调用,构建数据集并微调模型,使判断对话自然结束的 F1 分数从 91.7% 提升至 98.6%,超过 98% 的质量阈值。
LangSmith 评估器新增「自我改进」能力,把人类对 LLM-as-a-Judge 输出的修正存为 few-shot 示例,并在后续迭代中回填进提示词,从而无需提示词工程即可让评估器对齐人类偏好。
Adam D'Angelo 指出,任何把多个模型的 tokens 混在一起统计的指标都毫无意义,tokens 无法跨模型比较。他表示这一判断一直成立,而随着模型日益多样化、推理占全部 tokens 的比重越来越大,这一点正变得越来越明显。
LangChain 为开源代码库文档智能体 OpenWiki 构建了 WikiBench 基准,通过"读者智能体"回答基于代码仓库的问题来评估生成的 wiki 质量及其对编码智能体的实际帮助。
LangChain 开源了用于评估 LLM 问答链的自动评估器,并发布免费托管的开源应用与 API 以扩大可用性。该工具结合 Anthropic 的模型生成评估集与 OpenAI 的模型评分评估思路,自动为输入文档生成 QA 测试集并对指定 QA 链自动打分;测试显示 TF-IDF 与 SVM 检索在该场景下略优于 k-NN,且评分结果随打分提示词变化(如 OpenAI 评分最严格)。
吴恩达(Andrew Ng)发布 AI 工程技能图谱(AI Engineering Skills Map)第一支柱"构建与部署 AI 应用",涵盖 LLM 基础、用数据为模型提供依据、构建智能体系统、评估驱动开发、生产环境运维和机器学习基础六个方向。
LlamaIndex 推出 ExtractBench,在 370 份企业文档、67 种文档类型、4800+ 页面上评测 schema 引导的信息抽取,覆盖扫描表单、嵌套表格、带合并表头的 40 页财报等场景。
微软 AI 发布 MAI-Image-2.6,在 Artificial Analysis 图像编辑榜单位列第一,超过自家 MAI-Image-2.5-Pro、Reve 2.1 和 OpenAI 的 GPT Image 2,微软因此占据该榜前两名。
OpenAI 在 Hot Chips 上公布了与 Broadcom 合作自研的推理芯片 Jalapeño,设计始于 2024 年中,约 16 个月完成流片,SemiAnalysis 受邀在其实验室用 InferenceX 实测该芯片。
SemiAnalysis 在 OpenAI 实验室实测其首款推理芯片 Jalapeño,给出逐场景吞吐与能效对比及架构细节。
SemiAnalysis 发布 AgentX 1.0,称其为全球首个完全开源、100 万上下文的多轮智能体编码推理基准,Apache 2.0 许可,数据集与全栈工具投入超 300 万美元。
Qdrant 提出用候选排序上限与 nDCG@10 基线之差来判断是否值得引入重排序:在 200 个候选的深度下,五个数据集的 nDCG@10 差距介于 0.247 至 0.487。
Fish Audio 的 S2.1 Pro 在 OpenRouter 上成为请求量第一的语音模型,超过 Google、Grok、MiniMax 和 Deepgram。该模型免费开放 3 周内吸引 200 万+ 开发者,免费策略将延续至 11 月。
SemiAnalysis 按早期扩展、推理、智能体三个时代分别用当时的基准和自建评测栈给模型打分,发现开源模型追上每个时代首个闭源模型所需时间逐代减半:早期从 Llama-2-70B 到 Llama-3.1-405B 历时一年多。
Firecrawl 将其 benchmark 开源在 github.com/firecrawl/bench,用户可自行运行,并欢迎申请加入评测名单。该 benchmark 只发布一半查询,另一半留作留出集,以防有人在测试集上训练。
ARC Prize 公布 Gemini 3.7 Flash 在 ARC-AGI 基准上的成绩:ARC-AGI-2 得分 84.6%,每任务成本 0.25 美元;ARC-AGI-1 得分 95.5%,每任务成本 0.12 美元。Patrick Loeber 引用该数据表示,相对其他前沿模型,Gemini 3.7 Flash 在低成本和两代 ARC-AGI 高分上表现突出。
Logan Kilpatrick 在 X 上发问:全球 AI token 支出中,用于跑 evals 的比例能占多少?该帖获 1093 次点赞、209265 次浏览,并附有 xgo.ing 投票互动。