Epoch AI:推理模型问世以来,ECI 前沿能力每年提升 14 分
Epoch AI 数据显示,自推理模型出现以来,其 ECI(AI 能力指数)前沿水平以每年 14 分的速度提升。该机构此前在报告《Have AI capabilities accelerated?》中指出,ECI 等 AI 能力指标在推理模型出现后发生了趋势断点。相关趋势线、90% 预测区间及 bootstrap 样本数据已于 9 月 1 日更新。
Epoch AI 数据显示,自推理模型出现以来,其 ECI(AI 能力指数)前沿水平以每年 14 分的速度提升。该机构此前在报告《Have AI capabilities accelerated?》中指出,ECI 等 AI 能力指标在推理模型出现后发生了趋势断点。相关趋势线、90% 预测区间及 bootstrap 样本数据已于 9 月 1 日更新。
Qdrant 与 Vultr 合作发布开源向量检索基准 Qdrant-FineWeb-10B,含 24.47 TB 向量和 28.66 TB 源文本元数据,用 gte-multilingual-base 在 FineWeb 语料上生成 10.07B 稠密与稀疏向量,并为 10 万条查询算出精确 top-1000 真实近邻。
Epoch AI 发布 FrontierMath Erdős 基准,由 Thomas Bloom 从 erdosproblems.com 未解问题中挑选 68 道兼具数学意义与难度的问题,其中 50 道已由 Google Formal Conjectures 项目完成 Lean 形式化。
Qdrant 将举办一场关于混合检索调优的分享,其工作在 5 个数据集上评测混合检索流水线,用以判断哪些调优参数真正影响检索质量。重点不只是每个参数各自的作用,而是在真实数据上哪些参数真正重要。
Qdrant 的研究已超出传统向量搜索,将探讨双曲与球面几何、新的嵌入向量方法、非对称双编码器、更小的端侧查询编码器以及高效边缘检索架构。内容以系列第 5 篇形式发布,未给出具体模型、参数或基准数据。
Anthropic 把“模型能否对齐比自身更强的后继模型”作为首个测试:让 Sonnet 5 对 Opus 4.8 的一个早期 checkpoint 做后训练。该检查点最终达到的安全分数接近经过完整对齐训练的正式版 Opus 4.8。
Anthropic 公布新 Fellows 研究,测试 Claude 能否自主完成对其他 AI 的对齐工作。研究给 Claude 48 小时和 1 块 GPU,让它自行调研并提出方法,再独立训练和测试小模型,Anthropic 称效果出乎意料地好。
LlamaIndex 尝试了三种方法改进静态嵌入的检索效果:对逐 token 嵌入做原始 maxsim 打分、训练小型 adapter 模型、调整蒸馏训练目标与教师模型,均未取得预期结果。静态嵌入吞吐量无可匹敌,但相比传统嵌入模型存在精度损失。相关探索已发布在 LlamaIndex 博客。
Stanford 联合全球科研机构专家发布 Terminal-Bench-Science,用于评估 AI 智能体在跨科学领域科研工作流中的表现,v0.1 版本包含 70 项任务。Claude Opus 5 在该基准上仅解出约 30%。该基准由 Terminal-Bench 团队打造,是一项持续进行的 Stanford 主导社区项目。
Niklas Muennighoff 等人提出 Prefix Sliding,一种面向高效测试时扩展的简单快速方法,让 LLM 在长推理轨迹中“遗忘”部分前缀。该方法针对原生全注意力在长任务上 OOM、而压缩又会丢失关键细节的问题,效果可同时超过两者。
SALT Lab 研究了人们如何与 AI 协作,发现其中超过一半的对话涉及"高影响任务"——即会影响他人或难以撤销的工作。该团队已在 alphaXiv 发布完整研究文章。
LangChain 为开源代码库文档智能体 OpenWiki 构建了 WikiBench 基准,通过"读者智能体"回答基于代码仓库的问题来评估生成的 wiki 质量及其对编码智能体的实际帮助。
LlamaIndex 推出 ExtractBench,在 370 份企业文档、67 种文档类型、4800+ 页面上评测 schema 引导的信息抽取,覆盖扫描表单、嵌套表格、带合并表头的 40 页财报等场景。
微软研究院发布深度学习交换相关泛函 Skala 1.1,在提升精度的同时扩展了对计算化学生态系统的可及性,并引入可持续跟踪计算性能的 living benchmark。该版本为 Skala 的更新版本。
SemiAnalysis 发布 AgentX 1.0,称其为全球首个完全开源、100 万上下文的多轮智能体编码推理基准,Apache 2.0 许可,数据集与全栈工具投入超 300 万美元。
Jim Fan 转发 Dantong Niu 等人的 T-Rex:Tactile-Reactive Dexterous Manipulation,针对多数 Vision-Language-Action(VLA)模型忽略触觉反馈或无法响应高频接触信号的问题,给出数据与架构两方面的方案。
Jim Fan 宣布开源名为 T-Rex 的触觉方法,将触觉作为模型的一等公民:其 mixture-of-transformer 以异步双时钟运行,慢速视觉运动专家规划动作,快速触觉专家以每个视觉 tick 4 个触觉 tick 的高频修正实时细化动作。
一条 rank 30 的椭圆曲线被匿名发布,数学研究者 Robin Houston 给出了该曲线的具体方程,相关数据可在 elliptic-rank.icarm.cloud 查看。Kevin Weil 转发并表示,人类与 AI 每天共同学到关于世界的新东西,这让他每天早上都充满期待。
Microsoft Research 发布更新版深度学习交换关联泛函 Skala 1.1,精度更高,并扩展了对计算化学生态的兼容性。该版本同时提供一个持续更新的基准,用于追踪计算性能。
Niklas Muennighoff 等人在新工作"embedder's dilemma"中发现,LLM 在嵌入任务上已超过专用嵌入模型,但成本高得多。该研究探讨了在什么场景下应选择嵌入模型、什么场景下应选择 LLM。论文见 arxiv.org/abs/2608.12875。
Latent.Space 成员在今天的 paper club 上就 AI Engineer 的后训练演讲中涉及的 OPSD 展开深挖。在持续学习(Continual Learning)议题中,Trajectory 的 Ronak 介绍了他们如何应对 CL 遗留的核心数据问题,包括为何 GRPO 不够用、必须转向 on-policy 并逐一修复随之出现的问题。
LlamaIndex 推出 ExtractBench,对文档抽取的“依据”严格打分:字段值与其引文都正确才算对,词级框需 IoU 0.5。VLMs 和编码智能体均未返回任何证据,两级得分均为零;能返回框的系统中词级 F1 仍不足 50%。
Rowan Cheung 在 X 上分享了一篇发表于 ACM 的研究论文链接(dl.acm.org/doi/10.1145/38…),未附加额外说明或评论。
庆应大学与 MIT Media Lab 的研究者造出一台氦气填充的漂浮机器人,没有脸、没有旋翼和夹伤点,靠轻柔拍动的鳍片在房间中漂移并用动作与人交流。演示中它充当闹钟、学习伙伴、起身活动提醒,甚至舞伴。团队避开类人脸孔带来的恐怖谷效应,押注这种像宠物般可触摸的软体硬件能被人接受进入个人空间。
Import AI 第 469 期介绍新基准 DiG-bench,用 70 款隐藏规则的文字游戏测试 AI 自主发现环境规律的能力,Claude Opus 5 与 Fable 5 配合 Claude Code 表现最佳,GPT-5.5 紧随其后,但仅 Opus 5 和 Fable 5 能在最难的第 7 档取得 0.2 的成绩。
LlamaIndex 推出 ExtractBench,用 1950 年代监管文件、手填税表及经传真阈值化、复印机色调曲线、传感器噪声和手机拍摄退化的页面测试了 14 个文档抽取系统。
LlamaIndex 发布文档抽取基准 ExtractBench,覆盖 370 份企业文档、14 个系统,最难的测试是长列表完整性:26,725 行的无主财产清单、8,624 条债权人矩阵、3,063 项持仓的 13F。
Microsoft Research 推出 MindTopo 基准,用于测试 AI 对路径、栅栏、绳结等拓扑关系的理解能力。该基准揭示 AI 在空间推理与规划方面仍有提升空间,并指出新的改进机会。
Microsoft Research 推出 MindTopo 基准,用于评测多模态大模型在连通、包围、顺序、分离与打结五类拓扑关系上的推理与规划能力。测试显示,当前模型在静态识别上表现明显优于交互式规划任务,且两者均远低于人类水平,失败多发生在规划阶段而非感知阶段。图像与视频生成仅在前者能维持单帧可见关系时有所帮助,视频推演常改变拓扑或违反任务物理约束。
腾讯混元发布《Diving into Reliable Self-Evolving Agents》综述,为智能体自我进化建立系统图谱,提出 L0–L4 自进化分类体系和面向可信更新的可靠性阶梯,并整理 549 篇工作构成开放目录。其核心原则是:任何更新都不应掌控用于验证自身的唯一证据。
Microsoft Research 提出 CARE-X,探索将灵活推理、校准预测与基于测量的工具统一用于胸部 X 光解读,让放射学 AI 不再局限于生成报告。
微软研究院推出研究模型 CARE-X,一个统一胸部 X 光 VLM,可兼顾报告生成与结构化诊断预测,并用强化学习(DAPO)在多任务设置下奖励临床正确性。另一项独立实验中,团队将 Qwen3-VL-4B-Instruct 与确定性测量工具配对,检验直接计算能否改善心脏增大等依赖测量的病变判断。
LlamaIndex 发布 ExtractBench,用于评测复杂企业文档的信息抽取能力,测试覆盖 14 个系统(前沿 VLM、编程智能体和抽取 API)、370 份企业文档、4,869 页、67 种文档类型,全程无 LLM 评判、完全确定性。
Hugging Face 发布内容展示 AI 智能体如何复现 ICML 2026 的论文。该内容以直播形式呈现,配文附带 x.com 直播链接,未披露所用模型、复现数量或评测分数等具体细节。
Epoch AI 与 Ipsos 于 7 月 10–19 日调查 1,106 名美国在职成年人发现,20% 受访者称 AI 已接管至少一项原本交给同事或外包的工作,十项职场任务中 AI 使用率从维护记录的 25% 到设计系统与软件的 57% 不等。
Mistral 的内容审核模型把审核政策当作自然语言问题输入,直接返回校准后的评分,并在同一接口中同时处理文本和图像。完整技术报告已发布在 arXiv(2607.25857)。
微软研究院介绍多项成果:小语言模型通过 SocialRL 学习谈判,PazaBench V2 将语音 AI 评测扩展到多种非洲语言,EvoLib 则帮助智能体把经验转化为知识。此外还包括更可靠的 A/B 测试方法以及 AI 驱动精准肿瘤学的进展。
该推文分享了一项研究的链接,指向 pmc.ncbi.nlm.nih.gov 上的文章 PMC27…,未提供研究主题、结论或数据等具体信息。
Microsoft Research 提出 Echoverse,用于训练计算机操作 AI 智能体,让它们在真实环境中随任务、测试和环境的变化持续提升,而非单纯增加训练任务量。这类智能体目前在多步工作流(如邮件处理、客户支持)中仍表现吃力。
微软推出 EvoLib,将模型部署后积累的经验转化为可复用的技能与洞察,形成持续演化的知识,帮助 LLM 跨任务学习与适应,而非仅靠记住更多内容变聪明。