Epoch AI:OpenAI Codex 代码库贡献出现 AI 提效迹象
Epoch AI 分析 OpenAI 公开 Codex 仓库的 41 位核心贡献者,用 LLM 评委估算每个已合并 PR 在无 AI 辅助下所需的工程师工时。2026 年 Q2 有 8% 的贡献者-日对应超过 24 小时的无辅助工作量,高于 2025 年 Q2 的 2%。Epoch 指出 LLM 评委的估算并不完美,只能视为节省时间的上限。
Epoch AI 分析 OpenAI 公开 Codex 仓库的 41 位核心贡献者,用 LLM 评委估算每个已合并 PR 在无 AI 辅助下所需的工程师工时。2026 年 Q2 有 8% 的贡献者-日对应超过 24 小时的无辅助工作量,高于 2025 年 Q2 的 2%。Epoch 指出 LLM 评委的估算并不完美,只能视为节省时间的上限。
Import AI 464 汇总多项 AI 研究进展。Fable 在 KernelBench-Mega 上以单次协作 kernel 启动实现 18.71X 加速,超过 Claude Opus 4.8、GLM-5.2、GPT 5.5 等用 Triton 的尝试。
Stanford AI Lab 公布其在 ICML 2026 的完整论文清单,涵盖编码智能体、LLM 推理、评估与基准、AI 安全与可解释性、AI for science 等方向。ICML 2026 在首尔举行,该实验室邀请参会者到场交流。
在 ICML 2026 论文《Truthfulness Does Not Scale Like Reasoning》中,研究者发现 LLM 预测其他模型会说什么的准确率高于预测事实真相,且模型犯错时会"一起犯错",因此通过多次采样投票无法恢复真相。Pass@k 与自一致性在数学和代码等有验证器的领域有效,但在没有验证器的领域中无法扩展真实性。论文将在首尔 ICML 2026 会议上报告。
Stanford AI Lab 团队在 ICML 2026 workshop 获得 Oral 接收,共同负责人包括 @jchudnov、@JoshuaK92829 和 Noam Levi,合作者还有 @RylanSchaeffer、@yegordb、Bo He、Mehmet Donmez、@sanmikoyejo 和 David Donoho。
斯坦福 AI Lab 分享的研究《Internal Data Repetition Destroys Language Models》量化了预训练数据去重后残留重复的代价:最坏情况下可浪费高达 33% 的算力(FLOPs),且最坏情况的重复结构可由模型规模预测。
Lilian Weng 在 Lil'Log 发表长文,系统梳理 harness engineering 与递归自我改进(RSI)的研究脉络。文章把 harness 定义为围绕基座模型、负责编排执行与上下文管理的系统,并归纳出工作流自动化、文件系统作持久记忆、子智能体与后台任务三类设计模式。
Stanford AI Lab 提出 Freeform Preference Learning,让标注者用自然语言描述偏好轴,并据此学习条件奖励、提取更优策略。该方法针对机器人反馈中单一偏好会掩盖信息的问题——如同样的两条轨迹,一条掉了餐具、一条掉了盘子,只问一个偏好无法体现差异。相关博客与论文已公开(arXiv 2606.32027)。
Stanford AI Lab 提出 QuasiMoTTo,通过改用相关采样而非独立并行采样来扩展推理算力,减少重复求解带来的浪费。该方法在测试时扩展中实现同等性能、样本量减少 25-47%,并将 RL 训练步数减少 50%;相关样本覆盖度更高,边际上仍是 LLM 的精确采样,且可并行生成。
Epoch AI 的数据分析显示,2026 年 6 月多家机构披露约 1500 个高危和严重级 CVE,超过 Mythos 发布前月度纪录的 3.5 倍。
Jim Fan 公布 Physical AutoResearch 系列第二项工作 ASPIRE,让机器人通过自进化技能库实现持续学习,解决第 100 个任务时不再像第一个任务那样毫无头绪。
B站大语言模型团队将在 ACL 2026 展示 FATE 系列成果 SABER 与 CASTER,并现场开放「B-UP 顶尖技术人才项目」校招与实习岗位投递。SABER 提出可切换、受 Token 预算约束的混合思考训练范式,实验显示 FastThink 模式在 MATH、GSM8K、MBPP 及逻辑推理任务上推理长度减少 65%~80% 同时保持甚至提升准确率。
Modal Research 与 NYU Shanghai HeavyBall Research 提出多 token 残差预测(MRP),用一个 3 层小模块预测相邻去噪步之间的 logit 残差,让冻结的扩散语言模型骨干一次前向解码多个 token。
Epoch AI 发布 EBR-bench 基准,让 AI 系统反复游玩桌游 Earthborne Rangers,测试其能否从经验中学习。结果显示几乎没有证据表明 AI 能在重复游玩中进步,GPT-5.5 和 Opus 4.8 的分数提升来自更高的初始分而非边玩边学。
NVIDIA GEAR 实验室联合 UMich、Berkeley、CMU 推出 ASPIRE,被称为首个面向机器人的自动化技能发现系统。它不再逐一解决任务,而是持续发现并积累可复用技能,从而支持多任务迁移、sim-to-real 迁移与跨本体迁移。项目论文与画廊已上线研究主页。
Stanford AI Lab 在推文中分享了 ai.stanford.edu 上的一篇博客文章(rnb-encor),并 @ 了 milanganai 和 katielulula。推文未透露文章的具体主题或技术细节。
斯坦福 SAIL 新博客介绍了 R&B-EnCoRe,展示 Vision-Language-Action 模型如何自教自学哪些链式推理真正有助于行动,无需奖励、验证器或人工标注。
NVIDIA 推出 ENPIRE 框架,让编码智能体驱动真实机械臂自主试错、自动重置与评估,在 PushT、整理插针、用切割器剪扎带等任务上实现 99% 成功率。
Meta 发布 Brain2Qwerty v2,这是可从非侵入式脑记录实时解码句子的端到端流程,实现 61% 的词准确率,而其他非侵入式方法为 8%,表现最好的受试者达到 78%。
Stanford AI Lab 发布了一项由 @kushin_m、@danielwurgaft、@LinasNasvytis、@michaelyli_、@noahdgoodman 和 @mcxfrank 共同完成的成果。原文除作者名单外未披露具体模型、参数或评测信息。
Stanford AI Lab 分享的 Auto-psych 让 AI 智能体自行走完整个科研闭环:提出理论、设计实验、在线招募真实受试者,并根据结果迭代改进。研究者 noahdgoodman 称,他多年来设想的"自动化心理学研究"这次因 AI 取得了实质进展。
XLANG NLP Lab 发布 OSWorld 2.0,用于在长时程真实任务上评测计算机操作智能体。基准包含 108 个真实工作流,每个约需熟练人类 1.6 小时,平均约 318 次工具调用,而 OSWorld 1.0 约为 30 次。
METR 在 NDA 下对 GPT-5.6 Sol 做了独立外部评估,OpenAI 提供了最终 checkpoint、railfree 版本、raw chain-of-thought 的 API 访问以及 Codex harness 配置指南。
Epoch AI 与 METR 联合发布 MirrorCode 基准,用于测试 AI 在长周期编码任务上的能力,任务是让模型在没有原始源码的情况下端到端重写整个程序,AI 方案需在包括留出测试在内的端到端测试中与原始程序输出完全一致。
OpenThoughts-Agent-v2 在算力受控对比中于每个训练集规模上均领先,并跨七个 agentic benchmark 实现泛化。同系列还发布 OpenThinkerAgent-32B,号称基于 Qwen-3 的最强开放数据 agentic 模型,在 7 个 agentic benchmark 上平均得分 44.8%。
斯坦福 AI Lab 提出 Spiral,一个用强化学习让模型端到端学会协调串行、并行、聚合三种推理计算方式的框架。它用 set RL 训练模型生成对聚合器集体有用的回答,再用标准 RL 训练模型把这些回答聚合成更优答案,且仅依赖最终输出的奖励。该工作旨在解决训练只优化串行计算、与部署时多轴扩展推理算力之间的错配。
一篇技术综述梳理了 scaling laws 的经验基础:Amari 等(1992)用贝叶斯方法导出四类幂律学习曲线,Hestness 等(2017)在机器翻译。
Stanford AI Lab 公布一项由 jubayer_hamid、ifdita_hasan、michaelyli_、oshaikh13、yoonholeee、DorsaSadigh、chelseabfinn、noahdgoodman 等组成的团队完成的新成果。原文未披露成果名称、模型版本或具体指标。
斯坦福 AI Lab 提出 Spiral,一个用强化学习让模型端到端掌握串行、并行与聚合三种推理算力原语的框架。它用集合 RL 训练模型生成对聚合器集体有用的回答,再用标准 RL 让它把多个回答聚合成更优答案。目前仅优化串行算力的训练方式与部署时的多轴扩展存在根本错配,Spiral 仅凭最终输出奖励即可学习协调三种推理方式。
牛津大学、英国 AI 安全研究所、斯坦福和伦敦政治经济学院的研究者通过四项实验、18978 场对话和 6923 名参与者发现,AI 系统在文本说服上比专家人类更有效,即使在专家自选议题、提前研究并接受训练后依然如此。
网络安全评测普遍遵循四个组件:Docker 沙箱目标、影响难度的输入(如仅给脆弱代码对应 zero-day,或附带补丁与 PoC 对应 one-day)、工具集以及确定性打分器。
Stanford AI Lab 在推文中分享了 Peter Hase 与 Chris Potts 关于 CoT 监控(cot-monit)的博文,链接指向 ai.stanford.edu/blog/cot-monit。
Stanford AI Lab 发布新 SAIL 博客文章,由 @peterbhase 与 @ChrisGPotts 撰写,梳理 CoT Monitoring 这一 AI 安全问题热点的历史渊源。文章追溯了这一重要理念的发展脉络。
斯坦福 AI Lab 提出 M*,一个统一运行时,用于服务已不再是单一 decode loop、而是复合结构的现代多模态模型。它在 omni TTS 上最高提速 2.7×,在 world-model rollout 上提速 12.5×,并声称匹配或超越各专用系统。
Google 同事 Norm Jouppi、Sridhar Lakshmanamurthy、Cliff Young 和 David Patterson 撰写的论文将发表于 2026 年 7/8 月《IEEE Micro》,题为 "Google's Training Supercomputers from TPU v2 to Ironwood"。
Stanford AI Lab 的 DeLM(Decentralized Language Models)让智能体无需中心编排器即可协作,在编码和多文档问答等任务上更准确且成本大幅降低。用 Gemini-3 Flash 在 SWE-bench Verified 上取得约 10% 提升,成本不到一半。VentureBeat 报道了这项工作。
B站搜索团队提出特征选择算法LeAP,将离散的特征打乱转化为端到端可学习的门控网络,并引入基于特征打散差异的自适应梯度去偏正则。该算法已被ECML-PKDD 2026录用,在Criteo、Avazu、ML-1M、AliCCP等公开数据集上达到SOTA水平。
Epoch AI 提议为 AI 研发打造专属 O*NET,将前沿 AI 实验室的工作拆解为 6 大类、60 多项代表性任务,并按 0 到 5 分评估当前 AI 对每项任务的自动化程度。现有 O*NET 对约 1000 种职业的描述过于宽泛,难以追踪 AI 研究本身的自动化进展。该任务数据集可用于观察任务被自动化的比例、解读 benchmark 结果,并建立研究者之间的通用词汇。
Jim Fan 回应称,其论文结果显示 Codex 表现优于 Claude,Claude 又优于 Kimi,并称这是一个"在物理世界中无法被作弊"的基准测试。
NVIDIA 的 Jim Fan 宣布推出 ENPIRE,为 8 个 Codex 智能体配备机器人集群、GPU 配额和 token 预算,让它们自主探索并直接在硬件上学习、读论文和反复尝试。