Modal 与 NYU Shanghai 提出 MRP:为扩散语言模型做多 token 残差预测
Modal Research 与 NYU Shanghai HeavyBall Research 提出多 token 残差预测(MRP),用一个 3 层小模块预测相邻去噪步之间的 logit 残差,让冻结的扩散语言模型骨干一次前向解码多个 token。
Modal Research 与 NYU Shanghai HeavyBall Research 提出多 token 残差预测(MRP),用一个 3 层小模块预测相邻去噪步之间的 logit 残差,让冻结的扩散语言模型骨干一次前向解码多个 token。
Epoch AI 发布 EBR-bench 基准,让 AI 系统反复游玩桌游 Earthborne Rangers,测试其能否从经验中学习。结果显示几乎没有证据表明 AI 能在重复游玩中进步,GPT-5.5 和 Opus 4.8 的分数提升来自更高的初始分而非边玩边学。
NVIDIA GEAR lab 联合 UMich、Berkeley、CMU 推出 ASPIRE,这是首个面向机器人的自动化技能发现系统。它不再逐个解决任务,而是持续发现并积累可复用技能,这些持久化技能支持多任务迁移、sim-to-real 迁移和跨形态迁移。论文与项目页面已在 NVIDIA 官网发布。
Jim Fan 发布 ASPIRE,用编码智能体观察仿真与真实机器人的多模态感知轨迹,对控制程序做进化搜索,将最优经验蒸馏进不断扩张的技能库。它把"训练"变成技能精炼而非梯度下降,"模型"变成传感器运动技能仓库而非浮点权重。ASPIRE 将 sim2real 与跨本体迁移的 token 消耗最多降低约 10 倍,已积累 150+ 任务、90+ 技能,并将开源全栈。
Stanford AI Lab 在推文中分享了 ai.stanford.edu 上的一篇博客文章(rnb-encor),并 @ 了 milanganai 和 katielulula。推文未透露文章的具体主题或技术细节。
斯坦福 SAIL 新博客介绍了 R&B-EnCoRe,展示 Vision-Language-Action 模型如何自教自学哪些链式推理真正有助于行动,无需奖励、验证器或人工标注。
NVIDIA 推出 ENPIRE 框架,让编码智能体驱动真实机械臂自主试错、自动重置与评估,在 PushT、整理插针、用切割器剪扎带等任务上实现 99% 成功率。
Meta 发布 Brain2Qwerty v2,这是可从非侵入式脑记录实时解码句子的端到端流程,实现 61% 的词准确率,而其他非侵入式方法为 8%,表现最好的受试者达到 78%。
Stanford AI Lab 发布了一项由 @kushin_m、@danielwurgaft、@LinasNasvytis、@michaelyli_、@noahdgoodman 和 @mcxfrank 共同完成的成果。原文除作者名单外未披露具体模型、参数或评测信息。
Stanford AI Lab 分享的 Auto-psych 让 AI 智能体自行走完整个科研闭环:提出理论、设计实验、在线招募真实受试者,并根据结果迭代改进。研究者 noahdgoodman 称,他多年来设想的"自动化心理学研究"这次因 AI 取得了实质进展。
XLANG NLP Lab 发布 OSWorld 2.0,用于在长时程真实任务上评测计算机操作智能体。基准包含 108 个真实工作流,每个约需熟练人类 1.6 小时,平均约 318 次工具调用,而 OSWorld 1.0 约为 30 次。
METR 在 NDA 下对 GPT-5.6 Sol 做了独立外部评估,OpenAI 提供了最终 checkpoint、railfree 版本、raw chain-of-thought 的 API 访问以及 Codex harness 配置指南。
Epoch AI 与 METR 联合发布 MirrorCode 基准,用于测试 AI 在长周期编码任务上的能力,任务是让模型在没有原始源码的情况下端到端重写整个程序,AI 方案需在包括留出测试在内的端到端测试中与原始程序输出完全一致。
OpenThoughts-Agent-v2 在算力受控对比中于每个训练集规模上均领先,并跨七个 agentic benchmark 实现泛化。同系列还发布 OpenThinkerAgent-32B,号称基于 Qwen-3 的最强开放数据 agentic 模型,在 7 个 agentic benchmark 上平均得分 44.8%。
斯坦福 AI Lab 提出 Spiral,一个用强化学习让模型端到端学会协调串行、并行、聚合三种推理计算方式的框架。它用 set RL 训练模型生成对聚合器集体有用的回答,再用标准 RL 训练模型把这些回答聚合成更优答案,且仅依赖最终输出的奖励。该工作旨在解决训练只优化串行计算、与部署时多轴扩展推理算力之间的错配。
一篇技术综述梳理了 scaling laws 的经验基础:Amari 等(1992)用贝叶斯方法导出四类幂律学习曲线,Hestness 等(2017)在机器翻译。
Stanford AI Lab 公布一项由 jubayer_hamid、ifdita_hasan、michaelyli_、oshaikh13、yoonholeee、DorsaSadigh、chelseabfinn、noahdgoodman 等组成的团队完成的新成果。原文未披露成果名称、模型版本或具体指标。
斯坦福 AI Lab 提出 Spiral,一个用强化学习让模型端到端掌握串行、并行与聚合三种推理算力原语的框架。它用集合 RL 训练模型生成对聚合器集体有用的回答,再用标准 RL 让它把多个回答聚合成更优答案。目前仅优化串行算力的训练方式与部署时的多轴扩展存在根本错配,Spiral 仅凭最终输出奖励即可学习协调三种推理方式。
牛津大学、英国 AI 安全研究所、斯坦福和伦敦政治经济学院的研究者通过四项实验、18978 场对话和 6923 名参与者发现,AI 系统在文本说服上比专家人类更有效,即使在专家自选议题、提前研究并接受训练后依然如此。
网络安全评测普遍遵循四个组件:Docker 沙箱目标、影响难度的输入(如仅给脆弱代码对应 zero-day,或附带补丁与 PoC 对应 one-day)、工具集以及确定性打分器。
Stanford AI Lab 在推文中分享了 Peter Hase 与 Chris Potts 关于 CoT 监控(cot-monit)的博文,链接指向 ai.stanford.edu/blog/cot-monit。
Stanford AI Lab 发布新 SAIL 博客文章,由 @peterbhase 与 @ChrisGPotts 撰写,梳理 CoT Monitoring 这一 AI 安全问题热点的历史渊源。文章追溯了这一重要理念的发展脉络。
斯坦福 AI Lab 提出 M*,一个统一运行时,用于服务已不再是单一 decode loop、而是复合结构的现代多模态模型。它在 omni TTS 上最高提速 2.7×,在 world-model rollout 上提速 12.5×,并声称匹配或超越各专用系统。
Google 同事 Norm Jouppi、Sridhar Lakshmanamurthy、Cliff Young 和 David Patterson 撰写的论文将发表于 2026 年 7/8 月《IEEE Micro》,题为 "Google's Training Supercomputers from TPU v2 to Ironwood"。
Stanford AI Lab 的 DeLM(Decentralized Language Models)让智能体无需中心编排器即可协作,在编码和多文档问答等任务上更准确且成本大幅降低。用 Gemini-3 Flash 在 SWE-bench Verified 上取得约 10% 提升,成本不到一半。VentureBeat 报道了这项工作。
B站搜索团队提出特征选择算法LeAP,将离散的特征打乱转化为端到端可学习的门控网络,并引入基于特征打散差异的自适应梯度去偏正则。该算法已被ECML-PKDD 2026录用,在Criteo、Avazu、ML-1M、AliCCP等公开数据集上达到SOTA水平。
Epoch AI 提议为 AI 研发打造专属 O*NET,将前沿 AI 实验室的工作拆解为 6 大类、60 多项代表性任务,并按 0 到 5 分评估当前 AI 对每项任务的自动化程度。现有 O*NET 对约 1000 种职业的描述过于宽泛,难以追踪 AI 研究本身的自动化进展。该任务数据集可用于观察任务被自动化的比例、解读 benchmark 结果,并建立研究者之间的通用词汇。
Jim Fan 回应称,其论文结果显示 Codex 表现优于 Claude,Claude 又优于 Kimi,并称这是一个"在物理世界中无法被作弊"的基准测试。
NVIDIA GEAR 实验室发布 ENPIRE,为 8 个 Codex 智能体配备机器人集群、GPU 配额和充足 token 预算,目标是在保证安全、不浪费算力的前提下尽快解决任务。
NVIDIA、CMU 与 Berkeley 的研究者发布 ENPIRE,将前沿编码智能体接入真实机器人集群,自主完成重置环境、检索文献、实现想法、搭建基础设施、训练部署、自验证、分析日志并改写代码的完整闭环,全程无需人类介入。
一项新方法发现,单个皮层神经元就能完成猫狗分类、识别口头单词和求解 10-bit parity,而这些任务此前被认为需要整个神经网络才能完成。Jeff Dean 转发并称,真实生物神经元的能力远超感知机中的经典人工神经元。
哔哩哔哩 Index LLM 团队的 CASTER 已被 ACL 2026 Main Conference 收录,并开源模型、代码与数据集。其 MEDEA 框架用 Social-CoT 模拟多元观众反应,在 CASTER-Bench 上高质量类别 F1 达 0.650,超越 GPT-5.2 与 Claude-4.5-Opus,提升 17.1%。
Richard Socher 宣布 Recursive 公开其自动化开放式发现系统,作为迈向递归自我改进超级智能(RSI)的 v0.1 版本。该系统在 NanoGPT speedrun、NanoChat 和 NVIDIA Sol-ExecBench 三个 AI 任务上均取得 SOTA,且取得这些结果的代码和思路由 AI 系统自身提出,而非团队发明。
Richard Socher 宣布 Recursive 首次公开其自动化开放式发现系统的成果,该系统瞄准递归自我改进超级智能(RSI),可指向任意难题并产出有用发明。
Crownlands 开源 Gateway 4M,这是迄今从活体人类中发布的最大单细胞组织数据集,用于推进大脑衰老与神经退行性研究。人类生物学数据对科学家和 AI 理解健康与疾病至关重要,Kevin Weil 称此举对加速 AI 在科学与健康领域的影响意义重大。
Scott Wu 介绍 Cognition 推出的新编码评测 FrontierCode,认为 SWE-Bench 式评分只考察能否通过单元测试,还需评估代码范围、编码风格和意外副作用。该评测声称假阳性减少约 80%,每个任务由领先开源维护者花费 40 多小时完成,最好的模型 Opus 4.8 得分仅 13%。
Google DeepMind 公布在塞拉利昂开展的一项预注册对照试验结果,使用 Guided Learning 的学生数学成绩比对照组提升 0.258 个标准差,约相当于 1.2 至 1.7 年的常规学习进度。
Kings College London、复旦大学与 Alan Turing Institute 构建 SocioHack 基准,含 72 个沙箱社会环境,用 RL 训练 LLM 重新发现历史已修补的规则漏洞,召回率 61.25%、精确率 90.85%。
Sebastian Raschka 发布 2026 年 1 月至 5 月的 LLM 研究论文精选清单,涵盖架构与模型设计、高效训练与扩展、推理效率与 KV Cache、稀疏注意力与长上下文、推理与测试时计算、强化学习与 RLVR、智能体系统与工具使用、编码智能体与软件工程、扩散语言模型、模型评测与基准十大类。
NVIDIA Research 本周在 CVPR 2026 展示三篇物理 AI 论文:首个零样本抓取基础模型 GraspGen-X,基于数十亿次模拟抓取训练;用紧凑隐表示替代昂贵文本推理的 LCDrive;以及借助 NVIDIA Isaac GR00T 训练具身智能体的通用游戏 AI 基础模型 NitroGen。