Stanford AI Lab 公布 ICML 2026 论文清单,覆盖编码智能体与 LLM 推理等方向
Stanford AI Lab 公布其在 ICML 2026 的完整论文清单,涵盖编码智能体、LLM 推理、评估与基准、AI 安全与可解释性、AI for science 等方向。ICML 2026 在首尔举行,该实验室邀请参会者到场交流。
Stanford AI Lab 公布其在 ICML 2026 的完整论文清单,涵盖编码智能体、LLM 推理、评估与基准、AI 安全与可解释性、AI for science 等方向。ICML 2026 在首尔举行,该实验室邀请参会者到场交流。
Apodex两位首席科学家杜少雷和李辈滨在硅谷101播客中预测,最快半年AI就能跑通一次完整的自我进化闭环,但解决递归漂移还需2-3年。这家由陈天桥主导的公司只做heavy duty solver,其discovery model强调提出人类未想到的假设并自我验证,方法之一是多个子agent互相验证。随着模型能力变强、长程任务表现更好,RSI概念才真正走热。
在 ICML 2026 论文《Truthfulness Does Not Scale Like Reasoning》中,研究者发现 LLM 预测其他模型会说什么的准确率高于预测事实真相,且模型犯错时会"一起犯错",因此通过多次采样投票无法恢复真相。Pass@k 与自一致性在数学和代码等有验证器的领域有效,但在没有验证器的领域中无法扩展真实性。论文将在首尔 ICML 2026 会议上报告。
Stanford AI Lab 提出 Freeform Preference Learning,让标注者用自然语言描述偏好轴,并据此学习条件奖励、提取更优策略。该方法针对机器人反馈中单一偏好会掩盖信息的问题——如同样的两条轨迹,一条掉了餐具、一条掉了盘子,只问一个偏好无法体现差异。相关博客与论文已公开(arXiv 2606.32027)。
Stanford AI Lab 提出 QuasiMoTTo,通过改用相关采样而非独立并行采样来扩展推理算力,减少重复求解带来的浪费。该方法在测试时扩展中实现同等性能、样本量减少 25-47%,并将 RL 训练步数减少 50%;相关样本覆盖度更高,边际上仍是 LLM 的精确采样,且可并行生成。
晚点聊发布 2026 年 Q2 AI 季报,嘉宾为 MoE Capital 创始合伙人 Henry Yin,围绕推进智能前沿和智能扩散两条脉络回顾本季度进展。
Aether AI 创始人黄碧薇提出,具身智能当前靠 Scaling Law 堆数据的路线存在误区:VLA 模型在 demo 中表现良好,但真实场景里桌面高两厘米任务就会失败,因为它学的是相关性而非因果。她主张用因果大模型从同样数据中挖掘变量间的因果关系与动作后状态演化,让机器人能举一反三,这一方向在学术界已酝酿 37 年。
Modal Research 与 NYU Shanghai HeavyBall Research 提出多 token 残差预测(MRP),用一个 3 层小模块预测相邻去噪步之间的 logit 残差,让冻结的扩散语言模型骨干一次前向解码多个 token。
Epoch AI 发布 EBR-bench 基准,让 AI 系统反复游玩桌游 Earthborne Rangers,测试其能否从经验中学习。结果显示几乎没有证据表明 AI 能在重复游玩中进步,GPT-5.5 和 Opus 4.8 的分数提升来自更高的初始分而非边玩边学。
Poe 平台上线 Anthropic 的 Sonnet 5 与 Google 的 Nano Banana 2 Lite。Sonnet 5 被称为 Anthropic 迄今最具智能体能力的模型,具备 Opus 级编码与推理能力,成本更低。Nano Banana 2 Lite 是 Google 最快、最具性价比的图像模型,约 4 秒生成清晰一致的图像。
斯坦福 SAIL 新博客介绍了 R&B-EnCoRe,展示 Vision-Language-Action 模型如何自教自学哪些链式推理真正有助于行动,无需奖励、验证器或人工标注。
Richard Ngo 提出「信念之网(belief webs)」框架,把智能体的信念、目标与行动统一为同一现象的三个方面。该框架整合了主动推理、智能体基础与机器学习的思路,核心前提是智能体的信念通常只与邻近信念局部一致,而非全局一致,因此单一概率分布框架难以描述;Ngo 认为 PDG 与 Garrabrant induction 可处理全局不一致,但只有后者能处理自指悖论。
Lilian Weng 发布了一篇拖延 3 年多的 Scaling Laws 长文,探讨如何在投入大规模训练前推理数据与模型规模之间的最优算力分配。文章涵盖 Scaling Laws 的预测内容、算力最优分配的工作机制、Kaplan et al. 与 Chinchilla 结论分歧的原因,以及数据上限与拟合细节如何让外推变得困难。
Qdrant 发布教程,介绍用查询分解(Query Decomposition)处理多跳问题:先检索原问题,由 LLM 读取结果并生成下一个子问题,循环检索直到补齐缺失事实,再融合各跳结果。该方案基于 Self-Ask 与 IRCoT,用 gpt-5-mini 生成子问题,并用 Reciprocal Rank Fusion(k=2)合并各跳结果。
Modal 发布面向 HTTP、WebSocket 和 gRPC 流量的 Servers,通过区域化自动扩缩容的 HTTP 服务器副本池和反向代理路由,将 p50 延迟从 39ms 降至 6ms。该方案走轻量低延迟路径,副本不可用时客户端会收到 503,排队与降载交由容器应用处理,适合 LLM 推理等毫秒级场景。
斯坦福 AI Lab 提出 Spiral,一个用强化学习让模型端到端学会协调串行、并行、聚合三种推理计算方式的框架。它用 set RL 训练模型生成对聚合器集体有用的回答,再用标准 RL 训练模型把这些回答聚合成更优答案,且仅依赖最终输出的奖励。该工作旨在解决训练只优化串行计算、与部署时多轴扩展推理算力之间的错配。
Modal 推出 Auto Endpoints,通过投机解码等优化实现低延迟推理。在 Decagon Voice 案例中,团队将某推理子系统从约 290ms(p50)降至约 190ms,比专有推理提供商同 workload 的最优延迟还快 60ms 以上。其低延迟方案组合了 Blackwell GPU、SGLang 引擎与 Modal Servers 区域部署。
斯坦福 AI Lab 提出 Spiral,一个用强化学习让模型端到端掌握串行、并行与聚合三种推理算力原语的框架。它用集合 RL 训练模型生成对聚合器集体有用的回答,再用标准 RL 让它把多个回答聚合成更优答案。目前仅优化串行算力的训练方式与部署时的多轴扩展存在根本错配,Spiral 仅凭最终输出奖励即可学习协调三种推理方式。
Modal 与 Z Lab 合作训练并在 Hugging Face 发布 Qwen 3.5/3.6 系列 DFlash 推测解码模型,包括 4B、9B、27B、35B-A3B、122B-A10B 及 Qwen 3.6 35B-A3B 等版本。
斯坦福 AI Lab 提出 M*,一个统一运行时,用于服务已不再是单一 decode loop、而是复合结构的现代多模态模型。它在 omni TTS 上最高提速 2.7×,在 world-model rollout 上提速 12.5×,并声称匹配或超越各专用系统。
Air Canada 聊天机器人曾给出不存在的丧亲票价退款政策,航空公司拒绝兑现后被裁定败诉,暴露了把 AI 预测当作事实的风险。文章主张设计师应以概率思维看待 AI 输出——它们是信号而非结论,并可用结构化提示词在产品设计前模拟结果,但模拟不能替代真实实验,因为模型基于历史数据,往往反映过去行为而非预测未来变化。
灵初智能联合创始人陈源培在斯坦福李飞飞实验室实现了全球首次双臂长程灵巧操作,以及全球首次用人类数据训练机器人双臂灵巧操作。他认为具身 Scaling Law 的核心瓶颈是数据,单靠遥操数据难以堆到足够规模,百万小时级别的人类中心数据至少能让行业看到效果;跨本体泛化的关键是提取人类操作中的通用信息,再用强化学习补足机器人具体关节、力和接触细节。
Richard Socher 宣布 Recursive 首次公开其自动化开放式发现系统的成果,该系统瞄准递归自我改进超级智能(RSI),可指向任意难题并产出有用发明。
Modal 对 FlashAttention-4 内核做了一系列改动,使其更适合大语言模型推理,尤其是 decode 密集的负载。团队将优化归为两类:调整并行策略(如把 split KV 技术移植到 FA4、从 query 并行转向 key/value 并行),以及支持不规则全局内存访问(用 cp.async 取代基于 TMA 的 cp.async.bulk)。
同济大学长聘教授、OpenKG 发起人王昊奋认为,大模型越强,本体和知识图谱反而越重要,它们正是 AI Agent 所需的 harness。他把落地路线分为两派:Palantir 走本体优先、模型靠边,Claude 走模型优先、再补 MCP 与 skill,并称两者最终会你中有我。他还强调现有 AI 找的是相关性而非因果,严肃决策的解释权仍须握在人手里。
Google DeepMind 发布 Gemma 4 12B,一款面向笔记本本地运行的统一无编码器多模态模型,视觉与音频输入直接进入 LLM 主干,不再依赖独立编码器。
Gemma 4 12B 用无编码器架构把多模态能力压进 16GB 显存笔记本,读者可判断本地智能体部署的可行边界。
NotebookLM 推出多项升级,在对话中加入智能体能力、更强的推理能力以及一批新的输出格式,官方称处理复杂的多步骤研究问题更容易。该更新首先面向 Google AI Ultra 与拥有 AI Ultra Access、AI Expanded Access 的 Workspace 商业客户在网页端全球推送,官方表示后续会扩展到其他用户。
NotebookLM 发布大规模升级,在对话中引入智能体能力、更高级的推理以及一套新的输出格式,官方称处理复杂的多步研究问题变得更容易。该更新正面向 Google AI Ultra 订阅用户推送。
Kings College London、复旦大学与 Alan Turing Institute 构建 SocioHack 基准,含 72 个沙箱社会环境,用 RL 训练 LLM 重新发现历史已修补的规则漏洞,召回率 61.25%、精确率 90.85%。
Sebastian Raschka 发布 2026 年 1 月至 5 月的 LLM 研究论文精选清单,涵盖架构与模型设计、高效训练与扩展、推理效率与 KV Cache、稀疏注意力与长上下文、推理与测试时计算、强化学习与 RLVR、智能体系统与工具使用、编码智能体与软件工程、扩散语言模型、模型评测与基准十大类。
Andrew Ng 联合 Red Hat 推出高效 LLM 服务短课程,由 cedricclyburn 主讲。课程教你用量化压缩模型显存占用,并用 vLLM 通过智能内存管理高效处理大量并发请求,还将对部署进行基准测试,在速度、成本与精度间做权衡。70B 参数模型仅加载权重就需约 140 GB 显存,每个活跃请求还需独立的 KV cache。
Claude 4.8 Opus 已在 Monica AI 正式上线,官方称其为迄今最先进的推理模型,具备更深入的分析、更敏锐的逻辑和更细致的表达。该模型适用于研究、编码和战略思考等任务,用户可通过 monica.im 体验。
Anthropic 为 Opus 4.8 的思考量(thinking effort)做了大量校准工作。官方邀请用户在试用模型时,若遇到仍过度思考或思考不足的案例,向其反馈。团队成员 kipply 也同步征集 Claude 在任务中思考过多或过少的示例。
Redis 作者用 C 语言为 DeepSeek-V4-Flash 打造了本地推理引擎 ds4,支持 Metal、CUDA 加速、2-bit 量化和 HTTP API,并非简单的 GGUF 运行工具。
Epoch AI 测算,以 Kimi K2.6 类模型在 Q4 2025 全部 Nvidia GB200 与 GB300 上的推理能力,可提供 5 亿至 200 亿 output tokens/秒,取决于请求上下文长度(8,000 / 25,000 / 128,000 输入 token)。
DeepSeek 正以极致压缩 KV 缓存换取硬件自主:据测算,1.6T 参数的 DeepSeek V4 在 100 万上下文、8-bit KV 精度下只需 5.48 GB HBM,而 GLM5 需 60 GB、Qwen3-235B-A22B 需 89 GB。
智谱面向部分企业客户开放 GLM-5.1 高速版 API GLM-5.1-highspeed,输出速度达 400 tokens/s,官方称刷新全球大模型厂商 API 速度上限。
Modal 宣布完成 3.55 亿美元 C 轮融资,投后估值 46.5 亿美元,由 General Catalyst 和 Redpoint 领投。自去年 9 月以来公司规模增长五倍,年化营收超过 3 亿美元。
Gemini 3.5 Flash 已在 Monica AI 正式上线,主打极快响应速度,兼具顶级推理与多模态能力。用户可用于头脑风暴、文档分析或构建工作流,AI 助手速度显著提升。
Sebastian Raschka 梳理近期开源权重模型的架构改动,指出长上下文效率成为设计重心。文章拆解 Gemma 4 的跨层 KV 共享与逐层嵌入、Laguna XS.2 的逐层注意力预算、ZAYA1-8B 的压缩卷积注意力,以及 DeepSeek V4 的 mHC 与 CSA/HCA 压缩注意力。