吴佳俊 IROS 2026 演讲:结构化表征是机器人学会推理的脚手架
斯坦福大学助理教授吴佳俊在 IROS 2026 的 RoBoWoMo 研讨会上发表《Building Physical Agents via Structured Representations》报告,提出用结构化表征搭建物理世界智能体。他介绍了从演示中学习谓词与原子动作、让模型自行提出 DSL、并用演示标签对视觉判据做后训练等路径,并透露最近投稿的工作已将规划器也换成后训练的开源视觉模型。
斯坦福大学助理教授吴佳俊在 IROS 2026 的 RoBoWoMo 研讨会上发表《Building Physical Agents via Structured Representations》报告,提出用结构化表征搭建物理世界智能体。他介绍了从演示中学习谓词与原子动作、让模型自行提出 DSL、并用演示标签对视觉判据做后训练等路径,并透露最近投稿的工作已将规划器也换成后训练的开源视觉模型。
StartLux(原点星辉)开源决策模型 StartLux-Decision,一次推出 0.8B、2B、4B、9B 和 27B 五档版本,并提供支持本地部署的量化模型。
亚马逊与杜克大学研究发现,大模型后训练中每条 rollout 只保留一个 token 的梯度信号(占比约0.025%),学生模型推理能力反而显著提升。基于 Qwen3 的9组教师—学生配置及代码推理、Llama 系列、PPO-based RLVR 验证中均复现该现象,仅监督一到两个分歧最大的 token 即可匹配甚至超过全信号训练。极稀疏监督仅更新约10%网络参数,其机制仍待解释。
蚂蚁百灵新一代大模型 Ling-3.1-Flash 在「Teenage Engineering 风格信息卡」提示词测试中一把过,输出效果达标。该模型为 560B/A25B MoE 架构,支持 1M token 上下文,输出速度基本维持在 100+ tokens/s,整个推理生成与校验流程约 2-3 分钟完成。
Harrison Chase 点评一篇 Google Research 的多智能体证明发现论文,认为验证者从干净上下文起步的模式值得借鉴,探索者的推理无法说服验证者接受错误证明,探索者因此可以大胆尝试,由验证者筛掉错误方向,DeepAgents 子智能体拥有独立上下文也是同一道理。
Y Combinator 本期 Paper Club 聚焦替代计算,探讨超越传统数字硬件的 AI 算力路径:用光执行计算的光学系统、受大脑启发的神经形态架构,以及教活体脑细胞玩 Doom 的实验。议程涵盖零阶优化与 SOMA、用光构建扩散模型,以及用强化学习训练生物神经元。
Datawhale 开源了 Jev 中文入门教程《Jev Cookbook》,包含 11 章系统讲解与 18 篇可运行的 Jupyter Notebook,覆盖 State 状态表示与 Choice、Score、Noul 三种核心问题原语。
一篇 LLM 面试题整理,从 Transformer 架构讲起,覆盖 Self-Attention 数学原理、Multi-Head Attention 代码实现。
前微软合伙人 Ramez Naam 发表长文质疑递归自我改进(RSI)引发智能爆炸的判断,认为当前回路强度仅为起飞门槛的 10% 到 20%,需再增强 5 到 10 倍。
Yann LeCun 在 X 上发问:"我的家用机器人在哪?我的 L5 自动驾驶汽车在哪?"他指出,可以把 LLM 微调成能回答任何物理世界问题的模型,但这并不意味着它拥有足够的理解力和物理直觉,去预测一个 6 岁儿童就能预测的事情。
Epoch AI 测算,2025–27 年出货的 HBM 硬件最多可支撑约 3000 万至 1.7 亿个并发前沿模型智能体,按每周 168 小时不间断运行折算,相当于约 1.4 亿至 7.2 亿名全职员工的工作时长。
Liquid AI 的决策模型 D1 已在 OpenRouter 上线,可接收应用状态与 yes/no、选择题或打分问题,返回带各选项概率的结构化答案。该模型定价为输入 $0.04/M、输出 $0,上下文窗口 65K,并承诺零数据留存。
Google 发布 Gemini 4 Argon,目前仅通过 Fairwind 计划对少量网络安全合作伙伴开放,后续先向付费 API 用户和 Google AI Ultra 订阅者开放。
Richard Sutton 在《苦涩的教训》中指出,回顾 70 年 AI 研究,长期最有效的往往是能持续利用更多算力的通用方法,而非人类精心设计的领域知识。国际象棋、围棋、语音识别与计算机视觉的历史都显示,研究者起初想用人类理解减少搜索,真正的突破却来自拥抱搜索和学习。他因此认为,搜索和学习是当前最能随算力扩展的两类方法,而试图把人类对心智的理解直接写进系统,长期会停滞甚至阻碍突破。
谷歌宣布推出新一代模型 Gemini 4 Argon,重点面向长流程软件工程、法律与金融等企业知识工作以及网络安全防御;输出 Token 上限从此前 64K 提升至 100 万。
NVIDIA 介绍如何用 Dynamo-Triton 部署 HSTU 生成式推荐系统,将推荐任务重构为对用户行为的序列建模。用户的交互、上下文、候选物品与动作都被转化为高基数事件流中的 token,取代了原本割裂的召回、排序与预测多阶段流程,从而面向大规模个性化场景。
Google 今天预告 Gemini 4 Argon,称其在真实软件工程、知识工作和网络安全防御等复杂工作流中达到前沿性能,并具备行业领先的 1M token 输出上限。Google 表示将尽快且尽可能安全地开放该模型,发布前仍会快速迭代。
Google 宣布推出新前沿模型 Gemini 4 Argon,定位于在复杂长程工作流中维持深度推理,并在真实软件工程、法律与金融等企业知识工作以及网络安全防御中提供前沿性能。该模型输出 token 上限提升至业界领先的 1M tokens,目前正通过 Fairwind Program 向一批受信任的网络防御者开放,并将尽快扩大可用范围。
Google DeepMind 发布 Argon,具备 1M token 输出上限,并加入更深层的推理能力,用于一次性处理长链路、多步骤问题。官方表示将参考早期测试者的反馈完善系统,随后会逐步向开发者、企业和消费者开放。
Google DeepMind 发布新前沿模型 Gemini 4 Argon,通过 Fairwind Program 先向受信任的网络安全防御方开放,后续将逐步提供给开发者、企业和消费者,起价为每百万输入 token 2 美元、每百万输出 token 10 美元,缓存输入按输入价 95% 折扣计费。
原文给出了输出上限、基准成绩与定价,读者可以据此判断它在长程工程与网络安全任务上的定位。
Fireworks 的 Ember-1 已可在 Fireworks Serverless 上调用,Vals AI 的独立测试显示其在金融和法律基准上表现接近 Kimi K3,同时每轮推理 token 用量更少。每轮 token 更少意味着单次调用成本更低、智能体循环更快。
针对 arXiv 论文《Score Centering Stabilizes Off Policy Reinforcement Learning》被传为 OpenAI 后训练 RL 算法,有分析指出该 score centering 算法本质上是 STE(straight through estimation)的近似实现,其梯度与 STE 方案完全一致。
腾讯混元、复旦大学和清华大学的研究者发布 ExplorationBench,用于衡量 AI 系统的探索能力,并构建了规则可执行、与已知知识冲突的 Alien Worlds 环境。
在华盛顿一场科技圆桌论坛上,黄仁勋、马斯克与 Anthropic 联合创始人 Tom Brown 同台对话。
对 GPT-6.1 Sol 在文档 OCR 任务上的综合基准测试显示,其表格解析能力与阅读顺序较一周前的 GPT-6 Sol 有明显提升,表格解析水平已接近 GPT-6 Astra。前沿模型在文档解析上仍通常比高性价比方案贵一个数量级,但这也意味着"高端"档位(每页超过 1 美分)的能力提升空间很大。
InclusionAI 的 Ling 3.1 Flash 已在 AI Gateway 上线,10 月 13 日前免费使用。该模型为混合推理语言模型,总参数 560B、每 token 激活 25B,在 AI Gateway 上支持 262K token 上下文窗口,面向编码、多步分析与工具调用智能体。
6.1 Sol 发布,据 Tibo 介绍,其智能水平接近 Astra,价格仅为 Astra 的五分之一,并提供 95% 的缓存读取折扣。该模型被形容为绝对的主力机型,配合 ultrafast 可在 Astra 上实现 8 倍速度,该加速也即将支持 6.1 Sol。
OpenAI 发布 GPT-6.1 Sol,主打让前沿智能更可负担,开发者可以更大规模地构建和运行应用。缓存输入价格为每百万 tokens 0.10 美元,比标准输入价格低 95%,比 GPT-6 Sol 的缓存输入价格低 50%。
Sebastian Raschka 以 Jev 引发的热度为切入点,回顾文本分类从词袋加朴素贝叶斯、逻辑回归、RNN、CNN 到 BERT、GPT、T5 的技术演进,并实测 Jev 在 IMDb 电影评论数据集上的表现。
Anthropic 发布 Claude Sonnet 5.5,API 单价没变、生成速度更快,Terminal-Bench、CursorBench 等 Agent benchmark 成绩明显上涨。
Qdrant 的 /4 Nano 和 Zero 专门训练用于生成与 Stella 文档嵌入兼容的向量,因此无需重建文档索引即可在两者间切换,权衡检索质量与查询延迟。其中 Zero 极其轻量,Nano 是小型 Transformer,检索质量更接近 Stella。
Anthropic 的 Claude 账号发帖询问用户正在用 Sonnet 5.5 探索什么,该帖获得 179 个点赞、44 条回复和 52626 次浏览。帖子未披露 Sonnet 5.5 的任何新功能、参数或发布信息。
SemiAnalysis 分析 GLM-5.3 采用 DeepSeek Sparse Attention 后,稀疏注意力虽降低了 SDPA 阶段的 KV cache 读写需求,但 top-k 选择仍需完整上下文驻留 HBM,因此并未消除显存容量瓶颈。
生产级 AI 应用仅靠模型版本无法保证可复现,检索、提示词、工具契约与推理服务配置都会独立改变行为。文章建议用版本化发布清单(含模型、提示词、索引、嵌入、运行时修订号)统一界定发布边界,并以覆盖端到端路径的评估门禁和经过演练的回滚路径作为 MLOps 起点。
有网友在 Qwen 上跑测试集发现,要求模型诚实作答、对自己说出的话负责,并在实验中压低 "wait / maybe / perhaps" 这几个词的概率后,Qwen 的准确率反而提高了。该实验由 Reddit 网友完成,相关帖子获得 2 条评论、2 次转发、7 个赞和 4109 次浏览。
Naive AI 发布开源模型 Naive-N0.5-Flash,权重与推理代码以 MIT 许可证开放,API 输入每百万 Token 0.6 元、输出每百万 2.6 元。
Niket Patel 展示了一种教 LLM 自主发现有趣定理的方法,提出可量化的"有趣度"指标,使发现结果的有趣度提升 4.3×,并形成自我扩展的发现循环。研究者指出,LLM 已能证明困扰数学家数十年的结果,而无需人类引导地找到有趣定理正成为新的瓶颈。
Anthropic 科学博客称 Claude 在平面 N=4 超对称杨-米尔斯模型中完成了九圈散射振幅计算,此前纪录是 SLAC 的 Lance Dixon 及合作者保持的八圈。
Anthropic 科学博客发布消息称,Claude 在 Claude Science 中接收一个描述九圈问题的提示词后,基本无监督运行数天,用 Dixon 及同事发展的方法解决了九圈散射振幅计算,总成本为几千美元。
Runway 联合创始人兼联合 CEO Anastasios Germanidis 阐述 AI 视频的终局是世界模型:Sora 曾触发 Runway 内部的生死冲刺,而扩大视频模型规模或许足以学到物理规律。他进一步提出实时生成可让世界模型充当机器人模拟器,软件的未来可能是直接以像素而非 HTML 和代码生成的界面,Runway 正朝完全神经操作系统推进。