NVIDIA GEAR 联合四校发布 ASPIRE:首个机器人自动化技能发现系统
NVIDIA GEAR 实验室联合 UMich、Berkeley、CMU 推出 ASPIRE,被称为首个面向机器人的自动化技能发现系统。它不再逐一解决任务,而是持续发现并积累可复用技能,从而支持多任务迁移、sim-to-real 迁移与跨本体迁移。项目论文与画廊已上线研究主页。
NVIDIA GEAR 实验室联合 UMich、Berkeley、CMU 推出 ASPIRE,被称为首个面向机器人的自动化技能发现系统。它不再逐一解决任务,而是持续发现并积累可复用技能,从而支持多任务迁移、sim-to-real 迁移与跨本体迁移。项目论文与画廊已上线研究主页。
Jim Fan 发布 ASPIRE,为机器人提供可自我进化、持续累积的技能库,让智能体观察仿真与真实机器人的多模态感知轨迹,对控制程序做进化搜索,并把最佳经验蒸馏进不断扩张的库中。
斯坦福 SAIL 新博客介绍了 R&B-EnCoRe,展示 Vision-Language-Action 模型如何自教自学哪些链式推理真正有助于行动,无需奖励、验证器或人工标注。
NVIDIA 推出 ENPIRE 框架,让编码智能体驱动真实机械臂自主试错、自动重置与评估,在 PushT、整理插针、用切割器剪扎带等任务上实现 99% 成功率。
《晚点聊》「具身季报 26Q2」邀请 Alphaist 创始合伙人陈哲盘点本季具身智能 TOP 5 进展:人形机器人马拉松、Figure AI 连续 200 小时直播、中国高自由度灵巧手亮相 ICRA、英伟达 Cosmos 3 世界模型从生成视频转向直接生成动作,以及 π0.7 与 Gen-1 的模型进展。节目还讨论 OpenAI Robotics 团队官宣、世界模型创投热与具身落地节奏。
Jim Fan 披露 ENPIRE 物理 AutoResearch 的幕后设计,需 8 台机器人可无人值守整夜运行。系统内置两层安全机制:硬性运动学限制在机器人越界时立即判定任务失败并自动重置,扭矩限制柔性夹爪则在接触失误时安全停转;同时定义机器人利用率、Token 利用率等遥测指标供 ENPIRE 实时感知资源。
Jim Fan 披露 Physical AutoResearch 的幕后工程:ENPIRE 让 8 台机器人整夜无人值守运行,通过硬运动学限制与力矩受限柔性夹爪两层机制保障安全。系统在 AutoResearch 前冻结奖励函数,并用机器人秒、GPU 秒、token 三类遥测(如 MRU、MTU)让 ENPIRE 实时感知资源,避免盲目爬山。
NVIDIA 的 Jim Fan 宣布推出 ENPIRE,为 8 个 Codex 智能体配备机器人集群、GPU 配额和 token 预算,让它们自主探索并直接在硬件上学习、读论文和反复尝试。
NVIDIA、CMU 与 Berkeley 的研究者发布 ENPIRE,将前沿编码智能体接入真实机器人集群,自主完成重置环境、检索文献、实现想法、搭建基础设施、训练部署、自验证、分析日志并改写代码的完整闭环,全程无需人类介入。
通义实验室发布 Qwen-Robot 系列,用三个专业基础模型弥合从认知到行动的鸿沟:Qwen-RobotNav 统一指令跟随、点/目标导航、目标追踪和自动驾驶四类任务,Qwen-RobotManip 基于超过 38,100 小时数据实现跨本体训练,Qwen-RobotWorld 以自然语言动作接口跨场景预测物理未来。
通义实验室一次发布三款具身基础模型,给出统一语言接口与跨本体数据方案,可观察大模型接入物理行动的路径。
硅谷华人创业者 Shane 创立 Animotion Robotics,想做外表像迪士尼动画、内部由模型驱动的仿生机器人,能察言观色并拥有自己的性格。其上一份创业曾为特斯拉、OpenAI 做情绪模型训练,新机器人采用模块化人脸结构,用户可自行更换眼睛、鼻子、耳朵,第一代 IP 名为伊洛瓦。产品由 8 个子模型并联模拟认知,记忆、性格与灵魂承载在芯片上,数据不上传云端,先通过社区预售推进。
智元机器人合伙人姚卯青在访谈中表示,2026年具身智能连GPT-1阶段都未达到,真机数据量与支撑基座模型涌现所需规模相差四五个数量级。智元已将核心数据资产剥离,独立孵化一站式物理AI数据服务平台"觅蜂",对标具身版Scale AI,姚卯青兼任其董事长兼CEO。他预计2027到2028年行业有望达到1亿小时级数据规模,届时才可能出现真正的涌现能力。
人形机器人正从实验室走向真实产线:Figure AI 的 Figure 02 在 BMW Spartanburg 工厂完成数月部署,参与生产超 30,000 辆汽车,特斯拉也在自己的 Gigafactory 内测试 Optimus。
灵初智能联合创始人陈源培在斯坦福李飞飞实验室实现了全球首次双臂长程灵巧操作,以及全球首次用人类数据训练机器人双臂灵巧操作。他认为具身 Scaling Law 的核心瓶颈是数据,单靠遥操数据难以堆到足够规模,百万小时级别的人类中心数据至少能让行业看到效果;跨本体泛化的关键是提取人类操作中的通用信息,再用强化学习补足机器人具体关节、力和接触细节。
极客公园播客「开始连接 LinkStart」本期拆解即将创下人类商业史上最大规模 IPO 的 SpaceX,嘉宾翟光龙认为支撑其超 1.7 万亿美元估值的核心叙事是「太空算力」。节目估算入轨成本需控制到 200 美元/公斤以内才算得过账,并指出近地轨道碎片超一亿个,天数天算可能是太空态势感知率先跑通的场景。
Google DeepMind 推出为期三个月的 Robotics 加速器,从欧洲选拔 15 家早期机器人初创公司,入选者将获得 Gemini 机器人模型、AI 技术栈和专家指导。项目本周在伦敦启动,覆盖物流、制造、医疗、气候和导航等领域。
锦秋基金合伙人臧天宇、郑晓超在播客中复盘 2026 上半年 AI 行业,用「重估」与「世界模型」概括,并梳理三场模型战争:OpenAI vs Anthropic vs Google、视频模型的「GPT-3 时刻」、具身智能的 VLA 与世界模型路线之争。对创业者,核心问题是中国还是美国、以及模型吞噬应用下垂类 AI 的活路。
Spelman College 宣布 Ayanna Howard 出任第 12 任校长,Jeff Dean 发文祝贺,称 Spelman 做出了极佳选择。Howard 是机器人领域的先驱,也是高等教育领导者,将带着大胆愿景带领这所拥有 140 多年历史的学院进入新篇章。
NVIDIA Research 本周在 CVPR 2026 展示三篇物理 AI 论文:首个零样本抓取基础模型 GraspGen-X,基于数十亿次模拟抓取训练;用紧凑隐表示替代昂贵文本推理的 LCDrive;以及借助 NVIDIA Isaac GR00T 训练具身智能体的通用游戏 AI 基础模型 NitroGen。
NitroGen 获得 CVPR 最佳论文荣誉提名,目标是在真实世界物理与多种模拟物理环境中都能胜任的通用具身智能体。这是团队自 4 年前 MineDojo 获 NeurIPS 最佳论文后再次获奖。
小鹏汽车董事长兼CEO何小鹏返场接受访谈,谈及2025年下更大赌注、人形机器人Iron的诞生故事,以及造人形机器人的胜率比造车低得多。他还聊到去年那场意外、技术剧变下CEO的心路,以及新车GX,并直言行业内没有一家游出血海。
理想汽车创始人李想做客罗永浩播客《十字路口》,介绍已完成从汽车公司向 AI 和具身智能公司的阶段性转型,并发布新一代旗舰 SUV L9 Livis。L9 Livis 搭载理想自研马赫 M100 芯片,算力达 2560 TOPS,配备全球首个完全体全线控底盘与 800V 主动式悬架系统,定位五十万元左右档位。
英伟达 GEAR Lab 负责人 Jim Fan 在 Sequoia AI Ascent 2026 的《Robotics' End Game》演讲中宣布 VLA 路线过时,包括他此前主推的 GR00T,提出以世界动作模型(WAM)为新范式,代表作是 2 月发布的 140 亿参数 DreamZero。
Jim Fan 在 2025 年 5 月 Sequoia AI Ascent 上发表了题为 The Physical Turing Test 的演讲,相关视频已在 YouTube 上线。
Jim Fan 在 YouTube 发布题为《Robotics: Endgame》的视频,附上链接 youtube.com/watch?v=3Y8aq_…,帖子获 230 赞、22 次转发、6 条回复与约 19.5 万次浏览。
Jim Fan 在红杉 AI Ascent 演讲《Robotics: Endgame》中,把解决 Physical AGI 的路线类比 LLM 的成功路径,指出 VLA 的不足,并提出视频世界模型作为第二预训练范式、World Action Models(WAM)以及机器人数据飞轮等方向。
字节跳动 Seed 发布新一代 3D 生成大模型 Seed3D 2.0,几何及纹理材质生成均达 SOTA 表现,技术报告已公开,API 上线火山引擎。几何生成引入 Coarse-to-Fine 两阶段 DiT 策略,将整体结构与几何细节解耦;纹理生成简化为统一 PBR 生成模型,并采用 MoE 架构与 VLM 先验增强材质分解稳定性。
播客节目回顾波士顿动力从单腿弹簧机器人到BigDog、Spot、PETMan、Atlas的近半个世纪发展史,并追问机器人如何控制身体、如何学会走路、具身智能意味着什么。节目提到2026年最新Atlas亮相,2027年将部署现代工厂,还谈及Google、软银、现代汽车的几次易主。
Physical Intelligence 与 Modal 合作构建基于 QUIC/UDP 的专用传输通道,替代 TCP,实现机器人与云端 GPU 容器之间的持久双向连接,网络开销仅约 10-15ms。
Lex Fridman 表示在世界领导人对话节目后遭到各方激烈攻击,心理一度跌至低点,但他称自己会继续做这类对话,并强调每场对话背后常做 100+ 小时研究。他还说今年想走遍世界,在话筒内外与更多普通人交谈。
NVIDIA、Berkeley AI、CMU Robotics 与 Stanford AI Lab 联合推出开源框架与基准 CaP-X,让 coding agent 为机器人感知和控制编写代码,并在仿真与真实机器人上执行、观察结果、迭代提升代码可靠性。项目主页为 capgym.github.io。
NVIDIA 联合 Berkeley、Stanford 和 CMU 开源了 CaP-X,采用 MIT 许可证,代码、论文与项目主页均已公开。论文编号为 arXiv:2603.22435。
Jim Fan 团队开源 CaP-X,将智能体以机械臂和人形机器人形态带入物理世界,并配套感知 API、执行 API 与自动合成的技能库;团队称策略如 VLA 也只是 API 调用,因此它是旧技术栈的严格超集。
Jim Fan 转发并评论 Danfei Xu 发布的 EgoVerse,这是一个基于第一人称人类数据进行机器人学习的生态。他称自 EgoScale 和灵巧度扩展定律公布后,直接对人类行为做行为克隆已成为打破遥操作限制的路径,2026 年的重点是无需机器人本体来扩展机器人学习。
斯坦福李飞飞团队发布 Dream2Flow,用 3D 物体流(3D object flow)打通视频生成与机器人控制,实现开放世界机器人操作。该方法以物体为中心的空间信息作为表征,旨在提升泛化能力,相关工作将亮相 ICRA 2026,项目主页为 dream2flow.github.io。
Jim Fan 公开致谢灵巧手硬件供应商 Sharpa,感谢其提供的支持。Sharpa 为其项目提供灵巧手硬件。
NVIDIA Robotics 团队发布 EgoScale,在 20K+ 小时的自我中心人类视频上预训练 GR00T VLA 模型,发现机器人灵巧度可以随更多人类数据而非更多机器人数据扩展。论文见 arxiv.org/abs/2602.16710,项目主页为 research.nvidia.com/labs/gear/egos。
Jim Fan 团队训练了一台配备 22 自由度灵巧手的人形机器人,完成组装模型车、操作注射器、整理扑克牌、折叠卷起衬衫等任务,主要从 2 万多小时第一视角人类视频中学习,训练过程中没有机器人参与。
NVIDIA 团队训练了一个 42M 的 Transformer 模型 SONIC 用于控制人形机器人全身动作,并开放代码和模型检查点。该模型以人类动捕数据做逐帧监督,将运动跟踪作为全身控制的统一可扩展任务,数据本身即隐含奖励函数。
42M 模型用人类动捕数据替代手工奖励设计,并开源代码与检查点,对具身智能研究者是可复用的训练范式。
Jim Fan 推荐 Shenyuan Gao 的技术详解:NVIDIA 的 DreamDojo 是一个交互式机器人世界模型,基于 44K 小时人类第一人称视频预训练,团队称这是目前机器人世界模型学习中规模最大、最多样的数据集。该模型在泛化能力之外,经知识蒸馏后支持 10 FPS 的实时交互,可用于实时遥操作、策略评估和测试时的基于模型规划,代码、模型与数据已在 GitHub 开源。