Google DeepMind 发布具身推理模型 Gemini Robotics ER 2
Google DeepMind 发布面向机器人具身推理的 Gemini Robotics ER 2,可通过 Gemini API、Google AI Studio 公开使用,并在 Gemini Enterprise Agent Platform 上开启私密预览。
Google DeepMind 发布面向机器人具身推理的 Gemini Robotics ER 2,可通过 Gemini API、Google AI Studio 公开使用,并在 Gemini Enterprise Agent Platform 上开启私密预览。
Google DeepMind 发布 Gemini Robotics 2,并展示了机器人之间协同工作的能力。
Google DeepMind 发布视频,介绍 Gemini Robotics 2 具备高级灵巧能力。材料仅提供标题,未包含正文与其他细节。
Jim Fan 表示强化学习的关键在于环境(envs),而 Real2sim2real 是为物理 RL 扩展环境的最佳方式之一,并就此向李飞飞表示祝贺。
李飞飞指出,Sim-to-real 对齐的仿真让评估变得可扩展:同一失败行为与结果会同时出现在虚拟和物理世界中。该仿真不只还原任务设置或最终成功标签,而是复现推动策略走向成功或失败的条件,从而带来更快迭代、更广覆盖和显著更低的成本。
李飞飞在 world models 分类中将模拟器称为枢纽,即智能体行动、学习与评估的场所。其 R2S2R 引擎能让机器人开发摆脱缓慢昂贵、受硬件束缚的迭代,转向更具扩展性且更便宜的训练与评估。
借助生成式世界模型,real-to-sim-to-real(R2S2R)仿真引擎可将一个物理任务转化为多个可控、可复用的世界,帮助机器人团队更快训练策略模型、更早发现失败并减少昂贵的硬件实验。
李飞飞介绍的 R2S2R 中 Real-to-Sim 环节,可把物理机器人、传感器、环境、物体及交互转化为仿真,同时保留与任务相关的观测和动力学——不只是世界的外观,还有机器人交互时它的行为方式。该结果在机器人操作领域的 sim-real 对齐上树立了新标准。
World Labs 公布其空间智能愿景的早期成果:构建可训练机器人的世界。SceniX 加入 World Labs 时,团队曾表示空间智能不止于感知和生成虚拟与物理世界,还包括与之交互。
Google DeepMind 发布 Gemini Robotics 2,包含三款模型:负责视觉-语言-动作的 Gemini Robotics 2、负责具身推理的 Gemini Robotics ER 2,以及本地运行的 Gemini Robotics On-Device 2。
Rowan Cheung 表示可在 @weaverobotics 官网预订该机器人,并强调这不是赞助内容。他询问是否应该入手一台,并在今年秋天拍一支更新视频。
一款轮式机器人底座可在3英尺至5英尺9之间调节,双臂垂直触及范围达80英寸,足以在床边、台面和衣柜处作业。其定价为每月$449或一次性$7,999,价格仅为1X Neo的一半。
Weave Robotics 售价 8000 美元的机器人已开启预售,可叠衣服、整理床铺,交付时间定在今年秋季。
Meta 的 DINOv3 与 SAM 正被匹兹堡大学 RAMMP 项目用于辅助机器人,在电池供电的边缘设备上实现实时感知。团队用 DINOv2 嵌入微调轻量检测模型 RF-DETR,并用 SAM 自动标注训练数据,从而获得实时 360 度环境感知与自适应物体检测。DINOv3 作为通用“视觉大脑”,支持自然语言加图像查询机器人环境,该功能已集成进首个原型并准备进入真实场景测试。
智象未来 HiDream 创始人梅涛在访谈中提出"图片是入口,视频是过程,世界模型是终局",认为语言、视频、具身终将汇聚。他 2017 年做出全球首篇文生视频论文 TGANs-C,如今带队探索取消外部 VAE 的 UiT 架构,并称架构领先只能维持六个月。他判断多模态仍处 GPT-2 阶段,"像素没有统计意义",世界模型更像一组模型家族而非单一模型。
蚂蚁集团孵化的蚂蚁灵波刚发布第二代具身基础模型,首席科学家沈宇军在本期访谈中介绍了这次发布的 Depth、Vision、VLA、Video、World、VA 2.0 六个模型及其关系。
姚颂创办正行创新(Striding AI),这是他继 AI 芯片公司深鉴科技、商业航天公司东方空间之后的第三次硬科技创业,方向转向物理 AI。他 26 岁时以 3 亿美元卖掉深鉴科技,此后在东方空间经历引力一号发射等节点。访谈中他谈到智能优先只适合极少数公司,并认为 OpenAI、Anthropic 不会摘取物理 AI 果实。
SceniX 宣布加入李飞飞的 World Labs。李飞飞表示,世界不只由文字构成,空间智能从来不只是感知和生成世界,更在于与世界交互。
World Labs 宣布 SceniX 团队加入,该团队由 @YunzhuLiYZ、@fast_sploosh 和 @xhsonny 带领,在高保真仿真中训练和评估机器人,并已在真实硬件的现场部署中验证。World Labs 表示,将其世界模型与 SceniX 的仿真和机器人技术专长结合,是迈向空间智能的重要一步。
阶跃星辰在 WAIC 2026 展区(H1 馆 C107)展出大模型原生智能体手机 STEPX Neo,搭载全球首个智能体原生操作系统 Step AOS,内置智能体阶跃Amoo,为首批通过《人工智能终端智能化分级》L3 级别测试的智能体手机。
Jim Fan 介绍 RoboTTT,将机器人模型原生扩展到 8000 个时间步的上下文,约 5 分钟的肌肉记忆,推理成本保持恒定,比 SOTA 推进三个数量级。
Jim Fan 晒出自家机器人的装配演示:模型速度不快,但会测量每次抓取、反复校准对齐,整段视频未剪辑、未加速,端到端策略一次跑完。他把清晨看机器人干活当成一种冥想式的享受。
阶跃星辰董事长印奇在 WAIC 2026 开幕式主论坛发表演讲《当智能体进入物理世界》,提出智能体能力 = 模型能力 × 智能体操作系统能力,并指出智能体将带来新系统、新载体、新网络三大结构性变化。
硅谷机器人公司Physical Intelligence(Pi)研究员柯丽一鸣在访谈中详解了Pi在机器人大脑上的开源模型研究脉络,从π0到π0.5再到π*0.6。她主要负责强化学习方向研究,也是Pi核心论文作者之一,节目中聊到了机器人的江湖、谱系、门派与主角。访谈还涉及π0.7,其强调统一模型、无需后训练即可媲美以往后训练的通用能力。
苏度科技联合创始人兼CEO韩铮在硅谷101播客中称,公司走软硬件协同设计的上下分层路线,上层负责规划与环境理解、下层负责物体操作,并以Sim-to-Real为核心训练范式。其零样本通用抓取单次成功率接近100%,节目中另有片段提到98%。他预测,被硅谷主流冷落的"上下分层"路线将重新回到主流。
李飞飞介绍斯坦福 SVL 与 NVIDIA Robotics 合作的研究 RoboTTT,把机器人模型原生扩展到 8000 个时间步的上下文,约 5 分钟的肌肉记忆,且推理成本保持恒定,相比此前一次只看几帧(不足 0.1 秒)的策略提升了三个数量级。
NVIDIA GEAR Lab 发布 RoboTTT,将机器人策略的视觉运动上下文扩展到 8K 时间步,远超当前 SOTA,且推理延迟保持恒定。凭上下文中的数分钟经验,机器人可单次模仿人类视频演示、在部署中自我改进、从扰动中恢复,并完成 5 分钟 10 阶段装配流程。
机器人模型 RoboTTT 原生扩展至 8,000 timesteps 上下文、约 5 分钟的肌肉记忆,且推理成本恒定。其采用 Test-Time Training,把一个小模型放进模型内部,每条传感器读数触发一次梯度步,将历史压缩进固定大小的隐状态,部署后可持续学习。8K 上下文预训练比 1K 提升 62%,并支持从单次人类视频进行上下文学习。
阶跃星辰将在 WAIC 2026 展出 Step 系列模型矩阵,覆盖云端与端侧、多模态理解与生成,并带来号称全球首个智能体原生操作系统的 Step AOS。获本届 WAIC“镇馆之宝”的智能体手机 STEPX Neo 首次线下公开亮相,同时联合吉利、千里科技升级汽车智能体并上线极氪 8X。展位为上海世博展览馆 H1 馆 C107。
Momenta 创始人曹旭东在 IPO 前后接受《晚点聊》专访,讲述公司十年"一个飞轮、两条腿"战略。Momenta 在第三方城区 NOA 份额已超 65%,比华为等对手总和还多。他还推演了面向具身智能与物理 AI 的下一个十年。
Fei-Fei Li 公开发文致谢赞助方与支持者对项目的慷慨支持,点名感谢 SimovationInc、IMDAsg、StanfordHAI、SchmidtFutures 及 Calder Inc.。该致谢为其系列帖文的第 11 条。
李飞飞团队在 BEHAVIOR 数据集相关工作中致谢 Simovation 提供模拟环境下的高质量 JoyLo 遥操作数据,并说明 BEHAVIOR 构建于 NVIDIA Omniverse 之上,感谢 NVIDIA 的持续支持。
斯坦福 BEHAVIOR Challenge 第二年回归,聚焦需要规划、物体检测、物体操作和失败恢复的长时程复杂任务,去年获胜方案全任务成功率仅 12.4%。今年挑战赛任务更多、评估更好且更易用,提交截止日期为 2026 年 10 月 16 日,获奖者于 2026 年 11 月 4 日公布,奖池 11,000 美元。
今年上半年国内具身智能赛道已披露融资达 300-500 亿,超过去年全年,行业讨论其是否已走向泡沫。极客公园播客邀请蓝驰创投合伙人曹巍、具身智能投资人笔盒、诺亦腾机器人 CEO 戴若犁等嘉宾,探讨机器人公司估值逻辑、中美具身智能分岔及本体赛道未来一年半或进入平台期。嘉宾预测未来 12 个月真实商业场景开始造血、行业进入二八分化、2 万元级人形本体可能出现。
Mistral 发布 Robostral,可运行在轮式、足式与飞行机器人上,并能跨不同尺寸泛化。该模型面向配送、物流、制造与酒店服务等场景。
Mistral 发布首个具身导航模型 Robostral Navigate,这是一个 8B 机器人导航模型,可引导机器人自主执行自然语言指定的任务,仅需单个 RGB 摄像头,并在 R2R-CE 上达到 SOTA。
仙工智能已于2026年6月24日在香港交易所主板挂牌上市,成为"机器人大脑第一股",其机器人控制器全球出货量第一。创始人赵越在首次深度访谈中提出"所有公司都可以是机器人公司",并称仙工不立刻训练通用大脑,而是靠2000种机型×400种传感积累天然对齐的数据,先做垂类模型。
Jim Fan 公布 Physical AutoResearch 系列第二项工作 ASPIRE,让机器人通过自进化技能库实现持续学习,解决第 100 个任务时不再像第一个任务那样毫无头绪。
一目科技创始人兼 CEO 李智强在播客中提出,机器人运动能力已接近 90 分、灵巧手 59 分,而「大脑」只有 30 分,缺的正是物理世界的触觉信息。他主张「视触觉」本质仍是触觉,靠弹性皮肤形变与光影读取力与纹理,与视觉互补;行业正从 VLA 向加入 Tactile 的 VTLA 演进,触觉数据则靠大量纯视觉预训练再叠加触觉微调。
Aether AI 创始人黄碧薇提出,具身智能当前靠 Scaling Law 堆数据的路线存在误区:VLA 模型在 demo 中表现良好,但真实场景里桌面高两厘米任务就会失败,因为它学的是相关性而非因果。她主张用因果大模型从同样数据中挖掘变量间的因果关系与动作后状态演化,让机器人能举一反三,这一方向在学术界已酝酿 37 年。