Aether AI 发布 CRIS-0,因果智能在真机跑通闭环
Aether AI 发布 CRIS-0,把因果智能体与因果世界模型在统一因果状态表示下打通,通过统一工具接口调度机械臂完成家庭任务。在咖啡、微波炉、垃圾分拣等真机测试中,系统面对物体移位等扰动平均 2 秒内重置规划,10 次强干扰测试成功恢复 9 次,长程任务靠阶段验证制切断误差累积。公司称目前跑通技术四层金字塔的前两层,后续需补上消融实验数据与更复杂环境下的泛化验证。
Aether AI 发布 CRIS-0,把因果智能体与因果世界模型在统一因果状态表示下打通,通过统一工具接口调度机械臂完成家庭任务。在咖啡、微波炉、垃圾分拣等真机测试中,系统面对物体移位等扰动平均 2 秒内重置规划,10 次强干扰测试成功恢复 9 次,长程任务靠阶段验证制切断误差累积。公司称目前跑通技术四层金字塔的前两层,后续需补上消融实验数据与更复杂环境下的泛化验证。
Odyssey 发布 Odyssey-3 系列世界模型,其中 Odyssey-3 Pro 在 Physics-IQ Verified 上刷新最高分,该基准要求模型续写真实物理实验视频。
Runway 机器人业务负责人 Andy Chen 阐述了 Runway 在机器人领域的独特路线,并首次发布开放权重的世界动作模型 Praxis-1。Praxis-1 已在 runway.com/praxis-1 开放提前访问申请。
Runway 发布 Praxis-1,一个开放权重的世界动作模型(World Action Model),把其在视频预训练上的积累用于机器人真实世界控制。该模型基于大规模视频预训练和实时基础设施构建,定位为可跨任意具身形态与环境的策略模型,面向机器人开发者和研究者。
影溯科技发布并上线新一代世界模型 InSpatio-World 1.5,支持单图、多图、全景图和视频等不同输入,强化实时场景探索与时空一致性,并已开放试用与开源代码,同时即将邀测世界模拟器 Topos-Pro 1.0。
Reward AI 推出首个机器人基础模型 OM-1,可零样本泛化到桌面机械臂、工业机械臂和人形机器人等任意机器人本体。该模型直接从人类操作数据中学习,无需遥操作或机器人数据,据称在灵巧度与效率上接近人类水平,并支持多机器人协作。
World Labs 发布面向空间智能的世界模型 Atlas,其核心是新视角预测,并称它是首个统一像素生成与像素重建的模型。团队表示这让数字化采集一个空间三维表示所需的数据量减少 50 到 100 倍,过去一个房间需要 100 到 300 张照片,Atlas 只需三张。
Google 发布 Gemini Robotics ER 2,称其为面向物理 AI 能力最强的具身推理模型,定位为机器人的高层大脑,可直接连接 Gemini Live API。该模型处理连续视频流以跟踪进度、调用工具、搜索网页并实时指挥动作模型,面向开发者新增进度跟踪增强、执行中途故障实时检测、多机器人协作和安全指令遵循等升级。
Google DeepMind 推出 Gemini Robotics 2,作为驱动新一代机器人的智能层,支持全身智能控制、高级灵巧操作和多机器人协作。新发布的具身推理模型 Gemini Robotics ER 2 充当机器人的高层大脑,负责观察环境、推理完成任务所需动作并与视觉-语言-动作模型协同执行,同时跟踪进度,使机器人能够完成复杂多步工作流、在步骤失败时自我纠正并适应全新场景。
Google DeepMind 发布 Gemini Robotics 2 系列,读者可了解机器人全身控制与具身推理的新分工。
Google DeepMind 发布面向机器人具身推理的 Gemini Robotics ER 2,可通过 Gemini API、Google AI Studio 公开使用,并在 Gemini Enterprise Agent Platform 上开启私密预览。
Google DeepMind 发布 Gemini Robotics 2,并展示了机器人之间协同工作的能力。
Google DeepMind 发布 Gemini Robotics 2,包含三款模型:负责视觉-语言-动作的 Gemini Robotics 2、负责具身推理的 Gemini Robotics ER 2,以及本地运行的 Gemini Robotics On-Device 2。
Mistral 发布首个具身导航模型 Robostral Navigate,这是一个 8B 机器人导航模型,可引导机器人自主执行自然语言指定的任务,仅需单个 RGB 摄像头,并在 R2R-CE 上达到 SOTA。
通义实验室发布 Qwen-Robot 系列,用三个专业基础模型弥合从认知到行动的鸿沟:Qwen-RobotNav 统一指令跟随、点/目标导航、目标追踪和自动驾驶四类任务,Qwen-RobotManip 基于超过 38,100 小时数据实现跨本体训练,Qwen-RobotWorld 以自然语言动作接口跨场景预测物理未来。
通义实验室一次发布三款具身基础模型,给出统一语言接口与跨本体数据方案,可观察大模型接入物理行动的路径。
字节跳动 Seed 发布新一代 3D 生成大模型 Seed3D 2.0,几何及纹理材质生成均达 SOTA 表现,技术报告已公开,API 上线火山引擎。几何生成引入 Coarse-to-Fine 两阶段 DiT 策略,将整体结构与几何细节解耦;纹理生成简化为统一 PBR 生成模型,并采用 MoE 架构与 VLM 先验增强材质分解稳定性。
NVIDIA 团队训练了一个 42M 的 Transformer 模型 SONIC 用于控制人形机器人全身动作,并开放代码和模型检查点。该模型以人类动捕数据做逐帧监督,将运动跟踪作为全身控制的统一可扩展任务,数据本身即隐含奖励函数。
42M 模型用人类动捕数据替代手工奖励设计,并开源代码与检查点,对具身智能研究者是可复用的训练范式。
NVIDIA 发布世界模型 DreamDojo,项目网站 dreamdojo-world.github.io 与论文 arXiv 2602.06949 已上线,代码仓库和模型 ckpts 已在 GitHub 的 NVIDIA/DreamDojo 开放。该项目由 NVIDIA 内部大团队协作完成。
Jim Fan 宣布开源交互式世界模型 DreamDojo,它接收机器人电机控制信号并直接生成像素层面的未来画面,不依赖引擎、网格或人工编写的动力学。模型在 44K 小时人类第一视角视频上预训练,通过从视频中推断的 latent actions 统一动作表示,从而零样本泛化到机器人训练集未见过的物体与环境,之后再针对具体机器人硬件做后训练。
NVIDIA 推出 14B 世界动作模型 DreamZero,在同一扩散前向过程中联合预测视频与动作,实现对未见任务的零样本泛化和对新机器人的少样本适配。该模型由 NVIDIA 团队完成,作者 Joel Jang 发布了详细介绍。