跳到正文

#具身智能

今日 0 条
10月9日周五
  1. AI科技评论AI 评估 · 53/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    星动纪元 VPP2 登顶 RoboDojo,14B 参数无额外数据开源可复现

    星动纪元(清华唯一持股的具身公司)推出世界动作模型 VPP2(Video Prediction Policy 2),以平均成功率 32.26%、平均得分 39.26 登顶 RoboDojo 榜首,超过此前 GPT-6-Astra 的 22.48% 和 28.97%,并拿下 generalization、precision、memory 三项第一。

  2. 机器之心AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    李飞飞团队发布 OpenWAM:世界动作模型开源框架让动作翻译器可迁移

    斯坦福大学李飞飞、吴佳俊、Ehsan Adeli 等人发布论文,提出开放的世界动作建模框架 OpenWAM,相关代码、评测与预训练视频模型权重已开源。框架从阿里开源的 Wan2.2-5B 出发,在约 334 万条人机交互视频上继续预训练,用 MoT 架构把 5B 视频专家与 2B 动作专家拼在一起,并定义 VTA、ATV、Joint、Decoupled 四种交互程序。

  3. 量子位AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    MirroS 团队发布 AgentGarten:让智能体在代码与实时渲染的试炼场中边玩边进化

    MirroS 团队发布 AgentGarten,将可执行代码环境与实时神经渲染器连接,物理规则由代码裁决、光影由模型生成,以超过 30 fps 的吞吐让智能体持续与虚拟世界交互。

  4. 美团技术团队AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    美团 LongCat 发布 MineExplorer:首个开放世界分钟级长程任务评测基准,18 款顶级多模态大模型集体"考砸"

    美团 LongCat 团队构建 MineExplorer,首个在开放世界中做到分钟级长程任务的评测基准,包含 813 个人工验证实例(1-hop 到 4-hop),每个任务实例运行 1800 个环境步、对应 3 分钟连续交互。

  5. 国际大厂AI 评估 · 61/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    TouchScale 发布 500 小时人类视觉-触觉数据集,机器人真机成功率翻番

    德州农工大学、Google DeepMind、CMU 等 15 家机构联合发布 TouchScale,一个在统一传感器与采集流程下构建的 500 小时人类双手视觉-触觉数据集。

  6. 量子位AI 评估 · 56/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    星动纪元VPP2登顶RoboDojo仿真榜单并开源

    星动纪元自研的世界动作模型VPP2登顶RoboDojo仿真榜单,平均成功率32.26%、平均得分39.26分,两项均列第一,领先GPT-6-Astra。该模型未额外加数据、未用Agent RSI等增强手段,仅靠标准数据集,在泛化、精细操作、记忆三个维度也拿下第一。团队将视频预测与动作学习分阶段训练,真机ALOHA零样本操作平均成功率58.5%,高于π0.5的40%,现已在GitHub开源。

10月5日周一
  1. 机器之心AI 评估 · 50/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    VA-Bench 测出大模型空间智能执行断层:目标识别接近满分,完整任务成功率仅约一半

    VA-Bench 以观察、推理、行动、修正的闭环测试 12 个多模态模型,覆盖 14 类机器人操作任务共 280 个基础场景。表现最好的模型在目标识别与定位上达到 100%、操作语义理解达到 99.6%—100%,但 Qwen3.8-max、Opus-5 和 GPT-5.6-sol 的完整任务成功率分别只有 53.93%、52.86% 和 51.55%。

10月3日周六
  1. AK(@_akhaliq)AI 评估 · 19/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    EgoTools:面向真实第一人称视频的工具中心推理

    论文 EgoTools 提出面向真实第一人称视频的工具中心推理,论文已在 HuggingFace 上线(编号 2609.39…)。目前仅有论文链接与演示视频,未披露模型规模、benchmark 分数或开源情况。

10月2日周五
  1. 大模型智能AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    世界—动作模型综述:从预测未来到机器人闭环控制

    MBZUAI、Caltech 等机构发布综述《World-Action Models for Robot Learning and Control: A Survey》,系统梳理世界—动作模型(WAMs)的概念、架构、训练与评测,核心是把未来世界预测与可执行动作生成连接起来。论文按语言接口、视觉编码器、预测骨干与动作解码器拆解 WAM,并区分联合预测与逆动力学两条路径,覆盖操作、导航与自动驾驶。

9月30日周三
  1. AK(@_akhaliq)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    SpatialClaw:重新思考智能体空间推理的动作接口

    SpatialClaw 提出重新思考智能体空间推理的动作接口,相关论文已发布在 Hugging Face Papers。原文未披露模型规模、benchmark 分数或开源情况。

  2. Berkeley AI Research(@berkeley_ai)AI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Dextac-WAM 项目网站上线:新增真机演示、世界模型预测与触觉可视化

    Dextac-WAM 项目网站新增真机演示、世界模型预测、触觉可视化、消融实验与详细说明,网址为 dextacwam.github.io。

  3. Berkeley AI Research(@berkeley_ai)AI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    如何把触觉世界建模扩展到十指?一种手指与姿态感知的触觉压缩器

    一种手指与姿态感知的触觉压缩器将10路指尖数据流映射为2个手部级潜变量,同时保留89.4%的融合前接触召回率,使训练速度提升2.26倍、推理速度提升1.29倍。该工作面向十指触觉世界建模的规模化问题。

  4. Berkeley AI Research(@berkeley_ai)AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Berkeley AI 开源 DexTacWAM:面向灵巧操作的视触觉世界-动作模型

    Berkeley AI 人类智能中心发布 DexTacWAM,一个将预训练视频世界模型通过持续视触觉学习改造而成的视触觉世界-动作模型,用于多指接触预测与动作生成。

9月27日周日
  1. Thomas Wolf(@Thom_Wolf)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    不用 IMU 也能实现人形机器人抗推行走:Blind Dexterity 只用关节编码器

    Aditya Bhatt 等人的最新博士论文提出 Blind Dexterity,首次仅靠关节编码器实现抗推的人形机器人行走,无需 IMU 和力/力矩(F/T)传感器。该工作由 DFKI 与达姆施塔特工业大学(@ias_tudarmstadt)团队完成,论文已被 IROS 2026 接收。

9月24日周四
  1. Microsoft Research(@MSFTResearch)AI 评估 · 29/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Microsoft Research 新发现:把 AI 推理移出机器人本体可提升任务成功率

    Microsoft Research 新研究显示,将 AI 推理从机器人本体移出可提升任务成功率、提高效率,并支撑更先进的物理 AI 工作负载。该结论指向机器人硬件与智能增长不匹配的问题,即算力从机器人端外移是可行路径。

  2. Microsoft Research BlogAI 评估 · 49/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    微软研究:把物理 AI 推理卸载到边缘或云端,可提升机器人成功率与续航

    微软研究发现,将物理 AI 推理从机器人板载 GPU 卸载到边缘或云端 GPU,可显著提升移动操作任务的成功率、响应速度与电池续航。测试显示,较轻 GPU 下建图与规划最多变慢 383%,导航障碍及时检测下降 30%,VLA 模型准确率下降 50%;用树莓派 5 替代板载 GPU 后,Jetson Thor 一类板载 GPU 曾使续航最多减少 160%。

9月23日周三
  1. AK(@_akhaliq)AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    将 VLM 的智能迁移到机器人控制

    一篇论文提出把视觉语言模型(VLM)的智能迁移到机器人控制中,论文页面已发布在 Hugging Face Papers(编号 2609.22…)。原帖未披露所用模型、参数规模或评测结果。

8月22日周六
  1. Jim Fan(@DrJimFan)AI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jim Fan 转发 T-Rex 触觉反应式灵巧操作研究

    Jim Fan 转发 Dantong Niu 等人的 T-Rex 触觉反应式灵巧操作研究,该工作针对多数 VLA 模型忽略触觉反馈或无法响应高频接触信号的问题,从数据和架构两方面入手。

8月17日周一
  1. Rowan Cheung(@rowancheung)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    庆应大学与 MIT Media Lab 造出漂浮机器人:氦气软体、无脸无旋翼,靠摆动与人交流

    庆应大学与 MIT Media Lab 的研究者造出一台氦气填充的漂浮机器人,无面部、无旋翼,靠轻柔摆动的鳍片在房间中漂移并用动作与人交流。演示中它可充当闹钟、学习伙伴、起身活动提醒,甚至舞伴。团队刻意避开人脸设计以绕开恐怖谷,赌的是只要硬件适合触摸,人们就会像接纳宠物一样让它进入个人空间。

7月29日周三
  1. Fei-Fei Li(@drfeifei)AI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    李飞飞:world models 分类中模拟器是枢纽,R2S2R 引擎推动机器人训练评估摆脱硬件束缚

    李飞飞在 world models 分类中将模拟器称为枢纽,即智能体行动、学习与评估的场所。其 R2S2R 引擎能让机器人开发摆脱缓慢昂贵、受硬件束缚的迭代,转向更具扩展性且更便宜的训练与评估。

  2. Fei-Fei Li(@drfeifei)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    李飞飞团队 R2S2R 的 Real-to-Sim 环节:将物理机器人、传感器与环境转化为仿真

    李飞飞介绍的 R2S2R 中 Real-to-Sim 环节,可把物理机器人、传感器、环境、物体及交互转化为仿真,同时保留与任务相关的观测和动力学——不只是世界的外观,还有机器人交互时它的行为方式。该结果在机器人操作领域的 sim-real 对齐上树立了新标准。

7月18日周六
  1. Jim Fan(@DrJimFan)AI 评估 · 51/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jim Fan 介绍 RoboTTT:机器人模型上下文原生扩展到 8000 时间步

    Jim Fan 介绍 RoboTTT,将机器人模型上下文原生扩展到 8000 个时间步、约 5 分钟的肌肉记忆,且推理成本保持恒定。其做法是 Test-Time Training,在模型内部携带一个小模型,每条传感器读数触发一次梯度更新,把历史压缩进权重,使隐藏状态保持固定大小。

7月16日周四
  1. Fei-Fei Li(@drfeifei)AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    李飞飞与 NVIDIA 合作发布 RoboTTT 机器人测试时训练工作

    李飞飞介绍斯坦福 SVL 与 NVIDIA Robotics 合作的机器人学习测试时训练工作 RoboTTT,把机器人模型原生扩展到 8000 个 timestep 上下文,相当于 5 分钟的肌肉记忆,且推理成本恒定。

7月15日周三
  1. Jim Fan(@DrJimFan)AI 评估 · 43/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NVIDIA GEAR Lab 推出 RoboTTT:机器人策略扩展到 8K 时间步视觉运动上下文

    NVIDIA GEAR Lab 发布 RoboTTT,将机器人策略的视觉运动上下文扩展到 8K 时间步,远超当前 SOTA 且保持恒定推理延迟。机器人凭借上下文中的数分钟经验,可单次模仿人类视频演示、在部署过程中自我提升、从扰动中恢复,并完成一个 5 分钟 10 阶段的完整装配任务。

  2. Jim Fan(@DrJimFan)AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jim Fan 团队推出 RoboTTT:机器人模型原生扩展至 8000 时间步上下文

    Jim Fan 团队推出 RoboTTT,将机器人模型原生扩展到 8000 时间步上下文,约合 5 分钟的肌肉记忆,且推理成本保持不变。此前机器人策略通常只处理不到 0.1 秒的几帧,RoboTTT 把这一尺度推进了 3 个数量级。

7月14日周二
  1. Fei-Fei Li(@drfeifei)AI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    李飞飞团队致谢 Simovation 与 NVIDIA:JoyLo 遥操作数据助力 BEHAVIOR 数据集

    李飞飞团队在 BEHAVIOR 数据集相关工作中致谢 Simovation 提供模拟环境下的高质量 JoyLo 遥操作数据,并说明 BEHAVIOR 构建于 NVIDIA Omniverse 之上,感谢 NVIDIA 的持续支持。

  2. Fei-Fei Li(@drfeifei)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    斯坦福 BEHAVIOR Challenge 第二年回归:任务更多、评估更好、更易用

    斯坦福 BEHAVIOR Challenge 第二年回归,聚焦需要规划、物体检测、物体操作和失败恢复的长时程复杂任务,去年获胜方案全任务成功率仅 12.4%。今年挑战赛任务更多、评估更好且更易用,提交截止日期为 2026 年 10 月 16 日,获奖者于 2026 年 11 月 4 日公布,奖池 11,000 美元。

7月1日周三
  1. Jim Fan(@DrJimFan)AI 评估 · 65/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jim Fan 团队发布 ASPIRE:机器人用技能库实现持续学习

    Jim Fan 公布 Physical AutoResearch 系列第二项工作 ASPIRE,让机器人通过自进化技能库实现持续学习,解决第 100 个任务时不再像第一个任务那样毫无头绪。

  2. Jim Fan(@DrJimFan)AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NVIDIA 联合四校发布 ASPIRE:首个机器人自动化技能发现系统

    NVIDIA GEAR lab 联合 UMich、Berkeley、CMU 推出 ASPIRE,这是首个面向机器人的自动化技能发现系统。它不再逐个解决任务,而是持续发现并积累可复用技能,这些持久化技能支持多任务迁移、sim-to-real 迁移和跨形态迁移。论文与项目页面已在 NVIDIA 官网发布。

  3. Jim Fan(@DrJimFan)AI 评估 · 50/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jim Fan 推出机器人技能库 ASPIRE:自我进化、可无限累积

    Jim Fan 发布 ASPIRE,用编码智能体观察仿真与真实机器人的多模态感知轨迹,对控制程序做进化搜索,将最优经验蒸馏进不断扩张的技能库。它把"训练"变成技能精炼而非梯度下降,"模型"变成传感器运动技能仓库而非浮点权重。ASPIRE 将 sim2real 与跨本体迁移的 token 消耗最多降低约 10 倍,已积累 150+ 任务、90+ 技能,并将开源全栈。

6月30日周二
  1. Stanford AI Lab(@StanfordAILab)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    斯坦福 SAIL 博客:R&B-EnCoRe——机器人行动前究竟该思考什么?

    斯坦福 SAIL 新博客介绍了 R&B-EnCoRe,展示 Vision-Language-Action 模型如何自教自学哪些链式推理真正有助于行动,无需奖励、验证器或人工标注。

6月29日周一
  1. Import AI — Jack ClarkAI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Import AI 463:NVIDIA 用 ENPIRE 让机器人自我改进,中国 10k GPU 集群与人类时代挽歌

    NVIDIA 推出 ENPIRE 框架,让编码智能体驱动真实机械臂自主试错、自动重置与评估,在 PushT、整理插针、用切割器剪扎带等任务上实现 99% 成功率。

6月17日周三
  1. Jim Fan(@DrJimFan)AI 评估 · 74/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NVIDIA 推出 ENPIRE:让 Codex 智能体驱动机器人自主实验

    NVIDIA GEAR 实验室发布 ENPIRE,为 8 个 Codex 智能体配备机器人集群、GPU 配额和充足 token 预算,目标是在保证安全、不浪费算力的前提下尽快解决任务。

  2. Jim Fan(@DrJimFan)AI 评估 · 71/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NVIDIA 等发布 ENPIRE:编码智能体自主完成真机具身任务

    NVIDIA、CMU 与 Berkeley 的研究者发布 ENPIRE,将前沿编码智能体接入真实机器人集群,自主完成重置环境、检索文献、实现想法、搭建基础设施、训练部署、自验证、分析日志并改写代码的完整闭环,全程无需人类介入。

6月6日周六
  1. Jim Fan(@DrJimFan)AI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NVIDIA 在 CVPR 2026 展示三篇物理 AI 论文

    NVIDIA Research 本周在 CVPR 2026 展示三篇物理 AI 论文:首个零样本抓取基础模型 GraspGen-X,基于数十亿次模拟抓取训练;用紧凑隐表示替代昂贵文本推理的 LCDrive;以及借助 NVIDIA Isaac GR00T 训练具身智能体的通用游戏 AI 基础模型 NitroGen。

  2. Jim Fan(@DrJimFan)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NitroGen 获 CVPR 最佳论文荣誉提名,推进通用具身智能体

    NitroGen 获得 CVPR 最佳论文荣誉提名,目标是打造通用具身智能体,不仅能掌握真实世界物理,还能驾驭模拟多元宇宙中的各类物理规律。团队上一项在 Minecraft 中的具身智能体工作 MineDojo 曾获 NeurIPS 最佳论文,距今已 4 年。

4月1日周三
  1. Jim Fan(@DrJimFan)AI 评估 · 43/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NVIDIA 等推出 CaP-X:面向机器人 coding agent 的开源框架与基准

    NVIDIA、Berkeley AI、CMU Robotics 与 Stanford AI Lab 联合推出开源框架与基准 CaP-X,让 coding agent 为机器人感知和控制编写代码,并在仿真与真实机器人上执行、观察结果、迭代提升代码可靠性。项目主页为 capgym.github.io。

  2. Jim Fan(@DrJimFan)AI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NVIDIA 联合 Berkeley、Stanford、CMU 开源 CaP-X,采用 MIT 许可证

    NVIDIA 联合 Berkeley、Stanford 和 CMU 开源了 CaP-X,采用 MIT 许可证,代码、论文与项目主页均已公开。论文编号为 arXiv:2603.22435。

  3. Jim Fan(@DrJimFan)AI 评估 · 74/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jim Fan 团队开源 CaP-X:让智能体在真实机器人上运行

    Jim Fan 团队开源 CaP-X,将智能体以机械臂和人形机器人形态带入物理世界,并配套感知 API、执行 API 与自动合成的技能库;团队称策略如 VLA 也只是 API 调用,因此它是旧技术栈的严格超集。

3月21日周六
  1. Fei-Fei Li(@drfeifei)AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    李飞飞团队 Dream2Flow:用 3D 物体流连接视频生成与机器人控制

    斯坦福李飞飞团队发布 Dream2Flow,用 3D 物体流(3D object flow)打通视频生成与机器人控制,实现开放世界机器人操作。该方法以物体为中心的空间信息作为表征,旨在提升泛化能力,相关工作将亮相 ICRA 2026,项目主页为 dream2flow.github.io。