Mishig 用 MuJoCo、so101 与 gpt6 astra 让仿真机器人画埃菲尔铁塔
Mishig 在 MuJoCo 中复现实验,让 gpt6 astra 控制 so101 机械臂与画笔,在仿真里画出埃菲尔铁塔,完整实验已发布在 Hugging Face。
Mishig 在 MuJoCo 中复现实验,让 gpt6 astra 控制 so101 机械臂与画笔,在仿真里画出埃菲尔铁塔,完整实验已发布在 Hugging Face。
Citrini Research 分析师用一周时间在旧金山湾区走访十余家机器人实验室,实地观察 AI 机器人操作,重新评估了机器人形态、神经网络与商业化时间表。文章以 GeneralistAI GEN-1.5 和 Skild AI S1 的"in-context"学习演示为例,指出当前机器人多处于开发训练与遥操作演示阶段,真正的落地部署仍接近试点。
World Labs 正在招聘机器人学习方向的研究员与工程师,Yunzhu Li 与 Fei-Fei Li 邀请加入团队,共同定义并扩展面向机器人学习的下一代世界模型。相关方向包括 Atlas for Robotics 与 Real-to-Sim-to-Real。
具身智能初创公司芝诺机器人完成总额数亿元人民币种子轮融资,投资方包括舜宇光学、沐曦股份、网新集团、赛意产业基金等。该公司自研3B参数基础模型Zeno-1与机器人Malo,采用去中心化架构实现多机协作,据称单策略可连续运行超10分钟、完成8个子任务。芝诺机器人于2025年11月展业,预计2027年上半年启动规模化进程。
Reward AI 推出首个机器人基础模型 OM-1,可零样本泛化到桌面机械臂、工业机械臂和人形机器人等任意机器人本体。该模型直接从人类操作数据中学习,无需遥操作或机器人数据,据称在灵巧度与效率上接近人类水平,并支持多机器人协作。
SemiAnalysis 分析机器人与 LLM 的硬件逻辑差异:LLM 是模型先行、硬件适配,机器人则因实时控制环路和整机成本约束,硬件固定、模型去适配 Jetson 或 H100 等可量产硬件。
GPT-6 Astra 是否会降维打击具身行业,成为这场圆桌讨论的核心问题之一。苏度科技韩铮、蚂蚁灵波沈宇军、自变量王潜、破壳机器人许华哲四位一线从业者,围绕数据来源(仿真与真机、Real-to-Sim)、模型路线、商业化落地指标(高成功率、客户持续付钱)以及被高估与低估的领域展开分歧讨论。
OpenAI 的 cdngdev 预测机器人将重演 3D 打印热潮:人们会购买便宜的塑料机械臂夹在桌上、接入 AI 智能体。他现场使用的是 Hugging Face 的 SO-100 机械臂,开源、可完整 3D 打印,售价约 200 美元,而传统机器人设备要数千美元。他表示现在已可直接打开 Codex 操控机器人。
真格基金 Z News 回顾 8 月被投企业动态:月之暗面开源 2.8T 参数的 K3 成为仅次于 Fable 5 和 GPT5.6 的模型,也是目前参数最大的开源模型;赛博昆仑联合智谱 GLM 5.3 发现并报告三枚影响微软企业邮件与办公系统的重大漏洞。无问芯穹携手国家中试基地、广东联通发布新一代全栈国产 AI PC,潞晨科技单日最高 Token 提供量已接近万亿。
外科医生在一名受试者脑内植入 5 组电极阵列,AI 检测其移动意图并刺激手臂肌肉,指尖传感器把压力信号回传以实现触觉。作者认为最有趣的发现是,即使整套系统关闭,效果仍然持续。
一名瘫痪男子借助经脑活动训练的植入装置重新活动自己的手,并能感受到触碰到的物体。作者将其视为 AI 用于医疗康复的一个应用案例。
Sam Altman 转发并评论了开发者 thijs 的演示——他给 Astra 一台机器人、一支画笔和一台相机,要求它在现实中画出金门大桥,Astra 自行学会控制机器人,并在多次尝试中逐步画出更好的效果。演示以延时视频形式发布。
播客围绕 GPT-6 Astra 展开讨论,并质疑其自称 AGI 的说法;李飞飞的世界模型被指是"三无产品",而数据是否用完被称作伪命题。节目还探讨真正的物理世界模型如何拼出、没有手脚能否算 AGI,以及 Cybercab 为何只做两座、远程操控与真实路测数据为何大多无效。
机器人触觉传感器目前主要有压阻式、压电式、电容式、光学式和磁感应五条路线,业内认为多传感器结合更适合全身不同部位的需求。其中光学式(视触觉)精度最高,一目科技称其传感器可达24万个感知点,超过人类指尖约12000个神经元,但单指单价仍在千元级。触觉可用训练数据基本为0,真机采集面临三大难题,成本并非现阶段首要障碍,验证路径可行性才是关键。
World Labs 发布面向空间智能的世界模型 Atlas,其核心是新视角预测,并称它是首个统一像素生成与像素重建的模型。团队表示这让数字化采集一个空间三维表示所需的数据量减少 50 到 100 倍,过去一个房间需要 100 到 300 张照片,Atlas 只需三张。
微分智飞近日完成A2轮数亿元人民币融资,估值数十亿人民币,由普华资本领投,弘晖基金、长三角数智文化基金跟投,五源资本、深创投等老股东追加。公司主打全自主(Full Autonomy)飞行机器人,靠传感器与端侧芯片在无GPS、无通信的地下矿洞边飞边建图,已在矿山向大型矿企小批量交付,客户半年完成过去两年多的测绘工作,覆盖300多个采矿区、省下1000万元以上。
2026 京东全球科技探索者大会(JDD)将于 9 月 9 日在北京·北人亦创国际会展中心召开,届时京东集团将重磅发布物理 AI 全景战略。大会汇聚行业大咖与技术专家,共话技术前沿与产业实践,探索 AI 跃迁物理世界的新篇章,目前观众可扫码报名参会。
晚点聊播客邀请《晚点 LatePost》记者李梓楠、徐煜萌,围绕其《具身智能的金钱游戏》一文讨论具身智能创业现状:行业研发投入远少于全行业融资,技术仍处早期;在估值与外界期待偏高时,一批公司提前撑大收入,涉及地方政府、机器人供应链企业与创业公司多方利益;A 股和港股机器人行情下半年转折,排队上市公司的融资与 IPO 竞争走向待观察。
李飞飞回应 Jim Fan 关于 World Labs 的讨论时表示,带空间上下文的相机条件世界模型(camera conditioned world model)有大量横向用途,包括用于机器人领域的 real2sim。
Jim Fan 公开称赞 World Labs 的工作,称其是机器人领域迈向 real2sim 的重要一步。该帖获得 239 个点赞、4 次转发和 29723 次浏览,未披露具体模型或技术细节。
Reachy 与 Qdrant Edge 合作探索如何让机器人把记忆直接运行在自身硬件上,采用嵌入式和进程内方式,完全不依赖云端。该场次聚焦记忆与识别能力,全程保持离线运行。
穹彻智能首次对外发布自研预训练模型 Noe-0,基于世界模型架构,采用预训练与后训练均不引入遥操作数据的全链路无本体方案。公司称已积累超过 10 万小时数据资产,自建 RoboPocket 采集设备与云端数据治理体系,覆盖全国超过 50 座城市、上千名采集员。Noe-0 当前能力集中在中短程任务,更长程连续操作和 in-context learning 仍在迭代。
Anthropic 表示,开源 MHS 之前还有更多需要学习的地方,原因是 LLM 从文本和图像中学习物理世界,仍缺乏物理直觉。该研究预览版将用于构建更多安全评估,并加强对 AI 在物理世界中应用的防护。
播客「商业漫谈」邀请仙工智能联合创始人叶杨笙复盘今年世界人形机器人大会(WRC),认为行业已从展示后空翻、跳舞的概念 Demo 转向算 ROI、看真实出货、拼落地能力的实战阶段。
Yann LeCun 表示,如果重返校园,他会先弄清 LLM 为何能写论文却不会打扫卧室,再据此选专业方向。他称将寻找超越 LLM 的方法与架构,让机器能像人类和动物一样快速学会执行物理任务,并强调这件事与年龄无关。
22 岁的 RoboParty 萝博派对创始人兼 CEO 黄一在一年内完成 5 轮融资、累计超 1 亿美元,股东包括小米、宁德等产业方。他称这段经历是"压缩的人生",把十年要吃的苦一年吃完,并认为对行业认知尚不清晰时的"愚昧之巅"反而最适合创业。
Jim Fan 转发 Dantong Niu 等人的 T-Rex:Tactile-Reactive Dexterous Manipulation,针对多数 Vision-Language-Action(VLA)模型忽略触觉反馈或无法响应高频接触信号的问题,给出数据与架构两方面的方案。
宇树科技 2026 年 8 月 19 日登陆科创板,首日盘中最高市值超 4400 亿元,较发行价上涨六倍多,收盘仍有 3400 多亿元,同期机器人板块指数却下跌近 8%。二级市场投资人周玖洲从投资与商业逻辑拆解宇树上市,讨论其千亿市值是否成为机器人赛道的「估值锚」、人形形态是否通向商业化,以及科研教育、商演、导览等场景的真实需求能否支撑复购和商业闭环。
Jim Fan 认为 GEN-1.5 的走红名副其实,其秘密在于人类采集数据中天然存在的重复性动作:对称模式(如拧完一颗螺栓再拧对称那颗,第二遍就是免费的训练信号)与恢复动作(把失败的前半段保留下来,而非剪掉,让模型完整经历失误、补救、继续)。
宇树科技正式敲钟上市,早期投资人、初心资本管理合伙人田江川在播客中复盘:2017年宇树估值3000万人民币时他曾在Costa咖啡馆错过王兴兴,而早年融资捉襟见肘反成宇树最大的「幸运」。他认为宇树不是一家机器人企业,而是全球性生态平台,草根背景与不做视觉算法的选择最终构筑了断代级壁垒。
李飞飞在 Huberman Lab 播客中与斯坦福神经科学教授 Andrew Huberman 对话,将智能追溯至5.4亿年前视觉的进化起源,并指出大数据、GPU 算力与神经网络算法三者于 2012 年汇合,成就了 ImageNet 引发的现代 AI 飞跃。
宇树(Unitree)上海 IPO 获得 8000 倍超额认购,创 STAR 市场纪录。此次募资 61 亿元人民币(约 9.05 亿美元),将于周三上市,已累计出货约 18,000 台人形机器人,投资方包括腾讯、阿里巴巴和 DeepSeek。
庆应大学与 MIT Media Lab 的研究者造出一台氦气填充的漂浮机器人,没有脸、没有旋翼和夹伤点,靠轻柔拍动的鳍片在房间中漂移并用动作与人交流。演示中它充当闹钟、学习伙伴、起身活动提醒,甚至舞伴。团队避开类人脸孔带来的恐怖谷效应,押注这种像宠物般可触摸的软体硬件能被人接受进入个人空间。
英伟达研究副总裁刘洺堉透露,其领导的唯一项目世界基座模型 Cosmos 已发布至第 3 代,直属团队不到 100 人,虚线汇报规模 200 至 300 人,黄仁勋要求他"做到 Cosmos 97"。他表示英伟达不做存量竞争,目标是像 CUDA 一样造出 Physical AI 这一新市场,因此坚持开源模型帮助具身智能领域分担压力。
英伟达研究副总裁刘洺堉在4小时访谈中谈及他领导的世界基座模型Cosmos项目,该项目2024年立项,已迭代至Cosmos 3,直属团队不到100人,虚线汇报规模200至300人。身为英伟达首位由研究员晋升的副总裁,他强调英伟达不参与存量竞争,主张"造市场"而非击败对手,黄仁勋曾对他说"你就做到Cosmos 97"。
一位曾为导弹设计制导与导航系统的工程师造出了一款自主猎蚊无人机,每架重 40 克,通过发射超声波脉冲并用微型麦克风阵列接收,读取昆虫翅膀的多普勒特征来区分蚊子和蜜蜂,再用螺旋桨在空中拦截目标。该项目由 YC 投资,团队认为 10 架无人机可清理 1 平方公里,将蚊虫控制成本降低 100 倍。目前唯一的公开演示是在封闭房间内杀死一只蛾子,能否在野外对蚊子奏效仍是待验证的关键。
GOAI 全球开源 AI 挑战赛现已启动,面向全球 AI 开发者、研究人员、创业团队和开源贡献者,设 Agent 基础设施、无界智能体、AI for research、具身未来 4 条赛道,全球奖池约 73 万美元。赛事本周在圣何塞举办社区活动,8 月 8 日下午 1:30-4:00(PT)在 Q Bay Center 进行赛道说明、炉边对话与组队交流,海报扫码即可报名。
前华为天才少年黄青虬创办的墨奇智能成立于 2025 年底,半年内完成超 10 亿元天使轮融资,他现任联合创始人兼 CTO。黄青虬认为具身是马拉松而非百米冲刺,技术范式尚未收敛,起点差几个身位区别不大。他判断 VLA 和世界模型都不够本质,今年能产出 5000 台靠谱机器人的公司不会超过三家,且具身数据质量远比数量重要。
Google 发布 Gemini Robotics ER 2,称其为面向物理 AI 能力最强的具身推理模型,定位为机器人的高层大脑,可直接连接 Gemini Live API。该模型处理连续视频流以跟踪进度、调用工具、搜索网页并实时指挥动作模型,面向开发者新增进度跟踪增强、执行中途故障实时检测、多机器人协作和安全指令遵循等升级。
Google DeepMind 推出 Gemini Robotics 2,作为驱动新一代机器人的智能层,支持全身智能控制、高级灵巧操作和多机器人协作。新发布的具身推理模型 Gemini Robotics ER 2 充当机器人的高层大脑,负责观察环境、推理完成任务所需动作并与视觉-语言-动作模型协同执行,同时跟踪进度,使机器人能够完成复杂多步工作流、在步骤失败时自我纠正并适应全新场景。
Google DeepMind 发布 Gemini Robotics 2 系列,读者可了解机器人全身控制与具身推理的新分工。