英伟达 Physis-Lang:让自然语言成为世界模型的物理表征,增强视频物理真实性
英伟达联合 MIT 和牛津大学提出 Physis-Lang,把物理原因、规律和结果写进语言描述,并贯穿数据筛选、训练与视频生成。其 Cosmos3-Super 和 Cosmos3-Nano 版本在 Physics-IQ Verified 榜单上分别以 48.2 和 43.3 分按平均分位列第一、第二,Super 较此前最高分提升 5.5 个百分点。
英伟达联合 MIT 和牛津大学提出 Physis-Lang,把物理原因、规律和结果写进语言描述,并贯穿数据筛选、训练与视频生成。其 Cosmos3-Super 和 Cosmos3-Nano 版本在 Physics-IQ Verified 榜单上分别以 48.2 和 43.3 分按平均分位列第一、第二,Super 较此前最高分提升 5.5 个百分点。
MirroS 团队发布 AgentGarten,将可执行代码环境与实时神经渲染器连接,物理规则由代码裁决、光影由模型生成,以超过 30 fps 的吞吐让智能体持续与虚拟世界交互。
NVIDIA 一篇被 NeurIPS 2026 接收的论文发现,给多模态模型接入工具后,其拒绝有害请求的失败率相对上升最高达 68.7%,平均上升 17.7%。
美团 LongCat 团队构建 MineExplorer,首个在开放世界中做到分钟级长程任务的评测基准,包含 813 个人工验证实例(1-hop 到 4-hop),每个任务实例运行 1800 个环境步、对应 3 分钟连续交互。
美团技术团队在 KDD 2026 分享 8 篇收录论文,覆盖推荐大模型 MTFM、奖励建模框架 CDRRM、智能体搜索基准 LocalSearchBench、ETA 元泛化框架 UME 及生成式推荐训练系统 MTGenRec 等方向。大众点评技术部还在 2026 KDD Cup 复杂数据分析 Data Agents 赛道夺得冠军与季军,相关代码已在 GitHub 开源。
论文提出 PAMI(Part Anchored Motion),用于文本到人-物交互(Human-Object Interaction)生成,论文页面已发布在 Hugging Face Papers(编号 2609.38…)。
Qdrant 与 Pento 合作推出 miniCOIL EN-ES,一个英西双语稀疏神经检索器,让 "home" 与 "casa"、"bat" 与 "murciélago" 映射到稀疏向量的同一单元格,单个倒排索引即可同时服务英语和西班牙语查询与文档,无需翻译步骤。
论文 OmniReasoning 提出突破音视频联合推理极限的方法,论文页面已发布在 Hugging Face。该推文获得 65 个点赞、11 条回复和 8 次转发。
Google 与 Northwestern、Jacaranda Health 合作,在肯尼亚内罗毕和芝加哥各纳入 1000 名孕妇,用机器学习模型分析未经超声培训的卫生员按预设路径完成的"盲扫"超声视频,估测妊娠龄和胎位,准确度与受训超声医师相当。卫生员仅需 8 小时即可学会操作,且全部处理在设备端完成,无需供电或 Wi-Fi,可在资源匮乏地区提供产前关键信息。
论文《Octrees as an Explicit 3D Language》提出将八叉树作为显式的 3D 语言表示,论文页面已在 Hugging Face Papers 上线(huggingface.co/papers/2610.02…)。该工作由 AK 在 X 上分享,附带的演示视频因浏览器不支持 video 标签未能直接播放。
EditHero 是一个面向长程部件级 3D 编辑与 Vibe Modeling 的基准,论文已在 Hugging Face Papers 发布(编号 2610.02)。该基准聚焦长时程、部件粒度的 3D 编辑任务,具体指标与数据未在原文披露。
VA-Bench 以观察、推理、行动、修正的闭环测试 12 个多模态模型,覆盖 14 类机器人操作任务共 280 个基础场景。表现最好的模型在目标识别与定位上达到 100%、操作语义理解达到 99.6%—100%,但 Qwen3.8-max、Opus-5 和 GPT-5.6-sol 的完整任务成功率分别只有 53.93%、52.86% 和 51.55%。
论文提出 Adaptive Reward Routing,面向音视频联合扩散模型做动态多奖励优化,方法基于前向过程 RL(Forward-Process RL)。论文已发布在 Hugging Face Papers(编号 2609.37)。
论文 EgoTools 提出面向真实第一人称视频的工具中心推理,论文已在 HuggingFace 上线(编号 2609.39…)。目前仅有论文链接与演示视频,未披露模型规模、benchmark 分数或开源情况。
MBZUAI、Caltech 等机构发布综述《World-Action Models for Robot Learning and Control: A Survey》,系统梳理世界—动作模型(WAMs)的概念、架构、训练与评测,核心是把未来世界预测与可执行动作生成连接起来。论文按语言接口、视觉编码器、预测骨干与动作解码器拆解 WAM,并区分联合预测与逆动力学两条路径,覆盖操作、导航与自动驾驶。
LEGO-Anything 提出用编码智能体(Coding Agents)做 3D 场景重建,论文已发布在 Hugging Face Papers(编号 2609.36)。该工作把 3D 场景重建任务交给编码智能体完成,具体方法与实验结果见论文原文。
NVIDIA 研究人员发布开源自进化框架 Physis-Lang,通过为视频描述加入物理解释来提升世界模型的物理推理能力。仅将物理推理加入提示词、不做重训练,NVIDIA Cosmos 3 的 PhyGenBench 分数即提升 5.62 分。论文与项目已上线。
Dextac-WAM 项目网站新增真机演示、世界模型预测、触觉可视化、消融实验与详细说明,网址为 dextacwam.github.io。
Berkeley AI 人类智能中心发布 DexTacWAM,一个将预训练视频世界模型通过持续视触觉学习改造而成的视触觉世界-动作模型,用于多指接触预测与动作生成。
微软研究院启动早期研究项目 Quine,一个面向生物学的多模态世界模型,通过跨生物尺度与模态连接洞察,帮助科学家在远超直觉可及的空间中进行计算搜索,并在进入实验室前对假设排序。实验结果会作为反馈,帮助研究者校准后续研究方向。
微软研究院发布 Quine,一个面向生物学复杂性的多模态世界模型加交互式 harness,连接科学工具、文献、湿实验与研究人员。该系统与 Broad Institute 合作用于胰腺导管腺癌研究,预测并优先排序数千种化合物以改变肿瘤细胞状态,从缩小搜索空间到筛出候选仅用一个周末,排名最高的化合物在多种湿实验中获得验证。
Epoch AI 发布家具组装基准 FAB,用 60 张宜家家具组装照片(含故意设置的错误)测试模型能否识别装配错误并获得装配手册与查看工具。
一篇论文提出把视觉语言模型(VLM)的智能迁移到机器人控制中,论文页面已发布在 Hugging Face Papers(编号 2609.22…)。原帖未披露所用模型、参数规模或评测结果。
WorldCrafter 是一个一致性视频世界模型,通过隐式 3D 感知记忆提升生成视频的时空一致性。相关论文已发布在 HuggingFace Papers。
Science 刊发阿里巴巴达摩院通用医疗影像模型 DAMO RADAR 论文,针对腹部增强 CT,同一模型可识别 18 个腹部器官上的 146 种病症,突破一病一模限制。
NVIDIA 研究团队在 ECCV 2026 发布 Axolotl3D,一个多模态、遮挡感知的 3D 生成模型,结合图像、相机数据和部分几何信息重建缺失区域并保留已观测区域,在单视图与多视图设置下均取得 SOTA 结果。
Qdrant 复现 SHIFT 论文方法,通过从嵌入向量中减去按语言估计的偏移,把非枢纽语言文档映射到枢纽语言空间,无需训练即可缓解多语言 RAG 的语言偏置。
Vidu S2 支持实时交互、可编辑与空间视频生成,论文已发布在 HuggingFace Papers(2609.11…)。该工作将交互式编辑与空间视频生成能力整合到同一视频生成框架中。
微软研究院新一期 Research Focus 聚焦四个方向:编码智能体在规模化场景下的行为表现、AI 模型在 PET/CT 扫描中识别淋巴瘤病灶的评估、AI 聊天机器人依赖问题,以及大规模决策系统的推进。
NVIDIA 研究团队与 USC 提出 HorizonRelight,通过将目标域上下文从一个滑动窗口传递到下一个,让各片段衔接更连贯,减少长视频分块重打光时的光照跳变、边界伪影和外观突变。该工作基于扩散模型视频方法,论文与演示已随 ECCV 2026 公布。
Q2D-Web 数据集覆盖编程、法律、健康、科学、金融以及消费品、旅游、娱乐和本地信息等领域,查询涉及十种语言,其中英语占 65.8%。
vivo BlueImage Lab 提出 SmartPhotoCrafter,一个统一理解—生成—优化框架,实现"先分析、再决策、后优化"的自动图像优化流程。
Google DeepMind 的 AlphaGenome Atlas 团队发布了 AlphaGenome Atlas,一个可搜索的 1-petabyte 数据库,映射人类基因组中全部 90 亿个单字母 DNA 变异的分子效应。该数据库提供统一的 AVI 突变评分,并配套网页门户、AlphaGenome API 以及智能体技能(Agent skill)。
Hailuo AI 转述团队工作 H3-World,称其首次把 MiniMax-H3 本身变成世界模型,无需新增动作模块,直接把 H3 预训练的语言理解转换为角色与镜头控制,仅用 8K 样本和 0.199% 可训练参数。团队表示,最值得关注的不只是 H3 也能成为世界模型,而是所需新增的部分极少,并给出论文与项目主页链接。
HuggingFace 随模型发布两个配套数据集:PubMed-Multi-Vector 在同一语料上提供 dense、sparse 和 ColBERT 式多向量表示,共 8.37B 多向量 token;Coyo-Vector-Embeddings 则提供 2,048 维的多模态图文嵌入。
Microsoft Research 推出 MindTopo 基准,用于评测多模态大模型在连通、包围、顺序、分离与打结五类拓扑关系上的推理与规划能力。测试显示,当前模型在静态识别上表现明显优于交互式规划任务,且两者均远低于人类水平,失败多发生在规划阶段而非感知阶段。图像与视频生成仅在前者能维持单帧可见关系时有所帮助,视频推演常改变拓扑或违反任务物理约束。
Microsoft Research 提出 CARE-X,探索将灵活推理、校准预测与基于测量的工具统一用于胸部 X 光解读,让放射学 AI 不再局限于生成报告。
微软研究院推出研究模型 CARE-X,一个统一胸部 X 光 VLM,可兼顾报告生成与结构化诊断预测,并用强化学习(DAPO)在多任务设置下奖励临床正确性。另一项独立实验中,团队将 Qwen3-VL-4B-Instruct 与确定性测量工具配对,检验直接计算能否改善心脏增大等依赖测量的病变判断。
Mistral 的内容审核模型把审核政策当作自然语言问题输入,直接返回校准后的评分,并在同一接口中同时处理文本和图像。完整技术报告已发布在 arXiv(2607.25857)。
B站大语言模型团队将在 ACL 2026 展示 FATE 系列成果 SABER 与 CASTER,并现场开放「B-UP 顶尖技术人才项目」校招与实习岗位投递。SABER 提出可切换、受 Token 预算约束的混合思考训练范式,实验显示 FastThink 模式在 MATH、GSM8K、MBPP 及逻辑推理任务上推理长度减少 65%~80% 同时保持甚至提升准确率。