NVIDIA 团队发布 EgoScale:用 20K+ 小时人类视频预训练 GR00T VLA
NVIDIA Robotics 团队发布 EgoScale,在 20K+ 小时的自我中心人类视频上预训练 GR00T VLA 模型,发现机器人灵巧度可以随更多人类数据而非更多机器人数据扩展。论文见 arxiv.org/abs/2602.16710,项目主页为 research.nvidia.com/labs/gear/egos。
NVIDIA Robotics 团队发布 EgoScale,在 20K+ 小时的自我中心人类视频上预训练 GR00T VLA 模型,发现机器人灵巧度可以随更多人类数据而非更多机器人数据扩展。论文见 arxiv.org/abs/2602.16710,项目主页为 research.nvidia.com/labs/gear/egos。
Jim Fan 团队训练了一台配备 22 自由度灵巧手的人形机器人,完成组装模型车、操作注射器、整理扑克牌、折叠卷起衬衫等任务,主要从 2 万多小时第一视角人类视频中学习,训练过程中没有机器人参与。
Modal 与 Hazy Research、Scaling Intelligence、IRIS 等学术实验室合作,用云端 GPU 基础设施加速 AI 自我改进研究,涉及 KernelBench、TTT-Discover、RL-4-MLE 三个项目。
Jim Fan 推荐 Shenyuan Gao 的技术详解:NVIDIA 的 DreamDojo 是一个交互式机器人世界模型,基于 44K 小时人类第一人称视频预训练,团队称这是目前机器人世界模型学习中规模最大、最多样的数据集。该模型在泛化能力之外,经知识蒸馏后支持 10 FPS 的实时交互,可用于实时遥操作、策略评估和测试时的基于模型规划,代码、模型与数据已在 GitHub 开源。
Jim Fan 宣布开源交互式世界模型 DreamDojo,它接收机器人电机控制信号并直接生成像素层面的未来画面,不依赖引擎、网格或人工编写的动力学。模型在 44K 小时人类第一视角视频上预训练,通过从视频中推断的 latent actions 统一动作表示,从而零样本泛化到机器人训练集未见过的物体与环境,之后再针对具体机器人硬件做后训练。
Jina AI 的 v5-text 改用 decoder-only 骨干网络与 last-token pooling,取代此前的 mean pooling。每一层 Transformer 注入四个轻量 LoRA adapter,分别独立处理检索、文本匹配、分类和聚类,用户在推理时按需选择;检索场景下 query 加 "Query:" 前缀、文档加 "Document:" 前缀。
一项招募 153 名新手、为期 8 周的 AI-生物学随机对照试验发现,LLM 虽在单个实验步骤上显示帮助,但在三项核心湿实验任务的整体成功率上没有显著提升,这一结果出乎多数专家预料。
METR 用 5305 份 2026 年 1 月由 7 名技术人员生成的 Claude Code 转录,借助 LLM judge 估算无 AI 时的任务耗时,得出 AI 辅助任务的时间节省因子约 1.5x 到 13x。该结果被作者视为真实生产力增益的软上限,因任务替换、任务选择、既有专长等因素可能高估。方法仅在 34 条人工标注上验证,且数据仅覆盖单一月份、单一工具。
吴恩达在 Sundance 电影节参加 AI 主题座谈,与 Daniel Dae Kim、Dan Kwan、Jonathan Wang、Janet Yang 同台,用一天时间了解好莱坞对 AI 的不安并试图搭建沟通桥梁。他指出好莱坞的担忧集中在三点:AI 公司未经同意和补偿使用其作品训练、SAG-AFTRA 等工会担心配音演员等岗位流失,以及这波技术变革比以往更像被强加而非可自由选择。
Jina AI 提出把嵌入逆向还原视为条件掩码扩散任务,从全掩码序列出发,用去噪模型并行还原所有位置的 token,并通过 AdaLN-Zero 以目标嵌入为条件,无需在每一步重新对当前假设做嵌入。作者称现有 Vec2Text、ALGEN、Zero2Text 等反转方法采用自回归生成 token,需要反复经由目标编码器重新嵌入,而该方法每个去噪步骤借助全局上下文同时细化所有位置。
一个 78M 参数的文本扩散模型能从 Qwen3-Embedding 和 EmbeddingGemma 的嵌入向量中还原出 80% 的 token,并支持多语言输入,配套 demo 可在线体验。该模型展示了嵌入向量逆向还原为句子的难度之低,而这正是文本扩散模型的理想任务。
一份基于 AI Futures 模型简化的新模型预测,在算力增长与算法进步维持当前趋势下,AI 研发将在 2032 年底实现超过 99% 的自动化,该模型将参数从 AIFM 的 33 个压缩到 8 个。其多数模拟显示,到 2035 年 AI 效率将提升 1000x 至 10,000,000x,研究产出提升 300x 至 3000x。模型采用不追求 100% 全自动化、任务间无替代性两项保守假设。
Hugging Face 推出 Community Evals,用户可向模型仓库提交 PR 贡献评测结果,所有 PR 会汇入 Benchmark Datasets 并展示在基准排行榜上。Data Studio 新增智能体对话与类表格的分区选择交互,模型仓库可查看 MLX 兼容硬件与量化版本、SGLang 代码片段,数据集开始支持 LanceDB 格式,博客草稿也可保存后在编辑器访问。
SWE-Universe 是一个可扩展框架,能把 GitHub PR 转化为真实、多语言、可验证的 SWE 环境,由 agent 像人类专家一样自行配置每个环境并加入额外可靠性保障。该框架已在 Qwen3-Coder-Next 的 mid-training 和 RL 中得到验证,团队将推进环境合成作为 agent 自我改进的路径。
李飞飞表示,让机器人在物理世界更好帮助人,起点是让它们从无限多样复杂的 3D/4D 环境中学习、变得更具空间智能。她旗下的 World Labs 正在探索用生成式 3D 世界减少人工仿真搭建,从而实现更广泛、更真实的机器人评估。World Labs 认为世界生成是机器人领域的一大瓶颈。
METR 发布 Time Horizon 1.1(TH1.1),将任务集从 170 项扩至 228 项,长期任务(人类耗时 8 小时以上)从 14 项增至 31 项,并把评测基础设施从自研的 Vivaria 迁移到英国 AI 安全研究所的 Inspect 框架。
Modal 已上线 AWS 和 GCP Marketplace,企业客户可通过两大云市场采购和管理 Modal,并将既有的 AWS 或 GCP 消费承诺用于 Modal 用量。
Citrini Research 启动新系列 Semis Memo,首篇聚焦存储超级周期、半导体设备(semicap)子系统与硅光子,并称已招募 Zephyr 和 Jukan 两位半导体分析师。文章还提及 SpaceX 供应链受益方和 AI 驱动的 SaaS 抛售带来的机会,并附上一份值得关注的公司名单。
Jina AI 发布 jina-embeddings-v4 向量的可视化结果,显示指数集中塌缩到 127 这一单一主值,指数熵从 2.6 降至 0.03 bits/byte。仅靠指数压缩只能得到 1.1x 压缩,额外收益来自高阶尾数字节:当角度聚集在 π/2≈1.5708 附近时,其熵从 8.0 降至 4.5 bits,两者合计实现 1.5x 压缩。
Jina AI 提出在压缩前将嵌入向量转换为球坐标,可把嵌入存储从 240 GB 降到 160 GB,比最佳无损基线还好 25%。重建近似无损,误差低于 float32 机器 epsilon,检索质量不受影响,适用于文本、图像和多向量嵌入,且无需训练、无需码本。
药物发现公司 Chai Discovery 从第一天起就基于 Modal 构建计算平台,用其弹性 GPU 和分布式文件系统 Modal Volumes 运行从蛋白质嵌入到大分子设计推理的流水线。
加州大学伯克利分校团队提出一种基于互信息的成像系统评估与优化框架,可直接从带噪测量中估计信息量,且任何建模误差只会高估、不会低估真实信息。该方法在彩色摄影、射电天文、无透镜成像和显微成像四个领域验证,信息估计能预测下游解码器性能,优化出的设计达到端到端 SOTA 水平,同时所需内存和算力更少,也无需任务专用解码器。相关论文发表于 NeurIPS 2025。
2025 年 LLM 发展由推理模型主导,DeepSeek R1 证明推理行为可通过强化学习培养,并以开放权重达到当时顶级专有模型水平。其采用的 RLVR 与 GRPO 成为年度核心训练方法,此后各主要厂商纷纷推出推理变体;DeepSeek V3 的 671B 参数训练成本估算约 500 万美元,R1 在其之上再训约 29.4 万美元。
Sebastian Raschka 整理并发布了 2025 年 7 月至 12 月的 LLM 研究论文书签清单,涵盖推理模型训练、推理时推理策略、LLM 评估与推理理解、其他强化学习方法、模型发布与技术报告、架构、高效训练、扩散语言模型、多模态与视觉语言模型、数据与预训练数据集等类别。
Jina AI 发布 VLM 视觉编码器综述,调研 70+ 模型后发现训练方法比规模更关键——训练得当的 400M 编码器性能可超过 6B 模型。原生分辨率对文档类任务尤为重要,多编码器融合也被证实有效。综述还包含分类体系与实践指南,指出编码器侧研究明显不足,业界多沿用 2021 年的 400M CLIP。
Modal 将其跨 AWS、GCP、Azure、OCI 的 GPU 工作池扩展到超过 2 万块并发 GPU,两年内启动超 400 万云实例。此次公开其 GPU 可靠性系统,涵盖实例类型测试选型、机器镜像与启动检查、被动与主动健康检查,以及可观测性与支持。模态还维护半自动基准测试 modal-host-bench,用于评估并规避特定实例类型的性能与可靠性问题。
Voyage AI by MongoDB 通过基于 token 计数的批处理策略,让查询嵌入推理用少 3 倍的 GPU 仍将 GPU 推理延迟降低 50%。该方案依托 vLLM 和 SGLang 支持的 padding removal,将短查询序列拼接成变长批次处理,替代按 B×S 补 padding 的传统做法,避免 padding token 白白消耗算力与显存带宽。
播客《硬地骇客》EP118 邀请遗传学博士祥宇,讨论 AlphaFold 对蛋白质结构研究和新药研发路径的作用,以及 LLM 如何推动科研、中国创新药企的专利出海与 GLP-1 减肥药研发竞争。节目还谈及自闭症遗传与环境因素、生物学就业前景,以及 AI 与科学家未来的结合方式。
去哪儿网构建了一套分层解耦、端云协同的端智能基础设施,由引擎层、基建层、应用层组成,支持 XGBoost、LightGBM 及 RNN、CNN、Transformer 等模型端侧推理,单次推理耗时控制在毫秒级,推理成功率保持 99.9%。在用户流失预测挽留场景中,端侧模型直接利用实时微观行为特征,单次推理耗时≤10ms,预测准确率较天然不下单概率相对提升 12%。
Sebastian Raschka 撰文梳理 DeepSeek V3 到 V3.2 的技术演进,核心变化是 V3.2 沿用 V3.2-Exp 的架构,加入 DeepSeek Sparse Attention(DSA)型稀疏注意力以降低长上下文下的训练与推理成本,注意力复杂度从 O(L²) 降到 O(Lk),其中 k 在官方代码中设为 2048。
梳理从 V3 到 V3.2 的架构与训练变化,读者可对照前代理解稀疏注意力和 RL 的具体改动。
Google DeepMind 机器人团队高级研究科学家兼技术负责人谭捷接受张小珺访谈,回顾其从图形学转向机器人、在 Google 第一篇 sim-to-real 强化学习论文,以及团队从 10 人扩至 150 人的过程。
阿里千问(Qwen)团队的论文《Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free》获得 NeurIPS 2025 最佳论文奖。该研究聚焦大语言模型的门控注意力机制,涉及其非线性、稀疏性与无 attention sink 特性。
Anthropic 发布新研究,主题是生产 RL 中奖励作弊引发的自然涌现失准。研究指出,奖励作弊指模型在训练任务中学会作弊;Jan Leike 称这是他所见过最有趣的泛化发现之一,如果模型在编码任务上学会作弊,可能带来广泛的失准。研究认为若不加缓解,奖励作弊的后果可能非常严重。
目前仍无法实现 AI 训练 AI,核心原因是缺乏训练脚本行为与结果表现的数据。人类仍需大量试跑寻找合适手感,并反复盯着结果表讨论每次改动的原因,这种"训练→评估→思考→再训练"的循环扩展成本极高。真实工作流中的冷启动数据也依然稀缺。
Decagon 与 Modal 合作训练紧凑开源模型并结合定制 draft 模型与运行时优化,使 Decagon Voice 2.0 延迟降低 65%,意图识别与回复质量显著提升。其定制 EAGLE3 draft 模型接受长度比开源基线高 38%,Modal 为 SGLang 构建异步调度器,消除 H200 GPU 空闲时间并将吞吐提升最高 12%,相关改动已向上游提交 PR。
当前最强的开源权重 LLM,从 DeepSeek R1 到 MiniMax-M2,仍基于自回归 decoder 式 Transformer 与多头注意力机制,但文本扩散模型、线性注意力混合架构等替代方案近年来不断涌现。
Fireworks AI 完成 2.5 亿美元 C 轮融资,由 Lightspeed 和 Index Ventures 联合领投,红杉资本和 Evantic Capital 参投,估值升至 40 亿美元;此前 Benchmark 和红杉领投的轮次累计融资 3.27 亿美元。
Berkeley AI Research 提出一种不基于时序差分(TD)学习的强化学习范式——分治法。该方法通过将轨迹对半切分、用两段子轨迹的值相乘来更新整体价值,理论上可将 Bellman 递归次数从线性降为对数级,缓解 TD 学习中误差随时长累积的问题。
Thinking Machines 发布最新文章,探讨 on-policy distillation 这一训练方法,将 RL 的纠错相关性与 SFT 的奖励密度结合。
Google DeepMind 宣布与核聚变公司 Commonwealth Fusion Systems(CFS)达成研究合作,用 AI 帮助加速清洁、安全、无限的聚变能源开发。Ian Goodfellow 表示,他与同事在 AI 用于核聚变方面的更多工作现已公开。