跳到正文

#数据/训练

今日 40 条
2月26日周四
  1. Jim Fan(@DrJimFan)AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NVIDIA 团队发布 EgoScale:用 20K+ 小时人类视频预训练 GR00T VLA

    NVIDIA Robotics 团队发布 EgoScale,在 20K+ 小时的自我中心人类视频上预训练 GR00T VLA 模型,发现机器人灵巧度可以随更多人类数据而非更多机器人数据扩展。论文见 arxiv.org/abs/2602.16710,项目主页为 research.nvidia.com/labs/gear/egos。

  2. Jim Fan(@DrJimFan)AI 评估 · 69/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jim Fan 团队用 2 万小时人类视频训练人形机器人灵巧操作

    Jim Fan 团队训练了一台配备 22 自由度灵巧手的人形机器人,完成组装模型车、操作注射器、整理扑克牌、折叠卷起衬衫等任务,主要从 2 万多小时第一视角人类视频中学习,训练过程中没有机器人参与。

2月25日周三
  1. Modal BlogAI 评估 · 29/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Modal 如何加速那些加速 AI 研究的 AI 研究

    Modal 与 Hazy Research、Scaling Intelligence、IRIS 等学术实验室合作,用云端 GPU 基础设施加速 AI 自我改进研究,涉及 KernelBench、TTT-Discover、RL-4-MLE 三个项目。

2月21日周六
  1. Jim Fan(@DrJimFan)AI 评估 · 59/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NVIDIA DreamDojo 机器人世界模型:44K 小时视频预训练,蒸馏后达 10 FPS

    Jim Fan 推荐 Shenyuan Gao 的技术详解:NVIDIA 的 DreamDojo 是一个交互式机器人世界模型,基于 44K 小时人类第一人称视频预训练,团队称这是目前机器人世界模型学习中规模最大、最多样的数据集。该模型在泛化能力之外,经知识蒸馏后支持 10 FPS 的实时交互,可用于实时遥操作、策略评估和测试时的基于模型规划,代码、模型与数据已在 GitHub 开源。

  2. Jim Fan(@DrJimFan)AI 评估 · 70/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jim Fan 宣布开源交互式世界模型 DreamDojo

    Jim Fan 宣布开源交互式世界模型 DreamDojo,它接收机器人电机控制信号并直接生成像素层面的未来画面,不依赖引擎、网格或人工编写的动力学。模型在 44K 小时人类第一视角视频上预训练,通过从视频中推断的 latent actions 统一动作表示,从而零样本泛化到机器人训练集未见过的物体与环境,之后再针对具体机器人硬件做后训练。

2月19日周四
  1. Jina AI(@JinaAI_)AI 评估 · 46/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jina AI v5-text 发布:改用最后一 token 池化,上下文扩至 32K

    Jina AI 的 v5-text 改用 decoder-only 骨干网络与 last-token pooling,取代此前的 mean pooling。每一层 Transformer 注入四个轻量 LoRA adapter,分别独立处理检索、文本匹配、分类和聚类,用户在推理时按需选择;检索场景下 query 加 "Query:" 前缀、文档加 "Document:" 前缀。

  2. METRAI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    METR 复盘 AI-生物学 RCT:五项证据型 AI 政策教训

    一项招募 153 名新手、为期 8 周的 AI-生物学随机对照试验发现,LLM 虽在单个实验步骤上显示帮助,但在三项核心湿实验任务的整体成功率上没有显著提升,这一结果出乎多数专家预料。

2月17日周二
  1. METRAI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    METR 用 Claude Code 转录分析 AI 智能体的生产力增益上限

    METR 用 5305 份 2026 年 1 月由 7 名技术人员生成的 Claude Code 转录,借助 LLM judge 估算无 AI 时的任务耗时,得出 AI 辅助任务的时间节省因子约 1.5x 到 13x。该结果被作者视为真实生产力增益的软上限,因任务替换、任务选择、既有专长等因素可能高估。方法仅在 34 条人工标注上验证,且数据仅覆盖单一月份、单一工具。

2月14日周六
  1. Andrew Ng(@AndrewYNg)AI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    吴恩达谈在 Sundance 电影节与好莱坞交流 AI 焦虑

    吴恩达在 Sundance 电影节参加 AI 主题座谈,与 Daniel Dae Kim、Dan Kwan、Jonathan Wang、Janet Yang 同台,用一天时间了解好莱坞对 AI 的不安并试图搭建沟通桥梁。他指出好莱坞的担忧集中在三点:AI 公司未经同意和补偿使用其作品训练、SAG-AFTRA 等工会担心配音演员等岗位流失,以及这波技术变革比以往更像被强加而非可自由选择。

2月12日周四
  1. Jina AI(@JinaAI_)AI 评估 · 59/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jina AI 用条件掩码扩散实现文本嵌入逆向还原

    Jina AI 提出把嵌入逆向还原视为条件掩码扩散任务,从全掩码序列出发,用去噪模型并行还原所有位置的 token,并通过 AdaLN-Zero 以目标嵌入为条件,无需在每一步重新对当前假设做嵌入。作者称现有 Vec2Text、ALGEN、Zero2Text 等反转方法采用自回归生成 token,需要反复经由目标编码器重新嵌入,而该方法每个去噪步骤借助全局上下文同时细化所有位置。

  2. Jina AI(@JinaAI_)AI 评估 · 35/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    78M 参数文本扩散模型可将 Qwen3-Embedding 与 EmbeddingGemma 向量还原为文本

    一个 78M 参数的文本扩散模型能从 Qwen3-Embedding 和 EmbeddingGemma 的嵌入向量中还原出 80% 的 token,并支持多语言输入,配套 demo 可在线体验。该模型展示了嵌入向量逆向还原为句子的难度之低,而这正是文本扩散模型的理想任务。

2月10日周二
  1. METRAI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    一个更简单的 AI 时间线模型预测:AI 研发将在约 2032 年实现 99% 自动化

    一份基于 AI Futures 模型简化的新模型预测,在算力增长与算法进步维持当前趋势下,AI 研发将在 2032 年底实现超过 99% 的自动化,该模型将参数从 AIFM 的 33 个压缩到 8 个。其多数模拟显示,到 2035 年 AI 效率将提升 1000x 至 10,000,000x,研究产出提升 300x 至 3000x。模型采用不追求 100% 全自动化、任务间无替代性两项保守假设。

2月6日周五
  1. Hugging Face(@huggingface)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Hugging Face 上线 Community Evals 与 Benchmark Datasets 等多项功能更新

    Hugging Face 推出 Community Evals,用户可向模型仓库提交 PR 贡献评测结果,所有 PR 会汇入 Benchmark Datasets 并展示在基准排行榜上。Data Studio 新增智能体对话与类表格的分区选择交互,模型仓库可查看 MLX 兼容硬件与量化版本、SGLang 代码片段,数据集开始支持 LanceDB 格式,博客草稿也可保存后在编辑器访问。

2月4日周三
  1. Binyuan Hui(@huybery)AI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    SWE-Universe:让 coding agent 自己构建训练环境,GitHub PR 变身可验证 SWE 环境

    SWE-Universe 是一个可扩展框架,能把 GitHub PR 转化为真实、多语言、可验证的 SWE 环境,由 agent 像人类专家一样自行配置每个环境并加入额外可靠性保障。该框架已在 Qwen3-Coder-Next 的 mid-training 和 RL 中得到验证,团队将推进环境合成作为 agent 自我改进的路径。

1月30日周五
  1. Fei-Fei Li(@drfeifei)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    李飞飞:机器人空间智能要从 3D/4D 世界学习,World Labs 探索用生成式 3D 世界破解机器人训练瓶颈

    李飞飞表示,让机器人在物理世界更好帮助人,起点是让它们从无限多样复杂的 3D/4D 环境中学习、变得更具空间智能。她旗下的 World Labs 正在探索用生成式 3D 世界减少人工仿真搭建,从而实现更广泛、更真实的机器人评估。World Labs 认为世界生成是机器人领域的一大瓶颈。

1月29日周四
  1. METRAI 评估 · 51/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    METR 发布 Time Horizon 1.1,任务集扩至 228 项

    METR 发布 Time Horizon 1.1(TH1.1),将任务集从 170 项扩至 228 项,长期任务(人类耗时 8 小时以上)从 14 项增至 31 项,并把评测基础设施从自研的 Vivaria 迁移到英国 AI 安全研究所的 Inspect 框架。

1月28日周三
  1. Modal BlogAI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Modal 上线 AWS 与 GCP Marketplace,并更新 Sandbox 可观测性

    Modal 已上线 AWS 和 GCP Marketplace,企业客户可通过两大云市场采购和管理 Modal,并将既有的 AWS 或 GCP 消费承诺用于 Modal 用量。

1月26日周一
  1. Citrini ResearchAI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Citrini Research 推出 Semis Memo 系列:关注存储超级周期、半导体设备子系统与硅光子

    Citrini Research 启动新系列 Semis Memo,首篇聚焦存储超级周期、半导体设备(semicap)子系统与硅光子,并称已招募 Zephyr 和 Jukan 两位半导体分析师。文章还提及 SpaceX 供应链受益方和 AI 驱动的 SaaS 抛售带来的机会,并附上一份值得关注的公司名单。

1月24日周六
  1. Jina AI(@JinaAI_)AI 评估 · 17/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jina AI 可视化 jina-embeddings-v4 向量:指数与尾数集中带来 1.5x 压缩

    Jina AI 发布 jina-embeddings-v4 向量的可视化结果,显示指数集中塌缩到 127 这一单一主值,指数熵从 2.6 降至 0.03 bits/byte。仅靠指数压缩只能得到 1.1x 压缩,额外收益来自高阶尾数字节:当角度聚集在 π/2≈1.5708 附近时,其熵从 8.0 降至 4.5 bits,两者合计实现 1.5x 压缩。

  2. Jina AI(@JinaAI_)AI 评估 · 39/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jina AI:嵌入向量压缩前先转球坐标,存储从 240 GB 降至 160 GB

    Jina AI 提出在压缩前将嵌入向量转换为球坐标,可把嵌入存储从 240 GB 降到 160 GB,比最佳无损基线还好 25%。重建近似无损,误差低于 float32 机器 epsilon,检索质量不受影响,适用于文本、图像和多向量嵌入,且无需训练、无需码本。

1月15日周四
  1. Modal BlogAI 评估 · 17/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Chai Discovery 如何用 Modal 无缝运行计算生物学工作负载

    药物发现公司 Chai Discovery 从第一天起就基于 Modal 构建计算平台,用其弹性 GPU 和分布式文件系统 Modal Volumes 运行从蛋白质嵌入到大分子设计推理的流水线。

1月10日周六
  1. Berkeley AI Research BlogAI 评估 · 29/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    信息驱动的成像系统设计:Berkeley 团队用互信息直接评估与优化成像硬件

    加州大学伯克利分校团队提出一种基于互信息的成像系统评估与优化框架,可直接从带噪测量中估计信息量,且任何建模误差只会高估、不会低估真实信息。该方法在彩色摄影、射电天文、无透镜成像和显微成像四个领域验证,信息估计能预测下游解码器性能,优化出的设计达到端到端 SOTA 水平,同时所需内存和算力更少,也无需任务专用解码器。相关论文发表于 NeurIPS 2025。

12月30日周二
  1. Ahead of AI — Sebastian RaschkaAI 评估 · 37/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LLM 的 2025:进展、问题与预测

    2025 年 LLM 发展由推理模型主导,DeepSeek R1 证明推理行为可通过强化学习培养,并以开放权重达到当时顶级专有模型水平。其采用的 RLVR 与 GRPO 成为年度核心训练方法,此后各主要厂商纷纷推出推理变体;DeepSeek V3 的 671B 参数训练成本估算约 500 万美元,R1 在其之上再训约 29.4 万美元。

  2. Ahead of AI — Sebastian RaschkaAI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LLM 研究论文:2025 年 7 月至 12 月精选清单

    Sebastian Raschka 整理并发布了 2025 年 7 月至 12 月的 LLM 研究论文书签清单,涵盖推理模型训练、推理时推理策略、LLM 评估与推理理解、其他强化学习方法、模型发布与技术报告、架构、高效训练、扩散语言模型、多模态与视觉语言模型、数据与预训练数据集等类别。

12月29日周一
  1. Jina AI(@JinaAI_)AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jina AI 综述 VLM 视觉编码器:400M 模型可超越 6B

    Jina AI 发布 VLM 视觉编码器综述,调研 70+ 模型后发现训练方法比规模更关键——训练得当的 400M 编码器性能可超过 6B 模型。原生分辨率对文档类任务尤为重要,多编码器融合也被证实有效。综述还包含分类体系与实践指南,指出编码器侧研究明显不足,业界多沿用 2021 年的 400M CLIP。

12月28日周日
  1. Modal BlogAI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Modal 如何保障 2 万块 GPU 的健康运行

    Modal 将其跨 AWS、GCP、Azure、OCI 的 GPU 工作池扩展到超过 2 万块并发 GPU,两年内启动超 400 万云实例。此次公开其 GPU 可靠性系统,涵盖实例类型测试选型、机器镜像与启动检查、被动与主动健康检查,以及可观测性与支持。模态还维护半自动基准测试 modal-host-bench,用于评估并规避特定实例类型的性能与可靠性问题。

12月18日周四
  1. MongoDB BlogAI 评估 · 37/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    MongoDB 旗下 Voyage AI 用基于 token 计数的批处理让查询嵌入推理提速

    Voyage AI by MongoDB 通过基于 token 计数的批处理策略,让查询嵌入推理用少 3 倍的 GPU 仍将 GPU 推理延迟降低 50%。该方案依托 vLLM 和 SGLang 支持的 padding removal,将短查询序列拼接成变长批次处理,替代按 B×S 补 padding 的传统做法,避免 padding token 白白消耗算力与显存带宽。

12月16日周二
  1. 硬地骇客AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    对话祥宇:从 AlphaFold 到 LLM,AI 会颠覆药物研发还是被高估了?

    播客《硬地骇客》EP118 邀请遗传学博士祥宇,讨论 AlphaFold 对蛋白质结构研究和新药研发路径的作用,以及 LLM 如何推动科研、中国创新药企的专利出海与 GLP-1 减肥药研发竞争。节目还谈及自闭症遗传与环境因素、生物学就业前景,以及 AI 与科学家未来的结合方式。

12月10日周三
  1. Qunar技术沙龙AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    去哪儿网端智能架构设计与实践:毫秒级推理与用户流失预测挽留

    去哪儿网构建了一套分层解耦、端云协同的端智能基础设施,由引擎层、基建层、应用层组成,支持 XGBoost、LightGBM 及 RNN、CNN、Transformer 等模型端侧推理,单次推理耗时控制在毫秒级,推理成功率保持 99.9%。在用户流失预测挽留场景中,端侧模型直接利用实时微观行为特征,单次推理耗时≤10ms,预测准确率较天然不下单概率相对提升 12%。

12月3日周三
  1. Ahead of AI — Sebastian RaschkaAI 评估 · 78/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    从 DeepSeek V3 到 V3.2:架构、稀疏注意力与 RL 更新

    Sebastian Raschka 撰文梳理 DeepSeek V3 到 V3.2 的技术演进,核心变化是 V3.2 沿用 V3.2-Exp 的架构,加入 DeepSeek Sparse Attention(DSA)型稀疏注意力以降低长上下文下的训练与推理成本,注意力复杂度从 O(L²) 降到 O(Lk),其中 k 在官方代码中设为 2048。

    为什么值得看

    梳理从 V3 到 V3.2 的架构与训练变化,读者可对照前代理解稀疏注意力和 RL 的具体改动。

11月28日周五
  1. 语言即世界language is worldAI 评估 · 52/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    独家对话 DeepMind 谭捷:机器人、世界模型与 Google

    Google DeepMind 机器人团队高级研究科学家兼技术负责人谭捷接受张小珺访谈,回顾其从图形学转向机器人、在 Google 第一篇 sim-to-real 强化学习论文,以及团队从 10 人扩至 150 人的过程。

11月27日周四
  1. Binyuan Hui(@huybery)AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    阿里千问(Qwen)团队论文获 NeurIPS 2025 最佳论文奖

    阿里千问(Qwen)团队的论文《Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free》获得 NeurIPS 2025 最佳论文奖。该研究聚焦大语言模型的门控注意力机制,涉及其非线性、稀疏性与无 attention sink 特性。

11月22日周六
  1. Jan Leike(@janleike)AI 评估 · 65/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 研究:生产 RL 中的奖励作弊可导致自然涌现的失准

    Anthropic 发布新研究,主题是生产 RL 中奖励作弊引发的自然涌现失准。研究指出,奖励作弊指模型在训练任务中学会作弊;Jan Leike 称这是他所见过最有趣的泛化发现之一,如果模型在编码任务上学会作弊,可能带来广泛的失准。研究认为若不加缓解,奖励作弊的后果可能非常严重。

11月15日周六
  1. Binyuan Hui(@huybery)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    为何 AI 训练 AI 还难以实现:缺少训练脚本与结果的真实数据

    目前仍无法实现 AI 训练 AI,核心原因是缺乏训练脚本行为与结果表现的数据。人类仍需大量试跑寻找合适手感,并反复盯着结果表讨论每次改动的原因,这种"训练→评估→思考→再训练"的循环扩展成本极高。真实工作流中的冷启动数据也依然稀缺。

11月13日周四
  1. Modal BlogAI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Decagon 如何在 Modal 上落地实时语音 AI

    Decagon 与 Modal 合作训练紧凑开源模型并结合定制 draft 模型与运行时优化,使 Decagon Voice 2.0 延迟降低 65%,意图识别与回复质量显著提升。其定制 EAGLE3 draft 模型接受长度比开源基线高 38%,Modal 为 SGLang 构建异步调度器,消除 H200 GPU 空闲时间并将吞吐提升最高 12%,相关改动已向上游提交 PR。

11月4日周二
  1. Ahead of AI — Sebastian RaschkaAI 评估 · 41/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    超越标准 LLM:线性注意力混合架构等替代方案解析

    当前最强的开源权重 LLM,从 DeepSeek R1 到 MiniMax-M2,仍基于自回归 decoder 式 Transformer 与多头注意力机制,但文本扩散模型、线性注意力混合架构等替代方案近年来不断涌现。

11月3日周一
  1. Sualeh Asif(@sualehasif996)AI 评估 · 57/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Fireworks AI 完成 2.5 亿美元 C 轮融资,估值达 40 亿美元

    Fireworks AI 完成 2.5 亿美元 C 轮融资,由 Lightspeed 和 Index Ventures 联合领投,红杉资本和 Evantic Capital 参投,估值升至 40 亿美元;此前 Benchmark 和红杉领投的轮次累计融资 3.27 亿美元。

11月1日周六
  1. Berkeley AI Research BlogAI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    不依赖 TD 学习的强化学习:用分治范式实现可扩展的 off-policy RL

    Berkeley AI Research 提出一种不基于时序差分(TD)学习的强化学习范式——分治法。该方法通过将轨迹对半切分、用两段子轨迹的值相乘来更新整体价值,理论上可将 Bellman 递归次数从线性降为对数级,缓解 TD 学习中误差随时长累积的问题。

10月28日周二
  1. Lilian Weng(@lilianweng)AI 评估 · 37/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Thinking Machines 探讨 on-policy distillation:用教师模型做过程奖励模型

    Thinking Machines 发布最新文章,探讨 on-policy distillation 这一训练方法,将 RL 的纠错相关性与 SFT 的奖励密度结合。

10月17日周五
  1. Ian Goodfellow(@goodfellow_ian)AI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 与 Commonwealth Fusion Systems 合作,用 AI 加速核聚变研发

    Google DeepMind 宣布与核聚变公司 Commonwealth Fusion Systems(CFS)达成研究合作,用 AI 帮助加速清洁、安全、无限的聚变能源开发。Ian Goodfellow 表示,他与同事在 AI 用于核聚变方面的更多工作现已公开。