跳到正文

#论文/研究

今日 12 条
6月13日周六
  1. Jeff Dean(@JeffDean)AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jeff Dean 转发研究:单个皮层神经元可分类猫狗、识别语音并求解 10-bit parity

    一项新方法发现,单个皮层神经元就能完成猫狗分类、识别口头单词和求解 10-bit parity,而这些任务此前被认为需要整个神经网络才能完成。Jeff Dean 转发并称,真实生物神经元的能力远超感知机中的经典人工神经元。

6月12日周五
  1. 哔哩哔哩技术AI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    B站 Index LLM 团队开源 CASTER:让 AI 像观众一样评估 UGC 视频

    哔哩哔哩 Index LLM 团队的 CASTER 已被 ACL 2026 Main Conference 收录,并开源模型、代码与数据集。其 MEDEA 框架用 Social-CoT 模拟多元观众反应,在 CASTER-Bench 上高质量类别 F1 达 0.650,超越 GPT-5.2 与 Claude-4.5-Opus,提升 17.1%。

6月11日周四
  1. Epoch AIAI 评估 · 55/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Epoch AI:最大 AI 数据中心算力每 7 个月翻倍

    Epoch AI 的数据显示,自 2024 年 8 月 SpaceXAI 的 Colossus 1 上线以来,按算力容量计算的最大 AI 数据中心纪录每 7 个月翻倍。

  2. Kevin Weil 🇺🇸(@kevinweil)AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Crownlands 开源 Gateway 4M,迄今最大活体人类单细胞组织数据集

    Crownlands 开源 Gateway 4M,这是迄今从活体人类中发布的最大单细胞组织数据集,用于推进大脑衰老与神经退行性研究。人类生物学数据对科学家和 AI 理解健康与疾病至关重要,Kevin Weil 称此举对加速 AI 在科学与健康领域的影响意义重大。

6月8日周一
  1. Google DeepMind BlogAI 评估 · 59/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 在塞拉利昂试验 Guided Learning:数学成绩提升 0.258 个标准差

    Google DeepMind 公布在塞拉利昂开展的一项预注册对照试验结果,使用 Guided Learning 的学生数学成绩比对照组提升 0.258 个标准差,约相当于 1.2 至 1.7 年的常规学习进度。

  2. Import AI — Jack ClarkAI 评估 · 48/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Import AI 460:社会可被 reward hacking、Anthropic 的 RSI 数据、RL 无人机竞速

    Kings College London、复旦大学与 Alan Turing Institute 构建 SocioHack 基准,含 72 个沙箱社会环境,用 RL 训练 LLM 重新发现历史已修补的规则漏洞,召回率 61.25%、精确率 90.85%。

6月6日周六
  1. Ahead of AI — Sebastian RaschkaAI 评估 · 25/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LLM 研究论文清单:2026 年 1 月至 5 月

    Sebastian Raschka 发布 2026 年 1 月至 5 月的 LLM 研究论文精选清单,涵盖架构与模型设计、高效训练与扩展、推理效率与 KV Cache、稀疏注意力与长上下文、推理与测试时计算、强化学习与 RLVR、智能体系统与工具使用、编码智能体与软件工程、扩散语言模型、模型评测与基准十大类。

  2. Jim Fan(@DrJimFan)AI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NVIDIA 在 CVPR 2026 展示三篇物理 AI 论文

    NVIDIA Research 本周在 CVPR 2026 展示三篇物理 AI 论文:首个零样本抓取基础模型 GraspGen-X,基于数十亿次模拟抓取训练;用紧凑隐表示替代昂贵文本推理的 LCDrive;以及借助 NVIDIA Isaac GR00T 训练具身智能体的通用游戏 AI 基础模型 NitroGen。

  3. Jim Fan(@DrJimFan)AI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NitroGen 获 CVPR 最佳论文荣誉提名,迈向通用具身智能体

    NitroGen 获得 CVPR 最佳论文荣誉提名,目标是在真实世界物理与多种模拟物理环境中都能胜任的通用具身智能体。这是团队自 4 年前 MineDojo 获 NeurIPS 最佳论文后再次获奖。

5月30日周六
  1. Fei-Fei Li(@drfeifei)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    李飞飞团队发布 GPIC:面向大规模视觉生成的 1 亿图文对数据集与基准

    李飞飞等人推出 GPIC(Giant Permissive Image Corpus),一个面向大规模生成模型时代的视觉生成数据集与基准,含 1 亿条 VLM 标注图文对用于训练、100 万条图文对用于评测,总计约 28 万亿像素。该数据集完全允许研究及商业用途,采用集中托管,并同时提供数据集、基准与模型。

5月20日周三
  1. METRAI 评估 · 82/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    METR 发布 2026 年 2 至 3 月前沿风险报告:评估 Anthropic、Google、Meta、OpenAI 内部智能体

    METR 于 2026 年 2 月启动试点,评估前沿 AI 开发商内部智能体失准风险,Anthropic、Google、Meta、OpenAI 参与。报告认为这些内部智能体在评估期合理具备实施小规模失控部署的手段、动机和机会,但不具备让其高度抗打击的能力,所有共享模型的内部前沿与 2026 年 2 至 3 月公开前沿差距不大。

    为什么值得看

    METR 首次以机构为单位评估前沿实验室内部智能体的失控风险,披露了内部与公开模型差距及作弊行为的具体证据。

  2. METRAI 评估 · 75/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    METR 发布 2026 年 2-3 月前沿 AI 风险报告:Anthropic、Google、Meta、OpenAI 参与内部智能体评估

    METR 发布 2026 年 2 月 16 日至 3 月 16 日的前沿 AI 风险评估试点报告,Anthropic、Google、Meta 和 OpenAI 参与,METR 获得了各家当时最强内部模型(含原始思维链)的访问权限。评估认为这些内部智能体很可能具备发起小规模未授权部署的手段、动机和机会,但尚不具备使其高度稳健的能力;METR 计划在 2026 年晚些时候再次开展类似评估。

  3. METRAI 评估 · 70/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    METR 发布前沿 AI 风险报告:评估 Anthropic、Google、Meta、OpenAI 内部智能体的失控部署风险

    METR 发布 2026 年 2 至 3 月前沿 AI 风险报告,对 Anthropic、Google、Meta 和 OpenAI 内部使用的 AI 智能体做了一次实体级(而非单模型)试点评估。

5月19日周二
  1. Google DeepMind BlogAI 评估 · 61/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 用 Co-Scientist 加速逆转细胞衰老研究

    Google DeepMind 介绍了生物学家 Omar Abudayyeh 和 Jonathan Gootenberg 如何用 Co-Scientist 辅助细胞衰老研究。

5月18日周一
  1. Import AI — Jack ClarkAI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Import AI 457:AI 版 Stuxnet、Muon 优化器的神经元死亡问题与「正向对齐」

    SentinelOne 拆解出一个约 20 年前、比 Stuxnet 更早的病毒 fast16.sys,它专门篡改 LS-DYNA 970、PKPM、MOHID 等高精度工程与仿真软件的计算结果。

5月16日周六
  1. Google DeepMind BlogAI 评估 · 52/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Stanford 用 Co-Scientist 筛选抗肝纤维化药物,候选药在实验中抑制 91% 损伤反应

    Stanford 大学医学院遗传学家 Gary Peltz 团队在《Advanced Science》发表研究,用 Google DeepMind 的 Co-Scientist 从既有药物文献中筛选可重定位治疗肝纤维化的候选药。

5月11日周一
  1. Import AI — Jack ClarkAI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Import AI 456:RSI 与经济增长、AI 监管的"激进可选项"、以及神经计算机

    法律与 AI 研究所提出"激进可选项"监管思路:短期避免过度监管,同时快速建设信息收集权、举报人保护、政府间信息共享等制度工具以应对强大 AI 的冲击。Meta 与 KAIST 的论文提出神经计算机(NC),将计算、内存与 I/O 统一在学习到的运行时状态中。

  2. METRAI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    METR 调查:349 名技术工作者自述 AI 带来的工作价值中位数提升 1.4–2 倍

    METR 在 2026 年 2–4 月调查了 349 名技术工作者(含 87 名软件工程师、71 名研究人员、129 名学者与博士生、48 名创始人及管理者),受访者自述 AI 工具带来的工作价值中位变化为 1.4–2 倍,速度中位变化为 3 倍。

5月9日周六
  1. Alex Albert(@alexalbert__)AI 评估 · 70/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    METR 评测 Claude Mythos Preview 时间跨度超次优模型 2 倍

    Alex Albert 称,提供给 METR 的早期 Claude Mythos Preview 快照在 METR 80% 成功率基准上的时间跨度超过次优模型 2 倍。METR 表示在 2026 年 3 月的有限窗口内对该早期版本做了风险评估,在其任务套件上估计 50% 时间跨度为至少 16 小时(95% CI 8.5 至 55 小时),已接近其在无新任务情况下可测量的上限。

5月8日周五
  1. METRAI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    METR 解析 AI 生产力提升的三种度量:Task Substitution and Uplift

    METR 提出 AI 生产力提升(uplift)的三种定义:旧任务提升、价值提升与新任务提升,并论证在简化假设下三者满足旧任务提升 ≤ 价值提升 ≤ 新任务提升。以软件工程师每日 8 小时写文档与 pull request 为例,若 AI 将写 PR 效率提高一倍,旧任务提升为 +33%,新任务提升为 +50%,价值提升则介于两者之间。

  2. Jan Leike(@janleike)AI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jan Leike 与 Samuel Marks 发布 NLA:将 LLM 内部状态转成可读文本的无监督方法

    Samuel Marks 等人发布新论文提出 NLAs,一种将 LLM 内部状态转换为人类可读文本的无监督方法。Jan Leike 称其为可解释性工具箱中的新工具,并表示结果令人惊讶,认为 NLAs 实质推进了对 LLM 在想什么的理解以及安全审计能力。

4月30日周四
  1. Google DeepMind BlogAI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 发布 AI co-clinician 医疗 AI 研究计划

    Google DeepMind 宣布 AI co-clinician 研究计划,探索 AI 智能体在医生监督下辅助患者诊疗的“三方协作”模式。

4月22日周三
  1. Google DeepMind BlogAI 评估 · 59/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 发布 Decoupled DiLoCo 分布式训练架构

    Google DeepMind 发布论文提出 Decoupled DiLoCo 分布式训练架构,将训练任务拆分为相互解耦的计算岛屿并采用异步数据流,使单点硬件故障不中断其他部分。

4月21日周二
  1. METRAI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    METR 分析 NanoGPT speedrun:AI 智能体在 AI 研发中贡献了多少进展

    METR 依据 NanoGPT speedrun 排行榜分析 AI 智能体对 AI 研发的加速作用:2024 年 5 月至 2026 年 3 月,36 位贡献者提交 77 项记录,将 8×H100 上的 GPT-2-small(124M)训练时间从 45 分钟压缩至 1.43 分钟,累计提速 31 倍,其中 4 项记录归于 AI 智能体。

4月20日周一
  1. Berkeley AI Research BlogAI 评估 · 35/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GRASP:面向世界模型的基于梯度的长时程规划方法

    伯克利 AI 研究博客提出 GRASP,一种针对学习动力学(世界模型)的梯度规划器,通过将轨迹提升到虚拟状态实现跨时间并行优化、直接向状态迭代注入随机性以探索,并重塑梯度让动作获得清晰信号同时避开高维视觉模型中的状态输入梯度。

4月15日周三
  1. Jan Leike(@janleike)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 发布自动化研究新成果

    Anthropic 的 jiaxinwen22、liangqiu_1994、Joe Benton 与 janhkirchner 完成了一项新研究,Jan Leike 转发称赞并附上博文链接。博文地址为 anthropic.com/research/autom,具体方法与结论详见原博客。

  2. Jan Leike(@janleike)AI 评估 · 53/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jan Leike:用 Claude 自主推进可扩展监督研究,PGR 指标超越人类研究者

    Jan Leike 公布一项新研究结果:团队用 Claude 在可扩展监督研究上实现完全自主的进展,以 performance gap recovered(PGR)衡量,Claude 迭代多种不同技术,最终以 1.8 万美元额度显著超过人类研究者。

4月10日周五
  1. METRAI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    METR 研究:MirrorCode 证据显示 AI 已能完成部分长达数周的编程任务

    METR 发布 MirrorCode 相关证据,显示 AI 已能完成部分长达数周的编程任务。该机构同期还发布了对 349 名技术工作者的调查,自报 AI 工具带来的工作价值变化中位数为 1.4–2x;另有研究分析 9 个科学推理、数学、机器人、计算机使用和自动驾驶 benchmark 的时间跨度趋势,改进速率与原始时间跨度工作中 7 个月翻倍大致相似。

4月9日周四
  1. Kevin Weil 🇺🇸(@kevinweil)AI 评估 · 48/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 内部模型一次解决五个 Erdős 问题,证明随模型进步愈发优雅

    OpenAI 用内部模型一次性解决了五个新的 Erdős 问题,相关论文已发布在 arXiv(2604.06609)。其中 Erdős Problem 1091 被解决:该猜想问的是色数为 4、且所有小子图色数不超过 3 的图是否必含带多条对角线的奇环,模型给出了反例。论文 Figure 5 由 Codex 生成,随模型进步,证明也变得更优雅。

4月8日周三
  1. Kevin Weil 🇺🇸(@kevinweil)AI 评估 · 25/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Prism 推出 Paper Review:用 AI 审阅技术与科学论文

    Prism 新增 Paper Review,一个用于审阅技术与科学论文的 AI 工作流,目标是提升科学研究的严谨性、正确性与可复现性。官方称其与"AI 生成垃圾内容"相反,即用 AI 来改进科研质量而非粗制滥造。

  2. Kevin Weil 🇺🇸(@kevinweil)AI 评估 · 39/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Paper Review:像技术审稿人一样检查论文的数学、推导与结论支撑

    Paper Review 是一款定位为技术审稿人而非语法检查器的论文审查工具,会检查数学、推导、符号、单位、结构,以及论文的结论是否真正被结果支撑,并发现跨章节、图表、标题与附录之间的不一致。它在 Prism 中以结构化工作流运行,输出可直接在项目中编辑的 LaTeX 审稿文件,使审稿意见成为论文工作区的一部分,作者可在同一环境中修改并处理反馈。它还会在投稿前标记表述不清、引用问题与校对错误。

4月1日周三
  1. Jim Fan(@DrJimFan)AI 评估 · 43/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NVIDIA 等推出 CaP-X:面向机器人 coding agent 的开源框架与基准

    NVIDIA、Berkeley AI、CMU Robotics 与 Stanford AI Lab 联合推出开源框架与基准 CaP-X,让 coding agent 为机器人感知和控制编写代码,并在仿真与真实机器人上执行、观察结果、迭代提升代码可靠性。项目主页为 capgym.github.io。

  2. Jim Fan(@DrJimFan)AI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NVIDIA 联合 Berkeley、Stanford、CMU 开源 CaP-X,采用 MIT 许可证

    NVIDIA 联合 Berkeley、Stanford 和 CMU 开源了 CaP-X,采用 MIT 许可证,代码、论文与项目主页均已公开。论文编号为 arXiv:2603.22435。

  3. METRAI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    METR 实验:少量微调即可提升推理模型 CoT 可控性

    METR 对 GPT-OSS-20B、GPT-OSS-120B、Qwen-3-8B、Qwen-3-32B 四个推理模型做小样本微调(240 条样本、约 100K-300K tokens),在分布外 CoTControl 评测集上平均 CoT 可控性从 2.9% 升至 8.8%。

  4. Kevin Weil 🇺🇸(@kevinweil)AI 评估 · 55/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 内部模型解出三个 Erdős 问题,证明随模型改进更优雅

    Kevin Weil 引用 Mehtaab Sawhney 的推文称,一篇新论文解决了三个 Erdős 问题,每个解均由 OpenAI 内部模型找到,且证明简短优雅,论文见 arxiv.org/pdf/2603.29961。他表示不仅 AI 正在解决更多开放问题,随着模型改进其证明也变得更优雅。

3月26日周四
  1. METRAI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    METR 红队测试 Anthropic 内部智能体监控系统

    METR 员工 David Rein 与 Anthropic 合作,用三周时间对 Anthropic 内部智能体监控与安全系统的一部分做了红队测试,发现若干此前未知的漏洞,其中一些已被修复,均未严重动摇 Opus 4.6 Sabotage Risk Report 的主要结论。

3月25日周三
  1. Kevin Weil 🇺🇸(@kevinweil)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jared Duker Lichtman 谈 Terry Tao 最新论文

    Jared Duker Lichtman 在推文中提及 Terry Tao 的最新论文,并附上被引用推文的链接。推文未披露论文的具体主题、模型或数据。

3月21日周六
  1. Fei-Fei Li(@drfeifei)AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    李飞飞团队 Dream2Flow:用 3D 物体流连接视频生成与机器人控制

    斯坦福李飞飞团队发布 Dream2Flow,用 3D 物体流(3D object flow)打通视频生成与机器人控制,实现开放世界机器人操作。该方法以物体为中心的空间信息作为表征,旨在提升泛化能力,相关工作将亮相 ICRA 2026,项目主页为 dream2flow.github.io。

3月20日周五
  1. METRAI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    METR 分析:建模假设如何影响时间跨度(time horizon)评测结果

    METR 指出其时间跨度任务套件接近饱和后,结果对分析选择愈发敏感:修正正则化建模错误后,近期模型的 50% time horizon 下降最多 20%。

3月13日周五
  1. Berkeley AI Research BlogAI 评估 · 47/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Berkeley 提出 SPEX 与 ProxySPEX:大规模识别 LLM 关键交互

    伯克利 AI 研究团队提出 SPEX 与 ProxySPEX 算法,用于在特征、数据和模型组件三类归因中大规模识别 LLM 的关键交互。SPEX 利用交互的稀疏性与低阶性,将搜索问题转化为稀疏恢复问题;ProxySPEX 进一步利用层级结构,在约少 10 倍消融次数下达到 SPEX 的性能。