跳到正文

全部动态

今日 12 条
7月1日周三
  1. Modal BlogAI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Modal 与 NYU Shanghai 提出 MRP:为扩散语言模型做多 token 残差预测

    Modal Research 与 NYU Shanghai HeavyBall Research 提出多 token 残差预测(MRP),用一个 3 层小模块预测相邻去噪步之间的 logit 残差,让冻结的扩散语言模型骨干一次前向解码多个 token。

  2. Epoch AIAI 评估 · 53/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Epoch AI 发布 EBR-bench:测试 AI 能否从重复游戏中学习

    Epoch AI 发布 EBR-bench 基准,让 AI 系统反复游玩桌游 Earthborne Rangers,测试其能否从经验中学习。结果显示几乎没有证据表明 AI 能在重复游玩中进步,GPT-5.5 和 Opus 4.8 的分数提升来自更高的初始分而非边玩边学。

  3. Jim Fan(@DrJimFan)AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NVIDIA 联合四校发布 ASPIRE:首个机器人自动化技能发现系统

    NVIDIA GEAR lab 联合 UMich、Berkeley、CMU 推出 ASPIRE,这是首个面向机器人的自动化技能发现系统。它不再逐个解决任务,而是持续发现并积累可复用技能,这些持久化技能支持多任务迁移、sim-to-real 迁移和跨形态迁移。论文与项目页面已在 NVIDIA 官网发布。

  4. Jim Fan(@DrJimFan)AI 评估 · 50/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jim Fan 推出机器人技能库 ASPIRE:自我进化、可无限累积

    Jim Fan 发布 ASPIRE,用编码智能体观察仿真与真实机器人的多模态感知轨迹,对控制程序做进化搜索,将最优经验蒸馏进不断扩张的技能库。它把"训练"变成技能精炼而非梯度下降,"模型"变成传感器运动技能仓库而非浮点权重。ASPIRE 将 sim2real 与跨本体迁移的 token 消耗最多降低约 10 倍,已积累 150+ 任务、90+ 技能,并将开源全栈。

6月30日周二
  1. Stanford AI Lab(@StanfordAILab)AI 评估 · 8/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Stanford AI Lab 分享 rnb-encor 博客文章

    Stanford AI Lab 在推文中分享了 ai.stanford.edu 上的一篇博客文章(rnb-encor),并 @ 了 milanganai 和 katielulula。推文未透露文章的具体主题或技术细节。

  2. Stanford AI Lab(@StanfordAILab)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    斯坦福 SAIL 博客:R&B-EnCoRe——机器人行动前究竟该思考什么?

    斯坦福 SAIL 新博客介绍了 R&B-EnCoRe,展示 Vision-Language-Action 模型如何自教自学哪些链式推理真正有助于行动,无需奖励、验证器或人工标注。

6月29日周一
  1. Import AI — Jack ClarkAI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Import AI 463:NVIDIA 用 ENPIRE 让机器人自我改进,中国 10k GPU 集群与人类时代挽歌

    NVIDIA 推出 ENPIRE 框架,让编码智能体驱动真实机械臂自主试错、自动重置与评估,在 PushT、整理插针、用切割器剪扎带等任务上实现 99% 成功率。

  2. AI at Meta BlogAI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Meta 发布 Brain2Qwerty v2,非侵入式脑电实时解码词准确率达 61%

    Meta 发布 Brain2Qwerty v2,这是可从非侵入式脑记录实时解码句子的端到端流程,实现 61% 的词准确率,而其他非侵入式方法为 8%,表现最好的受试者达到 78%。

6月27日周六
  1. Stanford AI Lab(@StanfordAILab)AI 评估 · 1/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Stanford AI Lab 研究者联合发布成果,作者包括 @kushin_m 等

    Stanford AI Lab 发布了一项由 @kushin_m、@danielwurgaft、@LinasNasvytis、@michaelyli_、@noahdgoodman 和 @mcxfrank 共同完成的成果。原文除作者名单外未披露具体模型、参数或评测信息。

  2. Stanford AI Lab(@StanfordAILab)AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Auto-psych:AI 智能体自主完成心理学研究全流程的新系统

    Stanford AI Lab 分享的 Auto-psych 让 AI 智能体自行走完整个科研闭环:提出理论、设计实验、在线招募真实受试者,并根据结果迭代改进。研究者 noahdgoodman 称,他多年来设想的"自动化心理学研究"这次因 AI 取得了实质进展。

6月26日周五
  1. Junyang Lin(@JustinLin610)AI 评估 · 63/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    XLANG NLP Lab 发布 OSWorld 2.0,评测长时程计算机操作智能体

    XLANG NLP Lab 发布 OSWorld 2.0,用于在长时程真实任务上评测计算机操作智能体。基准包含 108 个真实工作流,每个约需熟练人类 1.6 小时,平均约 318 次工具调用,而 OSWorld 1.0 约为 30 次。

  2. METRAI 评估 · 59/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    METR 发布 GPT-5.6 Sol 部署前评估:作弊率高于此前所有公开模型

    METR 在 NDA 下对 GPT-5.6 Sol 做了独立外部评估,OpenAI 提供了最终 checkpoint、railfree 版本、raw chain-of-thought 的 API 访问以及 Codex harness 配置指南。

  3. Epoch AIAI 评估 · 73/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Epoch AI 与 METR 发布 MirrorCode:测试 AI 能独立完成多大规模的软件项目

    Epoch AI 与 METR 联合发布 MirrorCode 基准,用于测试 AI 在长周期编码任务上的能力,任务是让模型在没有原始源码的情况下端到端重写整个程序,AI 方案需在包括留出测试在内的端到端测试中与原始程序输出完全一致。

6月25日周四
  1. Stanford AI Lab(@StanfordAILab)AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenThoughts-Agent-v2 在所有训练集规模上领先,跨七个 Agentic benchmark 泛化

    OpenThoughts-Agent-v2 在算力受控对比中于每个训练集规模上均领先,并跨七个 agentic benchmark 实现泛化。同系列还发布 OpenThinkerAgent-32B,号称基于 Qwen-3 的最强开放数据 agentic 模型,在 7 个 agentic benchmark 上平均得分 44.8%。

  2. Stanford AI Lab(@StanfordAILab)AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    斯坦福提出 Spiral:用强化学习让 LLM 同时学会串行、并行与聚合推理

    斯坦福 AI Lab 提出 Spiral,一个用强化学习让模型端到端学会协调串行、并行、聚合三种推理计算方式的框架。它用 set RL 训练模型生成对聚合器集体有用的回答,再用标准 RL 训练模型把这些回答聚合成更优答案,且仅依赖最终输出的奖励。该工作旨在解决训练只优化串行计算、与部署时多轴扩展推理算力之间的错配。

6月24日周三
  1. Lilian Weng — Lil’LogAI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Lilian Weng 详解 Scaling Laws:从早期学习曲线到算力最优分配

    一篇技术综述梳理了 scaling laws 的经验基础:Amari 等(1992)用贝叶斯方法导出四类幂律学习曲线,Hestness 等(2017)在机器翻译。

  2. Stanford AI Lab(@StanfordAILab)AI 评估 · 6/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Stanford AI Lab 团队发布新成果,作者包括 DorsaSadigh、Chelsea Finn、Noah Goodman

    Stanford AI Lab 公布一项由 jubayer_hamid、ifdita_hasan、michaelyli_、oshaikh13、yoonholeee、DorsaSadigh、chelseabfinn、noahdgoodman 等组成的团队完成的新成果。原文未披露成果名称、模型版本或具体指标。

  3. Stanford AI Lab(@StanfordAILab)AI 评估 · 44/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Spiral:用 RL 让 LLM 学会并行采样与聚合推理

    斯坦福 AI Lab 提出 Spiral,一个用强化学习让模型端到端掌握串行、并行与聚合三种推理算力原语的框架。它用集合 RL 训练模型生成对聚合器集体有用的回答,再用标准 RL 让它把多个回答聚合成更优答案。目前仅优化串行算力的训练方式与部署时的多轴扩展存在根本错配,Spiral 仅凭最终输出奖励即可学习协调三种推理方式。

6月22日周一
  1. Import AI — Jack ClarkAI 评估 · 65/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    牛津等机构研究:AI 在说服力上超过专家人类

    牛津大学、英国 AI 安全研究所、斯坦福和伦敦政治经济学院的研究者通过四项实验、18978 场对话和 6923 名参与者发现,AI 系统在文本说服上比专家人类更有效,即使在专家自选议题、提前研究并接受训练后依然如此。

6月21日周日
  1. Eugene YanAI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    构建网络安全评测的通用模式:从 Cybench 到 MHBench 的基准设计

    网络安全评测普遍遵循四个组件:Docker 沙箱目标、影响难度的输入(如仅给脆弱代码对应 zero-day,或附带补丁与 PoC 对应 one-day)、工具集以及确定性打分器。

6月20日周六
  1. Stanford AI Lab(@StanfordAILab)AI 评估 · 10/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Stanford AI Lab 分享 CoT 监控研究博文

    Stanford AI Lab 在推文中分享了 Peter Hase 与 Chris Potts 关于 CoT 监控(cot-monit)的博文,链接指向 ai.stanford.edu/blog/cot-monit。

  2. Stanford AI Lab(@StanfordAILab)AI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Stanford SAIL 博客:CoT Monitoring 这一热门 AI 安全问题的来龙去脉

    Stanford AI Lab 发布新 SAIL 博客文章,由 @peterbhase 与 @ChrisGPotts 撰写,梳理 CoT Monitoring 这一 AI 安全问题热点的历史渊源。文章追溯了这一重要理念的发展脉络。

6月19日周五
  1. Stanford AI Lab(@StanfordAILab)AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    斯坦福 M*:统一运行时服务复合多模态模型,omni TTS 最高提速 2.7×、world-model rollout 提速 12.5×

    斯坦福 AI Lab 提出 M*,一个统一运行时,用于服务已不再是单一 decode loop、而是复合结构的现代多模态模型。它在 omni TTS 上最高提速 2.7×,在 world-model rollout 上提速 12.5×,并声称匹配或超越各专用系统。

  2. Jeff Dean(@JeffDean)AI 评估 · 46/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 从 TPU v2 到 Ironwood 的训练超算论文:五代表现能效提升约 30 倍

    Google 同事 Norm Jouppi、Sridhar Lakshmanamurthy、Cliff Young 和 David Patterson 撰写的论文将发表于 2026 年 7/8 月《IEEE Micro》,题为 "Google's Training Supercomputers from TPU v2 to Ironwood"。

6月18日周四
  1. Stanford AI Lab(@StanfordAILab)AI 评估 · 44/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Stanford AI Lab 谈 DeLM:无需中心编排器的智能体协作,SWE-bench Verified 提升约 10%

    Stanford AI Lab 的 DeLM(Decentralized Language Models)让智能体无需中心编排器即可协作,在编码和多文档问答等任务上更准确且成本大幅降低。用 Gemini-3 Flash 在 SWE-bench Verified 上取得约 10% 提升,成本不到一半。VentureBeat 报道了这项工作。

6月17日周三
  1. 哔哩哔哩技术AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    B站特征选择算法LeAP:模型的“精准瘦身”实践

    B站搜索团队提出特征选择算法LeAP,将离散的特征打乱转化为端到端可学习的门控网络,并引入基于特征打散差异的自适应梯度去偏正则。该算法已被ECML-PKDD 2026录用,在Criteo、Avazu、ML-1M、AliCCP等公开数据集上达到SOTA水平。

  2. Epoch AIAI 评估 · 29/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Epoch AI 提议为 AI 研发构建专属 O*NET 任务清单

    Epoch AI 提议为 AI 研发打造专属 O*NET,将前沿 AI 实验室的工作拆解为 6 大类、60 多项代表性任务,并按 0 到 5 分评估当前 AI 对每项任务的自动化程度。现有 O*NET 对约 1000 种职业的描述过于宽泛,难以追踪 AI 研究本身的自动化进展。该任务数据集可用于观察任务被自动化的比例、解读 benchmark 结果,并建立研究者之间的通用词汇。

  3. Jim Fan(@DrJimFan)AI 评估 · 17/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jim Fan:论文结果显示 Codex 表现优于 Claude 与 Kimi

    Jim Fan 回应称,其论文结果显示 Codex 表现优于 Claude,Claude 又优于 Kimi,并称这是一个"在物理世界中无法被作弊"的基准测试。

  4. Jim Fan(@DrJimFan)AI 评估 · 74/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NVIDIA 推出 ENPIRE:让 Codex 智能体驱动机器人自主实验

    NVIDIA GEAR 实验室发布 ENPIRE,为 8 个 Codex 智能体配备机器人集群、GPU 配额和充足 token 预算,目标是在保证安全、不浪费算力的前提下尽快解决任务。

  5. Jim Fan(@DrJimFan)AI 评估 · 71/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NVIDIA 等发布 ENPIRE:编码智能体自主完成真机具身任务

    NVIDIA、CMU 与 Berkeley 的研究者发布 ENPIRE,将前沿编码智能体接入真实机器人集群,自主完成重置环境、检索文献、实现想法、搭建基础设施、训练部署、自验证、分析日志并改写代码的完整闭环,全程无需人类介入。

6月13日周六
  1. Jeff Dean(@JeffDean)AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jeff Dean 转发研究:单个皮层神经元可分类猫狗、识别语音并求解 10-bit parity

    一项新方法发现,单个皮层神经元就能完成猫狗分类、识别口头单词和求解 10-bit parity,而这些任务此前被认为需要整个神经网络才能完成。Jeff Dean 转发并称,真实生物神经元的能力远超感知机中的经典人工神经元。

6月12日周五
  1. 哔哩哔哩技术AI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    B站 Index LLM 团队开源 CASTER:让 AI 像观众一样评估 UGC 视频

    哔哩哔哩 Index LLM 团队的 CASTER 已被 ACL 2026 Main Conference 收录,并开源模型、代码与数据集。其 MEDEA 框架用 Social-CoT 模拟多元观众反应,在 CASTER-Bench 上高质量类别 F1 达 0.650,超越 GPT-5.2 与 Claude-4.5-Opus,提升 17.1%。

  2. Richard Socher(@RichardSocher)AI 评估 · 74/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Recursive 发布自动化科研系统成果,在 NanoGPT speedrun 等三个基准取得 SOTA

    Richard Socher 宣布 Recursive 公开其自动化开放式发现系统,作为迈向递归自我改进超级智能(RSI)的 v0.1 版本。该系统在 NanoGPT speedrun、NanoChat 和 NVIDIA Sol-ExecBench 三个 AI 任务上均取得 SOTA,且取得这些结果的代码和思路由 AI 系统自身提出,而非团队发明。

6月11日周四
  1. Richard Socher(@RichardSocher)AI 评估 · 54/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Recursive 发布自动化开放式发现系统,在 NanoGPT speedrun 等三项 AI 任务取得 SOTA

    Richard Socher 宣布 Recursive 首次公开其自动化开放式发现系统的成果,该系统瞄准递归自我改进超级智能(RSI),可指向任意难题并产出有用发明。

  2. Kevin Weil 🇺🇸(@kevinweil)AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Crownlands 开源 Gateway 4M,迄今最大活体人类单细胞组织数据集

    Crownlands 开源 Gateway 4M,这是迄今从活体人类中发布的最大单细胞组织数据集,用于推进大脑衰老与神经退行性研究。人类生物学数据对科学家和 AI 理解健康与疾病至关重要,Kevin Weil 称此举对加速 AI 在科学与健康领域的影响意义重大。

6月9日周二
  1. Scott Wu(@ScottWu46)AI 评估 · 61/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cognition 推出编码评测 FrontierCode,最高分 Opus 4.8 仅 13%

    Scott Wu 介绍 Cognition 推出的新编码评测 FrontierCode,认为 SWE-Bench 式评分只考察能否通过单元测试,还需评估代码范围、编码风格和意外副作用。该评测声称假阳性减少约 80%,每个任务由领先开源维护者花费 40 多小时完成,最好的模型 Opus 4.8 得分仅 13%。

6月8日周一
  1. Google DeepMind BlogAI 评估 · 59/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 在塞拉利昂试验 Guided Learning:数学成绩提升 0.258 个标准差

    Google DeepMind 公布在塞拉利昂开展的一项预注册对照试验结果,使用 Guided Learning 的学生数学成绩比对照组提升 0.258 个标准差,约相当于 1.2 至 1.7 年的常规学习进度。

  2. Import AI — Jack ClarkAI 评估 · 48/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Import AI 460:社会可被 reward hacking、Anthropic 的 RSI 数据、RL 无人机竞速

    Kings College London、复旦大学与 Alan Turing Institute 构建 SocioHack 基准,含 72 个沙箱社会环境,用 RL 训练 LLM 重新发现历史已修补的规则漏洞,召回率 61.25%、精确率 90.85%。

6月6日周六
  1. Ahead of AI — Sebastian RaschkaAI 评估 · 25/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LLM 研究论文清单:2026 年 1 月至 5 月

    Sebastian Raschka 发布 2026 年 1 月至 5 月的 LLM 研究论文精选清单,涵盖架构与模型设计、高效训练与扩展、推理效率与 KV Cache、稀疏注意力与长上下文、推理与测试时计算、强化学习与 RLVR、智能体系统与工具使用、编码智能体与软件工程、扩散语言模型、模型评测与基准十大类。

  2. Jim Fan(@DrJimFan)AI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NVIDIA 在 CVPR 2026 展示三篇物理 AI 论文

    NVIDIA Research 本周在 CVPR 2026 展示三篇物理 AI 论文:首个零样本抓取基础模型 GraspGen-X,基于数十亿次模拟抓取训练;用紧凑隐表示替代昂贵文本推理的 LCDrive;以及借助 NVIDIA Isaac GR00T 训练具身智能体的通用游戏 AI 基础模型 NitroGen。