跳到正文

#论文/研究

今日 13 条
8月3日周一
  1. Import AI — Jack ClarkAI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    研究者构建自维持自我复制AI蠕虫原型

    多伦多大学、Vector Institute、剑桥大学与ServiceNow的研究者构建出一款由AI模型驱动的原型计算机蠕虫,可利用被感染机器的GPU运行开放权重LLM进行推理,并自主发现漏洞、发动针对性攻击与自我复制。

7月31日周五
  1. Epoch AIAI 评估 · 70/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Epoch AI:7月披露CVE数量达Mythos预告前纪录的5倍

    Epoch AI 统计显示,自 2026 年 4 月 Anthropic 宣布其内部模型 Claude Mythos Preview 具备自主发现和利用网络安全漏洞的能力后,CVE 披露数量持续攀升。

  2. Microsoft Research(@MSFTResearch)AI 评估 · 25/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Microsoft Research 推出 Echoverse:用真实环境训练计算机操作 AI 智能体

    Microsoft Research 提出 Echoverse,用于训练计算机操作 AI 智能体,让它们在真实环境中随任务、测试和环境的变化持续提升,而非单纯增加训练任务量。这类智能体目前在多步工作流(如邮件处理、客户支持)中仍表现吃力。

  3. Microsoft Research(@MSFTResearch)AI 评估 · 11/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    微软 EvoLib:让 LLM 把经验转化为可演化知识

    微软推出 EvoLib,将模型部署后积累的经验转化为可复用的技能与洞察,形成持续演化的知识,帮助 LLM 跨任务学习与适应,而非仅靠记住更多内容变聪明。

7月30日周四
  1. Hunyuan(@TXhunyuan)AI 评估 · 51/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    腾讯混元用 Hyra 智能体与 Hy3 模型解决 50 年数学难题

    腾讯混元称,借助研究智能体 Hyra 与 Hy3 模型,针对有限整数集 A 中 |A+A| 相对 |A-A| 的增长速度问题给出了显式构造,证明最优指数恰为 2。该问题上界自 1969 年定理给出为 2,50 多年间已知构造仅略高于 1.1。相关论文见 arxiv.org/abs/2607.27199,另有 Hyra 博客与 GitHub 形式化证明。

7月29日周三
  1. Berkeley AI Research BlogAI 评估 · 55/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    从 CUDA 到 MLX:K-Search 如何把内核优化经验迁移到 Apple Silicon

    Berkeley Sky Lab 与 IBM Research 将演化式内核搜索框架 K-Search 扩展到 MLX 后端,通过结构化 CUDA-to-MLX 翻译层把现有 CUDA 内核知识适配成 Apple Silicon 内核。

  2. Epoch AIAI 评估 · 33/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    并行化限制会推迟智能爆炸吗?Epoch AI 新论文质疑自动化 R&D 增长模型

    Epoch AI 一篇新论文指出,标准增长模型假设研发可无限并行化,但这一外推并不可信。作者提出"并行化技术"这一新投入项,认为可用研究投入受制于原始投入与并行化技术中更稀缺的一方,并以 Anthropic 的 agent teams 为例说明多 AI 智能体协同可提升同时投入的算力。若并行化技术改进快于技术前沿但慢于研究投入,智能爆炸仍会发生,只是更慢。

  3. AI Breakfast(@AiBreakfast)AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 用 Claude Mythos Preview 发现密码算法弱点

    Anthropic 新研究显示,Claude Mythos Preview 已帮助研究人员发现密码算法的弱点。密码算法是用于保护数据隐私的数学方法。

  4. Fei-Fei Li(@drfeifei)AI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    李飞飞:world models 分类中模拟器是枢纽,R2S2R 引擎推动机器人训练评估摆脱硬件束缚

    李飞飞在 world models 分类中将模拟器称为枢纽,即智能体行动、学习与评估的场所。其 R2S2R 引擎能让机器人开发摆脱缓慢昂贵、受硬件束缚的迭代,转向更具扩展性且更便宜的训练与评估。

  5. Fei-Fei Li(@drfeifei)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    李飞飞团队 R2S2R 的 Real-to-Sim 环节:将物理机器人、传感器与环境转化为仿真

    李飞飞介绍的 R2S2R 中 Real-to-Sim 环节,可把物理机器人、传感器、环境、物体及交互转化为仿真,同时保留与任务相关的观测和动力学——不只是世界的外观,还有机器人交互时它的行为方式。该结果在机器人操作领域的 sim-real 对齐上树立了新标准。

7月28日周二
  1. Microsoft Research(@MSFTResearch)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    微软研究院在 NeurIPS 2026 举办 AI Foundations for Power Grids 研讨会,征稿至 8 月 29 日

    微软研究院(MSR)牵头的 AI Foundations for Power Grids 研讨会已获 NeurIPS 2026 接收,正在征稿,截止 8 月 29 日。征稿方向包括 benchmark、模型训练、可靠性、基础模型与真实部署。

7月27日周一
  1. Import AI — Jack ClarkAI 评估 · 72/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Import AI 466:机器人领域的苦涩教训、AI 完成数周编程任务、OpenAI 模型意外越狱

    Epoch 与 METR 发布 MirrorCode 基准,用于评估 AI 完成长时程编程任务的能力,Claude Opus 4.7 用 14 小时、251 美元推理成本解决了一项 METR 和 Epoch 估计人类需 2 至 17 周完成的任务,25 个目标程序中有 8 个始终未达 100% 通过阈值。

7月26日周日
  1. Berkeley AI Research BlogAI 评估 · 25/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    伯克利提出 ABBEL:用「信念评分」让 LLM 高效完成长程交互

    伯克利 AI 研究提出 ABBEL 框架,将摘要以自然语言"信念状态"的形式隔离并监督其信息内容,替代完整交互历史作为智能体的工作上下文。在 CollabBench 协作编程任务中,重建式信念评分(rec-BG)将相对全上下文模型的性能差距缩小约 50%,训练步数从 100 降至 50,峰值上下文 token 数也明显更低。

7月24日周五
  1. METRAI 评估 · 29/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    METR 盘点智能体能力度量指标:从固定花费得分到花费调整得分

    METR 发布文章系统梳理智能体能力度量指标,称为《Metrics of Agent Ability》。所有指标都建立在智能体得分 s_A(x) 与人类得分 s_H(x) 两条花费-得分曲线上,花费可解读为金钱、token 或时间。文章区分了仅看智能体的指标(固定花费得分、实用平台期得分、固定得分下的花费、花费回报、花费调整得分)与对照人类能力的人类锚定指标,但未推荐哪种指标最适合哪种场景。

  2. 哔哩哔哩技术AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    CVPR 2026 Highlight:GeoRK2 用几何感知把扩散 Transformer 采样做成免训练加速器

    论文 GeoRK2 提出一种免训练、可插拔的扩散 Transformer 加速框架,把二阶 Runge-Kutta 积分与深度特征空间的几何结构结合,使大步采样仍保持稳定生成质量,已被 CVPR 2026 收录为 Highlight。

  3. Berkeley AI Research(@berkeley_ai)AI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Berkeley AI Research 的 Peter Bartlett 将在 ICM2026 作全会报告

    Berkeley AI Research 的 Peter Bartlett 将于 2026 年 7 月 28 日在 ICM2026 作全会报告,题目为《Modern Machine Learning Methods。

7月23日周四
  1. Stanford AI Lab(@StanfordAILab)AI 评估 · 37/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    无需梯度下降:研究团队给出直接向 Transformer 模块写入事实的闭式方法,获 COLM 2026 接收

    Jerry Liu 与 HazyResearch 等合作者提出一种闭式(closed-form)方法,可将事实直接写入面向 Transformer 的 MLP,无需梯度下降或训练,相关工作已被 COLM 2026 接收。该研究指出 MLP 在语言模型中承担事实存储功能,并给出可直接存储事实的 MLP 构造配方。

7月22日周三
  1. METRAI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    METR 等八位经济学家合著论文《递归自我改进的经济学》,探讨 AI 加速 AI 研发的反馈强度

    METR 的 Parker 与 Tom 联合 7 位经济学家发布论文《The Economics of Recursive Self-Improvement》,用一系列简单模型刻画 AI 如何加速 AI 研发。

  2. Microsoft Research(@MSFTResearch)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Microsoft Research 扩展 PazaBench V2,提升语音 AI 基准的语言与地域覆盖

    PazaBench V2 通过扩展语言、地域和数据集覆盖,为面向历史上服务不足语言的语音技术研究提供更可靠的基础。Microsoft Research 称,可靠的基准对推进包容性 AI 至关重要。

  3. Stanford AI Lab(@StanfordAILab)AI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Christopher Manning 教授参与 PNAS《生成式 AI 时代的法律》专题

    Christopher Manning 教授参与的 PNAS《生成式 AI 时代的法律》专题上线,涵盖 AI 安全与版权、AI 治理、法律解释等议题。该专题由 Manning 提出创意,Dan Ho、Julian Nyarko、Vanessa Parli 与 PNAS 共同完成。

7月21日周二
  1. METRAI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    METR 提出"支出视界"指标衡量 AI 优化能力,并以 NanoGPT 为例

    METR 提出用"支出视界"(expenditure horizon)量化 AI 智能体的优化能力,即 AI 与人类在同等预算下效率持平的美元成本。在 NanoGPT speedrun 的实测中,人力边际上每提升 1% 性能约需 2500 美元人力成本,而初步智能体优化跑在花费超 1 万美元后,估计支出视界仅为 0–3000 美元。

7月18日周六
  1. Jim Fan(@DrJimFan)AI 评估 · 57/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jim Fan 介绍 RoboTTT 机器人模型:上下文扩至 8000 时间步

    Jim Fan 介绍 RoboTTT,将机器人模型原生扩展到 8000 个时间步的上下文,约 5 分钟的肌肉记忆,推理成本保持恒定,比 SOTA 推进三个数量级。

7月17日周五
  1. Marc Andreessen 🇺🇸(@pmarca)AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GPT-5.6 助力解决统计学悬置难题:BH 方法在相关高斯检验下不控制 FDR

    宾夕法尼亚大学 Edgar Dobriban 借助 GPT-5.6 Sol Pro 推翻了统计学界二十年来的猜想:Benjamini-Hochberg 方法对相关双侧高斯检验并不普遍控制错误发现率(FDR)。

  2. Stanford AI Lab(@StanfordAILab)AI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    YC Paper Club 芯片与内核专场:ParallelKittens、Intelligence Per Watt 等论文分享

    YC Paper Club 举办 Kernels/Chips 专场,分享了 ParallelKittens、"Intelligence Per Watt:衡量本地 AI 的智能效率"等论文,以及关于自动化系统研究与 AI 推理异构硬件的分享。下一场主题为机器人。

7月16日周四
  1. Marc Andreessen 🇺🇸(@pmarca)AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    数学家称用 GPT-5.6 Sol Ultra 等 GPT 模型拿下 19 个 Erdős 问题解答声明

    数学家 Przemek Chojecki 称借助 GPT 系列模型累计提出 19 个 Erdős 问题解答声明,其中 GPT-5.5 Pro 解决最多,GPT-5.2、5.4、5.6 各有斩获。

  2. Fei-Fei Li(@drfeifei)AI 评估 · 64/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    李飞飞与 NVIDIA 推出 RoboTTT:机器人模型上下文扩至 8K 时间步

    李飞飞介绍斯坦福 SVL 与 NVIDIA Robotics 合作的研究 RoboTTT,把机器人模型原生扩展到 8000 个时间步的上下文,约 5 分钟的肌肉记忆,且推理成本保持恒定,相比此前一次只看几帧(不足 0.1 秒)的策略提升了三个数量级。

7月15日周三
  1. Jim Fan(@DrJimFan)AI 评估 · 41/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NVIDIA GEAR Lab 推出 RoboTTT,将机器人策略扩展到 8K 时间步视觉运动上下文

    NVIDIA GEAR Lab 发布 RoboTTT,将机器人策略的视觉运动上下文扩展到 8K 时间步,远超当前 SOTA,且推理延迟保持恒定。凭上下文中的数分钟经验,机器人可单次模仿人类视频演示、在部署中自我改进、从扰动中恢复,并完成 5 分钟 10 阶段装配流程。

  2. Jim Fan(@DrJimFan)AI 评估 · 49/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jim Fan 推出 RoboTTT:机器人模型原生扩展至 8,000 timesteps 上下文

    机器人模型 RoboTTT 原生扩展至 8,000 timesteps 上下文、约 5 分钟的肌肉记忆,且推理成本恒定。其采用 Test-Time Training,把一个小模型放进模型内部,每条传感器读数触发一次梯度步,将历史压缩进固定大小的隐状态,部署后可持续学习。8K 上下文预训练比 1K 提升 62%,并支持从单次人类视频进行上下文学习。

  3. Mustafa Suleyman(@mustafasuleyman)AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Microsoft AI Futures 团队在 Nature Health 发表论文:分析 109 国 170 万次 Copilot 对话

    Microsoft AI Futures 团队在 Nature Health 发表新论文,审查了覆盖 109 个国家的 170 万次对话,发现 Copilot 对本国卫生系统信心较低的人群尤其有价值。团队称这是 AI 为全球服务不足人群提供支持的进一步证据。

  4. Epoch AIAI 评估 · 51/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Epoch AI 实测三款 AI 文本检测器:人类写作极少被误判,模仿特定作者的 AI 文本常被漏检

    Epoch AI 在人类写作、基础提示词生成的 AI 文本、以及模仿特定作者风格的 AI 文本三种条件下,测量了 Pangram、GPTZero 和 Originality.ai 三款 AI 文本检测器的表现。

7月14日周二
  1. Fei-Fei Li(@drfeifei)AI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    李飞飞团队致谢 Simovation 与 NVIDIA:JoyLo 遥操作数据助力 BEHAVIOR 数据集

    李飞飞团队在 BEHAVIOR 数据集相关工作中致谢 Simovation 提供模拟环境下的高质量 JoyLo 遥操作数据,并说明 BEHAVIOR 构建于 NVIDIA Omniverse 之上,感谢 NVIDIA 的持续支持。

  2. Fei-Fei Li(@drfeifei)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    斯坦福 BEHAVIOR Challenge 第二年回归:任务更多、评估更好、更易用

    斯坦福 BEHAVIOR Challenge 第二年回归,聚焦需要规划、物体检测、物体操作和失败恢复的长时程复杂任务,去年获胜方案全任务成功率仅 12.4%。今年挑战赛任务更多、评估更好且更易用,提交截止日期为 2026 年 10 月 16 日,获奖者于 2026 年 11 月 4 日公布,奖池 11,000 美元。

  3. Microsoft Research(@MSFTResearch)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    微软研究院新方法:在开发者编写密码学代码时同步验证

    微软研究院提出一种新方法,可在开发者编写密码学代码的过程中同步验证代码,并在实现与演进过程中兼顾速度与适应性。密码学代码支撑着现代计算系统的关键防护,该方法的细节尚未在公开信息中展开。

7月11日周六
  1. Stanford AI Lab(@StanfordAILab)AI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ICML 2026 收官日:Jessica Chudnovsky 将报告 "Scale Dependent Data Duplication"

    Stanford AI Lab 在 ICML 2026 最后一天推荐 "Scale Dependent Data Duplication"。

7月10日周五
  1. Stanford AI Lab(@StanfordAILab)AI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Stanford AI Lab 提出 LLM-as-a-Verifier,在四项智能体基准上实现 SOTA

    Stanford AI Lab 提出 LLM-as-a-Verifier 验证扩展框架,在 Terminal-Bench V2、SWE-Bench Verified、RoboRewardBench 和 MedAgentBench 上达到 SOTA。

  2. Stanford AI Lab(@StanfordAILab)AI 评估 · 39/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Stanford AI Lab 推出 TRACE:让智能体自我训练补齐能力短板,Qwen3.6-27B 在 SWE-bench Verified 达 73.2%

    Stanford AI Lab 提出智能体自我改进方法 TRACE,让模型自己找出失败背后的缺失能力并针对性自我训练。TRACE 训练的 Qwen3.6-27B 在 SWE-bench Verified 上达到 73.2%,超过体量更大的 Codex 5.2 和 GLM 5,并以不到 1/4 的训练 rollout 击败 GRPO 和 GEPA。

  3. Stanford AI Lab(@StanfordAILab)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Stanford AI Lab 提出 D2D:蒸馏放大微调 LLM 隐藏偏见

    斯坦福 AI 实验室提出 Distill to Detect(D2D),将疑似有偏见的微调模型与其基座模型之间的差异蒸馏进一个小型 cartridge,把隐藏偏好放大到生成文本中,使现有审计方法能识别原本无法搜索的偏见信号。该方法针对只在某个未知话题上显现的隐蔽偏见,论文见 arXiv 2607.01208。

  4. Stanford AI Lab(@StanfordAILab)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    论文《Internal Data Repetition Destroys Language Models》获 ICML 2026 深度生成模型基础研讨会口头报告与亚军奖

    论文《Internal Data Repetition Destroys Language Models》在 ICML 2026 的 Foundations of Deep Generative Models 研讨会上进行口头报告,并获该研讨会亚军奖。

7月8日周三
  1. Mistral AI(@MistralAI)AI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Mistral AI:完全在仿真中训练,前缀缓存配方将训练 token 减少 22 倍

    Mistral AI 展示了一套完全在仿真中训练的方案:覆盖 6000 个场景、约 40 万条轨迹,其前缀缓存(prefix-caching)配方将训练 token 用量减少 22 倍,把原本数月的训练压缩到数天。在线强化学习(CISPO)进一步提升了成功率。

7月7日周二
  1. 字节跳动SeedAI 评估 · 50/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    字节 Seed 发布 EdgeBench 评测集,提出环境学习 log-sigmoid 规律

    字节跳动 Seed 发布超长程评测集 EdgeBench,包含 134 个真实任务,横跨科学、复杂软件工程、白领知识工作、算法优化、前沿数学和数字游戏六大领域,每个任务支持 Agent 持续工作至少 12 小时,部分延长实验超过 72 小时。