跳到正文

#推理

今日 3 条
今天10月10日周六
  1. AI前线AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    字节 Seed 等团队发现 DeepSeek-V4 长文本检索的周期性盲区

    字节跳动 Seed 团队联合普林斯顿大学、斯坦福大学和加州大学伯克利分校,系统测试 DeepSeek-V4 与 V4.1 后发表论文,揭示其分块 KV 缓存压缩带来的相位敏感性缺陷。

  2. 哔哩哔哩技术AI 评估 · 35/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    HOMURA:面向时间受限场景的 LLM 翻译强化学习优化,入选 EMNLP 2026 Oral

    哔哩哔哩 Index LLM 团队提出 HOMURA 强化学习框架,通过 KL 正则化目标与动态音节比例奖励,在音节级长度约束下优化翻译的语义保留与时间合规性,并构建了 Sand-Glass 基准测试。

  3. AI Will(@FinanceYF5)AI 评估 · 67/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 发布 722 篇内部模型完成的数学手稿

    OpenAI 一次性发布 722 篇由未公开内部模型完成的数学手稿,成果来自约 4,000 个研究问题,被归为 372 个相关结果家族。OpenAI 称标准流程中每项成果平均使用约 3 小时的 ChatGPT Pro 思考算力。本次发布包含论文、证明材料和部分推理摘要,但模型本身仍未公开。

10月9日周五
  1. AI科技评论AI 评估 · 53/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    星动纪元 VPP2 登顶 RoboDojo,14B 参数无额外数据开源可复现

    星动纪元(清华唯一持股的具身公司)推出世界动作模型 VPP2(Video Prediction Policy 2),以平均成功率 32.26%、平均得分 39.26 登顶 RoboDojo 榜首,超过此前 GPT-6-Astra 的 22.48% 和 28.97%,并拿下 generalization、precision、memory 三项第一。

  2. DatawhaleAI 评估 · 71/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI公布722份由前沿模型产出的数学手稿

    OpenAI公布了一批由内部前沿模型产出的数学研究成果,包括722份数学手稿和372组相关成果,覆盖数论、代数几何、实分析、组合数学、理论计算机、数学物理、偏微分方程等多个方向。部分成果附有可由计算机核验的Lean形式化证明,社区初步核查发现其中涉及多个长期未解的开放问题,但具体结论仍需数学界进一步审阅与验证。OpenAI表示,AI正在从辅助解题走向参与真正的数学研究与发现。

  3. 量子位AI 评估 · 70/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    字节Seed发现DeepSeek时强时弱的原因:分块KV Cache压缩带来相位敏感性

    字节Seed团队发现,DeepSeek-V4系列在长上下文检索中的表现会随信息位置按固定周期波动,波动周期与模型采用的KV Cache压缩步长一致。

  4. 美团技术团队AI 评估 · 33/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    KDD'26 美团学术论文精选及 KDD Cup'26 DataAgents 赛道冠军思路解读

    美团技术团队在 KDD 2026 分享 8 篇收录论文,覆盖推荐大模型 MTFM、奖励建模框架 CDRRM、智能体搜索基准 LocalSearchBench、ETA 元泛化框架 UME 及生成式推荐训练系统 MTGenRec 等方向。大众点评技术部还在 2026 KDD Cup 复杂数据分析 Data Agents 赛道夺得冠军与季军,相关代码已在 GitHub 开源。

10月7日周三
  1. 机器之心AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    哈工大(深圳)与 NUS 提出 QuantWM:免训练 2-bit KV Cache 量化,视频世界模型压缩最高 6.20 倍

    哈工大(深圳)iLearn-Lab 与新加坡国立大学 LV-Lab 提出免训练 2-bit KV Cache 量化框架 QuantWM,通过量化敏感性感知聚类(QSAC)和主子空间注意力补偿(PSAC)改善视频世界模型的时序闪烁与画质下降。

  2. Greg Brockman(@gdb)AI 评估 · 57/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 发布内部前沿模型产出的数学结果

    OpenAI 发布了一批由其内部前沿模型产出的数学结果,并在 GitHub 上公开(github.com/openai/math)。发布前 OpenAI 咨询了普林斯顿高等研究院数学与人工智能独立咨询组的意见,并参考其建议与公开推荐来确定发布方式。Greg Brockman 表示这是朝着加速科学发现、改善所有人生活质量的方向。

  3. The Rundown AI(@TheRundownAI)AI 评估 · 69/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 用未公开内部模型发布 722 篇数学论文

    OpenAI 发布 722 篇由一款未公开内部前沿模型产出的数学论文,称这些结果解决或推进了数百个未解问题。该模型被输入约 4000 道题,每个结果平均消耗约三小时 ChatGPT Pro 级算力。OpenAI 表示曾咨询普林斯顿高等研究院数学与人工智能独立顾问组,并参考其公开建议决定发布方式,结果已上传至 github.com/openai/math。

10月3日周六
  1. 机器之心AI 评估 · 46/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    亚马逊与杜克大学研究:万分之一稀疏监督即可提升大模型推理能力

    亚马逊与杜克大学研究发现,大模型后训练中每条 rollout 只保留一个 token 的梯度信号(占比约0.025%),学生模型推理能力反而显著提升。基于 Qwen3 的9组教师—学生配置及代码推理、Llama 系列、PPO-based RLVR 验证中均复现该现象,仅监督一到两个分歧最大的 token 即可匹配甚至超过全信号训练。极稀疏监督仅更新约10%网络参数,其机制仍待解释。

  2. Harrison Chase(@hwchase17)AI 评估 · 52/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Harrison Chase 点评 Google 多智能体证明发现论文的验证者独立上下文模式

    Harrison Chase 点评一篇 Google Research 的多智能体证明发现论文,认为验证者从干净上下文起步的模式值得借鉴,探索者的推理无法说服验证者接受错误证明,探索者因此可以大胆尝试,由验证者筛掉错误方向,DeepAgents 子智能体拥有独立上下文也是同一道理。

9月30日周三
  1. Hunyuan(@TXhunyuan)AI 评估 · 51/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    腾讯混元联合复旦、清华发布 ExplorationBench 探索能力基准

    腾讯混元、复旦大学和清华大学的研究者发布 ExplorationBench,用于衡量 AI 系统的探索能力,并构建了规则可执行、与已知知识冲突的 Alien Worlds 环境。

9月28日周一
  1. Yangyi(@Yangyixxxx)AI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    要求 Qwen 诚实作答并压低 "wait / maybe / perhaps" 概率,测试集准确率反而提升

    有网友在 Qwen 上跑测试集发现,要求模型诚实作答、对自己说出的话负责,并在实验中压低 "wait / maybe / perhaps" 这几个词的概率后,Qwen 的准确率反而提高了。该实验由 Reddit 网友完成,相关帖子获得 2 条评论、2 次转发、7 个赞和 4109 次浏览。

9月26日周六
  1. Thomas Wolf(@Thom_Wolf)AI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LLM 被教会在无人类引导下自主发现有趣数学定理

    Niket Patel 展示了一种教 LLM 自主发现有趣定理的方法,提出可量化的"有趣度"指标,使发现结果的有趣度提升 4.3×,并形成自我扩展的发现循环。研究者指出,LLM 已能证明困扰数学家数十年的结果,而无需人类引导地找到有趣定理正成为新的瓶颈。

  2. Kevin Weil 🇺🇸(@kevinweil)AI 评估 · 64/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude 完成 N=4 超对称杨-米尔斯九圈计算,打破八圈纪录

    Anthropic 科学博客称 Claude 在平面 N=4 超对称杨-米尔斯模型中完成了九圈散射振幅计算,此前纪录是 SLAC 的 Lance Dixon 及合作者保持的八圈。

  3. Anthropic(@AnthropicAI)AI 评估 · 50/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 科学博客:Claude 完成九圈散射振幅计算

    Anthropic 科学博客发布消息称,Claude 在 Claude Science 中接收一个描述九圈问题的提示词后,基本无监督运行数天,用 Dixon 及同事发展的方法解决了九圈散射振幅计算,总成本为几千美元。

9月24日周四
  1. Microsoft Research BlogAI 评估 · 49/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    微软研究:把物理 AI 推理卸载到边缘或云端,可提升机器人成功率与续航

    微软研究发现,将物理 AI 推理从机器人板载 GPU 卸载到边缘或云端 GPU,可显著提升移动操作任务的成功率、响应速度与电池续航。测试显示,较轻 GPU 下建图与规划最多变慢 383%,导航障碍及时检测下降 30%,VLA 模型准确率下降 50%;用树莓派 5 替代板载 GPU 后,Jetson Thor 一类板载 GPU 曾使续航最多减少 160%。

9月23日周三
  1. 字节跳动技术团队AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    TWIST 入选 ACM CCS 2026:面向云上大模型服务的隐私保护新方案

    字节跳动安全研究团队与香港城市大学联合研究的 TWIST 被 ACM CCS 2026 接收,该方案用密钥将输入 Token 与模型权重映射到同一变换空间,使云端可沿用标准推理流程处理混淆态数据。

  2. Epoch AIAI 评估 · 59/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Epoch AI 发布宜家组装基准 FAB:GPT-6 Astra 得分 80%

    Epoch AI 发布家具组装基准 FAB,用 60 张宜家家具组装照片(含故意设置的错误)测试模型能否识别装配错误并获得装配手册与查看工具。

9月22日周二
  1. DeepLearning.AI(@DeepLearningAI)AI 评估 · 44/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    10,000 个 AI 智能体用 88 小时在 Lean 中攻关 Navier-Stokes 方程,引发的争议给 AI 开发者上了重要一课

    10,000 个 AI 智能体耗时 88 小时在 Lean 中形式化 Navier-Stokes 方程相关证明,由此引发的争议给 AI 开发者带来关键启示。智能体已能大规模形式化复杂数学证明,但人类评估对解释证明为何成立仍不可替代。企业数据隐私与零数据保留设置也属必需。

  2. METRAI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    METR 发布 Claude Opus 5.5 部署前评估摘要

    METR 发布对 Claude Opus 5.5 的部署前评估摘要,认为该模型对 AI 研发的加速略高于 Fable 5.1,但不太可能完全自动化 AI 研发。

9月18日周五
  1. SemiAnalysisAI 评估 · 50/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    SemiAnalysis 解读 Engram 嵌入:面向高效 DRAM/SSD 卸载的软硬件协同设计

    SemiAnalysis 分析了 DeepSeek 式 Engram 多 token 查表嵌入的协同设计思路:每个 token 只访问地址依赖 token ID 的少量嵌入行,运行时可在前层计算时从 host DRAM 预取,使嵌入表无需常驻 HBM。

9月14日周一
  1. AK(@_akhaliq)AI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    SAS:通过上下文排序端到端优化实现简单注意力稀疏化

    SAS 提出一种通过上下文排序端到端优化实现的简单注意力稀疏化方法,论文已在 Hugging Face 上线(huggingface.co/papers/2609.13…)。该方法以排序优化驱动注意力稀疏化,具体参数与评测结果暂未披露。

9月9日周三
  1. AK(@_akhaliq)AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    通过离散扩散实现 LLM 无损加速的新论文

    一篇题为《Unlocking Lossless Speedups in LLMs via Discrete Diffusion》的论文发布,提出用离散扩散为 LLM 带来无损加速,论文已在 Hugging Face Papers 上线。该工作聚焦大语言模型的推理提速,具体方法细节与实验数据见原文。

9月8日周二
  1. Epoch AIAI 评估 · 64/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Epoch AI 实测 GPT 与 Claude 长上下文延迟扩展差异

    Epoch AI 测量了 GPT-5.6 Terra、GPT-5.6 Sol 与 Claude Sonnet 5、Opus 5 在关闭推理时首 token 延迟(TTFT)随上下文长度的变化,发现 GPT-5.6 存在明显二次曲率,而 Claude 两款模型接近线性扩展。

9月1日周二
  1. Epoch AIAI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Epoch AI:推理模型问世以来,ECI 前沿能力每年提升 14 分

    Epoch AI 数据显示,自推理模型出现以来,其 ECI(AI 能力指数)前沿水平以每年 14 分的速度提升。该机构此前在报告《Have AI capabilities accelerated?》中指出,ECI 等 AI 能力指标在推理模型出现后发生了趋势断点。相关趋势线、90% 预测区间及 bootstrap 样本数据已于 9 月 1 日更新。

  2. Epoch AIAI 评估 · 71/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Epoch AI 发布 FrontierMath Erdős 基准

    Epoch AI 发布 FrontierMath Erdős 基准,由 Thomas Bloom 从 erdosproblems.com 未解问题中挑选 68 道兼具数学意义与难度的问题,其中 50 道已由 Google Formal Conjectures 项目完成 Lean 形式化。

8月27日周四
  1. Stanford AI Lab(@StanfordAILab)AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Muennighoff 等提出 Prefix Sliding:用前缀滑窗提升长推理效率

    Niklas Muennighoff 等人提出 Prefix Sliding,一种面向高效测试时扩展的简单快速方法,让 LLM 在长推理轨迹中“遗忘”部分前缀。该方法针对原生全注意力在长任务上 OOM、而压缩又会丢失关键细节的问题,效果可同时超过两者。

8月24日周一
  1. SemiAnalysisAI 评估 · 46/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    SemiAnalysis 开源 AgentX 1.0:百万上下文多轮智能体编码推理基准,CUDA 护城河在智能体推理下还成立吗?

    SemiAnalysis 发布 AgentX 1.0,称其为全球首个完全开源、100 万上下文的多轮智能体编码推理基准,Apache 2.0 许可,数据集与全栈工具投入超 300 万美元。

8月20日周四
  1. Stanford AI Lab(@StanfordAILab)AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    嵌入模型的困境:LLM 已超越嵌入模型,但成本更高,何时该用哪个?

    Niklas Muennighoff 等人在新工作"embedder's dilemma"中发现,LLM 在嵌入任务上已超过专用嵌入模型,但成本高得多。该研究探讨了在什么场景下应选择嵌入模型、什么场景下应选择 LLM。论文见 arxiv.org/abs/2608.12875。

8月17日周一
  1. Import AI — Jack ClarkAI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Import AI 469:DiG-bench 评测科学 AI、RSI 模拟器与扎克伯格的技术悲观主义

    Import AI 第 469 期介绍新基准 DiG-bench,用 70 款隐藏规则的文字游戏测试 AI 自主发现环境规律的能力,Claude Opus 5 与 Fable 5 配合 Claude Code 表现最佳,GPT-5.5 紧随其后,但仅 Opus 5 和 Fable 5 能在最难的第 7 档取得 0.2 的成绩。

8月13日周四
  1. Microsoft Research(@MSFTResearch)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    MindTopo 新基准发布:测试 AI 对拓扑关系的理解

    Microsoft Research 推出 MindTopo 基准,用于测试 AI 对路径、栅栏、绳结等拓扑关系的理解能力。该基准揭示 AI 在空间推理与规划方面仍有提升空间,并指出新的改进机会。

  2. Microsoft Research BlogAI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    MindTopo 揭示多模态大模型的空间推理能力短板

    Microsoft Research 推出 MindTopo 基准,用于评测多模态大模型在连通、包围、顺序、分离与打结五类拓扑关系上的推理与规划能力。测试显示,当前模型在静态识别上表现明显优于交互式规划任务,且两者均远低于人类水平,失败多发生在规划阶段而非感知阶段。图像与视频生成仅在前者能维持单帧可见关系时有所帮助,视频推演常改变拓扑或违反任务物理约束。

7月30日周四
  1. Hunyuan(@TXhunyuan)AI 评估 · 51/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    腾讯混元用 Hyra 智能体与 Hy3 模型解决 50 年数学难题

    腾讯混元称,借助研究智能体 Hyra 与 Hy3 模型,针对有限整数集 A 中 |A+A| 相对 |A-A| 的增长速度问题给出了显式构造,证明最优指数恰为 2。该问题上界自 1969 年定理给出为 2,50 多年间已知构造仅略高于 1.1。相关论文见 arxiv.org/abs/2607.27199,另有 Hyra 博客与 GitHub 形式化证明。

7月29日周三
  1. Epoch AIAI 评估 · 33/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    并行化限制会推迟智能爆炸吗?Epoch AI 新论文质疑自动化 R&D 增长模型

    Epoch AI 一篇新论文指出,标准增长模型假设研发可无限并行化,但这一外推并不可信。作者提出"并行化技术"这一新投入项,认为可用研究投入受制于原始投入与并行化技术中更稀缺的一方,并以 Anthropic 的 agent teams 为例说明多 AI 智能体协同可提升同时投入的算力。若并行化技术改进快于技术前沿但慢于研究投入,智能爆炸仍会发生,只是更慢。

7月26日周日
  1. Berkeley AI Research BlogAI 评估 · 25/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    伯克利提出 ABBEL:用「信念评分」让 LLM 高效完成长程交互

    伯克利 AI 研究提出 ABBEL 框架,将摘要以自然语言"信念状态"的形式隔离并监督其信息内容,替代完整交互历史作为智能体的工作上下文。在 CollabBench 协作编程任务中,重建式信念评分(rec-BG)将相对全上下文模型的性能差距缩小约 50%,训练步数从 100 降至 50,峰值上下文 token 数也明显更低。

7月24日周五
  1. METRAI 评估 · 29/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    METR 盘点智能体能力度量指标:从固定花费得分到花费调整得分

    METR 发布文章系统梳理智能体能力度量指标,称为《Metrics of Agent Ability》。所有指标都建立在智能体得分 s_A(x) 与人类得分 s_H(x) 两条花费-得分曲线上,花费可解读为金钱、token 或时间。文章区分了仅看智能体的指标(固定花费得分、实用平台期得分、固定得分下的花费、花费回报、花费调整得分)与对照人类能力的人类锚定指标,但未推荐哪种指标最适合哪种场景。

7月17日周五
  1. Marc Andreessen 🇺🇸(@pmarca)AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GPT-5.6 助力解决统计学悬置难题:BH 方法在相关高斯检验下不控制 FDR

    宾夕法尼亚大学 Edgar Dobriban 借助 GPT-5.6 Sol Pro 推翻了统计学界二十年来的猜想:Benjamini-Hochberg 方法对相关双侧高斯检验并不普遍控制错误发现率(FDR)。

  2. Stanford AI Lab(@StanfordAILab)AI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    YC Paper Club 芯片与内核专场:ParallelKittens、Intelligence Per Watt 等论文分享

    YC Paper Club 举办 Kernels/Chips 专场,分享了 ParallelKittens、"Intelligence Per Watt:衡量本地 AI 的智能效率"等论文,以及关于自动化系统研究与 AI 推理异构硬件的分享。下一场主题为机器人。