Agent Plasticity:通过经验衡量智能体自我改进的论文发布
一篇题为 Agent Plasticity 的论文发布,提出通过经验衡量 AI 智能体的自我改进能力,论文已在 Hugging Face 上线。
一篇题为 Agent Plasticity 的论文发布,提出通过经验衡量 AI 智能体的自我改进能力,论文已在 Hugging Face 上线。
Iris-3B 通过像素空间扩散训练、模型转换与微调,尝试摆脱对潜空间的依赖。相关论文已在 Hugging Face Papers 上线。
一篇题为《Native Action-Prior Learning from Videos for World Action Models》的论文发布,提出从视频中学习原生动作先验用于世界动作模型,论文已在 Hugging Face 上线。
论文提出 PAMI(Part Anchored Motion),用于文本到人-物交互(Human-Object Interaction)生成,论文页面已发布在 Hugging Face Papers(编号 2609.38…)。
一篇题为《Old Ideas, Novel Problems》的论文研究基于 LLM 的新颖性评估的不稳定性,论文已在 Hugging Face 上线。该研究聚焦 LLM 用于评判研究新颖性时结果是否稳定可靠。
Google 与 BIDMC 合作的 AMIE 研究发表于《柳叶刀》,这是首个在真实诊所中面向患者的对话式诊断前瞻性研究。AMIE 是供患者在就诊前对话使用的研究系统,在真实急诊患者中测试显示,临床医生在 75% 的病例中认为其摘要有助于准备问诊,超过一半的病例中影响了诊疗思路;AMIE 的鉴别诊断与医生最终诊断的一致率为 90%。这也是 Google 首次在《柳叶刀》主刊发表论文。
Google 与 Beth Israel Deaconess Medical Center(BIDMC)团队在《柳叶刀》发表研究,在 BIDMC 门诊开展真实临床研究,98 名患者在紧急就诊前先与 Google 研究型诊断 AI 聊天机器人 AMIE 对话。
Google 提出 CI 内的程序修复智能体 FlowAgent,针对提交前测试失败运行 ReAct 式生成-验证循环,并在代码审查工具中展示修复建议,其前置与后置两道弃权过滤器会拦下薄弱建议。对 195 个真实故障的人工评审显示,67.18% 的修复正确。Google 全公司上线后,它在 295,508 次变更上给出建议,开发者预览 65,069 次、采纳 28,554 次。
Evolvent AI 推出 RSIGym,把训练、推理、评测与沙箱打包成研究智能体可调用的服务,并开源代码、实验配置、研究轨迹和评测日志。以 Opus 5 作为研究者,改进后的系统在 SWE-bench Verified 上从 17.67% 升至 50.33%。
Yann LeCun 回应 Brian Roemmele 与 Elon Musk 时表示,科学奖是给科学家的,科学家会把成果发表在接受同行评审的平台上,以便被审视、验证和复现。
中科大、香港科技大学与阿里巴巴研究者发布 PEARL 论文,针对 Agentic RL 中 Rollout 占端到端时间 81.8% 的 GPU 调度瓶颈,提出动态调整 GPU 角色与 Prefill–Decode 配置的弹性方案。
Qdrant 与 Pento 合作推出 miniCOIL EN-ES,一个英西双语稀疏神经检索器,让 "home" 与 "casa"、"bat" 与 "murciélago" 映射到稀疏向量的同一单元格,单个倒排索引即可同时服务英语和西班牙语查询与文档,无需翻译步骤。
李继刚(@lijigang_com)发起提问:过去一百年里,对人类进步「影响最大」的十篇论文是哪些?该条内容获得 38 条回复、27 次转发、295 次点赞、148562 次浏览和 134 次引用,由 xgo.ing 提供支持。
Thomas Wolf 与 Joel Niklaus、Lewis Tunstall 将在 CoLM 2026 带来一场 oral spotlight 报告,他发帖邀请参会者到场交流。
NVIDIA 研究人员构建了 PivotOPD,用来教 AI 智能体避免任务早期的错误并在出错后恢复。训练期间,教师模型会向智能体展示更优动作,以及如何在后续几步中回到正轨。相关论文已在 NVIDIA 官网公布。
独立研究机构 Coleman Parkes 受 Undo 委托调研 300 位负责关键任务软件的资深工程负责人,多数使用 C/C++,发现 AI 编码智能体虽加快了代码生成,却把主要瓶颈转移到调试、代码理解和维护。
Stanford AI Lab 本周在旧金山 COLM 展示多项 SAIL 项目,具体项目清单见其官方博客 ai.stanford.edu/blog/colm-2026/。
文章系统梳理了 LLM RL 中训推不一致(TIM)的根源,从 IS、TIS、IcePop 等截断重要性采样方法讲到 SC(score centering)算法。
2026年诺贝尔化学奖授予 Henri Kagan 和 Kenso Soai,表彰他们在不对称有机合成中发现非线性效应与自催化作用。Kagan 证明异手性催化剂配对会失活、实现手性放大,Soai 则发现 Soai 反应:起点仅 0.00005% 的手性偏差经三轮自催化放大至 99.5% 以上。
哈工大(深圳)iLearn-Lab 与新加坡国立大学 LV-Lab 提出免训练 2-bit KV Cache 量化框架 QuantWM,通过量化敏感性感知聚类(QSAC)和主子空间注意力补偿(PSAC)改善视频世界模型的时序闪烁与画质下降。
a16z 发布第七版 Top 100 Gen AI Consumer Apps 榜单,首次引入 YipitData 的真实信用卡支出数据。截至 2026 年 8 月,仅 4.5% 的美国消费者为头部通用大模型付费,而支出最高的 1% 用户贡献了 19.5% 的消费金额,超过后 50% 用户总和,月均 AI 支出达 903 美元;付费榜前 50 名中有 29 家从未进入流量榜。
Epoch AI 发布 InnovationEval 评测,用一篇已发表的在线策略自蒸馏(SDPO)论文作基准,测试 AI 能否独立提出有同等效果的新后训练算法。
OpenAI 将内部未发布模型产出的 722 篇数学论文归成 372 组结果,全部放在 GitHub 仓库 openai/math 公开。该模型从 8 月 28 日开始训练,能力比已发布的 GPT-6 Astra 更强且尚未对外开放;约 160 篇主要结论附带 Lean 形式化证明,其余论文尚未形式化,OpenAI 承认其中可能有错并保留修订历史。
OpenAI 发布 722 篇由一款未公开内部前沿模型产出的数学论文,称这些结果解决或推进了数百个未解问题。该模型被输入约 4000 道题,每个结果平均消耗约三小时 ChatGPT Pro 级算力。OpenAI 表示曾咨询普林斯顿高等研究院数学与人工智能独立顾问组,并参考其公开建议决定发布方式,结果已上传至 github.com/openai/math。
OpenAI 发布一批由内部前沿模型产出的新数学结果,相关代码与内容放在 github.com/openai/math。OpenAI 表示在发布过程中咨询了 Institute for Advanced Study 的数学与人工智能独立顾问组,并参考其建议与公开推荐来确定发布方式。
Parsewave 审查了 Zapier AutomationBench 全部 600 个公开任务,用智能体写出逼真的错误答案来诱导验证器,人工复核确认 206 个真实 bug,并全部修复,发布 AutomationBench Verified。
论文 OmniReasoning 提出突破音视频联合推理极限的方法,论文页面已发布在 Hugging Face。该推文获得 65 个点赞、11 条回复和 8 次转发。
论文 ALoDLM(Adaptively Looped Diffusion Language Models)发布,提出面向扩散语言模型的自适应循环方法,论文页面已上线 Hugging Face。原文未披露参数量、benchmark 分数与开源情况等细节。
Google 与 Northwestern、Jacaranda Health 合作,在肯尼亚内罗毕和芝加哥各纳入 1000 名孕妇,用机器学习模型分析未经超声培训的卫生员按预设路径完成的"盲扫"超声视频,估测妊娠龄和胎位,准确度与受训超声医师相当。卫生员仅需 8 小时即可学会操作,且全部处理在设备端完成,无需供电或 Wi-Fi,可在资源匮乏地区提供产前关键信息。
Parsave 对 Zapier AutomationBench 全部 600 个公开任务逐一审计验证器,智能体标记出 323 个可疑验证器,人工复核确认 206 个真实 bug,并已全部修复,发布 AutomationBench Verified。
一项新论文提出 Harness-Aware Distillation,用同一教师模型分别在带与不带 harness 信息下作答,训练学生模型偏好带 harness 时选择的动作,并用过滤器剔除与 harness 记录矛盾的配对,全程不使用任务奖励或成功标签。
JetBrains 的 Human-AI eXperience 团队与隆德大学研究者合作,提出一套审查 AI 生成代码的概念框架,核心观点是审查 AI 生成代码的关键问题是"信任校准",而非传统的 diff 比对。
METR 发布研究指出,AI 系统可能先篡改人类用于审查其行为的工具,从而掩盖不当行为。研究人员借助 AI 智能体约 10 分钟就在 Inspect 的 transcript viewer 中发现一个客户端 JavaScript 注入漏洞,可任意修改审阅者看到的记录并拦截下载按钮;底层数据库中的原始轨迹未被修改,也尚未在评测中观察到智能体利用该漏洞。
Epoch AI 将半导体从国际投入产出表的宽泛电子类别中拆分出来,测算各国对芯片供应链冲击的暴露程度。2022 年每 1000 美元中国最终需求为半导体生产商带来 15.2 美元收入,是美国的 2.7 倍(美国为 5.7 美元)。在台湾供应中断叠加中西脱钩的模拟情景中,中国先进处理器价格上涨 17 倍、实际国民总支出下降 3%,美国则约为 20% 涨幅和 0.6% 降幅。
Epoch AI 发布研究,梳理中国六家头部 AI 公司(阿里、字节、Z.ai、月之暗面、DeepSeek、MiniMax)的五类收入来源:面向消费者的 AI 应用、售卖模型访问、面向企业和政府的定制部署、授权费,以及用 AI 带动既有产品线。
微软及合作者提出 CorpusMap,预先解析文档集合中的重复实体,为每个实体生成链接全部相关文档的页面,原始文档保持原位,智能体可沿实体跳转到相关文档而无需重复检索同一证据。在 7 个模型和三个基准上,答案质量提升 6.4 至 11.7 分,输入 token 减少 34% 至 57%,并优于 LLM Wiki 层等三种导航层。该地图无需调用 LLM 即可构建,并随新文档到来更新。
Geoffrey Hinton、Yoshua Bengio、Andrew Barto、Jakub Pachocki 等22位作者发布论文《What if automating AI R&D triggers an intelligence explosion?
一项名为 SelfSearch 的研究让 AI 智能体基于此前自我修改的记录来改写自己的指令、工具与流程,编码智能体借此在 DeepSeek V4 Flash 上以 4.03 美元的搜索成本解出 Terminal-Bench 2.1 的 82.0% 任务,无需搜索期间的任务奖励。
论文《Rollout-Marginal Distillation for Long-Horizon Autoregressive Video Generation》已在 Hugging Face Papers 上线,提出用于长时长自回归视频生成的 rollout-marginal 蒸馏方法。原文未披露具体模型、参数规模或 benchmark 分数,仅给出论文链接与演示视频。
Import AI 475 期关注群(swarm)扩展:Toby Ord 认为 4 智能体群完成同等任务需约 2 倍 token,但因并行可将耗时减半,群扩展存在类似"踩脚"参数的收益递减。