字节 Seed 等团队发现 DeepSeek-V4 长文本检索的周期性盲区
字节跳动 Seed 团队联合普林斯顿大学、斯坦福大学和加州大学伯克利分校,系统测试 DeepSeek-V4 与 V4.1 后发表论文,揭示其分块 KV 缓存压缩带来的相位敏感性缺陷。
字节跳动 Seed 团队联合普林斯顿大学、斯坦福大学和加州大学伯克利分校,系统测试 DeepSeek-V4 与 V4.1 后发表论文,揭示其分块 KV 缓存压缩带来的相位敏感性缺陷。
哔哩哔哩 Index LLM 团队提出 HOMURA 强化学习框架,通过 KL 正则化目标与动态音节比例奖励,在音节级长度约束下优化翻译的语义保留与时间合规性,并构建了 Sand-Glass 基准测试。
OpenAI 于 10 月 7 日一次性公开 722 篇数学手稿,论文和部分 Lean 证明上传 GitHub,作者栏均署 OpenAI。其中编号 074 的两篇分别声称证明三维挂谷极大函数猜想和四维挂谷集的 Hausdorff 维数猜想,后者把此前卡在 3 点几的维数下界直接推到 4,两篇共 272 页,四维论文还引用了三维论文中的引理。
OpenAI 正式公开此前“解决开放数学问题”声明背后的完整论文,包含 722 篇数学手稿、覆盖 372 项重要结果。该目录来自对内部模型约 4,000 个研究问题的测试,经归类和筛选形成,几乎所有结果采用同一套标准流程。每项成果平均消耗相当于 ChatGPT Pro 思考 3 小时的算力。
OpenAI 发布了其开放问题主张背后的完整论文,包含 722 篇手稿,涵盖 372 类数学结果。该目录的构建方式是在测试阶段让内部模型处理约 4K 个研究问题,再对输出分组和筛选,得到 372 个重要结果族。这些结果几乎都来自同一标准设置,每项平均消耗相当于 3 小时 ChatGPT Pro 思考的算力。
OpenViking 团队围绕 Agent 的上下文管理发布三项研究:VikingMem(VLDB 收录)把记忆分为事件与实体两层并维护最新档案,在 LoCoMo 长期记忆评测上得 88.83。
State of AI 第九份年度报告正式发布,涵盖 AI 构建更好的 AI、世界模型、物理 AI、地缘政治、网络防御以及 12 个月预测等议题。报告可在 stateof.ai 阅读,作者 Nathan Benaich 另提供了主编剪辑版视频。
墨尔本大学与新南威尔士大学联合团队提出多会话语音记忆基准VoxMem,用「声学证据×记忆操作」二维分类覆盖15种考察组合,包含799道题、3,196个评测实例、34,743个语音会话(约177小时),每道题在8K到64K token历史长度下保持不变。
英伟达联合 MIT 和牛津大学提出 Physis-Lang,把物理原因、规律和结果写进语言描述,并贯穿数据筛选、训练与视频生成。其 Cosmos3-Super 和 Cosmos3-Nano 版本在 Physics-IQ Verified 榜单上分别以 48.2 和 43.3 分按平均分位列第一、第二,Super 较此前最高分提升 5.5 个百分点。
NVIDIA 发布论文 VERA,把基准轨迹转成 9000 多个可重启沙箱并附带 rubric 评分,只保留能运行且可依据可观察证据评分的环境。系统同时更新模型权重和 harness,harness 改动需通过自测并在开发集上至少提升 5 分才保留,模型 checkpoint 若得分下降超过 20% 则被拒绝。
Voice Arena 发布 Monsoon ASR 语料库七天内,已有 80 多家机构申请授权。在孟加拉语 FLEURS 上,用 Monsoon 微调 Whisper Medium 将词错率从 85.27% 降至 7.65%。Monsoon 覆盖 50 种语言共 10 万小时,多为长尾语言,计划 2 月扩展到 100 种语言、2027 年底达到 1000 种,并开放模型 API 供实验室自测。
美团 LongCat 团队开源 LoHoSearch,一个基于覆盖 762 万维基百科实体知识图谱自动生成题目的搜索智能体评测基准,含 544 道经人工核验题目、覆盖 11 个领域。
德州农工大学、Google DeepMind、CMU 等 15 家机构联合发布 TouchScale,一个在统一传感器与采集流程下构建的 500 小时人类双手视觉-触觉数据集。
美团履约技术团队与北京大学提出 GeoRA,一种为 RLVR 显式对齐更新几何的低秩适配方法,已被 ACL 2026 接收为杰出论文(全球 18 篇入选)。
美团在 MTGR 基础上提出统一推荐基座大模型 MTFM,首次实现外卖多个主要业务的统一精排模型,相关成果已被 KDD 2026 收录。MTFM 以异构 Tokenizer 与动态掩码实现多场景特征免对齐,通过混合注意力与 Target Scale-Up 提升 Scaling 能力,单样本计算量达 192 GFLOPs。美团外卖多业务订单量提升 2.06%~6.68%,在线推理成本降低 24%。
腾讯混元联合复旦、清华推出 ExplorationBench,用于衡量 AI 系统如何探索未知规则,包含 31 处隐藏规则改动、70 项任务的 AlienCode 与 24 条补丁推理规则、70 条定理的 AlienLogic 两个可验证沙盒。
论文发现,在整仓库迁移任务上,同一模型和相同 effort 设置下把 Codex 换成 HERMES harness 后,GPT-5.6 Sol 的成功率从 6.5% 升到 31.0%,收益来自 harness 本身。
一篇题为 Native Action-Prior Learning from Videos for World Action Models 的论文发布,提出从视频中直接学习动作先验,用于世界动作模型。论文页面可在 huggingface.co 查看。
论文提出 PAMI(Part Anchored Motion),用于文本到人-物交互(Human-Object Interaction)生成,论文页面已发布在 Hugging Face Papers(编号 2609.38…)。
Evolvent AI 推出 RSIGym,把训练、推理、评测与沙箱打包成研究智能体可调用的服务,并开源代码、实验配置、研究轨迹和评测日志。以 Opus 5 作为研究者,改进后的系统在 SWE-bench Verified 上从 17.67% 升至 50.33%。
中科大、香港科技大学与阿里巴巴研究者发布 PEARL 论文,针对 Agentic RL 中 Rollout 占端到端时间 81.8% 的 GPU 调度瓶颈,提出动态调整 GPU 角色与 Prefill–Decode 配置的弹性方案。
2026年诺贝尔化学奖授予 Henri Kagan 和 Kenso Soai,表彰他们在不对称有机合成中发现非线性效应与自催化作用。Kagan 证明异手性催化剂配对会失活、实现手性放大,Soai 则发现 Soai 反应:起点仅 0.00005% 的手性偏差经三轮自催化放大至 99.5% 以上。
Epoch AI 发布 InnovationEval 评测,用一篇已发表的在线策略自蒸馏(SDPO)论文作基准,测试 AI 能否独立提出有同等效果的新后训练算法。
OpenAI 发布 722 篇由一款未公开内部前沿模型产出的数学论文,称这些结果解决或推进了数百个未解问题。该模型被输入约 4000 道题,每个结果平均消耗约三小时 ChatGPT Pro 级算力。OpenAI 表示曾咨询普林斯顿高等研究院数学与人工智能独立顾问组,并参考其公开建议决定发布方式,结果已上传至 github.com/openai/math。
一项新论文提出 Harness-Aware Distillation,用同一教师模型分别在带与不带 harness 信息下作答,训练学生模型偏好带 harness 时选择的动作,并用过滤器剔除与 harness 记录矛盾的配对,全程不使用任务奖励或成功标签。
Epoch AI 将半导体从国际投入产出表的宽泛电子类别中拆分出来,测算各国对芯片供应链冲击的暴露程度。2022 年每 1000 美元中国最终需求为半导体生产商带来 15.2 美元收入,是美国的 2.7 倍(美国为 5.7 美元)。在台湾供应中断叠加中西脱钩的模拟情景中,中国先进处理器价格上涨 17 倍、实际国民总支出下降 3%,美国则约为 20% 涨幅和 0.6% 降幅。
Google DeepMind 发布开源嵌入模型 EmbeddingGemma 2,基于 Gemma 4,把文本、代码、图像、视频、音频映射到同一 768 维空间,文本路径为 270M 参数,支持 8K token 上下文,代码检索较初代提升 14%。
Geoffrey Hinton、Yoshua Bengio、Andrew Barto、Jakub Pachocki 等22位作者发布论文《What if automating AI R&D triggers an intelligence explosion?
Hugging Face 的 Clement Delangue 介绍,团队在不改动 harness 和训练代码的前提下,把 Claude Code、Codex。
一篇题为《Scaling Trajectories for Complex Tasks through Recursive Self-Rewrite》的论文已在 Hugging Face 上线,提出用递归自改写来扩展复杂任务的性能轨迹。论文页面已公开,具体方法与结果细节以原文为准。
UT Austin 对编码智能体中的上下文压缩做了一项研究,在 SWE-bench Verified 和 Terminal-Bench 上跑了近 35,000 次智能体运行,分别改变压缩方式、触发时机和压缩比例三个变量。
亚马逊与杜克大学研究发现,大模型后训练中每条 rollout 只保留一个 token 的梯度信号(占比约0.025%),学生模型推理能力反而显著提升。基于 Qwen3 的9组教师—学生配置及代码推理、Llama 系列、PPO-based RLVR 验证中均复现该现象,仅监督一到两个分歧最大的 token 即可匹配甚至超过全信号训练。极稀疏监督仅更新约10%网络参数,其机制仍待解释。
Stanford AI Lab 与 Joachim Baumann 发布 SWE-chat v2,包含来自真实开发者的 23 万条 prompt、覆盖 1.8 万次会话,已上线 HuggingFace。该数据集记录人类与 AI 编程智能体的真实交互,v2 在上一版基础上规模进一步扩大,团队将在 COLM 会议上介绍相关工作。
LMArena 研究指出人类偏好奖励对后训练图像模型必要但不充分,模型仍会奖励好看却丢细节或引入无关内容的输出,因此提出复合奖励:约 560 万对人工投票训练的 Bradley-Terry 奖励模型、由视觉语言模型评估自动生成提示词清单的忠实度奖励、约束奖励与反奖励黑客评分奖励。
Epoch AI 发布 ChatGPT 使用情况浏览器,基于 YouGov 提供的 5,000 名美国 ChatGPT 用户聊天元数据,覆盖约 830 万条消息、66 万次对话,部分记录可追溯至 2022 年 11 月 ChatGPT 上线后数周。
Google DeepMind 将 SynthID 引入生物学领域,推出蛋白质水印方法 SynthID Bio,让 AI 生成的蛋白质可以被水印标记。相关成果发表在 Nature 上,团队还实现了兼具功能性与水印的 AI 设计蛋白质的成功合成,并将 SynthID Bio 工具开源供研究社区使用。Demis Hassabis 称这是 AI 时代生物安全的关键一步。
一种手指与姿态感知的触觉压缩器将10路指尖数据流映射为2个手部级潜变量,同时保留89.4%的融合前接触召回率,使训练速度提升2.26倍、推理速度提升1.29倍。该工作面向十指触觉世界建模的规模化问题。
中国科学技术大学与新加坡国立大学团队提出 PALU(Prefix-Aware Localized Unlearning,前缀感知局部遗忘),从时序与词表两个维度做局部化约束:只干预敏感片段最前面的 N 个词元,且只对冻结参考模型选出的 Top-K logit 做局部熵最大化,并用 KL 散度约束非敏感词元分布。
微软研究院发布 Quine,一个面向生物学复杂性的多模态世界模型加交互式 harness,连接科学工具、文献、湿实验与研究人员。该系统与 Broad Institute 合作用于胰腺导管腺癌研究,预测并优先排序数千种化合物以改变肿瘤细胞状态,从缩小搜索空间到筛出候选仅用一个周末,排名最高的化合物在多种湿实验中获得验证。
NanoGPT 训练纪录被刷新至 39.9 秒,比此前的 67.6 秒缩短 27.7 秒。该方案不再优化 matmul 或增加算子,而是逐 flop 判断价值。