字节 Seed 等团队发现 DeepSeek-V4 长文本检索的周期性盲区
字节跳动 Seed 团队联合普林斯顿大学、斯坦福大学和加州大学伯克利分校,系统测试 DeepSeek-V4 与 V4.1 后发表论文,揭示其分块 KV 缓存压缩带来的相位敏感性缺陷。
字节跳动 Seed 团队联合普林斯顿大学、斯坦福大学和加州大学伯克利分校,系统测试 DeepSeek-V4 与 V4.1 后发表论文,揭示其分块 KV 缓存压缩带来的相位敏感性缺陷。
OpenAgents 联合哥伦比亚大学、宾夕法尼亚大学等高校构建多智能体协作评测基准 AgentWorld,让 3 至 20 个智能体在 MMORPG 沙盒中分工完成 100 个人工设计任务及 100 个增强变体。
OpenAI 于 10 月 6 日在 GitHub 公开首批 722 篇数学手稿,其中一篇 175 页瞄准四维挂谷猜想的集合版,另一篇 97 页针对更强的三维极大函数猜想。两篇论证均依赖 Guth、王虹与 Zahl 的集合估计等已有结果,若成立可将四维满维结论从特殊情形推进到一般情形,但更强的四维极大函数版及五维以上问题仍未解决,且两篇手稿还需独立检验。
哔哩哔哩 Index LLM 团队提出 HOMURA 强化学习框架,通过 KL 正则化目标与动态音节比例奖励,在音节级长度约束下优化翻译的语义保留与时间合规性,并构建了 Sand-Glass 基准测试。
研究者构建了多智能体协作评测基准 AgentWorld,让 LLM 驱动的智能体在 MMORPG 沙盒中分工完成制作、采集、战斗等长时程任务。
OpenAI 于 10 月 7 日一次性公开 722 篇数学手稿,论文和部分 Lean 证明上传 GitHub,作者栏均署 OpenAI。其中编号 074 的两篇分别声称证明三维挂谷极大函数猜想和四维挂谷集的 Hausdorff 维数猜想,后者把此前卡在 3 点几的维数下界直接推到 4,两篇共 272 页,四维论文还引用了三维论文中的引理。
OpenAI 一次性发布 722 篇由未公开内部模型完成的数学手稿,成果来自约 4,000 个研究问题,被归为 372 个相关结果家族。OpenAI 称标准流程中每项成果平均使用约 3 小时的 ChatGPT Pro 思考算力。本次发布包含论文、证明材料和部分推理摘要,但模型本身仍未公开。
OpenAI 发布了一款未公开内部模型生成的 722 篇数学手稿,按 372 个相关结果族归类,来自约 4000 道研究问题的评测。OpenAI 称标准流程每条结果平均消耗约三小时 ChatGPT Pro 的思考算力,此次发布包含论文、证明产物和部分推理摘要,模型本身仍未发布。
OpenAI 正式公开此前“解决开放数学问题”声明背后的完整论文,包含 722 篇数学手稿、覆盖 372 项重要结果。该目录来自对内部模型约 4,000 个研究问题的测试,经归类和筛选形成,几乎所有结果采用同一套标准流程。每项成果平均消耗相当于 ChatGPT Pro 思考 3 小时的算力。
OpenAI 发布了其开放问题主张背后的完整论文,包含 722 篇手稿,涵盖 372 类数学结果。该目录的构建方式是在测试阶段让内部模型处理约 4K 个研究问题,再对输出分组和筛选,得到 372 个重要结果族。这些结果几乎都来自同一标准设置,每项平均消耗相当于 3 小时 ChatGPT Pro 思考的算力。
Meta Superintelligence Labs 提出用 "agent plasticity" 衡量智能体自我改进的性价比,即在模型权重冻结、每次运行使用全新上下文的条件下,衡量花费每美元学习成本在留出任务上取得的收益。
《State of AI Report 2026》10 月 8 日发布,第九期由 Air Street Capital 的 Nathan Benaich 牵头,正文 240 多页,分研究、产业、政治、安全、预测五部分。
约翰斯·霍普金斯大学天体物理学家、Anthropic 研究员 Brice Ménard 使用 Claude Science 做出首张完整全天紫外地图,其中约三分之一天空从未被紫外望远镜观测过,由 Claude 预测补齐,并为每个像素标注实测或预测及误差估计。
OpenViking 团队围绕 Agent 的上下文管理发布三项研究:VikingMem(VLDB 收录)把记忆分为事件与实体两层并维护最新档案,在 LoCoMo 长期记忆评测上得 88.83。
第 9 份年度《State of AI》报告发布,内容涵盖 AI 如何构建更强的 AI、世界模型、Physical AI、地缘政治、网络防御,以及对未来 12 个月的预测。报告列出了今年最重要的发现,并附带视频与原文链接。
State of AI 第九份年度报告正式发布,涵盖 AI 构建更好的 AI、世界模型、物理 AI、地缘政治、网络防御以及 12 个月预测等议题。报告可在 stateof.ai 阅读,作者 Nathan Benaich 另提供了主编剪辑版视频。
斯坦福大学李飞飞、吴佳俊、Ehsan Adeli 等人发布论文,提出开放的世界动作建模框架 OpenWAM,相关代码、评测与预训练视频模型权重已开源。框架从阿里开源的 Wan2.2-5B 出发,在约 334 万条人机交互视频上继续预训练,用 MoT 架构把 5B 视频专家与 2B 动作专家拼在一起,并定义 VTA、ATV、Joint、Decoupled 四种交互程序。
OpenAI公布了一批由内部前沿模型产出的数学研究成果,包括722份数学手稿和372组相关成果,覆盖数论、代数几何、实分析、组合数学、理论计算机、数学物理、偏微分方程等多个方向。部分成果附有可由计算机核验的Lean形式化证明,社区初步核查发现其中涉及多个长期未解的开放问题,但具体结论仍需数学界进一步审阅与验证。OpenAI表示,AI正在从辅助解题走向参与真正的数学研究与发现。
谷歌联合 20 多家研究机构、32 位作者发布 154 页综述,系统梳理大模型的分词(Token)机制,指出模型数不清 strawberry 里有几个 r、多位数算术出错,病根在文本进入模型前的分词环节。
墨尔本大学与新南威尔士大学联合团队提出多会话语音记忆基准VoxMem,用「声学证据×记忆操作」二维分类覆盖15种考察组合,包含799道题、3,196个评测实例、34,743个语音会话(约177小时),每道题在8K到64K token历史长度下保持不变。
Contra Labs 发布《Creative Intelligence Report 2026》,问卷覆盖 15 万名以上在职创意专业人士,数据依托 200 万以上创作者,显示超过 70% 的创意人每天都在用 AI,善用 AI 者承接项目客单价平均增长 40% 以上。
英伟达联合 MIT 和牛津大学提出 Physis-Lang,把物理原因、规律和结果写进语言描述,并贯穿数据筛选、训练与视频生成。其 Cosmos3-Super 和 Cosmos3-Nano 版本在 Physics-IQ Verified 榜单上分别以 48.2 和 43.3 分按平均分位列第一、第二,Super 较此前最高分提升 5.5 个百分点。
MirroS 团队发布 AgentGarten,将可执行代码环境与实时神经渲染器连接,物理规则由代码裁决、光影由模型生成,以超过 30 fps 的吞吐让智能体持续与虚拟世界交互。
字节Seed团队发现,DeepSeek-V4系列在长上下文检索中的表现会随信息位置按固定周期波动,波动周期与模型采用的KV Cache压缩步长一致。
LIFT 提出一种 Layout-In-Future 视频生成方法,在大视角变化条件下通过 On-Policy 自蒸馏实现生成,论文已发布在 Hugging Face Papers。
NVIDIA 发布论文 VERA,把基准轨迹转成 9000 多个可重启沙箱并附带 rubric 评分,只保留能运行且可依据可观察证据评分的环境。系统同时更新模型权重和 harness,harness 改动需通过自测并在开发集上至少提升 5 分才保留,模型 checkpoint 若得分下降超过 20% 则被拒绝。
NVIDIA 一篇被 NeurIPS 2026 接收的论文发现,给多模态模型接入工具后,其拒绝有害请求的失败率相对上升最高达 68.7%,平均上升 17.7%。
递归自我改进(RSI)是当前 AI 最热门的议题之一,且仍处于非常早期阶段。有人整理了一份 RSI 论文合集与阅读清单,用于了解该方向的历史与最新技术,链接为 academy.dair.ai/papers/collect。
DAIR.AI 发布 MCP 工具,将其 AI 论文索引接入 Codex、Claude、Grok Bot,用于发现和梳理热门论文。该索引收录了 elvis 近两年在 X 上推荐的论文,支持查找与总结论文、生成文献综述、可视化论文等功能。官方称未来几周还将发布多个配套 benchmark。
Voice Arena 发布 Monsoon ASR 语料库七天内,已有 80 多家机构申请授权。在孟加拉语 FLEURS 上,用 Monsoon 微调 Whisper Medium 将词错率从 85.27% 降至 7.65%。Monsoon 覆盖 50 种语言共 10 万小时,多为长尾语言,计划 2 月扩展到 100 种语言、2027 年底达到 1000 种,并开放模型 API 供实验室自测。
美团 LongCat 团队构建 MineExplorer,首个在开放世界中做到分钟级长程任务的评测基准,包含 813 个人工验证实例(1-hop 到 4-hop),每个任务实例运行 1800 个环境步、对应 3 分钟连续交互。
美团 LongCat 团队开源 LoHoSearch,一个基于覆盖 762 万维基百科实体知识图谱自动生成题目的搜索智能体评测基准,含 544 道经人工核验题目、覆盖 11 个领域。
美团技术团队在 KDD 2026 分享 8 篇收录论文,覆盖推荐大模型 MTFM、奖励建模框架 CDRRM、智能体搜索基准 LocalSearchBench、ETA 元泛化框架 UME 及生成式推荐训练系统 MTGenRec 等方向。大众点评技术部还在 2026 KDD Cup 复杂数据分析 Data Agents 赛道夺得冠军与季军,相关代码已在 GitHub 开源。
LMArena 发布技术报告,并开放 Alignment Index 完整排名查看。原文未披露具体模型、参数量或评测分数等细节,仅给出博客报告与排名页面链接。
Google 与贝斯以色列女执事医疗中心(BIDMC)研究人员主导的一项研究发表于《柳叶刀》主刊,这是 Google 研究成果首次登上该刊。
德州农工大学、Google DeepMind、CMU 等 15 家机构联合发布 TouchScale,一个在统一传感器与采集流程下构建的 500 小时人类双手视觉-触觉数据集。
美团履约技术团队与北京大学提出 GeoRA,一种为 RLVR 显式对齐更新几何的低秩适配方法,已被 ACL 2026 接收为杰出论文(全球 18 篇入选)。
美团在 MTGR 基础上提出统一推荐基座大模型 MTFM,首次实现外卖多个主要业务的统一精排模型,相关成果已被 KDD 2026 收录。MTFM 以异构 Tokenizer 与动态掩码实现多场景特征免对齐,通过混合注意力与 Target Scale-Up 提升 Scaling 能力,单样本计算量达 192 GFLOPs。美团外卖多业务订单量提升 2.06%~6.68%,在线推理成本降低 24%。
腾讯混元联合复旦、清华推出 ExplorationBench,用于衡量 AI 系统如何探索未知规则,包含 31 处隐藏规则改动、70 项任务的 AlienCode 与 24 条补丁推理规则、70 条定理的 AlienLogic 两个可验证沙盒。
在整仓库迁移任务上,同一模型和相同 effort 设置下,把 Codex 换成 HERMES harness 后 GPT-5.6 Sol 的成绩从 6.5% 提升到 31.0%,增益来自 harness 本身。