OpenAI 公开 722 篇数学手稿,声称证明三维挂谷极大函数与四维挂谷猜想
OpenAI 于 10 月 7 日一次性公开 722 篇数学手稿,论文和部分 Lean 证明上传 GitHub,作者栏均署 OpenAI。其中编号 074 的两篇分别声称证明三维挂谷极大函数猜想和四维挂谷集的 Hausdorff 维数猜想,后者把此前卡在 3 点几的维数下界直接推到 4,两篇共 272 页,四维论文还引用了三维论文中的引理。
OpenAI 于 10 月 7 日一次性公开 722 篇数学手稿,论文和部分 Lean 证明上传 GitHub,作者栏均署 OpenAI。其中编号 074 的两篇分别声称证明三维挂谷极大函数猜想和四维挂谷集的 Hausdorff 维数猜想,后者把此前卡在 3 点几的维数下界直接推到 4,两篇共 272 页,四维论文还引用了三维论文中的引理。
OpenViking 团队围绕 Agent 的上下文管理发布三项研究:VikingMem(VLDB 收录)把记忆分为事件与实体两层并维护最新档案,在 LoCoMo 长期记忆评测上得 88.83。
星动纪元(清华唯一持股的具身公司)推出世界动作模型 VPP2(Video Prediction Policy 2),以平均成功率 32.26%、平均得分 39.26 登顶 RoboDojo 榜首,超过此前 GPT-6-Astra 的 22.48% 和 28.97%,并拿下 generalization、precision、memory 三项第一。
OpenAI公布了一批由内部前沿模型产出的数学研究成果,包括722份数学手稿和372组相关成果,覆盖数论、代数几何、实分析、组合数学、理论计算机、数学物理、偏微分方程等多个方向。部分成果附有可由计算机核验的Lean形式化证明,社区初步核查发现其中涉及多个长期未解的开放问题,但具体结论仍需数学界进一步审阅与验证。OpenAI表示,AI正在从辅助解题走向参与真正的数学研究与发现。
美团 LongCat 团队构建 MineExplorer,首个在开放世界中做到分钟级长程任务的评测基准,包含 813 个人工验证实例(1-hop 到 4-hop),每个任务实例运行 1800 个环境步、对应 3 分钟连续交互。
美团 LongCat 团队开源 LoHoSearch,一个基于覆盖 762 万维基百科实体知识图谱自动生成题目的搜索智能体评测基准,含 544 道经人工核验题目、覆盖 11 个领域。
德州农工大学、Google DeepMind、CMU 等 15 家机构联合发布 TouchScale,一个在统一传感器与采集流程下构建的 500 小时人类双手视觉-触觉数据集。
星动纪元自研的世界动作模型VPP2登顶RoboDojo仿真榜单,平均成功率32.26%、平均得分39.26分,两项均列第一,领先GPT-6-Astra。该模型未额外加数据、未用Agent RSI等增强手段,仅靠标准数据集,在泛化、精细操作、记忆三个维度也拿下第一。团队将视频预测与动作学习分阶段训练,真机ALOHA零样本操作平均成功率58.5%,高于π0.5的40%,现已在GitHub开源。
在智能体搜索中,GPT-OSS-120B 智能体调用 9B 模型正确回答了 BrowseComp+ 上 64.0% 的问题,比次优的 ColBERT 模型高出 4.9 个百分点,且搜索次数少于所有基线。
HuggingFace 和 LiquidAI 团队提出一种多 Harness 强化学习训练方案,不改框架代码,在框架与模型之间加一个记录代理,让同一模型同时在四个真实框架里做 RL。
Hugging Face 团队发布多 harness RL 实践指南,指出同一模型同一权重在一个 agent harness 中得分 62%,在另一个中仅 33%。
Google DeepMind 将 SynthID 引入生物学领域,推出蛋白质水印方法 SynthID Bio,让 AI 生成的蛋白质可以被水印标记。相关成果发表在 Nature 上,团队还实现了兼具功能性与水印的 AI 设计蛋白质的成功合成,并将 SynthID Bio 工具开源供研究社区使用。Demis Hassabis 称这是 AI 时代生物安全的关键一步。
阿里巴巴达摩院联合浙江大学医学院附属第一医院等机构研发的通用医疗影像AI模型DAMO RADAR登上《科学》(Science),面向腹部增强CT诊断,可一次识别超过146种病症、覆盖18个器官,平均AUC达0.913,现已正式开源。
AuK 发布技术报告,推出面向语音生成与编辑的开源基础模型,论文已在 Hugging Face 上线。该模型同时支持语音生成与语音编辑两类任务,具体参数规模与评测数据报告尚未披露。
Qdrant-FineWeb-10B 已在 Hugging Face 上线,号称最大的开源向量检索基准数据集。该数据集包含 10B 篇 FineWeb 文档、gte-multilingual-base 生成的稠密与稀疏向量,向量规模 24.47 TB,文本与元数据 28.66 TB,并为 120,000 条查询提供精确 top-1,000 真值。
SemiAnalysis 发布 AgentX 1.0,称其为全球首个完全开源、100 万上下文的多轮智能体编码推理基准,Apache 2.0 许可,数据集与全栈工具投入超 300 万美元。
Jim Fan 转发 Dantong Niu 等人的 T-Rex 触觉反应式灵巧操作研究,该工作针对多数 VLA 模型忽略触觉反馈或无法响应高频接触信号的问题,从数据和架构两方面入手。
Jim Fan 宣布开源名为 T-Rex 的触觉方法,将触觉作为模型的一等公民:其 mixture-of-transformer 以异步双时钟运行,慢速视觉运动专家规划动作,快速触觉专家以每个视觉 tick 4 个触觉 tick 的高频修正实时细化动作。
Hugging Face 发布内容展示 AI 智能体如何复现 ICML 2026 的论文。该内容以直播形式呈现,配文附带 x.com 直播链接,未披露所用模型、复现数量或评测分数等具体细节。
Stanford AI Lab 提出智能体自我改进方法 TRACE,让模型自己找出失败背后的缺失能力并针对性自我训练。TRACE 训练的 Qwen3.6-27B 在 SWE-bench Verified 上达到 73.2%,超过体量更大的 Codex 5.2 和 GLM 5,并以不到 1/4 的训练 rollout 击败 GRPO 和 GEPA。
Import AI 464 汇总多项 AI 研究进展。Fable 在 KernelBench-Mega 上以单次协作 kernel 启动实现 18.71X 加速,超过 Claude Opus 4.8、GLM-5.2、GPT 5.5 等用 Triton 的尝试。
Jim Fan 公布 Physical AutoResearch 系列第二项工作 ASPIRE,让机器人通过自进化技能库实现持续学习,解决第 100 个任务时不再像第一个任务那样毫无头绪。
Meta 发布 Brain2Qwerty v2,这是可从非侵入式脑记录实时解码句子的端到端流程,实现 61% 的词准确率,而其他非侵入式方法为 8%,表现最好的受试者达到 78%。
Epoch AI 与 METR 联合发布 MirrorCode 基准,用于测试 AI 在长周期编码任务上的能力,任务是让模型在没有原始源码的情况下端到端重写整个程序,AI 方案需在包括留出测试在内的端到端测试中与原始程序输出完全一致。
OpenThoughts-Agent-v2 在算力受控对比中于每个训练集规模上均领先,并跨七个 agentic benchmark 实现泛化。同系列还发布 OpenThinkerAgent-32B,号称基于 Qwen-3 的最强开放数据 agentic 模型,在 7 个 agentic benchmark 上平均得分 44.8%。
Richard Socher 宣布 Recursive 公开其自动化开放式发现系统,作为迈向递归自我改进超级智能(RSI)的 v0.1 版本。该系统在 NanoGPT speedrun、NanoChat 和 NVIDIA Sol-ExecBench 三个 AI 任务上均取得 SOTA,且取得这些结果的代码和思路由 AI 系统自身提出,而非团队发明。
Crownlands 开源 Gateway 4M,这是迄今从活体人类中发布的最大单细胞组织数据集,用于推进大脑衰老与神经退行性研究。人类生物学数据对科学家和 AI 理解健康与疾病至关重要,Kevin Weil 称此举对加速 AI 在科学与健康领域的影响意义重大。
Scott Wu 介绍 Cognition 推出的新编码评测 FrontierCode,认为 SWE-Bench 式评分只考察能否通过单元测试,还需评估代码范围、编码风格和意外副作用。该评测声称假阳性减少约 80%,每个任务由领先开源维护者花费 40 多小时完成,最好的模型 Opus 4.8 得分仅 13%。
Kings College London、复旦大学与 Alan Turing Institute 构建 SocioHack 基准,含 72 个沙箱社会环境,用 RL 训练 LLM 重新发现历史已修补的规则漏洞,召回率 61.25%、精确率 90.85%。
Sebastian Raschka 发布 2026 年 1 月至 5 月的 LLM 研究论文精选清单,涵盖架构与模型设计、高效训练与扩展、推理效率与 KV Cache、稀疏注意力与长上下文、推理与测试时计算、强化学习与 RLVR、智能体系统与工具使用、编码智能体与软件工程、扩散语言模型、模型评测与基准十大类。
NVIDIA、Berkeley AI、CMU Robotics 与 Stanford AI Lab 联合推出开源框架与基准 CaP-X,让 coding agent 为机器人感知和控制编写代码,并在仿真与真实机器人上执行、观察结果、迭代提升代码可靠性。项目主页为 capgym.github.io。
Jim Fan 团队开源 CaP-X,将智能体以机械臂和人形机器人形态带入物理世界,并配套感知 API、执行 API 与自动合成的技能库;团队称策略如 VLA 也只是 API 调用,因此它是旧技术栈的严格超集。
METR 对 GPT-OSS-20B、GPT-OSS-120B、Qwen-3-8B、Qwen-3-32B 四个推理模型做小样本微调(240 条样本、约 100K-300K tokens),在分布外 CoTControl 评测集上平均 CoT 可控性从 2.9% 升至 8.8%。
Jina AI 发布两项研究:用约 80 万参数的小模型仅看向量即可识别生成模型,在 68 个模型与任务组合上准确率 87%;用掩码扩散模型直接从向量还原原始文本,Token 级还原准确率 81%,在 Qwen3-Embedding-0.6B 上达 81.3%、jina-embeddings-v3 上为 76.0%。
Jim Fan 推荐 Shenyuan Gao 的技术详解:NVIDIA 的 DreamDojo 是一个交互式机器人世界模型,基于 44K 小时人类第一人称视频预训练,团队称这是目前机器人世界模型学习中规模最大、最多样的数据集。该模型在泛化能力之外,经知识蒸馏后支持 10 FPS 的实时交互,可用于实时遥操作、策略评估和测试时的基于模型规划,代码、模型与数据已在 GitHub 开源。
SWE-Universe 是一个可扩展框架,能把 GitHub PR 转化为真实、多语言、可验证的 SWE 环境,由 agent 像人类专家一样自行配置每个环境并加入额外可靠性保障。该框架已在 Qwen3-Coder-Next 的 mid-training 和 RL 中得到验证,团队将推进环境合成作为 agent 自我改进的路径。