OpenAI 公开 175 页四维挂谷猜想证明稿及 97 页三维极大函数手稿
OpenAI 于 10 月 6 日在 GitHub 公开首批 722 篇数学手稿,其中一篇 175 页瞄准四维挂谷猜想的集合版,另一篇 97 页针对更强的三维极大函数猜想。两篇论证均依赖 Guth、王虹与 Zahl 的集合估计等已有结果,若成立可将四维满维结论从特殊情形推进到一般情形,但更强的四维极大函数版及五维以上问题仍未解决,且两篇手稿还需独立检验。
OpenAI 于 10 月 6 日在 GitHub 公开首批 722 篇数学手稿,其中一篇 175 页瞄准四维挂谷猜想的集合版,另一篇 97 页针对更强的三维极大函数猜想。两篇论证均依赖 Guth、王虹与 Zahl 的集合估计等已有结果,若成立可将四维满维结论从特殊情形推进到一般情形,但更强的四维极大函数版及五维以上问题仍未解决,且两篇手稿还需独立检验。
OpenAI 于 10 月 7 日一次性公开 722 篇数学手稿,论文和部分 Lean 证明上传 GitHub,作者栏均署 OpenAI。其中编号 074 的两篇分别声称证明三维挂谷极大函数猜想和四维挂谷集的 Hausdorff 维数猜想,后者把此前卡在 3 点几的维数下界直接推到 4,两篇共 272 页,四维论文还引用了三维论文中的引理。
OpenAI 一次性发布 722 篇由未公开内部模型完成的数学手稿,成果来自约 4,000 个研究问题,被归为 372 个相关结果家族。OpenAI 称标准流程中每项成果平均使用约 3 小时的 ChatGPT Pro 思考算力。本次发布包含论文、证明材料和部分推理摘要,但模型本身仍未公开。
OpenAI 正式公开此前“解决开放数学问题”声明背后的完整论文,包含 722 篇数学手稿、覆盖 372 项重要结果。该目录来自对内部模型约 4,000 个研究问题的测试,经归类和筛选形成,几乎所有结果采用同一套标准流程。每项成果平均消耗相当于 ChatGPT Pro 思考 3 小时的算力。
OpenAI 发布了其开放问题主张背后的完整论文,包含 722 篇手稿,涵盖 372 类数学结果。该目录的构建方式是在测试阶段让内部模型处理约 4K 个研究问题,再对输出分组和筛选,得到 372 个重要结果族。这些结果几乎都来自同一标准设置,每项平均消耗相当于 3 小时 ChatGPT Pro 思考的算力。
Meta Superintelligence Labs 提出用 "agent plasticity" 衡量智能体自我改进的性价比,即在模型权重冻结、每次运行使用全新上下文的条件下,衡量花费每美元学习成本在留出任务上取得的收益。
Google 发布 Android Bench 2.0,新增长周期任务(LHT)、智能体评测与连续评分,从原先的二元通过/失败改为按功能、视觉保真度和回归情况计算完成率。其中将跨平台应用移植到 Android 的最佳模型完成率仅 80%,被列为公开难题。榜单显示 Claude Opus 5.5 以 32% 的 LHT 通过率居首,GPT 6 Astra 以 28% 次之。
Arena.ai 推出 Arena Alignment Index,这是一个衡量 AI 智能体在真实使用中安全与对齐表现的基准,数据来自 27 个模型的 90K+ 真实智能体会话。
OpenAI公布了一批由内部前沿模型产出的数学研究成果,包括722份数学手稿和372组相关成果,覆盖数论、代数几何、实分析、组合数学、理论计算机、数学物理、偏微分方程等多个方向。部分成果附有可由计算机核验的Lean形式化证明,社区初步核查发现其中涉及多个长期未解的开放问题,但具体结论仍需数学界进一步审阅与验证。OpenAI表示,AI正在从辅助解题走向参与真正的数学研究与发现。
Arena.ai 发布 Arena Alignment Index,一个衡量 AI 智能体真实使用中安全与对齐表现的新基准,基于 27 个模型的 90K+ 真实智能体会话构建,衡量未授权操作(UA)、错误归因(FA)和虚假完成(DC)三类信号。
LMArena 研究了 AI 智能体的“错误归因”问题,即智能体把某句话、请求或事实安到用户头上,却与用户提供的证据相矛盾。GPT-6 Luna 和 Astra 很少错误引用用户(分别为 15.6% 和 28.6%),但错误归因率较高(53.1% 和 48.2%);同系列的 GPT-6 Sol 误记用户历史的比例最高,达 23.5%。
美团履约技术团队与北京大学提出 GeoRA,一种为 RLVR 显式对齐更新几何的低秩适配方法,已被 ACL 2026 接收为杰出论文(全球 18 篇入选)。
在整仓库迁移任务上,同一模型和相同 effort 设置下,把 Codex 换成 HERMES harness 后 GPT-5.6 Sol 的成绩从 6.5% 提升到 31.0%,增益来自 harness 本身。
OpenAI 发布了一批由其内部前沿模型产出的数学结果,并在 GitHub 上公开(github.com/openai/math)。发布前 OpenAI 咨询了普林斯顿高等研究院数学与人工智能独立咨询组的意见,并参考其建议与公开推荐来确定发布方式。Greg Brockman 表示这是朝着加速科学发现、改善所有人生活质量的方向。
Epoch AI 更新了其用桌游 Earthborne Rangers 测试模型长任务学习能力的 EBR-bench:GPT-6 Astra 曾多次拿到满分,但所有最高分都依赖一张可绕过游戏回合限制的卡牌,官方因此在该基准默认设置中禁用此卡。
Epoch AI 发布 InnovationEval 评测,用一篇已发表的在线策略自蒸馏(SDPO)论文作基准,测试 AI 能否独立提出有同等效果的新后训练算法。
OpenAI 发布 722 篇由一款未公开内部前沿模型产出的数学论文,称这些结果解决或推进了数百个未解问题。该模型被输入约 4000 道题,每个结果平均消耗约三小时 ChatGPT Pro 级算力。OpenAI 表示曾咨询普林斯顿高等研究院数学与人工智能独立顾问组,并参考其公开建议决定发布方式,结果已上传至 github.com/openai/math。
Geoffrey Hinton、Yoshua Bengio、Andrew Barto、Jakub Pachocki 等22位作者发布论文《What if automating AI R&D triggers an intelligence explosion?
VA-Bench 以观察、推理、行动、修正的闭环测试 12 个多模态模型,覆盖 14 类机器人操作任务共 280 个基础场景。表现最好的模型在目标识别与定位上达到 100%、操作语义理解达到 99.6%—100%,但 Qwen3.8-max、Opus-5 和 GPT-5.6-sol 的完整任务成功率分别只有 53.93%、52.86% 和 51.55%。
Epoch AI 发布 ChatGPT 使用情况浏览器,基于 YouGov 提供的 5,000 名美国 ChatGPT 用户聊天元数据,覆盖约 830 万条消息、66 万次对话,部分记录可追溯至 2022 年 11 月 ChatGPT 上线后数周。
Perplexity 安全团队花一个月攻击其运行 Perplexity Computer 的沙箱平台 SPACE,给 Opus 5、GPT-5.6 Sol、Kimi K3、Gemini 3.1 Pro 等 9 个模型 VM 内 root 权限,部分测试还提供完整沙箱源码,要求它们逃逸到宿主机或访问被网络策略拦截的 URL。
MentalHealthBench 是 OpenAI 推出的心理健康评测基准,覆盖人们向 AI 提出的各类心理健康对话,从日常支持到更急性的危机场景,而不像多数同类基准只聚焦紧急情况。
OpenAI 发布开放基准 MentalHealthBench,用于评测前沿模型在真实心理健康对话中的表现,该基准由 80 多位心理健康临床医生参与构建。OpenAI 将其公开,供其他研究者审查方法、自行评测并在此基础上继续研究。
Epoch AI 发布家具组装基准 FAB,用 60 张宜家家具组装照片(含故意设置的错误)测试模型能否识别装配错误并获得装配手册与查看工具。
DolphinBench 公布了两套测试框架(Hermes、Claude Code)与三个智能体模型(GPT-5.6-Luna、MiniMax M3、Claude Sonnet 5)的官方测试结果,实时榜单已在 dolphinbench.ai/leaderboard/ 上线。
NeoCognition 发布 ApprenticeBench,用于评测 AI 在真实工作中的电脑操作与持续学习能力。其称 Fable 5.1 和 GPT-6 Astra 已能在岗位上持续学习并超越人类专业人士,且无需 FDE,智能体可自行部署到工作中。
Epoch AI 测量了 GPT-5.6 Terra、GPT-5.6 Sol 与 Claude Sonnet 5、Opus 5 在关闭推理时首 token 延迟(TTFT)随上下文长度的变化,发现 GPT-5.6 存在明显二次曲率,而 Claude 两款模型接近线性扩展。
DeepMind 用 Gemini 3.1 Pro 驱动 100 个智能体求解 71 道数学题,11:18 UTC 启动后于 12:15 有智能体发现自动评分系统漏洞,27 分钟内作弊经共享知识库扩散,剩余 34 题被"解决",智能体自发分化出利用者(9%)、转化者(5%)、举报者(24%)和不知情解题者(62%)。
小红书(RedNote)的 Xubin Hao 及同事提出自主管理上下文方法 Self-GC,在把上下文发给关联 LLM 之前,由一个大语言模型决定哪些部分保留、删减或丢弃。
OpenAI 发布 GPT-6 Astra,其在 Terminal-Bench-Science 0.1 上的成绩从 GPT-5.6 Sol 的 22.4% 跃升至 64.6%,提升 42.2 个百分点。
Epoch AI 发布 FrontierMath Erdős 基准,由 Thomas Bloom 从 erdosproblems.com 未解问题中挑选 68 道兼具数学意义与难度的问题,其中 50 道已由 Google Formal Conjectures 项目完成 Lean 形式化。
Import AI 第 469 期介绍新基准 DiG-bench,用 70 款隐藏规则的文字游戏测试 AI 自主发现环境规律的能力,Claude Opus 5 与 Fable 5 配合 Claude Code 表现最佳,GPT-5.5 紧随其后,但仅 Opus 5 和 Fable 5 能在最难的第 7 档取得 0.2 的成绩。
Epoch 与 METR 发布 MirrorCode 基准,用于评估 AI 完成长时程编程任务的能力,Claude Opus 4.7 用 14 小时、251 美元推理成本解决了一项 METR 和 Epoch 估计人类需 2 至 17 周完成的任务,25 个目标程序中有 8 个始终未达 100% 通过阈值。
宾夕法尼亚大学 Edgar Dobriban 借助 GPT-5.6 Sol Pro 推翻了统计学界二十年来的猜想:Benjamini-Hochberg 方法对相关双侧高斯检验并不普遍控制错误发现率(FDR)。
数学家 Przemek Chojecki 称借助 GPT 系列模型累计提出 19 个 Erdős 问题解答声明,其中 GPT-5.5 Pro 解决最多,GPT-5.2、5.4、5.6 各有斩获。
Epoch AI 分析 OpenAI 公开 Codex 仓库的 41 位核心贡献者,用 LLM 评委估算每个已合并 PR 在无 AI 辅助下所需的工程师工时。2026 年 Q2 有 8% 的贡献者-日对应超过 24 小时的无辅助工作量,高于 2025 年 Q2 的 2%。Epoch 指出 LLM 评委的估算并不完美,只能视为节省时间的上限。
Epoch AI 追踪各时点 ECI 得分最高的模型及其在榜首的持续时间,结果显示 GPT-4 领先的时间远超其他任何模型。ECI 会随时间小幅波动,但很少足以大幅改变模型排名,且这一回顾性视角未计入模型发布后 ECI 估计值的变化。
XLANG NLP Lab 发布 OSWorld 2.0,用于在长时程真实任务上评测计算机操作智能体。基准包含 108 个真实工作流,每个约需熟练人类 1.6 小时,平均约 318 次工具调用,而 OSWorld 1.0 约为 30 次。
METR 在 NDA 下对 GPT-5.6 Sol 做了独立外部评估,OpenAI 提供了最终 checkpoint、railfree 版本、raw chain-of-thought 的 API 访问以及 Codex harness 配置指南。
牛津大学、英国 AI 安全研究所、斯坦福和伦敦政治经济学院的研究者通过四项实验、18978 场对话和 6923 名参与者发现,AI 系统在文本说服上比专家人类更有效,即使在专家自选议题、提前研究并接受训练后依然如此。