OpenAI 发布内部模型 722 篇数学论文,攻克 500 个公开数学难题中的 90 个
OpenAI 从一个未发布内部前沿模型公开了 722 篇数学手稿,归入 372 个结果族,来自约 4000 个研究问题的评测,平均每个结果约消耗 3 小时 ChatGPT Pro 推理算力,同时发布论文、证明工件与部分推理摘要,模型本身仍未公开。
为什么值得看
汇总了 OpenAI 内部数学模型的稿件规模与算力投入,以及 Mistral、Google 等多个同期发布的对照信息。
训练侧的门道:数据集构建、合成数据、预训练与后训练方法、算力与训练成本。
OpenAI 从一个未发布内部前沿模型公开了 722 篇数学手稿,归入 372 个结果族,来自约 4000 个研究问题的评测,平均每个结果约消耗 3 小时 ChatGPT Pro 推理算力,同时发布论文、证明工件与部分推理摘要,模型本身仍未公开。
汇总了 OpenAI 内部数学模型的稿件规模与算力投入,以及 Mistral、Google 等多个同期发布的对照信息。
AMD 与 World Labs 达成收购协议,交易金额 82 亿美元,交易预计今年年底前完成,仍需获得监管批准;World Labs 创始人李飞飞将加入 AMD 担任执行副总裁兼首席科学家,直接与 CEO 苏姿丰及团队合作。
交易把世界模型团队接入芯片研发链条,读者可以了解空间智能路线与硬件协同的动因。
Qwen 将 Qwen3.8-Max 升级为 Qwen3.8-Max-0902,参数规模 2.4T,上下文窗口 1M tokens。该版本在 Coding 与 Cowork 方向做了后训练,官方称在复杂企业任务、科研和长周期工作流上表现更强。API 定价为每 1M tokens 输入 $2、输出 $6,显式缓存命中 $0.17、隐式缓存命中 $0.25,现已在 QwenCloud 上线。
官方给出参数规模、上下文长度和 API 定价,读者可据此判断它在长流程任务上的接入成本。
阿里发布 Qwen3.8-Flash,这是一个多模态 MoE 模型,主模型参数量 125B,另配 51B N-gram Embedding,每 token 激活 6B 参数,原生支持 262,144 token 上下文并可通过 YaRN 扩展至 1M token。
官方一次给出 Qwen3.8-Flash 的架构改动、成本对比与开源权重入口,读者可据此判断新架构对长上下文推理的实际影响。
OpenAI 在 Hot Chips 上公布了与 Broadcom 合作自研的推理芯片 Jalapeño,设计始于 2024 年中,约 16 个月完成流片,SemiAnalysis 受邀在其实验室用 InferenceX 实测该芯片。
SemiAnalysis 在 OpenAI 实验室实测其首款推理芯片 Jalapeño,给出逐场景吞吐与能效对比及架构细节。
月之暗面在 Kimi K3 开放日发布 Kimi K3 模型权重、技术报告,并开源支撑其训练的关键 Infra 技术 MoonEP、FlashKDA 和 AgentEnv。
Kimi K3 开放权重、技术报告与 Infra 技术,读者可了解其 2.8 万亿参数 MoE 与 3 倍规模化效率的具体做法。
Sebastian Raschka 撰文梳理 DeepSeek V3 到 V3.2 的技术演进,核心变化是 V3.2 沿用 V3.2-Exp 的架构,加入 DeepSeek Sparse Attention(DSA)型稀疏注意力以降低长上下文下的训练与推理成本,注意力复杂度从 O(L²) 降到 O(Lk),其中 k 在官方代码中设为 2048。
梳理从 V3 到 V3.2 的架构与训练变化,读者可对照前代理解稀疏注意力和 RL 的具体改动。