OpenAI 用未发布内部模型生成 722 篇数学手稿
OpenAI 发布了一款未公开内部模型生成的 722 篇数学手稿,按 372 个相关结果族归类,来自约 4000 道研究问题的评测。OpenAI 称标准流程每条结果平均消耗约三小时 ChatGPT Pro 的思考算力,此次发布包含论文、证明产物和部分推理摘要,模型本身仍未发布。
OpenAI 发布了一款未公开内部模型生成的 722 篇数学手稿,按 372 个相关结果族归类,来自约 4000 道研究问题的评测。OpenAI 称标准流程每条结果平均消耗约三小时 ChatGPT Pro 的思考算力,此次发布包含论文、证明产物和部分推理摘要,模型本身仍未发布。
Google 内部正在测试新模型 Carbon,部署在内部 AI 编程工具 Jetski 上,有员工称其编码能力“感觉像 Opus 5.5”。Carbon 是在 9 月 30 日发布的 Gemini 4 Argon(内部版本 Barium-B)之后训练出的新版本,将作为 Argon 升级还是独立发布尚不清楚。
微软新模型 Microsoft-Decision-1 上线 OpenRouter,由 Qwen3.5-9B 后训练而来,主打快速决策任务。微软给出的数据是:在 36 个盲测基准(约 15 万道题)上准确率最高,比第二名快 4.5 倍,比 GPT-6 Sol 快 35 倍,扰动输入下仅 1.3% 的决策发生翻转。
微软推出新模型 Microsoft-Decision-1,专做选择题式判断,不生成文章也不聊天,给定选项后快速判断该选哪个并给每个选项打概率分,已在 Microsoft Foundry 上线,之后会上 OpenRouter。
OpenAI 推出 GPT-6.1 Sol 的 Ultrafast 版本,速度是标准版的 8 倍,官方称智能水平与标准版一致且逼近旗舰 Astra。
OpenAI 在疯狂 28 天计划的 Day 3 推出 GPT-6.1 Sol ultrafast。
OpenAI 宣布在 ChatGPT 中推出 GPT-6,并引入智能 UI。
OpenAI 发布数学成果,被 Opus 称为"史上影响最深远的一次数学成果发布"。LLM 已在 7 个千禧年大奖难题中的 4 个上取得实质性进展,但该判断的前提是相关结果需要通过验证。
Anthropic 发布 Claude Haiku 5.5,称其为该公司迄今最便宜、最快、能力最强的小模型。该模型相较上一代有大幅提升,在多项基准上超过 OpenAI 的同类模型 GPT-6 Luna,起售价为每百万输入 token 0.10 美元,运行成本比 Haiku 4.5 低约 75%,与 Luna 持平。
GPT-6 开始面向每周超过 12 亿 ChatGPT 用户全面推送,并带来全新的 Intelligent UI 能力。该能力让回复可用文本、图形、按钮、表单、图表乃至交互式工具共同组织:对比类问题并排呈现,原理类问题用交互式图解,简单问题仍用纯文本。
GPT-6 把回复从纯文本扩展到可交互界面,文中给出了组件库和界面编译器两层实现思路。
Claude Haiku 5.5 的 benchmark 全面领先 GPT-6 Luna,OpenRouter 观测到的 token 输出速度也是 2 倍。Anthropic 官方称 Claude Haiku 5.5 是迄今最便宜、最快、最强的小模型,运行成本比 Claude Haiku 4.5 低约 75%。
Mistral Large 4 在 Agent Arena 超过 5000 场真实智能体会话中录得 -6.6% 的净提升分数,位列总榜第 43,比上一版本 Mistral Medium 3.5(-12.60%)高 11 个名次。
OpenAI 宣布在 ChatGPT 上线 GPT-6 系列模型与全新 Intelligent UI 交互界面。Plus 及更高付费订阅用户即日起可使用 GPT-6 Sol,免费版与 Go 档位用户自 10 月 8 日起可使用轻量模型 GPT-6 Luna。
读者可了解 GPT-6 系列在 ChatGPT 的分档开放方式,以及新交互界面如何让模型直接渲染交互组件。
OpenAI 推出 GPT-6.1 Sol Ultrafast,覆盖 API、Codex 和 ChatGPT Work,智能水平接近 Astra,速度最高为 Sol Standard 的 8 倍,Ultrafast API 定价为每百万输入 token 12 美元、输出 token 60 美元。
OpenRouter 宣布 OpenAI GPT-6.1 Sol 的 Ultrafast 模式已在其平台上线,链接指向 openrouter.ai/openai/gpt-6.1。
OpenAI Developers 公布 GPT-6.1 Sol 在 Ultrafast 模式下的 API 定价,为每百万输入 token 12 美元、每百万输出 token 60 美元。该模式面向对速度和智能同时有要求的场景,例如排查线上故障、智能体操作应用,以及分秒必争的实时体验。
GPT-6 Astra 读取用户 Memory 后,按用户喜好用 Blender 建模的几个模型做了一张海报,模型的细节、材质、光影都做得很好。
OpenAI 宣布面向全球所有 ChatGPT 用户(含免费和付费用户)推出 GPT-6,取代 ChatGPT 中的 GPT-5.6 Sol 和 GPT-5.6 Luna,但通过 Codex 和 ChatGPT Work 访问这两款模型的用户仍使用之前发布的版本。
OpenAI 将 GPT-6 开放给免费用户并引入可自主生成交互界面的 Intelligent UI,读者可据此了解这一交互形态的变化。
Lovart 发布 Nano Banana 2.1 与 GPT Image 2.5 的并排对比图,称前者在人像光照和皮肤质感上有大幅提升,对比图由 Lovart 制作。引用内容显示,Google 介绍 Nano Banana 2.1 为其最新图像生成与编辑模型,在视觉设计、基于 mask 的编辑和主体一致性上均优于此前模型。
Anthropic 发布 Claude Haiku 5.5,这是 Haiku 系列约一年来的首次更新,定价与 OpenAI 的 GPT-6 Luna 持平,同日 Sonnet 5.5 缓存读取价格减半并推出订阅 API 额度。
汇总了 Haiku 5.5 的定价、第三方评测与 token 消耗代价,读者可据此判断小型模型在智能体工作流中的实际位置。
OpenAI 宣布 GPT-6 面向全球推送,付费用户先行,10 月 8 日起免费用户也能使用,正式取代 GPT-5.6 Sol 和 Luna,并带来可自动生成图表、按钮、表单的 Intelligent UI。
Anthropic 的 Haiku 5.5 定价低于 DeepSeek-V4.1 flash 和智谱 GLM 5.3 flash,在 Terminal Bench 4.0 上比 GLM 5.3 flash 高一分,与其他两个中国竞品相当或更高。Anthropic 还向每个 Max 和 Team 用户赠送对应额度的 API 金额,该 API 可在任何支持输入 API 的产品中使用。
OpenAI于10月7日宣布GPT-6进入ChatGPT日常对话,并推出Intelligent UI智能交互界面,向全球超过12亿周活跃用户开放。Plus、Pro、Business、Enterprise自10月7日起陆续获得GPT-6 Sol,Free和Go用户从10月8日起陆续获得GPT-6 Luna,企业工作区可用性还取决于管理员权限设置。
梳理了GPT-6在ChatGPT全员开放的分批安排,以及Intelligent UI如何把回答变成可交互界面。
Mistral 发布原生多模态 MoE 模型 Mistral Large 4(昵称“Le Chonk”)公开预览,总参数 1 万亿、激活约 490 亿,可通过 Mistral Studio API 试用,权重计划月底发布。
Anthropic 发布快速低价模型 Claude Haiku 5.5,价格与 OpenAI 上月发布的 GPT-6 Luna 完全一致,为每百万 token 输入 0.10 美元。
GPT-6 搭配 Intelligent UI 开始在 Chat 标签页面向 ChatGPT Plus、Pro、Business 和 Enterprise 档位全球上线,明天起扩展至 Free 和 Go 档位。
官方公布了 GPT-6 在 ChatGPT 各档位的上线节奏与差异化底层模型,可据此了解不同订阅层的能力差异。
OpenAI 今日面向全球 Plus、Pro、Business 和 Enterprise 用户推出带 Intelligent UI 的 GPT-6,明天起扩展到 Free 和 Go 用户。
这条发布说明给出了 GPT-6 在 ChatGPT 的分层模型安排与各档位的上线时间,便于读者核对自身账号何时可用。
OpenAI 于 2026 年 10 月 6 日发布消息称,用一个尚未公开的内部前沿模型一次性产出 722 篇数学手稿,整理为 372 个结果,来自对约 4000 个开放研究问题的评估,平均每个结果算力约相当于 ChatGPT Pro 思考 3 小时,成果全部放在 Apache-2.0 协议的 GitHub 仓库 openai/math 中。
OpenAI 以 GitHub 仓库而非期刊公开内部模型的数学产出,读者可了解其披露方式与研究协作的新变化。
Mistral Large 4 进入 Code Arena WebDev 榜单位列第 45 名,得分 1534 分,比第 130 名的 Mistral Large 3 提升 304 分,比第 122 名的 Mistral Medium 3.5 高出 271 分。
OpenAI 从一个未发布内部前沿模型公开了 722 篇数学手稿,归入 372 个结果族,来自约 4000 个研究问题的评测,平均每个结果约消耗 3 小时 ChatGPT Pro 推理算力,同时发布论文、证明工件与部分推理摘要,模型本身仍未公开。
汇总了 OpenAI 内部数学模型的稿件规模与算力投入,以及 Mistral、Google 等多个同期发布的对照信息。
Vercel 在 AI Gateway 上线隐身模型 Glyph Cluster,Pro 和 Enterprise 套餐且购买了 AI Gateway 额度的团队在隐身期可免费使用。
OpenAI 发布由内部前沿模型产出的一批新数学结果,并公开了 github.com/openai/math 仓库。OpenAI 称在发布过程中咨询了普林斯顿高等研究院的数学与人工智能独立咨询小组,并参考其建议和公开推荐意见来确定发布方式。Thomas Wolf 转引该消息时评价没有炒作、只有结果。
OpenAI 发布一批由内部前沿模型产出的新数学结果,相关代码与内容放在 github.com/openai/math。OpenAI 表示在发布过程中咨询了 Institute for Advanced Study 的数学与人工智能独立顾问组,并参考其建议与公开推荐来确定发布方式。
Mistral Large 4 已在 OpenRouter 开启公测,采用 1T 参数(激活 49B),原生多模态,支持 512K 上下文与最高 256K 输出。前两周五折,价格为每 1M tokens 输入 $0.68、输出 $2.09,缓存输入 $0.07。
OpenAI 在 28 天计划 Day 1 宣布 Astra 和 GPT-6.1 Sol 默认速度提升约 50%,当天并未重置使用额度。
flow-1 是用 RL 训练的新模型,用于在 agent trace 中查找错误,其 trace intelligence 与 GPT-6-sol 相当,但成本低 23 倍,运行成本也比 GPT-6-luna 低 25%。它让监控和理解每一次 agent 运行、且无需采样成为可能。
Agent Arena 按解决跨领域实际任务的智能体能力对模型排名,美国实验室在所有领域领先:Anthropic 模型在 Code、Work、Chat 均居第一,OpenAI 的 GPT 6 Astra(Max)在三个类别都进入前四,Code 第 2、Work 与 Chat 均第 4。
OpenAI 的 GPT-6.1 Sol (Max) 进入 Agent Arena 榜单第 5 名,成绩提升 11.23%,并改写了帕累托前沿。其单任务成本中位数为 $0.56,性能与 GPT-6 Sol 相差 2 个百分点以内,成本低 39%。
OpenAI DevDay 后 GPT-6.1 Sol (Max) 进入 Code Arena: WebDev 排第 3,以 $8/MToken 进入帕累托前沿;同日 Sonnet 5.5 上榜后 Sol 降至第 4 并跌出前沿,Sonnet 现以低 80% 成本落后第 2 名 GPT-6 Astra (Max) 2 分。
Sam Altman 表示,6.1 Sol 是迄今增长最快的模型,此前在负载下略显缓慢,现已大幅改善。原文未披露该模型的具体参数、性能数据或可用性信息。