OpenAI 发布内部前沿模型产出的数学结果
OpenAI 发布了一批由其内部前沿模型产出的数学结果,并在 GitHub 上公开(github.com/openai/math)。发布前 OpenAI 咨询了普林斯顿高等研究院数学与人工智能独立咨询组的意见,并参考其建议与公开推荐来确定发布方式。Greg Brockman 表示这是朝着加速科学发现、改善所有人生活质量的方向。
OpenAI 发布了一批由其内部前沿模型产出的数学结果,并在 GitHub 上公开(github.com/openai/math)。发布前 OpenAI 咨询了普林斯顿高等研究院数学与人工智能独立咨询组的意见,并参考其建议与公开推荐来确定发布方式。Greg Brockman 表示这是朝着加速科学发现、改善所有人生活质量的方向。
a16z 发布第七版 Top 100 Gen AI Consumer Apps 榜单,首次引入 YipitData 的真实信用卡支出数据。截至 2026 年 8 月,仅 4.5% 的美国消费者为头部通用大模型付费,而支出最高的 1% 用户贡献了 19.5% 的消费金额,超过后 50% 用户总和,月均 AI 支出达 903 美元;付费榜前 50 名中有 29 家从未进入流量榜。
Simon Willison 发布了一个 LLM 插件,用于向 OpenAI 新的 Jev-clone 决策模型发送提示词,该模型基于 GPT-6 Luna。插件详情发布在其个人博客上,相关帖子获得 86 条回复、12 次转发和 260 次点赞。
宝玉称自己有两个 Claude Max @20 账号,在用法相同的情况下,注册时间较长的那个消耗很快、不太耐用,较新的账号则耐用得多。他还引述一段外部测试反馈:某供应商同款订阅的三份测试账号中,有 1 个账号的限额比其他 2 个低约 20%,恰好也是注册时间显著更久的那个。
Sam Altman 表示"我们正进入一个发现的新时代",并附上 OpenAI 官网链接(openai.com/index/sharing-…)。该推文获得超过 1 万点赞与 958 次转发。
Vercel AI Gateway 现已提供 OpenAI Decisions API,端点位于 /v1/decisions,请求和响应格式与 OpenAI 一致,现有 OpenAI SDK 集成只需修改 base URL、凭证和模型 ID 即可切换。
Vercel 在 AI Gateway 上线隐身模型 Glyph Cluster,Pro 和 Enterprise 套餐且购买了 AI Gateway 额度的团队在隐身期可免费使用。
Epoch AI 对比两轮 Ipsos 民调发现,报告过去 12 个月遭遇至少一次网络事件的美国成年人比例从 6 月的 46% 变为 9 月的 45%,总体无变化,也没有可统计检出的具体事件类型上升。
Epoch AI 更新了其用桌游 Earthborne Rangers 测试模型长任务学习能力的 EBR-bench:GPT-6 Astra 曾多次拿到满分,但所有最高分都依赖一张可绕过游戏回合限制的卡牌,官方因此在该基准默认设置中禁用此卡。
Epoch AI 发布 InnovationEval 评测,用一篇已发表的在线策略自蒸馏(SDPO)论文作基准,测试 AI 能否独立提出有同等效果的新后训练算法。
OpenAI 今日发布一批数学领域成果,Kevin Weil 称其"令人难以置信",并表示要在物理科学领域做出同等水准的模型还有大量工作要做。他引用的一条帖子称,用 GPT 6 Pro 和 Fable 5.1 对近三年发现排名后,OpenAI/math 仓库中 81% 的成果于当日发布。
OpenAI 发布了 722 篇由 AI 撰写的数学论文,成果已打包上传至 GitHub 仓库,但这些声明尚未得到外部数学家证实。平均每道难题的解法消耗 ChatGPT Pro 深度思考约三小时算力,OpenAI 同步给出大量 Lean 代码用于机器核验证明,并开源技术细节与模型推理过程。
OpenAI Decisions API 现已面向所有开发者开放公开测试,可让应用近乎实时地选择模型、工具或动作,经 Responses API 做出的决策比 GPT-6 Luna 快最多 10 倍。作者 elvis 表示将借此对该 API 以及 Perplexity 的 Decisions API 做更细致的对比,并称会很快公布结果。
本·阿弗莱克称自己会写 Python 脚本,理解卷积神经网络、张量与 GPU 工作流程,并曾经营一家小型视觉特效公司。他还说自己凭借名人身份直接联系,得以私下参观 Google 和 OpenAI 在视频 Transformer 上的研究。
OpenAI 宣布发布一批由内部前沿模型产出的数学结果,并在 GitHub 的 openai/math 仓库公开。OpenAI 表示在发布过程中咨询了普林斯顿高等研究院数学与人工智能独立顾问组,并参考其建议与公开推荐来制定发布方式。
OpenAI 把一个内部未发布模型做出的数学成果整体公开,共 722 篇论文、归成 372 组结果,放在 GitHub 仓库 openai/math 中供人查看。
OpenAI 公开未发布模型的 722 篇数学论文,并回应数学界顾问组的发布规范建议,可看到 AI 攻数学难题在验证与托管上的分歧。
OpenAI 发布 722 篇由一款未公开的内部前沿模型产出的数学论文,称这些结果解决或推进了数百个开放问题。该模型被投入约 4,000 道问题,平均每个结果消耗约三小时 ChatGPT Pro 级算力。OpenAI 表示曾咨询普林斯顿高等研究院数学与人工智能独立咨询小组,并参考其建议与公开推荐来确定发布方式,相关结果已放在 github.com/openai/math。
OpenAI 发布文章,介绍其在 AI 生成内容溯源与来源标注方面的做法。原文未披露具体技术方案、模型版本或可用性细节,仅给出 openai.com 文章链接,正文内容需访问原文获取。
OpenAI 发布一批由内部前沿模型产出的新数学结果,相关代码与内容放在 github.com/openai/math。OpenAI 表示在发布过程中咨询了 Institute for Advanced Study 的数学与人工智能独立顾问组,并参考其建议与公开推荐来确定发布方式。
Boris 让 Opus 5.5 为 Acquired 播客最新一期 Home Depot 内容制作互动网站,水彩插图全部由 Claude 绘制。其提示词核心只有三点:要它做什么、消耗多少算力推理、如何验证自己做对了,其中"做什么"和"如何验证"是形成 Agent 自我验证闭环的关键。
OpenAI 的 Decisions API 现已进入公开测试,开发者可通过 developers.openai.com 的 API 文档指南接入试用。原文未披露该 API 的具体功能、参数或定价信息。
OpenAI Developers 披露开发者使用 Decisions API 的六类场景:将请求路由到合适的模型、工具或智能体,把规模化输入转成标签、排名与分数,分析图像、比较视觉内容或识别关键视频帧,根据截图选择按钮、填写表单或确定操作,标记有风险的工具调用或需深入审查的问题,以及对大规模数据集分类以发现趋势和模式。
一款由 GPT-6 Luna 驱动的模型支持文本和图像输入,可输出三类结果:Predicates 评估陈述为真的概率,Choices 从预设选项中带置信度选择,Scores 将输入映射到数值区间。
OpenAI 宣布 Decisions API 进入公开测试,面向所有开发者开放,可让应用近乎实时地选择模型、工具或动作。该 API 通过 Responses API 完成决策,速度最高可达 GPT-6 Luna 的 10 倍。
OpenAI 的 Greg Brockman 提出"安全循环":每次模型发布先指向自家系统找漏洞并自动化。他透露 OpenAI 抽调 25% 的生产工程师暂停原有项目专职防守,用模型排查安全隐患,已发现并修复若干严重问题。该轮排查最终饱和,已找出 Astra 能发现的全部 P0 级关键问题;内部正构建名为"defense factory"的自动化防御工厂,以应对后续新模型带来的新一轮排查。
v0 iOS app 支持接入 ChatGPT 订阅,用户连接账号后即可用 ChatGPT 的 tokens 进行构建。该功能面向 ChatGPT Plus 或 Pro 订阅用户开放。
ChatGPT 推出 Meetings 插件,可自动记录会议内容,并结合 ChatGPT 对你的了解,在 ChatGPT Space 中保存个性化摘要与下一步行动。笔记可设为私密或分享给团队,还能让 ChatGPT 更新项目计划、起草跟进内容。该功能以 beta 版面向 macOS 桌面端的 Pro 和 Business 用户开放,Enterprise 版本即将推出。
OpenAI 为 Codex 加入语音输入,用户可直接与 Codex 对话,不必全程使用键盘。一位用户表示自己过去整天守在桌前,如今在阳光房里用语音就能发送演示文稿。
OpenAI 付费层级的组织将自动迁移至新的套餐层级,用户无需进行任何操作。有关资格条件与速率限制的更多详情,可查看 platform.openai.com/settings/organ 页面。
OpenAI 将 API 付费使用层级从五档合并为 Build、Launch、Grow 三档,新最高档 Grow 的达标门槛为累计 API 付款 500 美元,此前的最高档需要 1000 美元。调整后开发者更容易获得更高的 API rate limits。
a16z 发布 OpenAI 的 Greg Brockman 访谈,他称能帮攻击者发现安全漏洞的 AI 对防守方其实是伪装的好事:一旦攻击者能找出漏洞就可能被滥用,但防守方可以据此打补丁,并掌握系统布防的主动权。
开发者用 Codex 配合自建的磁盘空间统计 Skill,8 分 14 秒扫描完 C 盘并生成 Excel 报表,查出 C:\Users 占 117.94 GB。
OpenAI 的 ChatGPT 与 Codex 负责人 @thsottiaux 分享 AI 时代技能趋势:上升的是出色的品味、打造有意义事物的热情,以及知道什么是"好";下降的是打字速度。
Firecrawl 在 Alexandria 上线梦幻体育数据,让 ChatGPT 或 Claude 接入球员与球队统计、梦幻分析、新闻和博彩赔率的数百万条数据点。官方称借助该 Firecrawl 插件可用 100 倍的研究量来构建阵容。
Mistral Large 4 已在 OpenRouter 开启公测,采用 1T 参数(激活 49B),原生多模态,支持 512K 上下文与最高 256K 输出。前两周五折,价格为每 1M tokens 输入 $0.68、输出 $2.09,缓存输入 $0.07。
Stack Overflow 第 16 届开发者调查公布,超 3 万人参与,Claude Code(66%)和 GitHub Copilot(59%)是开发者最常用的编码智能体。Anthropic 与 OpenAI 的模型使用率并驾齐驱,Google 位列第三,但更多受访者愿意继续使用 Anthropic 模型。62% 的受访者对 AI 持正面看法,日活用户中这一比例升至 71%。
OpenAI 的 Stefano Fabbri 将在 AI Engineer New York 主持一场 ChatGPT Work 工作坊,现场构建一个财富管理智能体并用它接受测试。工作坊使用金融数据插件和自定义技能,时间为 10 月 12 日,属于大会附加场次,需另行购票。
有用户反映 ChatGPT 多次对话后出现 "Selected model is at capacity" 提示,等待时间翻倍,部分 case 还会从 sol 直接切换到 luna;该提示最近一小时未再出现,使用较为流畅。用户称自己的号已用很久且未使用第三方,仍不确定风控原因,并询问如何检查账号是否被风控,同时表示想念 Opus 5.5、只能从 Cursor 上使用。
SemiAnalysis 对 Anthropic、OpenAI、Meta、MiniMax、月之暗面、智谱等厂商的订阅套餐做极限压力测试,结论是同等月费下 Anthropic 给用户的 Token 实际价值是 OpenAI 的 5 倍以上。
有用户反映 ChatGPT 最近体验急剧下滑:几次对话就出现 "Selected model is at capacity",等待时间翻倍,部分 case 还会从 sol 直接切换到 luna。