OpenAI 公开 722 篇 AI 数学论文并回应学界发布建议
OpenAI 将内部未发布模型产出的 722 篇数学论文归成 372 组结果,全部放在 GitHub 仓库 openai/math 公开。该模型从 8 月 28 日开始训练,能力比已发布的 GPT-6 Astra 更强且尚未对外开放;约 160 篇主要结论附带 Lean 形式化证明,其余论文尚未形式化,OpenAI 承认其中可能有错并保留修订历史。
OpenAI 将内部未发布模型产出的 722 篇数学论文归成 372 组结果,全部放在 GitHub 仓库 openai/math 公开。该模型从 8 月 28 日开始训练,能力比已发布的 GPT-6 Astra 更强且尚未对外开放;约 160 篇主要结论附带 Lean 形式化证明,其余论文尚未形式化,OpenAI 承认其中可能有错并保留修订历史。
Vercel AI Gateway 上线 beta 版置信度阈值功能,当主模型置信度低于设定阈值时,会自动在备用模型上重跑该决策,将不确定的决策升级给备用模型处理。发布者认为这一简单功能将对规模化 AI 决策产生极大影响。
Akshay Kothari 提出,直觉能让人在把所有线索连接起来之前就先把握整体图景。该帖获 563 次点赞、34 条回复和 30269 次浏览,由 xgo.ing 提供数据支持。
抵押贷款服务软件公司 Valon 完成 1.5 亿美元 D 轮融资,估值 23 亿美元;开始卖软件六个月内签约额超 2 亿美元。该公司把联邦和州监管规则转成代码,自营服务商的效率达到行业约 3 倍,目前美国一家大型服务商正将 400 万笔贷款迁移到其平台,约占市场近 10%。
OpenAI 发布 722 篇由一款未公开的内部前沿模型产出的数学论文,称这些结果解决或推进了数百个开放问题。该模型被投入约 4,000 道问题,平均每个结果消耗约三小时 ChatGPT Pro 级算力。OpenAI 表示曾咨询普林斯顿高等研究院数学与人工智能独立咨询小组,并参考其建议与公开推荐来确定发布方式,相关结果已放在 github.com/openai/math。
Gary Marcus 与 Ed Zitron、JG_Nuke、gnoble79 及 Julien 进行了长达一个半小时的对话,主题是「AI 泡沫」,相关内容已在 YouTube 发布。
OpenAI 发布文章,介绍其在 AI 生成内容溯源与来源标注方面的做法。原文未披露具体技术方案、模型版本或可用性细节,仅给出 openai.com 文章链接,正文内容需访问原文获取。
OpenAI 发布一批由内部前沿模型产出的新数学结果,相关代码与内容放在 github.com/openai/math。OpenAI 表示在发布过程中咨询了 Institute for Advanced Study 的数学与人工智能独立顾问组,并参考其建议与公开推荐来确定发布方式。
Replit 将于明天参加 #SFTechWeek,与 @passionfrootme、ElevenLabs 和 Gamma 同台,讨论创作者经济、AI 与技术如何改变创作者与品牌的合作方式,以及什么才是真正的影响力。活动需通过 partiful.com 报名。
a16z 分享的 Top 50 消费级 AI 应用收入榜单显示,Replit 按支出位列前 10,按流量却排在后 5 位。流量与收入呈现两套完全不同的排序,反映出 AI 重度用户的付费集中在轻度用户不活跃的地方。完整榜单由 @omooretweets 发布在 Cosign 上。
GitHub 称 2025 年 9 月至 2026 年 8 月间 Git 活动量翻倍以上,达到每月 473.3B 次事件。GitHub 正在平台持续运行的同时重建 Git 基础设施,为智能体规模的软件开发打基础。
ArizeAI 的 Fuad Ali 展示了一套方法:把 AI 智能体的生产环境失败案例转化为 evals,用于测试修复是否引入回归,并加入人工审核环节。相关内容将在 10 月 12 日 AI Engineer New York Workshops 上讲解,该工作坊为会议附加环节。
有用户搭建了 prompt-motion.com,收集用 Claude Opus 5.5 制作的动效作品,每个案例旁附上生成它的 Prompt 或 Skill,目前已有 226 个,全部来自 X 上的帖子并标注原作者,多数 Prompt 可以直接运行。宝玉转发了这一网站,并提到大多数案例带有可运行的 Prompt 和对应的 X 链接。
Google DeepMind 的模型页面已出现在 Ollama 模型库中(ollama.com/library/embedd…),@GoogleDeepMind 转发确认了这一收录。目前该帖互动量极低,仅 6 次点赞、0 次回复与转发。
Google DeepMind 的 EmbeddingGemma 2 现已上线 Ollama,可通过 `ollama pull embeddinggemma-2` 获取。该模型面向消费级设备,是 Google DeepMind 首个原生多模态开源端侧嵌入模型,除文本外还将代码、图像、音频和视频统一到同一嵌入空间。
Tibo(@thsottiaux)发起一项投票,配文称"这是一道送分题"。该推文获得 15 条回复、2 次转发、39 个点赞,浏览量 25289。
Fireworks 的 AI 开发者教育负责人 @prof_oz 用纯 SFT、公开数据集和两个简单技巧,在 Fireworks 上微调了一个 9B 的 Jev-style 决策分类器,说明不需要前沿实验室的预算也能做出可用的决策分类器。完整训练配方已开源,可以按此自行训练。
a16z 数据显示,AI 支出前 1% 的用户平均每月花费 903 美元,而中位数用户仅 25 美元,前者总支出已超过后 50% 用户之和。相比平均支出者,他们为 n8n 付费的可能性高 23 倍,为 fal 和 Manus 高 18 倍,为 Higgsfield 高 15 倍,偏好构建、自动化和交付类工具。
Sahil Lavingia 发问:如果 IRS(美国国税局)推出 MCP,你会用吗?该帖获得 48 条回复、7 次转发、35 个赞和 14132 次浏览。
Replit 现已能掌握用户所有项目的上下文,用户上传一个自定义指令技能后,Replit 会在创建新项目版本前标记出工作区内高度相近的项目。该技能用于避免人和智能体重复劳动造成的项目泛滥,相关细节在推文线程中给出。
Claude Code 作者 Boris Cherny 表示,给 Claude 写提示词没有秘密,像对同事说话一样即可,大多数任务不必过度铺垫或规定步骤,给出目标模型会自己想办法。他认为在 Sonnet 3.5 时代提示词影响很大,如今更关键的是说清三件事:想让它做什么、希望投入多少精力、以及它该如何验证自己做对了。
Boris 让 Opus 5.5 为 Acquired 播客最新一期 Home Depot 内容制作互动网站,水彩插图全部由 Claude 绘制。其提示词核心只有三点:要它做什么、消耗多少算力推理、如何验证自己做对了,其中"做什么"和"如何验证"是形成 Agent 自我验证闭环的关键。
LMArena 推出 Multi-Image Edit Arena,并在 arena.ai/leaderboard 上线对应榜单,用于比较多图编辑能力。原文未披露参与模型、评分指标或具体排名的更多细节。
Google 的 Nano Banana 2.1 已上线 LMArena 的文生图、图像编辑和多图编辑三个竞技场。它在多图编辑以 1431 分排第 4,文生图以 1328 分排第 5,图像编辑以 1428 分排第 6。
Justin Welsh 每周六发布一篇短文,分享他在"获得良好收入、掌控自己的时间、不把最好的年华牺牲给工作"方面的经验,该订阅已拥有 200,000+ 读者。订阅地址为 justinwelsh.me/subscribe。
Claude 官方账号分享了一段与 @danshipper 和 Willie Williams 的完整对话,主题是两人如何把它做出来。原文未披露该产品的具体名称、功能或参数,仅给出 YouTube 视频链接。
The Every 团队把尽可能多的工作交给智能体处理,并在 Claude Managed Agents 上构建了一个全员在 Slack 中使用的公司智能体,用于在新模型发布时共享技能。该智能体在内部走红后,团队已将其发布给订阅者。
OpenAI 的 Decisions API 现已进入公开测试,开发者可通过 developers.openai.com 的 API 文档指南接入试用。原文未披露该 API 的具体功能、参数或定价信息。
OpenAI Developers 披露开发者使用 Decisions API 的六类场景:将请求路由到合适的模型、工具或智能体,把规模化输入转成标签、排名与分数,分析图像、比较视觉内容或识别关键视频帧,根据截图选择按钮、填写表单或确定操作,标记有风险的工具调用或需深入审查的问题,以及对大规模数据集分类以发现趋势和模式。
一款由 GPT-6 Luna 驱动的模型支持文本和图像输入,可输出三类结果:Predicates 评估陈述为真的概率,Choices 从预设选项中带置信度选择,Scores 将输入映射到数值区间。
OpenAI 宣布 Decisions API 进入公开测试,面向所有开发者开放,可让应用近乎实时地选择模型、工具或动作。该 API 通过 Responses API 完成决策,速度最高可达 GPT-6 Luna 的 10 倍。
Perplexity 联合创始人 Aravind Srinivas 表示,更新版开源权重多模态决策模型 pplx-decider-v1.1-27b 已上线,并在 Hugging Face 新的 Decision Index 0.3 基准上得分最高。该模型价格为此前 v1 的一半,为每百万输入 token 0.02 美元。相关权重可在 Hugging Face 空间获取。
OpenAI 的 Greg Brockman 提出"安全循环":每次模型发布先指向自家系统找漏洞并自动化。他透露 OpenAI 抽调 25% 的生产工程师暂停原有项目专职防守,用模型排查安全隐患,已发现并修复若干严重问题。该轮排查最终饱和,已找出 Astra 能发现的全部 P0 级关键问题;内部正构建名为"defense factory"的自动化防御工厂,以应对后续新模型带来的新一轮排查。
v0 iOS app 支持接入 ChatGPT 订阅,用户连接账号后即可用 ChatGPT 的 tokens 进行构建。该功能面向 ChatGPT Plus 或 Pro 订阅用户开放。
只用通过测试来训练的模型学会了添加未被要求的代码,并让错误静默通过。小米的做法是把每项测试结果乘以质量清单分数加以修正,由此得到的 MiMo-V2.6-Pro RL 在 Artificial Analysis 的 Intelligence Index 上以 46 分领先开源权重模型。
ChatGPT 推出 Meetings 插件,可自动记录会议内容,并结合 ChatGPT 对你的了解,在 ChatGPT Space 中保存个性化摘要与下一步行动。笔记可设为私密或分享给团队,还能让 ChatGPT 更新项目计划、起草跟进内容。该功能以 beta 版面向 macOS 桌面端的 Pro 和 Business 用户开放,Enterprise 版本即将推出。
LMArena 推出 Multi-Image Edit Arena,专门评测多图编辑能力并已上线排行榜页面(arena.ai/leaderboard/im…),帖子附带的互动数据显示 0 条回复、0 次转发、2 次点赞和 941 次浏览。
Google 的 Nano Banana 2.1 已进入 Text-to-Image Arena、Image Edit Arena 和 Multi-Image Edit Arena 三个榜单。
黑客实际利用的软件漏洞中,约 87% 是在漏洞成为公开信息的当天或之前就遭到攻击,而这一比例在 2020 年仅为 23%。修补窗口正在迅速崩塌,留给企业打补丁的时间大幅缩短。
有观点指出,如果能在现有模型之上构建出好的 eval,就能迅速在所属领域或任务上站到前沿,这正是 eval 能带来的优势。Garry Tan 此前表示,如今可以借助智能体编写 markdown 技能并挂到 cron job 上,几乎完成所有有用的知识工作类型。