微软 Decision-1 上线 OpenRouter,基于 Qwen3.5-9B 后训练
微软新模型 Microsoft-Decision-1 上线 OpenRouter,由 Qwen3.5-9B 后训练而来,主打快速决策任务。微软给出的数据是:在 36 个盲测基准(约 15 万道题)上准确率最高,比第二名快 4.5 倍,比 GPT-6 Sol 快 35 倍,扰动输入下仅 1.3% 的决策发生翻转。
微软新模型 Microsoft-Decision-1 上线 OpenRouter,由 Qwen3.5-9B 后训练而来,主打快速决策任务。微软给出的数据是:在 36 个盲测基准(约 15 万道题)上准确率最高,比第二名快 4.5 倍,比 GPT-6 Sol 快 35 倍,扰动输入下仅 1.3% 的决策发生翻转。
Cognition 宣布 Devin 可接入个人 ChatGPT 订阅,用户连接 Go、Plus 或 Pro 计划后,所有 GPT 模型用量将从该订阅的配额中扣除。
微软推出新模型 Microsoft-Decision-1,专做选择题式判断,不生成文章也不聊天,给定选项后快速判断该选哪个并给每个选项打概率分,已在 Microsoft Foundry 上线,之后会上 OpenRouter。
OpenAI 的收入数字之所以重要,是因为模糊的财务数据可能为备受炒作的公司最终上市时的虚高估值埋下伏笔。
OpenAI 在 X 上回应解雇三名安全研究员 Jasmine Wang、Tomek Korbak 和 Mikita Balesni 的决定,称内部调查发现他们违反敏感信息处理政策,构成严重信任破坏,并强调解雇与他们就 AI 安全发声无关。这封信发布于周四,研究员在其中要求 OpenAI 提高决策透明度,称自己因提出安全担忧被解雇。OpenAI 表示调查发现的违规超出信中所述,但未提供细节。
三名被 OpenAI 解雇的安全研究员 Jasmine Wang、Mikita Balesni 和 Tomek Korbak 发表公开信,反驳公司对其解雇理由的说明。
OpenRouter 指出,Luna 和 Astra 正带动 Codex 用量大幅增长。该帖互动数据显示 11 条回复、1 次转发、123 次点赞、10861 次浏览,未披露具体增幅或使用数据。
OpenRouter 在 openrouter.ai/apps/codex 上线了 Codex 应用页面。该页面由 xgo.ing 提供支持,原帖互动数据为 0 条回复、1 次转发、2 个点赞、2926 次浏览。
LangSmith LLM Gateway 现已支持 OpenAI Decisions API,可为智能体提供低延迟推理。该网关同时提供模型回退、数据脱敏策略和支出限额,作为集中管控入口。
苹果发布会的“科技春晚”地位正在消退,OpenAI、Google、Anthropic 等 AI 开发者大会成为新的关注中心。2026 年 9 月 OpenAI DevDay 发布二十多项更新,重点推出可长期运行的个人 Agent Dots,并新增每月 500 美元会员档位、调整 GPT-6.1 Sol 价格体系,但新能力增量有限、悬念减弱。
Codex 面向 Pro 用户开放 composer predictions 测试版,可基于对话内容和你与它的交流方式预测你的下一条消息。有开发者表示自己在 agent orchestrator 中已自建同类功能数月,并用 Haiku、Luna 等小模型实现,可随使用调优并适配个人偏好。
Asana 借助 GPT-6.1 Sol 让浏览器智能体在测试中成本降低 76 倍、速度提升 5 倍,从而为客户提供能力更强的模型。
OpenAI Codex 面向 Pro 用户上线 beta 版 composer 预测,可根据对话内容和你与它的交流方式预测你的下一条消息。OpenAI 称这是其内部测试中最受欢迎的新功能之一。
OpenAI 在 Codex 桌面应用中面向 Pro 用户推出编辑器预测功能 beta 版,仅适用于本地任务。用户按“Tab”接受建议、按需编辑后发送,也可在 Settings 中关闭 composer predictions。
ChatGPT 为 dots 推出新更新,用户现在可以直接在 iOS 和 Android 的 ChatGPT 应用中创建自己的 dot,无需其他入口。这是该轮更新中公布的第一项变化,更多内容尚未在原文中展开。
ChatGPT 推出一批用户长期呼吁的小幅修复,包括更快的浏览速度与更顺滑的滚动、更少的无用通知、更整洁的代码块和附件展示。此次更新还简化了 Outlook 设置、让套餐说明更清晰并更易重试,同时提升了网页端和企业版语音访问的可靠性。
ChatGPT 的 dot 现在能在 Codex 中启动工作、跟进已有线程,并调用你的 ChatGPT 对话、Codex 线程和自动化任务,还能判断何时续用线程、何时新开。dot 也可在 ChatGPT Work 中查看和编辑 Scheduled Tasks,支持查询已排期任务或随计划变化更新重复任务。
LangChain 在 Open SWE 中把模型路由做进 agent harness,按任务类型和难度在 GLM-5.3-Flash、GPT-5.6 Sol、GPT-6 Astra 三档模型间选择,相比始终使用顶级模型的基线把每线程中位成本降低 64%,质量没有可测量变化。
OpenAI 推出 GPT-6.1 Sol 的 Ultrafast 版本,速度是标准版的 8 倍,官方称智能水平与标准版一致且逼近旗舰 Astra。
《金融时报》报道称 OpenAI 向投资人展示的年化收入数字与 Anthropic 进行对标,实际比此前广泛引用的 700 亿美元低约 200 亿美元,AI 股周四因此受挫。
TypeSafe AI 于 2026 年 9 月 15 日推出 Jev,并宣布获得 DCVC 领投的 4,000 万美元种子轮融资。Jev 不聊天不写文本,接收 state 与 typed questions,返回带校准概率的 Choice、Score 和 Noul 答案,通常耗时 70 到 500 毫秒,输入每百万 tokens 收费 0.042 美元、输出免费。
梳理 Jev 的十类真实用例与每类成本延迟数据,可对照现有 LLM 工作流判断哪些小决策值得下放。
Madrona 第五届 IA40 峰会以「释放 AI 价值」为主题,讨论重心已从模型本身转向由模型、工具和智能体界面组成的 AI 系统。Vercel 称其 56% 的生产部署已由智能体完成,微软 15 至 20 人团队能在六个月内完成过去数百人多年的工作量。IA40 六年 164 家上榜公司累计融资超 $500B,今年 23 家重复上榜。
Google 发布 Android Bench 2.0,新增长周期任务(LHT)、智能体评测与连续评分,从原先的二元通过/失败改为按功能、视觉保真度和回归情况计算完成率。其中将跨平台应用移植到 Android 的最佳模型完成率仅 80%,被列为公开难题。榜单显示 Claude Opus 5.5 以 32% 的 LHT 通过率居首,GPT 6 Astra 以 28% 次之。
据 Financial Times 报道,OpenAI 截至 9 月底的年化收入约为 500 亿美元;此前近 700 亿美元的说法是按更便于与 Anthropic 对比的口径计算,两者差异源于通过云合作伙伴销售时的记账方式。
Amazon 表示在与地方政府谈判数据中心交易时将不再使用保密协议(NDA),微软今年早些时候已采取类似举措。保密做法此前加剧了社区对 AI 基础设施的反对,从纽约到旧金山已出现数百项提案或已生效的暂停令。
2026 年上半年垃圾债发行量达 2290 亿美元,而投资级债券为 8059 亿美元,垃圾债市场已膨胀至投资级市场的 28.4%,较 2011 年上半年的 30 亿美元增长 75 倍。
最新一期科技、媒体与电信市场综述覆盖 SpaceX 的最新频谱交易,以及 OpenAI、小米等公司动态。文章以市场快评形式汇总上述科技、媒体与电信领域要点。
Amazon Bedrock 九月更新中,OpenAI 的 Astra、Sol、Luna 系列模型正式可用,其中 GPT-6 Astra 支持最高 100 万 input tokens,GPT-6 Astra Ultrafast 提供最高 6 倍推理加速、300 tokens/秒。
LangSmith Signals 上月数据显示,Claude Sonnet 5 在模型采用率上从第 9 升至第 2,使用它的组织数量增加 51%;gpt 5.6 luna 在调用足迹上从第 3 升至第 1,调用量增加 65%。两个开源权重模型进入采用率前 10,但调用量未进前列,更小更快的模型主导调用足迹。
数学家组织 AHM 发表声明,批评 OpenAI 一次性发布 700 多个 AI 生成的数学证明文件,称其不是学术展示而是力量展示,部分数学家呼吁抵制 OpenAI 产品。陶哲轩在博客转发该声明并提出数学应进入不再以解题为核心指标的 Math 2.0 时代,Scott Aaronson 则对比了 OpenAI 批量放出证明与 Anthropic 与研究者合作、给予补偿并写出人类可读证明的两种模式。
特朗普在白宫向马斯克、黄仁勋、苏姿丰、布林、纳德拉和戴尔颁发美国国家科学奖章与技术奖章,并称马斯克是当代爱迪生。颁奖词在介绍黄仁勋和纳德拉时多次使用超级智能一词,九天前特朗普刚签署行政令把联邦官方表述中的人工智能改称超级智能。
OpenAI 为 Windows 版 Codex 构建了基于微软 Execution Containers(MXC)的新沙箱模式,带来更快的环境搭建、更强的网络管控和更细粒度的文件访问控制,需搭配兼容的 Windows 11 设备使用。MXC 现已在 Windows 11 上正式可用,可将 AI 智能体限制在操作系统强制执行的边界内;Muse 也将作为原生 Windows 应用集成 MXC。
OpenAI Developers 分享了 ChatGPT Windows 版文档链接 learn.chatgpt.com/docs/windows,面向开发者说明该平台的接入方式。
《State of AI Report 2026》10 月 8 日发布,第九期由 Air Street Capital 的 Nathan Benaich 牵头,正文 240 多页,分研究、产业、政治、安全、预测五部分。
Arena.ai 推出 Arena Alignment Index,这是一个衡量 AI 智能体在真实使用中安全与对齐表现的基准,数据来自 27 个模型的 90K+ 真实智能体会话。
Kevin Roose 与研究员 Jasmine Sun 做客 ChinaTalk,讲述他新书《The AGI Chronicles》中 OpenAI、Anthropic、DeepMind 的历史,以及那群过度思考并担忧人工智能的人。Kevin 此前供职于《纽约时报》。
Crunchbase 数据显示,今年截至 9 月 29 日风投系 AI 公司对 AI 创企的收购已达 195 起,比 2025 年全年高出 14%。OpenAI 是过去三年最活跃的收购方,共完成 20 笔 AI 相关收购,其中 10 笔发生在今年;Anthropic、法律 AI 创企 Legora 各完成 5 起。
Simon Willison 用 ChatGPT 桌面版 Codex 标签页的语音对话模式,在做饭的半小时里边聊边让 GPT-6 Astra High 为博客搭出 Newsletters 页面,包括新 Django 模型与迁移、四个导入脚本、/newsletters/ 归档页和站内搜索集成。
Simon Willison 全程用语音、通过 Codex Desktop 给自己的博客开发了一个新功能,过程中他正在做晚饭。相关记录发布在其博客 simonwillison.net 上。
知行小酒馆第 253 期邀请益盒 CharityBox 联合创始人治霖,讨论 AI 是否真正改善了弱势群体的生活。节目引用数据显示,截至 2026 年第一季度全球劳动年龄人口 AI 使用率为 17.8%,仍有 6.55 亿人缺乏电力;2026 年美国四大科技企业在 AI 领域投入预计超过 6500 亿美元,而将全球贫困率降至 1% 每年需 3040 亿美元。