Microsoft-Decision-1 上线 OpenRouter,基于 Qwen3.5-9B 后训练
Microsoft-Decision-1 已在 OpenRouter 上线。微软方面给出的数据称,该模型在 36 项盲测基准(约 15 万道题)上准确率最高,速度是第二名的 4.5 倍、是 GPT-6 Sol 的 35 倍,在扰动输入下决策仅在 1.3% 的情况下发生变化。
今日精选 2 条
最近精选动态:10月10日 03:36
Microsoft-Decision-1 已在 OpenRouter 上线。微软方面给出的数据称,该模型在 36 项盲测基准(约 15 万道题)上准确率最高,速度是第二名的 4.5 倍、是 GPT-6 Sol 的 35 倍,在扰动输入下决策仅在 1.3% 的情况下发生变化。
TypeSafe AI 于 2026 年 9 月 15 日推出 Jev,并宣布获得 DCVC 领投的 4,000 万美元种子轮融资。Jev 不聊天不写文本,接收 state 与 typed questions,返回带校准概率的 Choice、Score 和 Noul 答案,通常耗时 70 到 500 毫秒,输入每百万 tokens 收费 0.042 美元、输出免费。
梳理 Jev 的十类真实用例与每类成本延迟数据,可对照现有 LLM 工作流判断哪些小决策值得下放。
OpenAI于10月7日宣布GPT-6进入ChatGPT日常对话,并推出Intelligent UI智能交互界面,向全球超过12亿周活跃用户开放。Plus、Pro、Business、Enterprise自10月7日起陆续获得GPT-6 Sol,Free和Go用户从10月8日起陆续获得GPT-6 Luna,企业工作区可用性还取决于管理员权限设置。
最新进展10月9日 14:50OpenAI 向全部 ChatGPT 用户推送 GPT-6
梳理了GPT-6在ChatGPT全员开放的分批安排,以及Intelligent UI如何把回答变成可交互界面。
微软宣布为 Windows 带来不限量智能能力,并让每台 PC 成为智能体可安全代为工作的平台。其中 MAI-Code-1.1 Flash 是 137B 参数的编码模型,拥有 256K 上下文窗口,已针对在 PC 上运行做优化;GitHub Copilot 可将工作交给本地模型,降低项目成本。
微软把编码模型和智能体能力搬到 Windows 本地,读者可据此观察端侧智能体的落地路径。
Google 在 Cloud 活动上宣布将 Gemini 带入智能体阶段,推出统一智能体,既能回答问题也能代用户完成任务,初期面向企业、之后再向消费者开放。该智能体可接收目标而非指令,自行规划工作并调用自定义技能与工具;默认自动选择模型,用户也可手动切换,首批第三方模型为 Anthropic 的 Claude。
Google 把 Gemini 智能体先落到企业场景,文中给出的模型选择、系统连接与审计线索可供评估落地边界。
CrowdStrike 报告称,2026 年 9 月下旬至 10 月初韩国多家金融机构遭针对性网络攻击,新韩银行约 2.5 万名客户信息受影响,KB 国民银行、韩亚银行等也有不同程度泄露。
CrowdStrike 报告披露的攻击链细节,可供安全从业者观察 AI Agent 被用于真实金融渗透的方式。
Google Cloud 在 Gemini at Work 2026 上发布 Gemini agent,一个面向工作的统一智能体,可回答问题、处理知识工作、生成图像媒体并编写运行代码,全部通过单一提示框和单一 API 完成。
Google Cloud 把 Gemini 从模型入口升级为统一工作智能体,读者可据此判断企业级 Agent 平台的竞争格局与落地条件。
Anthropic 发布 Claude Haiku 5.5,官方称其是迄今最便宜、最快、能力最强的小模型。该模型在多项基准上超过前代 Haiku 4.5,并胜过 OpenAI 的同类模型 GPT-6 Luna;定价为每百万输入 token 0.10 美元,比 Haiku 4.5 便宜约 75%,与 Luna 持平。
最新进展10月8日 15:27Anthropic 发布 Claude Haiku 5.5 并大幅降价
Anthropic 新小模型给出价格与基准对比,读者可据此判断小型模型的性价比走向。
微软在 10 月 8 日的 Windows 发布会上宣布将混合智能引入 Windows,通过模型路由、Windows ML 和本地 AI 能力,让 Copilot 等产品按任务复杂度、成本和隐私要求在云端与本地模型之间自动切换,GitHub Copilot 的 HydraFusion 首次可直接调用运行在 Windows PC 上的本地模型。
微软把混合智能与模型路由引入 Windows,并让 GitHub Copilot 直接调用本地模型,读者可了解 AI PC 向 Agent 运行环境演进的具体路径。
微软在特别发布会上推出 Surface Laptop Ultra,搭载 NVIDIA RTX Spark Superchip,最高 128GB 统一内存,可在本地运行超 1200 亿参数模型,起售价 2599 美元,10 月 7 日开放预订、10 月 16 日供货。
梳理微软从硬件到 MXC 容器、混合智能调度的整条设备链路,可对照两年前 Copilot+ PC 的定位变化。
Google 将其 SynthID 水印检测能力扩展到公开站点 synthid.com,任何人都可以上传图片、视频或音频文件检查是否带有 SynthID 水印,无论内容由 Google 生成还是来自 OpenAI、NVIDIA、Kakao 等合作方,Apple 也即将加入。
SynthID 验证入口从内置功能扩展为公开站点,并接入 OpenAI、NVIDIA 等合作方的水印检测。
Mistral 发布新旗舰 Mistral Large 4,总参数 1 万亿,采用混合专家架构,每个 token 激活 490 亿参数,权重将于月底全部开源。
通过第三方智能指数与多项细分基准的横向对比,读者可以看到开源万亿参数模型与闭源旗舰之间的实际差距。
OpenAI在GitHub发布openai/math仓库,公开722份数学手稿、归为372组成果,覆盖数论、代数几何、组合数学等方向,全部来自一个未公开的内部模型。作者称这些成果平均每个花费约3小时ChatGPT Pro级思考算力,其中包含将准黎曼猜想推进到7/8、复数域矩阵乘法指数降到2.25等说法,同时记录了25位菲尔兹奖得主联名信等数学界的质疑与争议。
梳理OpenAI一次性公开722份数学手稿所引发的学界反应与争议,并讨论AI科研中评审环节的瓶颈。
Mistral AI 发布 Mistral Large 4(代号 Le Chonk),1T 参数、原生多模态、49B 激活,号称是美欧聚合基准上最好的开放权重模型。该模型在网络防御、制造和金融等关键负载达到 SOTA,视觉 grounding 超过闭源前沿模型,端到端在欧洲锻造并可通过 Mistral Cloud 从欧洲部署,今日起 API 全面可用,开放权重将于十月底发布。
Mistral Large 4 以 1T 参数、49B 激活的开放权重形态发布,可对照其与闭源前沿模型的基准位置。
Mistral AI 发布 Mistral Large 4(代号 Le Chonk),1T 参数、49B 激活、原生多模态。官方称其在聚合基准上是美国或欧洲最好的开放权重模型,在网络防御、制造和金融等关键负载上达到 SOTA,视觉接地表现超过闭源前沿模型。
Mistral Large 4 的参数规模、多模态能力与开放权重时间表一并给出,可据此判断欧洲开源模型的竞争位置。
Mistral 发布 Mistral Large 4(代号 Le Chonk),1T 参数、原生多模态、49B 激活参数,已在 API 上线,开放权重将于 10 月底发布。
原文列出 Mistral Large 4 在多类工作负载上的对照数字,读者可据此判断开源权重模型的竞争位置。
Mistral AI 发布 Mistral Large 4(代号 Le Chonk),1T 参数、原生多模态、49B 激活参数,在自有算力上训练和推理。官方称其在聚合基准上是美国或欧洲最好的开放权重模型,在网络安全、制造和金融等关键负载上达到 SOTA,视觉 grounding 超过闭源前沿模型;由欧洲端到端打造,可通过自有 Mistral Cloud 从欧洲部署。
Mistral 联合创始人披露 Large 4 的参数量、多模态与自有算力训练细节,可据此判断欧洲开源模型的量级位置。
Mistral AI 发布 Mistral Large 4(代号 Le Chonk),1T 参数、原生多模态、49B 激活参数,称其是美欧范围内聚合基准上最好的开源权重模型。该模型在网络安全、制造和金融等关键负载上达到 SOTA,并在视觉定位上超过闭源前沿模型;今日起通过 API 提供,开源权重将于 10 月底发布,并可通过其自有 Mistral Cloud 基础设施在欧洲部署。
Mistral 官方给出新模型的参数规模、能力定位与开放节奏,可据此判断欧洲开源权重模型当前的位置。
谷歌宣布自 10 月 9 日起调整 Gemini 模型访问权限:免费用户仅能使用 Flash-Lite,AI Plus 订阅用户失去 Pro 模型使用权只保留 Flash 系列,只有 AI Pro 和 Ultra 用户可继续使用 Pro 模型及 Deep Think 最大并行推理能力。
材料梳理了谷歌 Gemini 各档订阅权限的调整细节和第三方模型清退时间点,可据此判断现有工作流将受何影响。
OpenAI 在 DevDay 上发布 Decisions API,基于当前体量最小、价格最低的 GPT-6 Luna,让模型在一组预设答案中作出选择并返回置信度分数,官方给出的延迟为 150 毫秒,而直接用 GPT-6 Luna 完成同类任务需 1.6 秒。
围绕OpenAI新API与Jev的能力重合度,梳理了双方产品形态与护城河所在,可帮助读者判断这一赛道的竞争格局。