跳到正文
10月10日 · 周六

当前筛选 · 今日暂无新精选

最近精选动态:10月9日 14:50

查看最新动态 →

最新精选

10月9日周五
  1. AI前线AI 评估 · 88/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI将GPT-6引入ChatGPT日常对话,并推出Intelligent UI

    OpenAI于10月7日宣布GPT-6进入ChatGPT日常对话,并推出Intelligent UI智能交互界面,向全球超过12亿周活跃用户开放。Plus、Pro、Business、Enterprise自10月7日起陆续获得GPT-6 Sol,Free和Go用户从10月8日起陆续获得GPT-6 Luna,企业工作区可用性还取决于管理员权限设置。

    最新进展10月9日 14:50OpenAI 向全部 ChatGPT 用户推送 GPT-6

    为什么值得看

    梳理了GPT-6在ChatGPT全员开放的分批安排,以及Intelligent UI如何把回答变成可交互界面。

10月8日周四
  1. Latent Space [Youtube]AI 评估 · 80/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 发布 Claude Haiku 5.5,定价对齐 GPT-6 Luna

    Anthropic 发布 Claude Haiku 5.5,这是 Haiku 系列约一年来的首次更新,定价与 OpenAI 的 GPT-6 Luna 持平,同日 Sonnet 5.5 缓存读取价格减半并推出订阅 API 额度。

    为什么值得看

    汇总了 Haiku 5.5 的定价、第三方评测与 token 消耗代价,读者可据此判断小型模型在智能体工作流中的实际位置。

10月7日周三
  1. DeepLearning.AI(@DeepLearningAI)AI 评估 · 80/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 发布 Gemini 3.8 Live 语音到语音模型

    Google 发布 Gemini 3.8 Live 语音到语音模型,跳过语音转文字再转语音的接力流程,在同一个系统内完成听、推理和回应。Extended Thinking 版本在 Artificial Analysis 的 Speech to Speech Index 排名第一,标准版本在真人盲测的实时对话中排名第二。

    为什么值得看

    对比传统级联语音助手的延迟来源,说明语音到语音模型把听、推理、回应合并到一套系统的差别。

  2. 新智元AI 评估 · 77/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Mistral 发布 1 万亿参数 Mistral Large 4,权重月底开源

    Mistral 发布新旗舰 Mistral Large 4,总参数 1 万亿,采用混合专家架构,每个 token 激活 490 亿参数,权重将于月底全部开源。

    为什么值得看

    通过第三方智能指数与多项细分基准的横向对比,读者可以看到开源万亿参数模型与闭源旗舰之间的实际差距。

  3. PyTorch研习社AI 评估 · 81/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 用内部模型产出 722 篇数学手稿并公开至 GitHub

    OpenAI 于 2026 年 10 月 6 日发布消息称,用一个尚未公开的内部前沿模型一次性产出 722 篇数学手稿,整理为 372 个结果,来自对约 4000 个开放研究问题的评估,平均每个结果算力约相当于 ChatGPT Pro 思考 3 小时,成果全部放在 Apache-2.0 协议的 GitHub 仓库 openai/math 中。

    为什么值得看

    OpenAI 以 GitHub 仓库而非期刊公开内部模型的数学产出,读者可了解其披露方式与研究协作的新变化。

10月6日周二
  1. Thomas Wolf(@Thom_Wolf)AI 评估 · 80/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Mistral AI 发布 Mistral Large 4,1T 参数多模态开放权重模型

    Mistral AI 发布 Mistral Large 4(代号 Le Chonk),1T 参数、原生多模态、49B 激活,号称是美欧聚合基准上最好的开放权重模型。该模型在网络防御、制造和金融等关键负载达到 SOTA,视觉 grounding 超过闭源前沿模型,端到端在欧洲锻造并可通过 Mistral Cloud 从欧洲部署,今日起 API 全面可用,开放权重将于十月底发布。

    为什么值得看

    Mistral Large 4 以 1T 参数、49B 激活的开放权重形态发布,可对照其与闭源前沿模型的基准位置。

  2. OpenRouter(@OpenRouterAI)AI 评估 · 77/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Mistral 发布 Mistral Large 4:1T 参数、原生多模态,开放权重 10 月底释出

    Mistral AI 发布 Mistral Large 4(代号 Le Chonk),1T 参数、49B 激活、原生多模态。官方称其在聚合基准上是美国或欧洲最好的开放权重模型,在网络防御、制造和金融等关键负载上达到 SOTA,视觉接地表现超过闭源前沿模型。

    为什么值得看

    Mistral Large 4 的参数规模、多模态能力与开放权重时间表一并给出,可据此判断欧洲开源模型的竞争位置。

  3. The Rundown AI(@TheRundownAI)AI 评估 · 83/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Mistral 发布 1T 参数开源模型 Mistral Large 4,代号 Le Chonk

    Mistral 发布 Mistral Large 4(代号 Le Chonk),1T 参数、原生多模态、49B 激活参数,已在 API 上线,开放权重将于 10 月底发布。

    为什么值得看

    原文列出 Mistral Large 4 在多类工作负载上的对照数字,读者可据此判断开源权重模型的竞争位置。

  4. Arthur Mensch(@arthurmensch)AI 评估 · 78/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Mistral AI 发布 Mistral Large 4,1T 参数原生多模态

    Mistral AI 发布 Mistral Large 4(代号 Le Chonk),1T 参数、原生多模态、49B 激活参数,在自有算力上训练和推理。官方称其在聚合基准上是美国或欧洲最好的开放权重模型,在网络安全、制造和金融等关键负载上达到 SOTA,视觉 grounding 超过闭源前沿模型;由欧洲端到端打造,可通过自有 Mistral Cloud 从欧洲部署。

    为什么值得看

    Mistral 联合创始人披露 Large 4 的参数量、多模态与自有算力训练细节,可据此判断欧洲开源模型的量级位置。

  5. Mistral AI(@MistralAI)AI 评估 · 77/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Mistral 发布 Mistral Large 4,1T 参数原生多模态

    Mistral AI 发布 Mistral Large 4(代号 Le Chonk),1T 参数、原生多模态、49B 激活参数,称其是美欧范围内聚合基准上最好的开源权重模型。该模型在网络安全、制造和金融等关键负载上达到 SOTA,并在视觉定位上超过闭源前沿模型;今日起通过 API 提供,开源权重将于 10 月底发布,并可通过其自有 Mistral Cloud 基础设施在欧洲部署。

    为什么值得看

    Mistral 官方给出新模型的参数规模、能力定位与开放节奏,可据此判断欧洲开源权重模型当前的位置。

10月1日周四
  1. AI寒武纪AI 评估 · 87/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    谷歌发布 Gemini 4 Argon:单次输出上限提至100万Token

    谷歌发布 Gemini 4 Argon,单次输出 Token 上限从 64K 提升至 100 万,面向软件工程、法律金融等企业级知识工作及网络安全防御场景。

    为什么值得看

    谷歌新一代模型把单次输出上限提升至100万Token,并给出内部代码迁移与定价细节,可据此判断长程任务的成本与落地边界。

9月30日周三
  1. The Rundown AI(@TheRundownAI)AI 评估 · 79/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 发布 GPT-6.1 Sol,称以五分之一价格接近 Astra 智能水平

    OpenAI 发布 GPT-6.1 Sol,官方称其以五分之一的价格提供接近 Astra 的智能水平,输入 $2 / 百万 token、输出 $10 / 百万 token。

    为什么值得看

    材料给出 GPT-6.1 Sol 在编码、办公与电脑操作三类任务上的对标结果和定价,可用来比较同价位模型的取舍。

  2. OpenAI(@OpenAI)AI 评估 · 80/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 向 ChatGPT Work 和 Codex 付费用户开放 GPT-6.1 Sol

    OpenAI 宣布 GPT-6.1 Sol 从今天起面向 ChatGPT Work 和 Codex 的 Plus、Pro、Business、Enterprise 和 Edu 用户开放。官方同时给出了介绍页面链接 openai.com/index/introduc…。

    为什么值得看

    OpenAI 公布 GPT-6.1 Sol 面向各付费档位开放,读者可据此了解新模型的可用范围。

9月29日周二
  1. 夕小瑶科技说AI 评估 · 78/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 发布 Claude Sonnet 5.5,编程能力逼近 Opus 5.5

    Anthropic 发布 Claude Sonnet 5.5,距 Opus 5.5 发布不到一周。在 Terminal-Bench 4.0 编程评测中,Sonnet 5.5 的 Max 档从上一代 Sonnet 5 的 10.3% 提升到 70.6%。

    为什么值得看

    梳理了 Sonnet 5.5 在编程与知识工作评测上的具体提升幅度、推理档位差异和官方迁移建议,便于对照选型。

  2. Mike Krieger(@mikeyk)AI 评估 · 78/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 发布 Claude Sonnet 5.5,速度快 30% 以上

    Anthropic 发布 Claude 5.5 家族的第二款模型 Claude Sonnet 5.5,相比 Sonnet 5 运行速度快 30% 以上,大多数工作场景成本最多降低 30%。该消息由 Mike Krieger 在 X 上转发引用 Claude 官方发布内容。

    为什么值得看

    Anthropic 5.5 家族第二款模型比上一代更快更便宜,读者可据此判断升级节奏与成本取舍。

9月23日周三
  1. Aravind Srinivas(@AravSrinivas)AI 评估 · 76/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    小米发布 MiMo-V2.6 Pro 与 Flash 全模态开源模型

    小米发布 MiMo-V2.6,包含 Pro 和 Flash 两个全模态模型,通过规模化强化学习推进,并可开放获取模型权重、技术报告、强化学习环境与训练代码。Pro 在多数智能体基准上与 Claude Opus 5 和 GPT-5.6 Sol 表现相当,在 Artificial Analysis 智能指数上得分 46,为开源模型中最高,同时在编码、电脑操作、3D 推理和创作能力上更强。

    为什么值得看

    小米发布 MiMo-V2.6 双版本开源权重模型,并给出与闭源前沿模型在智能体基准上的对照成绩。

  2. 夕小瑶科技说AI 评估 · 83/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    实测小米 MiMo-V2.6:Pro 版 AA 智能指数 46 分,跑一道题 0.13 美元

    小米正式推出 MiMo-V2.6-Flash、MiMo-V2.6-Pro 及 Pro 的 UltraSpeed 版本;Pro 在 Artificial Analysis 智能指数拿 46 分,超过 Kimi K3 和 Qwen3.8 Max。

    为什么值得看

    作者用编程、设计、视频三类实测展示 MiMo-V2.6 的实际交付能力,并给出与同级模型的价格对比。

  3. 机器之心SOTA模型AI 评估 · 80/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 发布 Claude Opus 5.5,OpenAI 推出 GPT-6 Sol 与 GPT-6 Luna

    Anthropic 发布 Claude Opus 5.5,重点提升代码库级迁移、调试、审查和长时间自主任务能力,API 输入输出每百万 token 分别为 4 美元和 20 美元,官方称典型任务整体运行成本较 Opus 5 降低约 40%、输出速度提高超过 30%。

    为什么值得看

    同一天多款编程与办公模型集中更新,并给出具体价格与运行成本变化,便于横向比较

  4. Genspark(@genspark_ai)AI 评估 · 76/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Genspark 上线 GPT-6 Sol 与 GPT-6 Luna

    Genspark 宣布 GPT-6 Sol 和 GPT-6 Luna 已在其 AI Chat、Code Agent 和 Claw 中上线。OpenAI 表示这两款模型基于 GPT-6 Astra 的技术,定位更快、更便宜,面向规模化工作场景;同时提升了缓存和推理效率,Sol 与 Luna 的 API 价格相比 GPT-5.6 促销价降低 50%。

    为什么值得看

    Genspark 同步接入 GPT-6 Sol 与 Luna,可看到新模型接入第三方平台的速度和降价幅度。

  5. 花叔AI 评估 · 84/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 发布 Opus 5.5,OpenAI 随后推出 GPT-6 Sol 与 GPT-6 Luna

    Anthropic 更新 Opus 5.5,每百万 token 输入 4 美元、输出 20 美元,比 Opus 5 降 20%,缓存读取从 0.5 美元降到 0.2 美元,已在 Claude Code 2.1.280 中设为默认 Opus 模型,支持 1M 上下文。

    为什么值得看

    作者用11道题横测Opus 5.5、Opus 5与Fable 5.1,给出真实账单与失败案例,可据此判断默认档位的取舍。