跳到正文

#模型发布

今日 21 条
9月23日周三
  1. NVIDIA AI(@NVIDIAAI)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NVIDIA 推出 Nemotron 3 Diarization 说话人分离模型,支持 8 人重叠语音

    NVIDIA 发布 Nemotron 3 Diarization 模型,可在多人同时说话、声音重叠时追踪谁在何时发言,最多支持 8 位说话人,参数量为 100M。该模型已在 Hugging Face 上线。

  2. Recraft(@recraftai)AI 评估 · 55/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Recraft V4.1 Flash 发布,1.3 秒生成图像

    Recraft 发布图像模型 Recraft V4.1 Flash,官方称生成一张图耗时 1.3 秒。用户可在模型选择器中选中 Flash 生成图像,再用 Refine 清理细节。

  3. Akshay Kothari(@akothari)AI 评估 · 37/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Opus 5.5 在写作上有巨大升级

    Claude Opus 5.5 在写作能力上迎来大幅升级,表达更自然,并回应了 Opus 5 收到的最常见反馈。它会将最重要的信息前置,并遵循用户给出的写作规则,让长会话更易跟进。

  4. ElevenLabs(@elevenlabsio)AI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ElevenLabs 发布 Scribe v2 Medical 临床语音转写模型

    ElevenLabs 发布语音转文字模型 Scribe v2 Medical,专为临床音频微调,相比基础版 Scribe v2 在临床音频上的词错误率(WER)降低 35%,提升了对药物名称、解剖结构和病理术语的识别准确度。

  5. 稀土掘金技术社区AI 评估 · 82/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 发布 Opus 5.5,OpenAI 随即推出 GPT-6 Sol 与 Luna

    Anthropic 先发布旗舰模型 Claude Opus 5.5,90 分钟后 OpenAI 推出 GPT-6 Sol 与 GPT-6 Luna 两款模型。Opus 5.5 定价 $4 / $20 每百万 token,比 Opus 5 便宜 20%,典型任务综合成本降 40%、加速 30%,Intelligence Index 得分 58 分登顶。

    为什么值得看

    Anthropic 与 OpenAI 同日发布新旗舰,文中给出的定价、上下文与基准数据可供对比两家最新模型定位。

  6. 夕小瑶科技说AI 评估 · 83/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    实测小米 MiMo-V2.6:Pro 版 AA 智能指数 46 分,跑一道题 0.13 美元

    小米正式推出 MiMo-V2.6-Flash、MiMo-V2.6-Pro 及 Pro 的 UltraSpeed 版本;Pro 在 Artificial Analysis 智能指数拿 46 分,超过 Kimi K3 和 Qwen3.8 Max。

    为什么值得看

    作者用编程、设计、视频三类实测展示 MiMo-V2.6 的实际交付能力,并给出与同级模型的价格对比。

  7. 卡尔的AI沃茨AI 评估 · 74/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    实测小米 MiMo V2.6:Pro、Flash、Pro-UltraSpeed 三个版本发布

    小米发布 MiMo V2.6 系列,包含 Pro、Flash 和 Pro-UltraSpeed 三个版本,其中 UltraSpeed 输出速度最高可达 Pro 的 20 倍。

  8. 机器之心SOTA模型AI 评估 · 80/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 发布 Claude Opus 5.5,OpenAI 推出 GPT-6 Sol 与 GPT-6 Luna

    Anthropic 发布 Claude Opus 5.5,重点提升代码库级迁移、调试、审查和长时间自主任务能力,API 输入输出每百万 token 分别为 4 美元和 20 美元,官方称典型任务整体运行成本较 Opus 5 降低约 40%、输出速度提高超过 30%。

    为什么值得看

    同一天多款编程与办公模型集中更新,并给出具体价格与运行成本变化,便于横向比较

  9. 魔搭ModelScope社区AI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jina AI 开源 jina-ocr-v1 文档解析模型

    Jina AI 开源端到端文档解析模型 jina-ocr-v1,总参数 3.4B、每 Token 仅激活 570M,在 OmniDocBench v1.6 得 91.14 分、olmOCR-Bench 得 83.4 分,均刷新同级别最佳成绩。

  10. Qwen(@Alibaba_Qwen)AI 评估 · 72/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    阿里发布 Qwen-Audio-3.1 音频模型栈,新增 TTS-Next 与 ASR-Next

    阿里发布 Qwen-Audio-3.1,ASR、TTS 与 Realtime 全面升级,并新增 TTS-Next 和 ASR-Next 两款模型,共五款覆盖理解、生成、交互与创作。

  11. Hunyuan(@TXhunyuan)AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    腾讯混元 Hy Image3.5 preview 上线 OnSolo,两周免费

    腾讯混元 Hy Image3.5 preview 已在 OnSolo 上线并免费开放两周,会员可免费使用。该预览版面向短剧角色设定图、全动态游戏素材和关键帧,支持 5 张参考图与 2K 画质,角色可在各集间保持一致,编辑时只需局部精修而无需重做。

  12. orange.ai(@oran_ge)AI 评估 · 46/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    看指标 Claude Opus 5.5 非常强悍,把 fable 和 astra 都比下去了?

    Claude Opus 5.5 在默认 effort 设置下即可取得前沿结果,每任务成本仅为其他模型的一小部分,常常击败以最高设置运行的模型,输出速度比 Opus 5 快 30% 以上。有观察者据此认为它把 fable 和 astra 都比了下去。

  13. Genspark(@genspark_ai)AI 评估 · 76/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Genspark 上线 GPT-6 Sol 与 GPT-6 Luna

    Genspark 宣布 GPT-6 Sol 和 GPT-6 Luna 已在其 AI Chat、Code Agent 和 Claw 中上线。OpenAI 表示这两款模型基于 GPT-6 Astra 的技术,定位更快、更便宜,面向规模化工作场景;同时提升了缓存和推理效率,Sol 与 Luna 的 API 价格相比 GPT-5.6 促销价降低 50%。

    为什么值得看

    Genspark 同步接入 GPT-6 Sol 与 Luna,可看到新模型接入第三方平台的速度和降价幅度。

  14. Hunyuan(@TXhunyuan)AI 评估 · 41/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ComfyUI 上线 Hy Image3.5 preview:人评胜率较 Hy Image3.0 提升 30%

    腾讯混元 Hy Image3.5 preview 已在 ComfyUI 上线,单模型同时支持文生图与图生图,最高可输出 2K 分辨率。官方称其人类评估胜率较 Hy Image3.0 提升 30%,支持多语言文字、符号与小字号渲染,覆盖电影、漫画、商业摄影和插画风格,并能在场景、服装和风格变化中保持人物身份与产品特征。

  15. Hunyuan(@TXhunyuan)AI 评估 · 43/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ComfyUI 上线 Hy image3.5 preview

    Hy Image3.5 preview 已在 ComfyUI 开放使用,单模型同时支持文生图与图生图,最高 2K 分辨率,人类评测胜率较 Hy Image3.0 提升 30%。该版本可正确渲染多语言文字、符号与小字,覆盖电影、漫画、商业摄影和插画风格,并在场景、服装与风格变化中保持人物身份与产品特征一致。

  16. 阿里研究院AI 评估 · 65/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    2026云栖大会首日:Qwen4训练中,平头哥发布真武V900芯片,阿里云推出AgentCore

    2026云栖大会首日,阿里公布大模型系列进展:基于新一代架构的Qwen4已在训练中,未来Qwen4.5、Qwen5等版本将扩展至5-10T参数;Qwen3.8-Max在人类零参与下自主迭代超1个月、完成33轮有效迭代,并在平头哥新款GPU上自主优化Qwen3.8-Flash推理框架,单实例推理吞吐量提升96%。

  17. Qwen(@Alibaba_Qwen)AI 评估 · 48/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qwen-Image-2.1 登顶 Image Edit 与 Text-to-Image 开源榜第一

    Qwen-Image-2.1 成为 Image Edit Arena 和 Text-to-Image Arena 的双料第一开源模型。其在 Image Edit Arena 拿下 1367 分,位列开源模型榜首,总榜排名第 16,距第 15 名的 GPT-Image-1.5-high-fidelity 仅差 3 分。该模型由阿里 Qwen 团队推出,现已开放试用。

  18. Simon Willison(@simonw)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Simon Willison 撰文评测 Claude Opus 5.5、GPT-6 Sol 与 GPT-6 Luna

    Simon Willison 发文评测同日发布的 Claude Opus 5.5、GPT-6 Sol 和 GPT-6 Luna 三款大模型,并给出不同模型家族在不同推理档位下生成鹈鹕图像的对比表格。

  19. 花叔AI 评估 · 84/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 发布 Opus 5.5,OpenAI 随后推出 GPT-6 Sol 与 GPT-6 Luna

    Anthropic 更新 Opus 5.5,每百万 token 输入 4 美元、输出 20 美元,比 Opus 5 降 20%,缓存读取从 0.5 美元降到 0.2 美元,已在 Claude Code 2.1.280 中设为默认 Opus 模型,支持 1M 上下文。

    为什么值得看

    作者用11道题横测Opus 5.5、Opus 5与Fable 5.1,给出真实账单与失败案例,可据此判断默认档位的取舍。

  20. orange.ai(@oran_ge)AI 评估 · 84/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GPT 6 全系列更新:Sol 和 Luna 降价 50%,Terra 消失

    GPT 6 全系列更新,Sol 和 Luna 价格下降 50%,Terra 消失;Sol 和 Luna 采用了与 Astra 类似的训练方法,能力更强、对齐更好、价格更低。

    为什么值得看

    梳理了 GPT 6 全系列更新与同日 Opus 5.5 降价的对比,可看两家同日的价格与能力变化。

  21. 数字生命卡兹克AI 评估 · 87/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Opus 5.5、GPT-6 Sol 与 Luna 同日发布

    Anthropic 发布 Claude Opus 5.5,OpenAI 发布 GPT-6 Sol 和 GPT-6 Luna,两款 GPT-6 新模型已上线 Codex,但尚未在 ChatGPT 聊天中提供。

    为什么值得看

    同一晚两家旗舰同代下放,对比价格、终端任务分数与实测体验,可看前沿能力下放的性价比取舍。

  22. Sam Altman(@sama)AI 评估 · 1/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Sam Altman 澄清此前所指为语音而非视频

    Sam Altman 发帖澄清自己此前说的是 VOICE 而非 video,并为造成的误解致歉。该帖获得 1352 次点赞和 239342 次浏览。

  23. Perplexity(@perplexity_ai)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Perplexity 实测:提示词使模型规避原失败案例比例从 75.1% 升至 93.7%

    在加入提示的情况下,未改动的模型规避原有失败案例的比例从 75.1% 升至 93.7%。另一项实时测试显示,不同训练版本之间工具调用失败率从 2.24% 降至 1.77%,且推理阶段未使用提示。

  24. Genspark(@genspark_ai)AI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Genspark Slides Benchmark 加入 Fireworks AI 的 SII,Gen-1 Slides 以约 1/17 输入 token 价格达到前沿级演示文稿质量

    Genspark Slides Benchmark 已被纳入 Fireworks AI 的 Specialized Intelligence Index(SII)。Genspark 首个自研模型 Gen-1 Slides 在其评测中实现前沿级演示文稿(deck)质量,输入 token 价格约为前者的 1/17。评测结果可在 fireworks.ai/specialized-in… 查看。

  25. Simon Willison(@simonw)AI 评估 · 72/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Simon Willison:GPT-6 Luna 价格仅为 5.6 Luna 的一半

    Simon Willison 指出 GPT-6 Luna 的价格是 5.6 Luna 的一半,而后者在能力表现下已经相当便宜。他称 Luna 因成本与速度是自己构建产品功能时最喜欢的模型。所引 OpenAI 内容称 GPT-6 Sol 与 GPT-6 Luna 基于 GPT-6 Astra 的技术进展,相比 GPT-5.6 促销价 API 价格降低 50%,同时提升了缓存与推理效率。

  26. AI SDK(@aisdk)AI 评估 · 70/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 发布 GPT-6 Sol 与 GPT-6 Luna,API 价格较 GPT-5.6 促销价低 50%

    OpenAI 推出 GPT-6 Sol 和 GPT-6 Luna,两款模型基于 GPT-6 Astra 的技术进展,将 Astra 的多数能力带入更快、更便宜的模型以支持规模化使用。官方称同时提升了缓存与推理效率,并将节省的成本直接传导给用户:Sol 和 Luna 的 API 价格比 GPT-5.6 促销价低 50%。AI SDK 同步发推介绍可在 AI SDK 中使用这两款模型。

  27. Perplexity(@perplexity_ai)AI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GPT-6 Sol 上线 Perplexity 与 Computer,并成为 Computer 默认 Light 选项

    GPT-6 Sol 已在 Perplexity 和 Computer 中上线,同时成为 Computer 努力程度选择器中的默认 Light 选项。该消息由 Perplexity 官方账号发布。

  28. Greg Brockman(@gdb)AI 评估 · 79/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 发布 GPT-6 Sol 和 GPT-6 Luna,API 价格较 GPT-5.6 促销价低 50%

    OpenAI 发布 GPT-6 Sol 和 GPT-6 Luna,两款模型基于 GPT-6 Astra 的技术进展,定位更快、更实惠,覆盖专业工作、事实性、编码、电脑操作和对齐等能力。OpenAI 同时优化了缓存和推理效率,并将节省直接传递给用户,Sol 和 Luna 的 API 价格比 GPT-5.6 促销价低 50%。

    为什么值得看

    OpenAI 发布 GPT-6 Sol 和 Luna 两款更快更便宜的模型,API 价格比 GPT-5.6 促销价低 50%,可据此判断成本结构变化。

  29. Sam Altman(@sama)AI 评估 · 68/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Sam Altman 称 GPT-6 Sol 和 Luna 在多项能力上较 5.6 家族大幅提升

    Sam Altman 表示 GPT-6 Sol 和 Luna 相比 5.6 家族前代,在智能、对齐、工作产出、编码和计算机操作等方面都有大幅提升,每 token 价格减半,按任务计费则更低。他还称若按每任务价格这一应当关键的指标衡量,市场上没有可竞争的产品,并希望人们能大量使用 AI。

  30. Sam Altman(@sama)AI 评估 · 39/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Sam Altman:GPT-6 Sol 与 Luna 在智能、对齐、代码等能力上大幅超越 5.6 系列,价格减半

    Sam Altman 称 GPT-6 Sol 和 Luna 在智能、对齐、工作产出、编程、计算机操作等方面均大幅超越 5.6 系列前代模型。两者每 token 价格为前代的一半,单任务成本更低。

  31. Sam Altman(@sama)AI 评估 · 77/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 发布 GPT-6 Sol 与 GPT-6 Luna 模型

    OpenAI 发布 GPT-6 Sol 和 GPT-6 Luna,称两款模型基于 GPT-6 Astra 的技术进展,把其部分优势带到更快、更便宜的模型中,以支持规模化工作。OpenAI 表示缓存与推理效率也有提升,Sol 和 Luna 的 API 价格相比 GPT-5.6 促销价降低 50%。

    为什么值得看

    这条信息给出了新模型的定位与 API 价格降幅,可据此了解 GPT-6 系列在速度与成本上的取舍。

  32. Jerry Liu(@jerryjliu0)AI 评估 · 74/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 发布 GPT-6 Sol 与 GPT-6 Luna,API 价格较 GPT-5.6 促销价低 50%

    OpenAI 发布 GPT-6 Sol 和 GPT-6 Luna,两者基于 GPT-6 Astra 的技术积累,把其部分能力下放到更快、更便宜的模型以支持规模化使用。OpenAI 同时提升了缓存与推理效率,并将节省直接让利:Sol 和 Luna 的 API 价格比 GPT-5.6 促销价低 50%。

  33. Cognition(@cognition_labs)AI 评估 · 57/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cognition 评测:GPT-6 Sol 比 GPT-5.6 Sol 少读约 17% 上下文

    Cognition 表示,在其评测中 GPT-6 Sol 达到相同分数时读取的上下文比 GPT-5.6 Sol 少约 17%,且最后一次编辑后很少留下测试失败的仓库。GPT-6 Luna 的最大提升出现在低和中等推理强度下,会编写真实的回归测试而非基于 mock 的测试。更多内容见 devin.ai/blog/gpt-6-sol。

  34. Cognition(@cognition_labs)AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GPT-6 Sol 与 Luna 接入 Devin,FrontierCode 1.1 上成本最高降约 75%

    GPT-6 Sol 和 Luna 已在 Devin 上线。在 FrontierCode 1.1 上,GPT-6 Sol 与 GPT-5.6 Sol 得分持平,但每任务成本低 61%;GPT-6 Luna 得分高于 GPT-5.6 Luna,成本约为后者的四分之一,每任务低于 $0.10,是该榜单上最便宜的模型。

  35. ChatGPT(@ChatGPTapp)AI 评估 · 68/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 向免费与 Go 用户开放 GPT-6 Luna 桌面端

    OpenAI 宣布免费与 Go 用户可在桌面应用中试用 GPT-6 Luna,即日起开始推送,并附上官方介绍页面链接 openai.com/index/introduc…。

  36. ChatGPT(@ChatGPTapp)AI 评估 · 73/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 发布 GPT-6 Sol 与 GPT-6 Luna,面向 ChatGPT Work 和 Codex 推送

    OpenAI 发布 GPT-6 Sol 和 GPT-6 Luna,当天起在 ChatGPT Work 和 Codex 中向 Plus、Pro、Business、Enterprise 和 Edu 用户推送。

  37. OpenAI(@OpenAI)AI 评估 · 39/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GPT-6 Sol 与 Luna 延续 Astra 对齐进展,较 GPT-5.6 同类模型提升

    GPT-6 Sol 与 Luna 基于 Astra 的对齐进展构建,较各自的 GPT-5.6 同类模型有所提升。该消息由 OpenAI 发布,未披露参数规模、benchmark 分数或可用性信息。

  38. OpenAI(@OpenAI)AI 评估 · 88/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 发布 GPT-6 Sol 和 Luna,面向 ChatGPT Work 与 Codex 多档用户及 API

    OpenAI 发布 GPT-6 Sol 和 Luna,今日在 ChatGPT Work 与 Codex 中面向 Plus、Pro、Business、Enterprise 和 Edu 用户上线,两款模型同时开放 API。Free 和 Go 用户可在桌面应用中试用 GPT-6 Luna。

    为什么值得看

    OpenAI 一次放出两个 GPT-6 版本并同步开放 API,读者可据此了解不同订阅档位能用到哪些模型。

  39. OpenAI(@OpenAI)AI 评估 · 79/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 发布 GPT-6 Sol 和 GPT-6 Luna

    OpenAI 发布 GPT-6 Sol 和 GPT-6 Luna,二者基于 GPT-6 Astra 的技术进展,将部分能力带入更快、更经济的模型以支持规模化工作。OpenAI 还提升了缓存和推理效率,Sol 与 Luna 的 API 价格比 GPT-5.6 促销价低 50%。

    为什么值得看

    OpenAI 发布 GPT-6 两个新成员,同时下调 API 价格,读者可据此比较性价比与适用规模。

  40. AI SDK(@aisdk)AI 评估 · 64/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI SDK 接入 Claude Opus 5.5,运行成本较 Opus 5 低 40%

    Anthropic 发布 Claude 5.5 系列首个模型 Claude Opus 5.5,在大多数任务上达到 Claude Fable 5.1 的水平。其运行成本比 Opus 5 低 40%。AI SDK 表示已可用 AI SDK 调用 Claude Opus 5.5。