跳到正文

全部动态

今日 20 条
9月23日周三
  1. Perplexity(@perplexity_ai)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Perplexity 实测:提示词使模型规避原失败案例比例从 75.1% 升至 93.7%

    在加入提示的情况下,未改动的模型规避原有失败案例的比例从 75.1% 升至 93.7%。另一项实时测试显示,不同训练版本之间工具调用失败率从 2.24% 降至 1.77%,且推理阶段未使用提示。

  2. Genspark(@genspark_ai)AI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Genspark Slides Benchmark 加入 Fireworks AI 的 SII,Gen-1 Slides 以约 1/17 输入 token 价格达到前沿级演示文稿质量

    Genspark Slides Benchmark 已被纳入 Fireworks AI 的 Specialized Intelligence Index(SII)。Genspark 首个自研模型 Gen-1 Slides 在其评测中实现前沿级演示文稿(deck)质量,输入 token 价格约为前者的 1/17。评测结果可在 fireworks.ai/specialized-in… 查看。

  3. Simon Willison(@simonw)AI 评估 · 72/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Simon Willison:GPT-6 Luna 价格仅为 5.6 Luna 的一半

    Simon Willison 指出 GPT-6 Luna 的价格是 5.6 Luna 的一半,而后者在能力表现下已经相当便宜。他称 Luna 因成本与速度是自己构建产品功能时最喜欢的模型。所引 OpenAI 内容称 GPT-6 Sol 与 GPT-6 Luna 基于 GPT-6 Astra 的技术进展,相比 GPT-5.6 促销价 API 价格降低 50%,同时提升了缓存与推理效率。

  4. AI SDK(@aisdk)AI 评估 · 70/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 发布 GPT-6 Sol 与 GPT-6 Luna,API 价格较 GPT-5.6 促销价低 50%

    OpenAI 推出 GPT-6 Sol 和 GPT-6 Luna,两款模型基于 GPT-6 Astra 的技术进展,将 Astra 的多数能力带入更快、更便宜的模型以支持规模化使用。官方称同时提升了缓存与推理效率,并将节省的成本直接传导给用户:Sol 和 Luna 的 API 价格比 GPT-5.6 促销价低 50%。AI SDK 同步发推介绍可在 AI SDK 中使用这两款模型。

  5. Perplexity(@perplexity_ai)AI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GPT-6 Sol 上线 Perplexity 与 Computer,并成为 Computer 默认 Light 选项

    GPT-6 Sol 已在 Perplexity 和 Computer 中上线,同时成为 Computer 努力程度选择器中的默认 Light 选项。该消息由 Perplexity 官方账号发布。

  6. Greg Brockman(@gdb)AI 评估 · 84/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 发布 GPT-6 Sol 与 GPT-6 Luna,API 价格较 GPT-5.6 降 50%

    OpenAI 发布 GPT-6 Sol 与 GPT-6 Luna,两款模型基于 GPT-6 Astra 背后的进展,把其在专业工作、事实性、编码、计算机使用和对齐方面的能力带入更快、更便宜的版本,以支持规模化工作。OpenAI 同时提升了缓存与推理效率,并把节省直接让给用户:Sol 和 Luna 的 API 价格相比 GPT-5.6 促销价降低 50%。

    为什么值得看

    OpenAI 发布 GPT-6 Sol 与 Luna 两款更快更便宜的模型,并给出 API 价格降幅,便于判断成本与能力取舍。

  7. Sam Altman(@sama)AI 评估 · 39/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Sam Altman:GPT-6 Sol 与 Luna 在智能、对齐、代码等能力上大幅超越 5.6 系列,价格减半

    Sam Altman 称 GPT-6 Sol 和 Luna 在智能、对齐、工作产出、编程、计算机操作等方面均大幅超越 5.6 系列前代模型。两者每 token 价格为前代的一半,单任务成本更低。

  8. Sam Altman(@sama)AI 评估 · 77/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 发布 GPT-6 Sol 与 GPT-6 Luna 模型

    OpenAI 发布 GPT-6 Sol 和 GPT-6 Luna,称两款模型基于 GPT-6 Astra 的技术进展,把其部分优势带到更快、更便宜的模型中,以支持规模化工作。OpenAI 表示缓存与推理效率也有提升,Sol 和 Luna 的 API 价格相比 GPT-5.6 促销价降低 50%。

    为什么值得看

    这条信息给出了新模型的定位与 API 价格降幅,可据此了解 GPT-6 系列在速度与成本上的取舍。

  9. Jerry Liu(@jerryjliu0)AI 评估 · 74/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 发布 GPT-6 Sol 与 GPT-6 Luna,API 价格较 GPT-5.6 促销价低 50%

    OpenAI 发布 GPT-6 Sol 和 GPT-6 Luna,两者基于 GPT-6 Astra 的技术积累,把其部分能力下放到更快、更便宜的模型以支持规模化使用。OpenAI 同时提升了缓存与推理效率,并将节省直接让利:Sol 和 Luna 的 API 价格比 GPT-5.6 促销价低 50%。

  10. Cognition(@cognition_labs)AI 评估 · 57/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cognition 评测:GPT-6 Sol 比 GPT-5.6 Sol 少读约 17% 上下文

    Cognition 表示,在其评测中 GPT-6 Sol 达到相同分数时读取的上下文比 GPT-5.6 Sol 少约 17%,且最后一次编辑后很少留下测试失败的仓库。GPT-6 Luna 的最大提升出现在低和中等推理强度下,会编写真实的回归测试而非基于 mock 的测试。更多内容见 devin.ai/blog/gpt-6-sol。

  11. ChatGPT(@ChatGPTapp)AI 评估 · 68/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 向免费与 Go 用户开放 GPT-6 Luna 桌面端

    OpenAI 宣布免费与 Go 用户可在桌面应用中试用 GPT-6 Luna,即日起开始推送,并附上官方介绍页面链接 openai.com/index/introduc…。

  12. ChatGPT(@ChatGPTapp)AI 评估 · 73/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 发布 GPT-6 Sol 与 GPT-6 Luna,面向 ChatGPT Work 和 Codex 推送

    OpenAI 发布 GPT-6 Sol 和 GPT-6 Luna,当天起在 ChatGPT Work 和 Codex 中向 Plus、Pro、Business、Enterprise 和 Edu 用户推送。

  13. OpenAI(@OpenAI)AI 评估 · 39/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GPT-6 Sol 与 Luna 延续 Astra 对齐进展,较 GPT-5.6 同类模型提升

    GPT-6 Sol 与 Luna 基于 Astra 的对齐进展构建,较各自的 GPT-5.6 同类模型有所提升。该消息由 OpenAI 发布,未披露参数规模、benchmark 分数或可用性信息。

  14. OpenAI(@OpenAI)AI 评估 · 83/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 在 ChatGPT Work 与 Codex 上线 GPT-6 Sol 和 Luna

    OpenAI 面向 Plus、Pro、Business、Enterprise 和 Edu 用户,在 ChatGPT Work 与 Codex 中上线 GPT-6 Sol 和 Luna,两款模型同时开放 API。Free 和 Go 用户可在桌面应用试用 GPT-6 Luna。

    为什么值得看

    OpenAI 官方公布 GPT-6 Sol 与 Luna 的开放范围,读者可据此确认不同订阅档位和 API 的可用差异。

  15. OpenAI(@OpenAI)AI 评估 · 73/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 发布 GPT-6 Sol 与 GPT-6 Luna,API 价格较 GPT-5.6 促销价低 50%

    OpenAI 发布 GPT-6 Sol 与 GPT-6 Luna 两款模型,二者基于 GPT-6 Astra 的技术进展,将其中多项能力带入更快、更便宜的模型,以支持规模化工作负载。OpenAI 同时优化了缓存与推理效率,并将节省的成本直接让渡给用户,Sol 和 Luna 的 API 价格比 GPT-5.6 促销价低 50%。

  16. Cognition(@cognition_labs)AI 评估 · 35/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Opus 5.5 在 FrontierCode 1.1 以 65.3% 登顶 Extended 榜

    Opus 5.5 在 Cognition 的 FrontierCode 1.1 基准上取得 Extended 65.3% 的成绩,超越 Fable 5 登顶,且成本仅为后者的一小部分。该基准针对真实工程任务,评估代码的可合并性与质量。

  17. AI SDK(@aisdk)AI 评估 · 64/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI SDK 接入 Claude Opus 5.5,运行成本较 Opus 5 低 40%

    Anthropic 发布 Claude 5.5 系列首个模型 Claude Opus 5.5,在大多数任务上达到 Claude Fable 5.1 的水平。其运行成本比 Opus 5 低 40%。AI SDK 表示已可用 AI SDK 调用 Claude Opus 5.5。

  18. Alex Albert(@alexalbert__)AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 预告 Claude Sonnet 5.5 与 Haiku 5.5 将于数周内发布

    Mike Krieger 表示 Anthropic 将在未来几周内推出 Claude Sonnet 5.5 和 Haiku 5.5,这两款模型将带来与近期发布相近的性能、效率和安全性改进。他同时称今天只是开始,后续还有更多内容。

  19. Mike Krieger(@mikeyk)AI 评估 · 41/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 将在未来数周推出 Claude Sonnet 5.5 和 Haiku 5.5

    Anthropic 将在未来数周推出 Claude Sonnet 5.5 和 Haiku 5.5。这两款模型将带来性能、效率与安全方面的多项相同改进。

  20. Mike Krieger(@mikeyk)AI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 称 Opus 5.5 经过广泛对齐测试与外部评估

    Anthropic 的 Opus 5.5 经过了广泛的对齐测试,并接受 METR 等外部机构评估,同时针对网络与生物等高风险领域引入了防护措施。

  21. Mike Krieger(@mikeyk)AI 评估 · 76/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 发布 Claude Opus 5.5,主打编码与知识工作

    Anthropic 发布 Claude 5.5 系列的首个模型 Claude Opus 5.5,官方称其在编码和知识工作上领先,写作能力也较强。该模型在多数任务上表现与 Claude Fable 5.1 相当,运行成本比 Opus 5 低 40%。

    为什么值得看

    Anthropic 新模型系列的定价与能力对照信息,可看出成本与性能的取舍方向。

  22. v0(@v0)AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    v0 现已支持 Claude Opus 5.5

    v0 宣布用户现在可以在 v0 中使用 Claude Opus 5.5,并附上试用入口 v0.app/?opus55。引用 Anthropic 的介绍,Claude Opus 5.5 是 Claude 5.5 系列的首个模型,多数任务上表现达到 Claude Fable 5.1 的水平,运行成本比 Opus 5 低 40%。

  23. Alex Albert(@alexalbert__)AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Alex Albert 体验 Claude Opus 5.5:更快更省,多数任务达到 Fable 5.1 水平

    Claude 发布 Claude Opus 5.5,这是新 Claude 5.5 系列的首个模型,多数任务表现达到 Claude Fable 5.1 的水平,运行成本比 Opus 5 低 40%。Alex Albert 表示使用 Opus 5.5 的体验很好,认为它聪明、写作清晰、速度快且成本低得多。

  24. cat(@_catwu)AI 评估 · 74/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Opus 5.5 成为 Claude Code 与 Claude 应用默认模型

    Claude Opus 5.5 现已成为 Claude Code 和 Claude 应用(含 Cowork)的默认模型,面向 Pro、Max 和 Team 套餐开放。

  25. Anthropic(@AnthropicAI)AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 发布 Claude Opus 5.5

    Anthropic 宣布 Claude Opus 5.5 今日上线,是其全新 Claude 5.5 家族的首款模型。官方称它在大多数任务上达到 Claude Fable 5.1 的水平,运行成本比 Opus 5 低 40%。

  26. Browser Use(@browser_use)AI 评估 · 54/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Browser Use 称开源 MiMo v2.6 模型成为新帕累托前沿

    Browser Use 称开源 MiMo v2.6 系列模型成为新的帕累托前沿,其中 MiMo v2.6 Flash 得分 37.6,Grok 4.7 为 39.9。其记录的智能体成本比 Grok 4.7 低 57 倍,比 DeepSeek v4.1 Flash(low)便宜 27%,每任务 $0.10 对 $5.72,两项对比各跑 60 个任务。

9月22日周二
  1. ElevenLabs(@elevenlabsio)AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ElevenLabs 发布 Scribe v2 Medical,临床音频转录 WER 降低 18%

    ElevenLabs 发布语音转文本模型 Scribe v2 Medical,针对临床音频微调,相较基础版 Scribe v2 在临床音频上的词错误率(WER)降低 18%。该模型提升了对药物名称、解剖结构和病理术语的识别能力。

  2. 魔搭ModelScope社区AI 评估 · 87/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    小米发布并开源 Xiaomi MiMo-V2.6 系列,扩展强化学习规模

    小米团队正式发布并开源 Xiaomi MiMo-V2.6 系列,包含 Pro 和 Flash 两个原生全模态模型。

    为什么值得看

    原文给出开源模型在AA综合指数上的位置与RL算力扩展的公开细节,便于比较开源与闭源差距。

  3. Founder ParkAI 评估 · 69/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jev 创始人 Diogo Almeida 谈为何做只做判断的 System 1 模型

    TypeSafe 于 9 月 15 日结束两年隐身期发布 Jev,并宣布完成由 DCVC 领投的 4000 万美元种子轮融资;创始人 Diogo Almeida 曾在 OpenAI 参与 InstructGPT、ChatGPT 和 GPT-4 研究,此次转向做一个不生成文字、只输出 Choice、Score、Noul 三种结构化判断与概率的 System 1 模型。

  4. 机器之心SOTA模型AI 评估 · 74/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    小米开源 MiMo-V2.6 Pro/Flash,xAI 发布 Grok 4.7,APUS 开源决策模型 OpenJev-v1

    小米发布原生全模态模型 MiMo-V2.6 Pro 与 Flash 并开放 MIT 许可权重,API 沿用 V2.5 定价;Pro 与 Flash 在长程软件工程评测 DeepSWE v1.1 中分别达到 72.6 和 65.7,较本轮训练前提升约 14 分和 17 分。

  5. 小米技术AI 评估 · 84/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    小米发布并开源 MiMo-V2.6 系列:扩展 RL 算力,含 Pro 与 Flash 两个全模态模型

    小米正式发布并开源 Xiaomi MiMo-V2.6 系列,包含 Pro 和 Flash 两个原生全模态模型,定位为探索 RSI(递归自我改进)路径的关键一步。

    为什么值得看

    小米开源 MiMo-V2.6 系列,公开 RL 算力扩展细节与 6 天 Live 训练实测数据,可观察开源模型追赶闭源的一条路径。

  6. Hunyuan(@TXhunyuan)AI 评估 · 57/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    腾讯混元 Hy Image3.5 preview 上线,支持文生图与图生图

    腾讯混元 Hy Image3.5 preview 上线,提供专业级图像生成,人工评测胜率比 Hy Image3.0 高 30%,支持文生图和图生图,最高 2K,一致性更好。API 按每张 0.024 美元计费,参考图不收费,Miora 和 OnSolo 提供两周免费试用。

  7. 阿里技术AI 评估 · 56/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    阿里发布Logics-Parsing-V3开源文档解析模型

    阿里巴巴在云栖大会推出 Logics-Parsing-V3 开源文档解析模型,通过循环滑动窗口与结构状态传递处理跨页内容,解决表格截断、文本割裂和标题层级错位问题。

  8. Qwen(@Alibaba_Qwen)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qwen-Image-2.1 获 Intel OpenVINO Day-0 支持

    Qwen-Image-2.1 获得 Intel OpenVINO 的 Day-0 支持,可在 Intel 硬件上优化运行。该模型以单一开放权重 checkpoint 同时支持图像生成与编辑。Intel Devs 表示已为 Qwen-Image-2.1 提供 Day-0 OpenVINO 支持。

  9. Hunyuan(@TXhunyuan)AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    腾讯混元发布 Hy Image3.5 预览版,人评胜率较 3.0 提升 30%

    腾讯混元上线 Hy Image3.5 预览版,官方称在人类评估中相较 Hy Image3.0 胜率提升 30%,支持文生图与图生图,最高 2K 分辨率,一致性更好。API 已在腾讯云上线,每张图 0.024 美元,参考图不计费,并提供两周免费试用(仅限 OnSolo 与 Miora)。

  10. Hunyuan(@TXhunyuan)AI 评估 · 49/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    腾讯混元 Hy4 preview 用 214 GiB 装下 770B 参数模型:STQ1_0 量化如何做到"体积更小、智能不变"

    腾讯混元团队把 Hy4 preview 的权重从约 1.5TB 压缩到 214 GiB,参数量仍为 770B,改变的是权重的表示方式。

  11. 腾讯混元AI 评估 · 69/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    腾讯混元发布 Hy Image3.5 preview 专业级生图模型

    腾讯混元发布混元图像 3.5 预览版(Hy Image3.5 preview),一款高性价比专业级生图模型,对比 Hy Image3.0 综合能力提升约 30%。

  12. 数字生命卡兹克AI 评估 · 81/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    小米发布 MiMo V2.6 系列模型并全面开源

    小米发布 MiMo-V2.6 系列,含 Pro、Flash 和 20 倍速的 Pro-UltraSpeed 三个版本,AA 指数 46 分与同日发布的 Grok 4.7 打平,位列开源模型第一。

    为什么值得看

    作者以实测视角对比 Grok 4.7 与 MiMo V2.6 的性能、价格和速度,呈现国产开源模型的实际能力边界。

  13. Vercel NewsAI 评估 · 72/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI GPT-6 Sol 与 GPT-6 Luna 上线 Vercel AI Gateway

    OpenAI 的 GPT-6 Sol 和 GPT-6 Luna 现已上线 Vercel AI Gateway。

  14. Vercel NewsAI 评估 · 76/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Opus 5.5 上线 Vercel AI Gateway

    Anthropic 的 Claude Opus 5.5 已在 Vercel AI Gateway 上线,模型标识为 anthropic/claude-opus-5.5,支持 1M token 上下文窗口和最多 128K 输出 token,面向智能体编码、长时智能体任务和专业知识工作。

    为什么值得看

    Claude Opus 5.5 上线 Vercel AI Gateway,同时列出两项会导致 400 报错的 API 不兼容变更,便于现有调用方迁移。