跳到正文

#编码

今日 3 条
今天10月10日周六
  1. THE DECODERAI 评估 · 44/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google Gemini 4 "Carbon" 模型据称编码性能追平 Anthropic Opus 5.5

    据 Business Insider 看到的内部文件与聊天记录,Google 正在测试 Argon、Barium、Carbon 三个 Gemini 4 变体,其中 Carbon 已部署在内部编码平台 Jetski 上,被认为在编程任务上强于 Argon,有员工将其比作 Anthropic 最强的编码模型 Opus 5.5,但仍需更多测试。

  2. 宝玉(@dotey)AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 内部测试新模型 Carbon,员工称编码能力“感觉像 Opus 5.5”

    Google 内部正在测试新模型 Carbon,部署在内部 AI 编程工具 Jetski 上,有员工称其编码能力“感觉像 Opus 5.5”。Carbon 是在 9 月 30 日发布的 Gemini 4 Argon(内部版本 Barium-B)之后训练出的新版本,将作为 Argon 升级还是独立发布尚不清楚。

  3. elvis(@omarsar0)AI 评估 · 71/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    StepFun Step 5 Preview 发布次日登顶 OpenRouter Trending

    阶跃星辰的 Step 5 Preview 发布一天后登上 OpenRouter Trending 第一名,并已在 Kilo Code、Cline、Hermes Agent 和 OpenCode 中可用。

10月9日周五
  1. 新智元AI 评估 · 64/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    谷歌 Gemini 4 Argon 现身 Google Cloud 与 Antigravity,最快今日发布

    谷歌下一代模型 Gemini 4 Argon 尚未官宣,已被曝密集现身多个平台,最快将于本周甚至数小时内发布。爆料称其发布卡片已上线谷歌内部系统及部分 Pro 用户界面,并已进入 Google Cloud 控制台,在编程工具 Antigravity 中被设为默认模型,还出现了真实的代码提交记录。

  2. OpenRouter(@OpenRouterAI)AI 评估 · 57/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    阶跃星辰 Step 5 Preview 上线 OpenRouter,稀疏 MoE 架构支持 1M 上下文

    阶跃星辰(StepFun)的 Step 5 Preview 已在 OpenRouter 上线,官方称其为面向智能体任务的新旗舰模型。该模型采用稀疏 MoE 架构,激活参数 27B、总参数 600B,支持 1M 上下文以及文本、图像和视频输入,官方称其在编码和专业领域知识工作上表现较强,尤其是金融场景。

  3. OpenRouter(@OpenRouterAI)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    StepFun 8 项基准评测:Step 5 Preview 在 6 项上击败 Kimi K3 和 GLM-5.3

    在 StepFun 的 8 项基准评测中,Step 5 Preview 在 6 项上超过 Kimi K3 和 GLM-5.3,包括 DeepSWE(67.7)、ProgramBench(80.5)、StepCodeBench(49.0)和 FrontierFinance(66.4)。该结果由 StepFun 自家评测给出。

  4. Claude(@claudeai)AI 评估 · 57/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 发布 Claude Haiku 5.5,在编码、computer use 与知识工作上较 Haiku 4.5 显著提升

    Anthropic 发布 Claude Haiku 5.5,官方称其在编码、computer use 和知识工作方面较 Haiku 4.5 有显著提升。目前可获取的信息仅为这一结论,官方未在原文中给出具体评测数据、价格或可用范围。

  5. lmarena.ai(@lmarena_ai)AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Mistral Large 4 预览版登 Code Arena WebDev 第 45 名,成唯一上榜欧洲实验室

    Mistral Large 4 预览版在 Code Arena: WebDev 以 1534 分位列第 45 名,比 Mistral Large 3 提升 304 分,使 MistralAI 进入该榜前 15 实验室,是唯一上榜的欧洲实验室。

  6. lmarena.ai(@lmarena_ai)AI 评估 · 72/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Haiku 5.5 在 Code Arena WebDev 以 1587 分首秀排第 30

    Arena.ai 公布 Claude Haiku 5.5 (High) 在 Code Arena: WebDev 的真实评测结果,首秀以 1587 分排在第 30 位,略在帕累托前沿之外,但仍然具备很强的成本效率。

  7. OpenRouter(@OpenRouterAI)AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenRouter 上线 OpenAI GPT-6.1 Sol Ultrafast

    OpenRouter 宣布 OpenAI GPT-6.1 Sol 的 Ultrafast 模式已在其平台上线,链接指向 openrouter.ai/openai/gpt-6.1。

10月8日周四
  1. The JetBrains BlogAI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    JetBrains 发布 Mellum2.1:面向编码智能体的快速开源模型

    JetBrains 发布开源模型 Mellum2.1,这是 6 月开源的 12B MoE 模型的新版本,架构未变,仍为 2.5B 激活参数、Apache 2.0 许可,改进集中在预训练之后的强化学习阶段。

  2. Windsurf(@windsurf_ai)AI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Haiku 5.5 上线 Devin

    Claude Haiku 5.5 已在 Devin 上线,在 FrontierCode 1.1 上得分 58.4%,超过 Sonnet 5,且每任务成本约为其八分之一。它还可作为 Fusion 中的辅助模型,搭配 Opus 5.5 作为 Lead 在 Devin Desktop 和 CLI 中使用。

  3. Alex Albert(@alexalbert__)AI 评估 · 75/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Haiku 5.5 发布 速度更快且便宜 75%

    Claude Haiku 5.5 在编码、computer use 和知识工作方面相比 Haiku 4.5 有显著提升,同时速度更快、价格便宜 75%。作者提到 Haiku 4.5 发布于 2025 年 10 月 15 日,两代间隔不到一年。

10月7日周三
  1. Mistral AI(@MistralAI)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Mistral Large 4 在 Harvey 法律智能体基准 LAB 上位列开源模型第一

    在 Harvey 的法律智能体基准 LAB(Legal Agent Benchmark)上,Mistral Large 4 成为排名第一的开源模型(oss model)。该结果由 Mistral AI 公布,评测针对法律领域的智能体任务。

  2. 新智元AI 评估 · 77/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Mistral 发布 1 万亿参数 Mistral Large 4,权重月底开源

    Mistral 发布新旗舰 Mistral Large 4,总参数 1 万亿,采用混合专家架构,每个 token 激活 490 亿参数,权重将于月底全部开源。

    为什么值得看

    通过第三方智能指数与多项细分基准的横向对比,读者可以看到开源万亿参数模型与闭源旗舰之间的实际差距。

  3. Geek(@geekbb)AI 评估 · 17/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenCode 上线隐身模型 Exo Free

    OpenCode 出现一款新的隐身模型 Exo Free,目前已在平台上可供试用。该消息来自 Hakm 的推文,附带 Quoted Tweet 链接,未披露模型规模、上下文长度或基准分数等细节。

  4. Vercel NewsAI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Vercel 在 AI Gateway 上线隐身模型 Glyph Cluster 并限时免费

    Vercel 在 AI Gateway 上线隐身模型 Glyph Cluster,Pro 和 Enterprise 套餐且购买了 AI Gateway 额度的团队在隐身期可免费使用。

10月6日周二
  1. Amjad Masad(@amasad)AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Reflection 发布 Beam:501B 参数、23B 激活的开源智能体模型

    Reflection 推出 Beam,一个总参数 501B、激活 23B 的高效智能体开放模型,主打前沿推理效率,并在编码与智能体任务上推进西方开源前沿,从零端到端训练。完整权重将于本月发布,详情见 reflection.ai/beam。

  2. The Rundown AI(@TheRundownAI)AI 评估 · 63/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Reflection 发布首款开源模型 Beam,501B 总参数、23B 激活

    Reflection 发布首款模型 Beam,一款面向智能体的高效开源权重模型,总参数 501B、激活参数 23B,主打前沿推理效率,并在编码与智能体任务上推进西方开源前沿,从零端到端训练。完整权重将于本月发布,详情见 reflection.ai/beam。

  3. NVIDIA AI(@NVIDIAAI)AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NVIDIA Nemotron-Labs-3-Competitive-Coding 上架 Hugging Face

    NVIDIA 将 Nemotron-Labs-3-Competitive-Coding 发布到 Hugging Face,这是一个基于 Nemotron-3-Ultra 的竞赛编程专用模型。该模型聚焦竞技编程场景。

  4. clem 🤗(@ClementDelangue)AI 评估 · 63/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Reflection 发布 Beam 开源智能体模型,501B 总参数、23B 激活

    Reflection AI 发布名为 Beam 的高效智能体开源模型,总参数 501B、激活参数 23B。官方称其在编码与智能体任务上推进了西方开源前沿,主打前沿推理效率,并从头端到端训练,完整权重将于本月发布。

  5. ollama(@ollama)AI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Reflection AI 开源 Beam 模型,501B 总参数、23B 激活,即将上线 Ollama

    Reflection AI 推出高效智能体开源模型 Beam,总参数 501B、激活参数 23B,从零端到端训练,主打前沿推理效率并推进西方开源模型在编程与智能体任务上的边界。Ollama 表示更多美国模型将接入,Beam 完整权重本月发布。

10月5日周一
  1. Fireworks AI(@FireworksAI_HQ)AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Fireworks AI 上线 DeepSeek V4.1 Flash 训练支持

    Fireworks AI 宣布 DeepSeek V4.1 Flash 现可在 Dedicated Training API 和 Managed Training 两个入口上训练。官方称它是智能体编码、终端自动化和工具调用的强基础模型,且服务成本很低,并给出了微调文档链接 docs.fireworks.ai/fine-tuning/mo…。

10月3日周六
  1. meng shao(@shao__meng)AI 评估 · 19/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Ling-3.1-Flash 实测:蚂蚁百灵 1M 上下文模型一把过 TE 风格信息卡

    蚂蚁百灵新一代大模型 Ling-3.1-Flash 在「Teenage Engineering 风格信息卡」提示词测试中一把过,输出效果达标。该模型为 560B/A25B MoE 架构,支持 1M token 上下文,输出速度基本维持在 100+ tokens/s,整个推理生成与校验流程约 2-3 分钟完成。

10月2日周五
  1. 爱范儿AI 评估 · 64/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    和 Opus 5.5 同题交卷,MiniMax M3.1 让 Flash 开始超纲了

    作者在 MiniMax Code 里沿用 Claude Opus 5.5 公开案例的提示词,用 MiniMax M3.1 Flash Preview 同题生成动态设计作品集。

10月1日周四
  1. 谷歌开发者AI 评估 · 79/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 发布 Gemini 4 Argon 前沿模型

    Google DeepMind 推出前沿 AI 模型 Gemini 4 Argon,主打复杂长流程任务中的深度推理,目前通过 Fairwind 计划向网络安全专家开放试用。

    为什么值得看

    官方披露了 Gemini 4 Argon 在软件工程、安全防御等长流程任务中的能力和定价,可据此判断前沿模型在企业工作流中的落地进展。

  2. Varun Mohan(@_mohansolo)AI 评估 · 43/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gemini 4 Argon 在 AA Coding Agent Index 表现亮眼

    Gemini 4 Argon 在 AA Coding Agent Index 上使用 Antigravity harness 取得不错成绩,不过真实世界使用情况更为重要。发布者表示后续还有更多进展。

  3. AI寒武纪AI 评估 · 87/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    谷歌发布 Gemini 4 Argon:单次输出上限提至100万Token

    谷歌发布 Gemini 4 Argon,单次输出 Token 上限从 64K 提升至 100 万,面向软件工程、法律金融等企业级知识工作及网络安全防御场景。

    为什么值得看

    谷歌新一代模型把单次输出上限提升至100万Token,并给出内部代码迁移与定价细节,可据此判断长程任务的成本与落地边界。

  4. Varun Mohan(@_mohansolo)AI 评估 · 57/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 发布 Gemini 4 Argon 前沿模型

    Google 发布新前沿模型 Gemini 4 Argon,在复杂软件任务上提供前沿性能,数千名 Google 员工已在 Antigravity 内部使用。该模型先向 Fairwind 计划中一批受信任的网络防御者开放,更广泛的可用性将尽快推出。Sundar Pichai 表示它在复杂工作流、网络防御和软件工程中展现前沿性能,团队在 Google 内部从编码到量子计算广泛使用。

  5. Sundar Pichai(@sundarpichai)AI 评估 · 63/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 预告 Gemini 4 Argon,公布复杂工作流与软件工程基准表现

    Google 发布预告,推出下一代模型 Gemini 4 Argon,称其在复杂工作流、网络防御和软件工程方面展现前沿性能。团队已在 Google 内部从编码到量子计算广泛使用,并附上基准数据与反馈。

9月30日周三
  1. 智东西AI 评估 · 53/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    美团 LongCat-2.5-Preview 上线,万亿参数模型实测复刻 Muse 前端

    美团 LongCat 团队于 9 月 25 日上线预览版模型 LongCat-2.5-Preview,并在 OpenCode 开放两周限时免费体验。该模型总参数 1.6 万亿,每次推理激活约 480 亿参数,支持 100 万 Token 上下文窗口和原生多模态,主要面向长周期任务。

  2. Vercel NewsAI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    InclusionAI 的 Ling 3.1 Flash 上线 AI Gateway,10 月 13 日前免费

    InclusionAI 的 Ling 3.1 Flash 已在 AI Gateway 上线,10 月 13 日前免费使用。该模型为混合推理语言模型,总参数 560B、每 token 激活 25B,在 AI Gateway 上支持 262K token 上下文窗口,面向编码、多步分析与工具调用智能体。

  3. v0(@v0)AI 评估 · 74/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GPT-6.1 Sol 上线 v0,可通过 AI Gateway 调用

    GPT-6.1 Sol 已在 v0 上线,可在 v0.app 试用。v0 引用的 Vercel Developers 消息称,GPT-6.1 Sol 已在 AI Gateway 上线,相比 GPT-6 Sol 在编码、computer use、多步工作流和复杂文档分析方面有所改进。

  4. Augment Code(@augmentcode)AI 评估 · 48/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GPT-6.1 Sol 已在 Cosmos 上线,Augment Code 将替换 GPT-5.6 Sol 与 GPT-6 Sol

    GPT-6.1 Sol 现已在 Cosmos 上线,Augment Code 表示将在未来几天用它替换软件工厂中的 GPT-5.6 Sol 和 GPT-6 Sol。该消息发布于 OpenAI DevDay 之后。

  5. The Rundown AI(@TheRundownAI)AI 评估 · 79/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 发布 GPT-6.1 Sol,称以五分之一价格接近 Astra 智能水平

    OpenAI 发布 GPT-6.1 Sol,官方称其以五分之一的价格提供接近 Astra 的智能水平,输入 $2 / 百万 token、输出 $10 / 百万 token。

    为什么值得看

    材料给出 GPT-6.1 Sol 在编码、办公与电脑操作三类任务上的对标结果和定价,可用来比较同价位模型的取舍。

  6. OpenAI(@OpenAI)AI 评估 · 69/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 发布 GPT-6.1 Sol,多项基准接近 GPT-6 Astra 且成本更低

    OpenAI 宣布 GPT-6.1 Sol 发布,称其在编码、computer use 和复杂专业工作上相较 GPT-6 Sol 有显著升级。该模型在多项基准上接近 GPT-6 Astra,同时成本大幅更低。

9月29日周二
  1. Genspark(@genspark_ai)AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Genspark 上线 Claude Sonnet 5.5,覆盖 AI Chat、Code Agent 与 Claw

    Claude Sonnet 5.5 已上线 Genspark,接入 AI Chat、Code Agent 和 Claw。Genspark 称这是 Anthropic 目前最快的 Sonnet,输出速度提升 30% 以上,单任务成本比 Sonnet 5 最多降低 30%,价格保持不变。

  2. 夕小瑶科技说AI 评估 · 78/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 发布 Claude Sonnet 5.5,编程能力逼近 Opus 5.5

    Anthropic 发布 Claude Sonnet 5.5,距 Opus 5.5 发布不到一周。在 Terminal-Bench 4.0 编程评测中,Sonnet 5.5 的 Max 档从上一代 Sonnet 5 的 10.3% 提升到 70.6%。

    为什么值得看

    梳理了 Sonnet 5.5 在编程与知识工作评测上的具体提升幅度、推理档位差异和官方迁移建议,便于对照选型。

  3. Akshay Kothari(@akothari)AI 评估 · 71/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Databricks 评测:Opus 5.5 与 GPT-6 Luna 如何改变成本质量前沿

    Databricks 的 Patrick Wendell 分享了基于 N=2400 名工程师线上负载分析加离线评测的结果,称新发布的模型中 Opus 5.5 与 GPT-6 Luna 明显扩展了成本与质量的前沿。

9月27日周日
  1. Vercel NewsAI 评估 · 56/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Fireworks 的 Ember-1 上线 Vercel AI Gateway

    Fireworks 的 Ember-1 已在 Vercel AI Gateway 上线,这是一个基于 Kimi K3 构建、面向编码与智能体工作流的研究预览版推理模型。