跳到正文

全部动态

今日 14 条
今天10月10日周六
  1. THE DECODERAI 评估 · 44/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google Gemini 4 "Carbon" 模型据称编码性能追平 Anthropic Opus 5.5

    据 Business Insider 看到的内部文件与聊天记录,Google 正在测试 Argon、Barium、Carbon 三个 Gemini 4 变体,其中 Carbon 已部署在内部编码平台 Jetski 上,被认为在编程任务上强于 Argon,有员工将其比作 Anthropic 最强的编码模型 Opus 5.5,但仍需更多测试。

  2. AI Will(@FinanceYF5)AI 评估 · 63/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 用未发布内部模型生成 722 篇数学手稿

    OpenAI 发布了一款未公开内部模型生成的 722 篇数学手稿,按 372 个相关结果族归类,来自约 4000 道研究问题的评测。OpenAI 称标准流程每条结果平均消耗约三小时 ChatGPT Pro 的思考算力,此次发布包含论文、证明产物和部分推理摘要,模型本身仍未发布。

  3. 宝玉(@dotey)AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 内部测试新模型 Carbon,员工称编码能力“感觉像 Opus 5.5”

    Google 内部正在测试新模型 Carbon,部署在内部 AI 编程工具 Jetski 上,有员工称其编码能力“感觉像 Opus 5.5”。Carbon 是在 9 月 30 日发布的 Gemini 4 Argon(内部版本 Barium-B)之后训练出的新版本,将作为 Argon 升级还是独立发布尚不清楚。

  4. OpenRouter(@OpenRouterAI)AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    微软 Decision-1 上线 OpenRouter,基于 Qwen3.5-9B 后训练

    微软新模型 Microsoft-Decision-1 上线 OpenRouter,由 Qwen3.5-9B 后训练而来,主打快速决策任务。微软给出的数据是:在 36 个盲测基准(约 15 万道题)上准确率最高,比第二名快 4.5 倍,比 GPT-6 Sol 快 35 倍,扰动输入下仅 1.3% 的决策发生翻转。

  5. 宝玉(@dotey)AI 评估 · 74/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    微软发布决策模型 Microsoft-Decision-1,基于 Qwen3.5-9B 后训练

    微软推出新模型 Microsoft-Decision-1,专做选择题式判断,不生成文章也不聊天,给定选项后快速判断该选哪个并给每个选项打概率分,已在 Microsoft Foundry 上线,之后会上 OpenRouter。

  6. 国际大厂AI 评估 · 71/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cloudflare 发布多模态决策模型 Clef-omni,Clef 提速、Clef-flash 降价

    Cloudflare 发布 Clef-omni,在文本和图像之外新增音频(wav/mp3)与视频(mp4/webm)输入,基于 Qwen3-Omni-30B-A3B-Instruct MoE 构建并已在 Hugging Face 开放权重,定价为每百万输入 token 0.15 美元。

  7. elvis(@omarsar0)AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Microsoft 发布决策模型 Microsoft-Decision-1

    Microsoft 发布新的快速决策模型 Microsoft-Decision-1,官方称其在结构化决策任务上表现领先,延迟和质量均优于 LLM 与其他决策模型。该模型已在 Microsoft 内部用于事件响应、质量控制和科学发现等场景。作者表示会将其加入自己的评测清单,并指出这类决策模型在一致性和更复杂决策上仍存在困难。

  8. Satya Nadella(@satyanadella)AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    微软发布 Decision-1 决策模型

    微软发布新模型 Microsoft-Decision-1,面向快速决策场景,在结构化决策任务上表现领先,在延迟和质量上优于 LLM 及其他决策模型。该模型已在微软内部多个场景测试,涵盖事件响应、质量控制和科学发现。

  9. Ideogram(@ideogram_ai)AI 评估 · 48/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Ideogram 4.5 被评为最精准的图像编辑模型,30 轮连续编辑测试中稳定性胜过 GPT Image 2.5

    Ideogram 4.5 在 Artificial Analysis 的 30 轮连续编辑测试中保持了原图稳定,而 GPT Image 2.5 Sunburst 出现明显漂移。

  10. 大模型智能AI 评估 · 68/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 推出 GPT-6.1 Sol Ultrafast 版本,速度提升 8 倍

    OpenAI 推出 GPT-6.1 Sol 的 Ultrafast 版本,速度是标准版的 8 倍,官方称智能水平与标准版一致且逼近旗舰 Astra。

  11. elvis(@omarsar0)AI 评估 · 71/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    StepFun Step 5 Preview 发布次日登顶 OpenRouter Trending

    阶跃星辰的 Step 5 Preview 发布一天后登上 OpenRouter Trending 第一名,并已在 Kilo Code、Cline、Hermes Agent 和 OpenCode 中可用。

  12. Fish Audio(@FishAudio)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Fish Audio Drama 3 Preview 开放 API 与网页访问

    Fish Audio 开放 Drama 3 Preview 的使用入口:API 调用时需将模型设为 [drama-3-preview],文档见 docs.fish.audio/api-reference/;网页端可在 fish.audio/app/text-to-sp… 选择 Fish Audio Drama 3(Preview)模型使用。

  13. HeyGen(@HeyGen_Official)AI 评估 · 43/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    HeyGen Voice 登顶 Artificial Analysis TTS 排行榜,API 限时五折

    HeyGen 推出语音模型 HeyGen Voice,在 Artificial Analysis TTS 排行榜盲测中超越所有主流模型登顶第一,现已在 HeyGen 平台和 API 上线。10 月 31 日前 API 用户自动享受五折优惠,价格从 $30 降至 $15 每百万字符。

  14. THE DECODERAI 评估 · 69/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 发布 Claude Haiku 5.5,价格下调最高 90%

    Anthropic 发布小型模型 Claude Haiku 5.5,平均价格比 Haiku 4.5 低约 75%,10 万 token 以内的提示词最高降价 90%,同时 Sonnet 5.5 的缓存读取价格减半。

10月9日周五
  1. Qwen(@Alibaba_Qwen)AI 评估 · 0/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qwen 发布图文内容(Pics)

    Qwen 发布一条以「Pics」为主题的内容,附带 4 条回复、4 次转发、112 次点赞和 20624 次浏览的数据,互动数据由 xgo.ing 提供支持。

  2. Qwen(@Alibaba_Qwen)AI 评估 · 68/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    阿里发布 Qwen-Image-2.1-Turbo,8 步去噪即可生成和编辑图像

    阿里 Qwen 团队发布 Qwen-Image-2.1-Turbo,称只需 8 个去噪步骤即可生成和编辑图像,并已开放权重。该模型基于 Qwen-Image-2.1,是在同一 7B 视觉生成架构上的加速检查点,官方称仍能由文本生成 2K 图像,并支持通过自然语言编辑继续创作,例如添加配饰或更换场景。

  3. 甲子光年AI 评估 · 55/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Aether AI 发布 CRIS-0,因果智能在真机跑通闭环

    Aether AI 发布 CRIS-0,把因果智能体与因果世界模型在统一因果状态表示下打通,通过统一工具接口调度机械臂完成家庭任务。在咖啡、微波炉、垃圾分拣等真机测试中,系统面对物体移位等扰动平均 2 秒内重置规划,10 次强干扰测试成功恢复 9 次,长程任务靠阶段验证制切断误差累积。公司称目前跑通技术四层金字塔的前两层,后续需补上消融实验数据与更复杂环境下的泛化验证。

  4. LovartAI(@lovart_ai)AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 发布 NanoBanana 2.1 图像生成模型

    Google AI Studio 推出最新图像生成模型 NanoBanana 2.1,官方称其在视觉设计、基于 mask 的编辑、主体一致性和图像自然度上全面优于此前模型,并已在 ai.studio 上线。LovartAI 转发了这条发布信息,并配文称用 Lovart 制作的效果出色。

  5. 魔搭ModelScope社区AI 评估 · 53/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AutoTrust AI Lab 开源多模态决策模型 JEV-27B-VL,Jev Decision Index 0.3 视觉榜单第一

    AutoTrust AI Lab 开源基于 Qwen3.8-27B 的多模态决策模型 JEV-27B-VL,融合 System 1 快速决策与 System 2 深度推理,可视为能“看见”的 JEV-27B。

  6. AINLPAI 评估 · 64/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 28 天计划 Day 3 推出 GPT-6.1 Sol ultrafast

    OpenAI 在疯狂 28 天计划的 Day 3 推出 GPT-6.1 Sol ultrafast。

  7. 新智元AI 评估 · 64/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    谷歌 Gemini 4 Argon 现身 Google Cloud 与 Antigravity,最快今日发布

    谷歌下一代模型 Gemini 4 Argon 尚未官宣,已被曝密集现身多个平台,最快将于本周甚至数小时内发布。爆料称其发布卡片已上线谷歌内部系统及部分 Pro 用户界面,并已进入 Google Cloud 控制台,在编程工具 Antigravity 中被设为默认模型,还出现了真实的代码提交记录。

  8. OpenAIAI 评估 · 78/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 在 ChatGPT 中推出 GPT-6,引入智能 UI

    OpenAI 宣布在 ChatGPT 中推出 GPT-6,并引入智能 UI。

  9. AI Will(@FinanceYF5)AI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    为什么大家都对 Opus 生成的视频如此着迷

    针对有人不理解为何大家对 Opus 生成的视频如此着迷,这条推文提出了这一疑问,并附上视频引发讨论。原文未披露 Opus 的版本、参数或视频生成的具体能力细节。

  10. AI Will(@FinanceYF5)AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 数学成果发布:LLM 已在 7 个千禧年大奖难题中的 4 个取得实质性进展

    OpenAI 发布数学成果,被 Opus 称为"史上影响最深远的一次数学成果发布"。LLM 已在 7 个千禧年大奖难题中的 4 个上取得实质性进展,但该判断的前提是相关结果需要通过验证。

  11. Notion(@NotionHQ)AI 评估 · 67/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Notion 上线 Claude Haiku 5.5

    Notion 宣布其平台已可调用 Claude Haiku 5.5。引用 Anthropic 的介绍,Haiku 5.5 是其发布的最便宜、最快且能力最强的小模型,平均运行成本比 Claude Haiku 4.5 低约 75%。

  12. OpenRouter(@OpenRouterAI)AI 评估 · 71/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 的 Claude Haiku 5.5 上线 OpenRouter

    Anthropic 的 Claude Haiku 5.5 已在 OpenRouter 上线。OpenRouter 称这是首个支持 reasoning efforts 的 Haiku 模型,价格比上一代便宜约 75%,速度实测 100+ TPS,基准测试中能力也有明显提升,可通过 openrouter.ai/anthropic/clau… 使用。

  13. OpenRouter(@OpenRouterAI)AI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Perplexity Decider v1.1 上线 OpenRouter:开源权重多模态决策模型

    Perplexity Decider v1.1 现已上线 OpenRouter,这是 Perplexity 的开源权重多模态决策模型,可接收文本、JSON 或图像并返回带概率的类型化答案,输入价格 $0.02/M,输出免费。

  14. OpenRouter(@OpenRouterAI)AI 评估 · 57/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    阶跃星辰 Step 5 Preview 上线 OpenRouter,稀疏 MoE 架构支持 1M 上下文

    阶跃星辰(StepFun)的 Step 5 Preview 已在 OpenRouter 上线,官方称其为面向智能体任务的新旗舰模型。该模型采用稀疏 MoE 架构,激活参数 27B、总参数 600B,支持 1M 上下文以及文本、图像和视频输入,官方称其在编码和专业领域知识工作上表现较强,尤其是金融场景。

  15. OpenRouter(@OpenRouterAI)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    StepFun 8 项基准评测:Step 5 Preview 在 6 项上击败 Kimi K3 和 GLM-5.3

    在 StepFun 的 8 项基准评测中,Step 5 Preview 在 6 项上超过 Kimi K3 和 GLM-5.3,包括 DeepSWE(67.7)、ProgramBench(80.5)、StepCodeBench(49.0)和 FrontierFinance(66.4)。该结果由 StepFun 自家评测给出。

  16. OpenRouter(@OpenRouterAI)AI 评估 · 71/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    StepFun 的 Step 5 Preview 上线 OpenRouter,输入 $1.00/M、输出 $2.70/M

    StepFun 的 Step 5 Preview 已在 OpenRouter 上线,定价为输入 $1.00/M、输出 $2.70/M,发布期缓存命中价再打五折至 $0.05/M。发布方称该模型面向智能体与专业工作场景,并提供为期一周的免费访问,逐步覆盖 opencode、cline、NousResearch、kilocode 等平台。

  17. AK(@_akhaliq)AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qwen-Image-2.1-Multiple-Angles-LoRA 模型发布

    Qwen-Image-2.1-Multiple-Angles-LoRA 模型已上线 Hugging Face,可通过 huggingface.co/akhaliq 访问。该模型以 LoRA 形式为 Qwen-Image-2.1 提供多角度图像生成能力,具体参数与效果未在原文披露。

  18. 歸藏(guizang.ai)(@op7418)AI 评估 · 55/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic Haiku 5.5 发布,价格低于 DeepSeek-V4.1 flash 与 GLM 5.3 flash

    Anthropic 发布 Haiku 5.5,作者对比其与几款中国竞品的价格和测试评分:价格上比 DeepSeek-V4.1 flash 和智谱 GLM 5.3 flash 都便宜。在 Terminal Bench 4.0 上,作者称其分数比 GLM 5.3 flash 高一分,与另一竞品相同,比其他两个更高。

  19. Simon Willison(@simonw)AI 评估 · 56/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Simon Willison 整理 Claude Haiku 5.5 定价笔记

    Simon Willison 发布了一篇关于 Claude Haiku 5.5 定价的笔记,标题中同时提到 Pelicans,附有 simonwillison.net 的链接。材料仅有推文摘要,未提供具体定价数字或分析内容。

  20. Simon Willison(@simonw)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Haiku 5.5 画骑自行车鹈鹕远胜 Claude Haiku 4.5

    Haiku 5.5 在绘制骑自行车的鹈鹕上明显优于近一年前发布、成本贵 10 倍的 Claude Haiku 4.5。作者同时贴出了 Haiku 4.5 的生成结果作对比。

  21. The Rundown AI(@TheRundownAI)AI 评估 · 69/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 发布 Claude Haiku 5.5

    Anthropic 发布 Claude Haiku 5.5,称其为该公司迄今最便宜、最快、能力最强的小模型。该模型相较上一代有大幅提升,在多项基准上超过 OpenAI 的同类模型 GPT-6 Luna,起售价为每百万输入 token 0.10 美元,运行成本比 Haiku 4.5 低约 75%,与 Luna 持平。

  22. Claude(@claudeai)AI 评估 · 72/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 发布 Claude Haiku 5.5 小模型

    Anthropic 发布 Claude Haiku 5.5,称其是目前最便宜、最快且能力最强的小模型。官方表示其运行成本平均比 Claude Haiku 4.5 低约 75%。

  23. Claude(@claudeai)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Haiku 5.5 在编码、计算机使用和知识工作上较 Haiku 4.5 显著提升

    Claude Haiku 5.5 在编码、计算机使用和知识工作三类任务上较 Haiku 4.5 实现显著提升。该消息未披露具体参数规模、benchmark 分数或可用性细节。

  24. Claude(@claudeai)AI 评估 · 64/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 发布 Haiku 5.5,首个支持可调 effort 设置的 Haiku 模型

    Anthropic 发布 Haiku 5.5,这是其首个带可调 effort 设置的 Haiku 模型,用户可按任务自行选择偏向成本还是智能。原文未披露具体版本参数与定价信息。

  25. Claude(@claudeai)AI 评估 · 46/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Haiku 5.5:10 万 token 以下任务性价比突出,占前代 Haiku 约 90% 请求

    Claude Haiku 5.5 在 10 万 token 以下任务上性价比尤为突出,这类任务占前代 Haiku 模型约 90% 的请求量。该说法来自 Claude 官方账号,未披露具体价格或 benchmark 数据。

  26. Claude(@claudeai)AI 评估 · 70/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 的 Haiku 5.5 已在 AWS、Google Cloud 和 Microsoft Azure 全平台上线

    Anthropic 宣布 Haiku 5.5 现已在所有平台上线,包括 Amazon Web Services、Google Cloud 和 Microsoft Azure。官方给出详情链接 anthropic.com/claude-haiku-5。