跳到正文

#模型发布

今日 11 条
今天10月10日周六
  1. THE DECODERAI 评估 · 44/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google Gemini 4 "Carbon" 模型据称编码性能追平 Anthropic Opus 5.5

    据 Business Insider 看到的内部文件与聊天记录,Google 正在测试 Argon、Barium、Carbon 三个 Gemini 4 变体,其中 Carbon 已部署在内部编码平台 Jetski 上,被认为在编程任务上强于 Argon,有员工将其比作 Anthropic 最强的编码模型 Opus 5.5,但仍需更多测试。

  2. 宝玉(@dotey)AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 内部测试新模型 Carbon,员工称编码能力“感觉像 Opus 5.5”

    Business Insider 援引知情人士称,Google 内部正在测试新模型 Carbon,部署在内部 AI 编程工具 Jetski 上,有员工评价其编码能力“感觉像 Opus 5.5”。

  3. OpenRouter(@OpenRouterAI)AI 评估 · 72/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    微软发布 Microsoft-Decision-1 决策模型并在 OpenRouter 上线

    微软发布面向快速决策的模型 Microsoft-Decision-1,并已在 OpenRouter 上线。按微软给出的数字,它在 36 项盲测(约 15 万道题)上准确率最高,比第二名快 4.5 倍,比 GPT-6 Sol 快 35 倍,扰动输入下仅有 1.3% 的决策发生翻转。

  4. 宝玉(@dotey)AI 评估 · 74/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    微软发布决策模型 Microsoft-Decision-1,基于 Qwen3.5-9B 后训练

    微软推出新模型 Microsoft-Decision-1,专做选择题式判断,不生成文章也不聊天,给定选项后快速判断该选哪个并给每个选项打概率分,已在 Microsoft Foundry 上线,之后会上 OpenRouter。

  5. 国际大厂AI 评估 · 71/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cloudflare 发布多模态决策模型 Clef-omni,Clef 提速、Clef-flash 降价

    Cloudflare 发布 Clef-omni,在文本和图像之外新增音频(wav/mp3)与视频(mp4/webm)输入,基于 Qwen3-Omni-30B-A3B-Instruct MoE 构建并已在 Hugging Face 开放权重,定价为每百万输入 token 0.15 美元。

  6. elvis(@omarsar0)AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    微软发布决策模型 Microsoft-Decision-1

    微软发布系统一模型 Microsoft-Decision-1,用于快速决策,在结构化决策任务上表现最优,延迟和质量均优于 LLM 与其他决策模型。微软已在内部将其用于事件响应、质量控制和科学发现等场景。发布者还提到,决策模型可用于驱动 LLM 评判和科研流程中的候选假设筛选,并称在自己的评测中这类模型在一致性和更复杂决策上仍存在困难。

  7. Satya Nadella(@satyanadella)AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    微软发布决策模型 Microsoft-Decision-1

    微软发布新模型 Microsoft-Decision-1,面向快速决策场景,在结构化决策任务上性能领先,在延迟和质量上优于 LLM 及其他决策模型。该模型已在微软内部测试,应用范围涵盖事件响应、质量控制和科学发现。

  8. Logan Kilpatrick(@OfficialLoganK)AI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Logan Kilpatrick 预告 Argon 即将到来

    Logan Kilpatrick 回应 @StatsWire 时表示 Argon 即将到来,并称"不必担心"。该帖获 1458 点赞、59 次转发、408 条回复及 27.9 万次浏览。

  9. 大模型智能AI 评估 · 68/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 推出 GPT-6.1 Sol Ultrafast 版本,速度提升 8 倍

    OpenAI 推出 GPT-6.1 Sol 的 Ultrafast 版本,速度是标准版的 8 倍,官方称智能水平与标准版一致且逼近旗舰 Astra。

  10. elvis(@omarsar0)AI 评估 · 73/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    阶跃星辰 Step 5 Preview 发布次日登顶 OpenRouter Trending

    阶跃星辰(StepFun)的 Step 5 Preview 发布一天后登上 OpenRouter Trending 第一,并已接入 Kilo Code、Cline、Hermes Agent 和 OpenCode。

  11. THE DECODERAI 评估 · 69/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 发布 Claude Haiku 5.5,价格下调最高 90%

    Anthropic 发布小型模型 Claude Haiku 5.5,平均价格比 Haiku 4.5 低约 75%,10 万 token 以内的提示词最高降价 90%,同时 Sonnet 5.5 的缓存读取价格减半。

10月9日周五
  1. lmarena.ai(@lmarena_ai)AI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LMArena 周报:Nano Banana 2.1 三项 Image Arena 进前六,Mistral Large 4 登 Agent Arena 第 43

    Nano Banana 2.1 在三项 Image Arena 模式中均进入前六:Multi-Image Edit 第 4(1431 分)、Text-to-Image 第 5(1328 分)、Image Edit 第 6(1428 分)。

  2. Qwen(@Alibaba_Qwen)AI 评估 · 72/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    阿里 Qwen 发布 Qwen-Image-2.1-Turbo:8 步去噪生成与编辑图像,开放权重

    阿里 Qwen 发布 Qwen-Image-2.1-Turbo,只需 8 步去噪即可生成和编辑图像,开放权重已上线。该模型基于 Qwen-Image-2.1,是同一 7B 视觉生成架构上的加速 checkpoint,仍可从文本生成 2K 图像,并支持通过自然语言编辑继续创作,例如添加配饰或更换场景。

  3. 甲子光年AI 评估 · 55/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Aether AI 发布 CRIS-0,因果智能在真机跑通闭环

    Aether AI 发布 CRIS-0,把因果智能体与因果世界模型在统一因果状态表示下打通,通过统一工具接口调度机械臂完成家庭任务。在咖啡、微波炉、垃圾分拣等真机测试中,系统面对物体移位等扰动平均 2 秒内重置规划,10 次强干扰测试成功恢复 9 次,长程任务靠阶段验证制切断误差累积。公司称目前跑通技术四层金字塔的前两层,后续需补上消融实验数据与更复杂环境下的泛化验证。

  4. 魔搭ModelScope社区AI 评估 · 53/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AutoTrust AI Lab 开源多模态决策模型 JEV-27B-VL,Jev Decision Index 0.3 视觉榜单第一

    AutoTrust AI Lab 开源基于 Qwen3.8-27B 的多模态决策模型 JEV-27B-VL,融合 System 1 快速决策与 System 2 深度推理,可视为能“看见”的 JEV-27B。

  5. AINLPAI 评估 · 64/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 28 天计划 Day 3 推出 GPT-6.1 Sol ultrafast

    OpenAI 在疯狂 28 天计划的 Day 3 推出 GPT-6.1 Sol ultrafast。

  6. OpenAIAI 评估 · 78/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 在 ChatGPT 中推出 GPT-6,引入智能 UI

    OpenAI 宣布在 ChatGPT 中推出 GPT-6,并引入智能 UI。

  7. AI Will(@FinanceYF5)AI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    为什么大家都对 Opus 生成的视频如此着迷

    针对有人不理解为何大家对 Opus 生成的视频如此着迷,这条推文提出了这一疑问,并附上视频引发讨论。原文未披露 Opus 的版本、参数或视频生成的具体能力细节。

  8. AI Will(@FinanceYF5)AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 数学成果发布:LLM 已在 7 个千禧年大奖难题中的 4 个取得实质性进展

    OpenAI 发布数学成果,被 Opus 称为"史上影响最深远的一次数学成果发布"。LLM 已在 7 个千禧年大奖难题中的 4 个上取得实质性进展,但该判断的前提是相关结果需要通过验证。

  9. OpenRouter(@OpenRouterAI)AI 评估 · 72/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 的 Claude Haiku 5.5 上线 OpenRouter

    Anthropic 的 Claude Haiku 5.5 已在 OpenRouter 上线,这是首个支持 reasoning effort 的 Haiku 模型。OpenRouter 称其比前代便宜约 75%,速度更快(实测 100+ TPS),基准测试中能力有明显提升。

  10. OpenRouter(@OpenRouterAI)AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Perplexity Decider v1.1 上线 OpenRouter,开放权重多模态决策模型

    Perplexity Decider v1.1 已在 OpenRouter 上线,这是一款开放权重的多模态决策模型,可接收文本、JSON 或图像输入,返回带概率的类型化答案。输入价格为 $0.02/M,输出免费。

  11. OpenRouter(@OpenRouterAI)AI 评估 · 56/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    阶跃星辰 Step 5 Preview 上线 OpenRouter,主打智能体任务

    阶跃星辰的 Step 5 Preview 已在 OpenRouter 上线,是其面向智能体任务的新旗舰模型。该模型采用稀疏 MoE 架构,激活参数 27B、总参数 600B,支持 1M 上下文以及文本、图像和视频输入,在编码和专业领域(尤其是金融)表现较强。

  12. AK(@_akhaliq)AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qwen-Image-2.1-Multiple-Angles-LoRA 模型发布

    Qwen-Image-2.1-Multiple-Angles-LoRA 模型已上线 Hugging Face,可通过 huggingface.co/akhaliq 访问。该模型以 LoRA 形式为 Qwen-Image-2.1 提供多角度图像生成能力,具体参数与效果未在原文披露。

  13. 歸藏(guizang.ai)(@op7418)AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic Haiku 5.5 对比 DeepSeek-V4.1 flash、GLM 5.3 flash:价格更低,Terminal Bench 4.0 评分持平或更高

    Anthropic 的 Haiku 5.5 价格低于 DeepSeek-V4.1 flash 和智谱 GLM 5.3 flash。在 Terminal Bench 4.0 上,其 AA 测试评分比 GLM 5.3 flash 高一分,与另一竞品持平,且高于其余两个中国竞品。该对比由歸藏整理发布。

  14. Simon Willison(@simonw)AI 评估 · 16/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Haiku 5.5 画骑车鹈鹕远胜 Claude Haiku 4.5

    Haiku 5.5 在绘制骑自行车的鹈鹕上远好于 Claude Haiku 4.5。Claude Haiku 4.5 发布于近一年前,价格是它的 10 倍。

  15. The Rundown AI(@TheRundownAI)AI 评估 · 80/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 发布 Claude Haiku 5.5,输入价格每百万 token 0.10 美元

    Anthropic 发布小模型 Claude Haiku 5.5,官方称其是迄今最便宜、最快、最强的小模型。相比上一代 Haiku 4.5 有大幅提升,并在多项基准上超过 OpenAI 的同类模型 GPT-6 Luna。输入价格从每百万 token 0.10 美元起,运行成本比 Haiku 4.5 低约 75%,与 Luna 持平。

    为什么值得看

    Anthropic 小模型迭代给出价格与跑分对比,可据此判断小模型市场的性价比走向。

  16. Claude(@claudeai)AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 发布 Claude Haiku 5.5 小模型

    Anthropic 发布 Claude Haiku 5.5,称其是迄今最便宜、最快且能力最强的小模型。官方表示其平均运行成本比 Claude Haiku 4.5 低约 75%。

  17. Claude(@claudeai)AI 评估 · 57/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 发布 Claude Haiku 5.5,在编码、computer use 与知识工作上较 Haiku 4.5 显著提升

    Anthropic 发布 Claude Haiku 5.5,官方称其在编码、computer use 和知识工作方面较 Haiku 4.5 有显著提升。目前可获取的信息仅为这一结论,官方未在原文中给出具体评测数据、价格或可用范围。

  18. Claude(@claudeai)AI 评估 · 61/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 发布 Haiku 5.5,首次为 Haiku 系列加入可调 effort 设置

    Anthropic 发布 Haiku 5.5,这是首个带有可调 effort 设置的 Haiku 模型,用户可针对每个任务自行决定侧重成本还是智能表现。

  19. Claude(@claudeai)AI 评估 · 53/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude 称 Haiku 5.5 在 10 万 token 以下任务中性价比突出

    Anthropic 的 Claude 官方账号表示,Haiku 5.5 在 10 万 token 以下的任务中性价比尤其突出。这类任务占其上一代 Haiku 模型约 90% 的请求量。

  20. Claude(@claudeai)AI 评估 · 61/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 在 AWS、Google Cloud 和 Azure 上线 Haiku 5.5

    Anthropic 宣布 Haiku 5.5 现已在所有平台上线,包括 Amazon Web Services、Google Cloud 和 Microsoft Azure。官方同时给出详情链接 anthropic.com/claude-haiku-5。

  21. meng shao(@shao__meng)AI 评估 · 84/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GPT-6 面向每周超 12 亿 ChatGPT 用户推送,新增 Intelligent UI 能力

    GPT-6 开始面向每周超过 12 亿 ChatGPT 用户全面推送,并带来全新的 Intelligent UI 能力。该能力让回复可用文本、图形、按钮、表单、图表乃至交互式工具共同组织:对比类问题并排呈现,原理类问题用交互式图解,简单问题仍用纯文本。

    为什么值得看

    GPT-6 把回复从纯文本扩展到可交互界面,文中给出了组件库和界面编译器两层实现思路。

  22. meng shao(@shao__meng)AI 评估 · 68/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Haiku 5.5 benchmark 领先 GPT-6 Luna,用户从 CodeX 迁移到 Claude Code

    Claude Haiku 5.5 的 benchmark 全面领先 GPT-6 Luna,OpenRouter 观测到的 token 输出速度也是 2 倍。Anthropic 官方称 Claude Haiku 5.5 是迄今最便宜、最快、最强的小模型,运行成本比 Claude Haiku 4.5 低约 75%。

  23. 宝玉(@dotey)AI 评估 · 82/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 发布 Claude Haiku 5.5,输入价格降至每百万 Token 0.1 美元

    Anthropic 发布 Claude Haiku 5.5,处理 10 万 Token 以内请求时每百万 Token 输入 0.1 美元、输出 0.5 美元,比 Haiku 4.5 便宜 90%。

    为什么值得看

    原文给出了新模型的价格、实测成绩与推荐用法,读者可据此判断小模型在成本敏感任务中的位置。

  24. Aravind Srinivas(@AravSrinivas)AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Perplexity 开源 pplx-embed-v2-late 多向量嵌入模型,9B 与 0.6B 双版本

    Perplexity 开源 pplx-embed-v2-late,包含 9B 和 0.6B 两个晚期交互多向量嵌入模型,用于检索文本、图像和页面,二者共享同一嵌入空间以支持跨模型查询。

  25. lmarena.ai(@lmarena_ai)AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Mistral Large 4 预览版登 Code Arena WebDev 第 45 名,成唯一上榜欧洲实验室

    Mistral Large 4 预览版在 Code Arena: WebDev 以 1534 分位列第 45 名,比 Mistral Large 3 提升 304 分,使 MistralAI 进入该榜前 15 实验室,是唯一上榜的欧洲实验室。

  26. lmarena.ai(@lmarena_ai)AI 评估 · 72/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 发布 Claude Haiku 5.5,上线 Agent Arena 与 Code Arena

    Anthropic 发布 Claude Haiku 5.5,官方称这是其推出的最便宜、最快、能力最强的小模型,平均运行成本比 Claude Haiku 4.5 低约 75%。该模型现已加入 Agent Arena,可在其中使用网页搜索、文件系统和终端工具完成长流程智能体任务,成绩尚未公布;同时也在 Code Arena 的 WebDev、Text、Document 和 Vision 板块上线。

  27. lmarena.ai(@lmarena_ai)AI 评估 · 67/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Mistral Large 4 亮相:1T 参数、49B 激活,月底开放权重

    Mistral AI 的 Mistral Large 4 是一个 1T 参数、49B 激活的模型,权重将于月底开放。

  28. lmarena.ai(@lmarena_ai)AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Haiku 5.5 在 Code Arena 得分 1587,较 Haiku 4.5 提升 257 分

    Claude Haiku 5.5 在 Code Arena 得分 1587 分,比 Haiku 4.5 的 1330 分提升 257 分,且各分类均有明显进步。相关榜单可在 Code Arena: WebDev(arena.ai/leaderboard/co…)查看。

  29. Anthropic(@AnthropicAI)AI 评估 · 61/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 发布 Claude Haiku 5.5

    Anthropic 在 X 上宣布推出最新模型 Claude Haiku 5.5。该帖未披露参数、能力指标或开放范围等细节。