跳到正文

#评测/基准

今日 19 条
10月9日周五
  1. 美团技术团队AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    美团 LongCat 发布 MineExplorer:首个开放世界分钟级长程任务评测基准,18 款顶级多模态大模型集体"考砸"

    美团 LongCat 团队构建 MineExplorer,首个在开放世界中做到分钟级长程任务的评测基准,包含 813 个人工验证实例(1-hop 到 4-hop),每个任务实例运行 1800 个环境步、对应 3 分钟连续交互。

  2. 美团技术团队AI 评估 · 41/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    美团开源 LoHoSearch 搜索智能体评测基准,用知识图谱让机器自动出题

    美团 LongCat 团队开源 LoHoSearch,一个基于覆盖 762 万维基百科实体知识图谱自动生成题目的搜索智能体评测基准,含 544 道经人工核验题目、覆盖 11 个领域。

  3. 美团技术团队AI 评估 · 37/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    美团技术团队:Agent评测漫谈——从观测到长程Agent的评测方法论

    美团图灵Agent评测团队公开内部博客,系统讲解Agent评测:评测需覆盖结果层、过程层、效率层、风险层四层,主张"观测+评测=持续迭代",并将模糊指标下钻为二元化Rubric以实现人人一致与人机一致,如Beam人机一致率从62%提升到92%。

  4. Lenny Rachitsky(@lennysan)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Every 招聘 PM:构建个人基准测试平台 Checks

    Every 已构建个人基准测试平台 Checks,帮助任何人衡量新模型在其实际工作中的表现,目前正招聘产品经理。该岗位面向理解这一方向重要性、并希望参与塑造人类借助 AI 完成工作方式的人。

  5. lmarena.ai(@lmarena_ai)AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Mistral Large 4 预览版登 Code Arena WebDev 第 45 名,成唯一上榜欧洲实验室

    Mistral Large 4 预览版在 Code Arena: WebDev 以 1534 分位列第 45 名,比 Mistral Large 3 提升 304 分,使 MistralAI 进入该榜前 15 实验室,是唯一上榜的欧洲实验室。

  6. lmarena.ai(@lmarena_ai)AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Agent Arena 评测 Jev Router:成本高 38%、延迟 1.7 倍,但可控性接近 Claude Opus 5.5

    Agent Arena 用超 4700 个真实智能体会话评测 typesafeai 的 Jev Router,结果显示它未能推进当前帕累托前沿:达到与 DeepSeek V4.1 Flash(Max)相近性能时成本高 38%,模型请求延迟中位数高 1.7 倍。

  7. lmarena.ai(@lmarena_ai)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LMArena 评测:Jev Router 模型路由尚未跑赢直连 DeepSeek V4.1 Flash

    Jev Router 最常用的 5 个模型中 4 个位于帕累托前沿,可操控性表现突出,但整体权衡不及直接调用 DeepSeek V4.1 Flash——后者以更低成本和延迟取得相近表现。该评测显示,同时平衡任务成功率、可操控性、成本与延迟仍是模型路由的未解难题。

  8. lmarena.ai(@lmarena_ai)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jev Router 与 DeepSeek V4.1 Flash 端到端延迟对比:中位数 6.18 秒对 3.64 秒

    Jev Router 的端到端请求延迟高于同类 Pareto 最优模型,中位数为 6.18 秒,DeepSeek V4.1 Flash(Max)为 3.64 秒。在 P90(最慢 10% 请求)上差距扩大,Jev Router 耗时 30.59 秒,DeepSeek 为 14.26 秒。

  9. lmarena.ai(@lmarena_ai)AI 评估 · 63/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Arena 发布 Alignment Index,基于 2.7 万个模型会话评测 AI 智能体安全与对齐

    Arena.ai 发布 Arena Alignment Index,一个衡量 AI 智能体真实使用中安全与对齐表现的新基准,基于 27 个模型的 90K+ 真实智能体会话构建,衡量未授权操作(UA)、错误归因(FA)和虚假完成(DC)三类信号。

  10. lmarena.ai(@lmarena_ai)AI 评估 · 25/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LMArena 研究 AI 智能体的错误归因:GPT-6 Luna、Astra 与 Sol 表现各异

    LMArena 研究了 AI 智能体的“错误归因”问题,即智能体把某句话、请求或事实安到用户头上,却与用户提供的证据相矛盾。GPT-6 Luna 和 Astra 很少错误引用用户(分别为 15.6% 和 28.6%),但错误归因率较高(53.1% 和 48.2%);同系列的 GPT-6 Sol 误记用户历史的比例最高,达 23.5%。

  11. lmarena.ai(@lmarena_ai)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LMArena 完成 2 亿美元 B 轮融资,Lightspeed 追加投资并推出 Alignment Index

    LMArena 完成 2 亿美元 B 轮融资,Lightspeed 继种子轮后继续加注。Arena 年化收入已超 1 亿美元,另有数百万用户通过真实使用参与前沿模型评估。Arena 同时推出 Alignment Index,用于衡量 AI 行为在真实场景中与人类价值观的一致程度。

  12. lmarena.ai(@lmarena_ai)AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Haiku 5.5 在 Code Arena 得分 1587,较 Haiku 4.5 提升 257 分

    Claude Haiku 5.5 在 Code Arena 得分 1587 分,比 Haiku 4.5 的 1330 分提升 257 分,且各分类均有明显进步。相关榜单可在 Code Arena: WebDev(arena.ai/leaderboard/co…)查看。

  13. lmarena.ai(@lmarena_ai)AI 评估 · 72/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Haiku 5.5 在 Code Arena WebDev 以 1587 分首秀排第 30

    Arena.ai 公布 Claude Haiku 5.5 (High) 在 Code Arena: WebDev 的真实评测结果,首秀以 1587 分排在第 30 位,略在帕累托前沿之外,但仍然具备很强的成本效率。

  14. lmarena.ai(@lmarena_ai)AI 评估 · 49/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Arena 完成 2 亿美元 B 轮融资,估值 31 亿美元并推出 AI Alignment Index

    Arena 宣布完成 2 亿美元 B 轮融资,估值达 31 亿美元,同时推出 Arena AI Alignment Index,用于衡量 AI 智能体在真实世界中的行为表现。该公司起源于 UC Berkeley 的一个研究项目,Felicis 在其种子轮即参与投资并领投了 A 轮。

  15. lmarena.ai(@lmarena_ai)AI 评估 · 29/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Salesforce Ventures 投资 Arena 的 B 轮融资

    Salesforce Ventures 宣布投资 Arena 的 B 轮融资。Arena 让真实用户对匿名模型输出投票,覆盖文本、编程、视觉、图像生成和智能体任务,其排行榜被实验室用于决定训练和发布哪些模型,也被开发者用于选型。投资方强调,这套机制成立的前提是没有实验室拥有这块记分牌。

  16. LangChain(@LangChainAI)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LangSmith Engine v2 新功能:红队测试智能体、检测更多问题类型、自动验证修复方案

    LangSmith Engine v2 新增三项能力:对 AI 智能体进行红队测试、检测更多问题类型,以及自动测试提出的修复方案。@bentannyhill 在 Interrupt NYC 场次中讲解了这些更新及 LangChain 改进智能体的思路,完整视频已在 YouTube 发布。

  17. Jerry Liu(@jerryjliu0)AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jerry Liu:定义 eval 并爬山,就能解决几乎所有任务

    Jerry Liu 认为,如今解决任务的主流方式已从直接定义确定性或智能体工作流,转为定义 eval 并对其爬山优化。数据提供方公司的全部工作就是为各类经济活动定义 eval,让前沿模型具备完成任何任务的能力;使用者的工作则变成给前沿智能指明方向——定义要解决什么、以及如何衡量做得好不好。最复杂的流程仍需要显式的工作流构建器界面,但大多数任务可以压缩为目标加 eval 指令。

  18. 美团技术团队AI 评估 · 35/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    《Agent 评测白皮书》系列01:Agent 评测全览

    美团技术团队发布《Agent 评测白皮书》系列第一篇《评测全览》,提出完备评测体系可概括为四个模块、三种能力、两条 Loop、一套资产。两条 Loop 分别为评测体系迭代 Loop 与 Agent 迭代 Loop,二者共享线上真实样本,通过 Case 挖掘与归因咬合。评测集是核心资产,分端到端与过程两类,前者答"事有没有办成",后者答"中间哪一步出了问题"。

  19. lmarena.ai(@lmarena_ai)AI 评估 · 6/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Agent Arena 完整排行榜发布

    Agent Arena 完整排行榜已上线,可在 arena.ai/leaderboard/ag… 查看。该榜单来自 lmarena.ai,用于展示 AI 智能体(Agent)的评测排名,完整数据以官方页面为准。

  20. lmarena.ai(@lmarena_ai)AI 评估 · 64/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Mistral Large 4 进入 Agent Arena 榜单前 15 实验室

    Mistral Large 4 在 Agent Arena 超过 5000 场真实智能体会话中录得 -6.6% 的净提升分数,位列总榜第 43,比上一版本 Mistral Medium 3.5(-12.60%)高 11 个名次。

  21. 硅谷101AI 评估 · 41/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    模型越来越强,为什么用户没感觉?再访阿里国际站总裁张阔

    阿里国际站总裁张阔在播客中分享,团队从真实业务整理出107个任务,用于评测AI能否独立完成商家工作,结果最前沿模型在无人干预条件下的任务通过率约为61%。他指出,模型通用评测成绩已接近满分,但商家在报价比较、钓鱼邮件识别、订船期和交易纠纷处理等经营环节并未感受到同等幅度的提升。他同时谈到,最贵的模型不一定最好,多模型路由需要为不同任务匹配能力与成本。

  22. AK(@_akhaliq)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    《Old Ideas, Novel Problems:基于 LLM 的新颖性评估的不稳定性》

    一篇题为《Old Ideas, Novel Problems》的论文研究基于 LLM 的新颖性评估的不稳定性,论文已在 Hugging Face 上线。该研究聚焦 LLM 用于评判研究新颖性时结果是否稳定可靠。

  23. elvis(@omarsar0)AI 评估 · 49/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    RSIGym:Evolvent AI 发布 AI 研究智能体训练环境,Opus 5 在 SWE-bench Verified 提升至 50.33%

    Evolvent AI 推出 RSIGym,把训练、推理、评测与沙箱打包成研究智能体可调用的服务,并开源代码、实验配置、研究轨迹和评测日志。以 Opus 5 作为研究者,改进后的系统在 SWE-bench Verified 上从 17.67% 升至 50.33%。

  24. Aravind Srinivas(@AravSrinivas)AI 评估 · 25/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Perplexity Decider V1.1 在 DecisionBench 排名第一,成本也最低

    Perplexity 的 Decider V1.1 在 decisionbench.ai 上排名第一,949 个共享文本案例中准确率 93.9%,中位延迟 534 ms,成本 $0.016 / 1k decisions,为榜上最低。Rohan Goel 表示将把它用于自家产品的用例。

10月8日周四
  1. 歸藏(guizang.ai)(@op7418)AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    A÷被指 Haiku 阶梯定价压价造假,100k 上下文后价格翻 5 倍

    针对归藏老师今日关于 A÷ 刻意压价的帖子,有观点指出连"压价"本身都是假的:Haiku 采用阶梯定价,但上下文一旦达到 100k,价格就翻 5 倍,而 gpt 的分界线是 272k。图片里看似很低的价格,实际使用成本要高得多,被认为是面向 Benchmark 的特化优化,并借此打榜到第一。

  2. AI Engineer(@aiDotEngineer)AI 评估 · 8/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI Engineer New York 10 月 12 日设工作坊日,动手实践智能体工作流与评估

    AI Engineer New York 将 10 月 12 日设为工作坊日,参会者需自带笔记本电脑,在讲师带领下动手实践智能体工作流与评估。工作坊为会议附加环节,需另行选择场次,参会者可现场提问。

  3. 极客公园AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    实测 Today AI 十天:国产个人 AI 助手能做什么、卡在哪

    作者用十天体验 Teambition 创始人齐俊元打造的 Today AI,其国内版于 9 月 24 日上线,已接入飞书、钉钉、腾讯文档和邮箱;绑定微信后可直接在微信里发语音、图片和文件与它交互。

  4. LovartAI(@lovart_ai)AI 评估 · 56/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Lovart 对比 Nano Banana 2.1 与 GPT Image 2.5 的人像生成效果

    LovartAI 发布 Nano Banana 2.1 与 GPT Image 2.5 的人像生成对比图,称 Nano Banana 2.1 在光影和皮肤质感上大幅领先。

  5. 爱范儿AI 评估 · 61/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用 Vidu Q4 Preview 实测 AI 视频的人物表演与运镜能力

    爱范儿作者提前拿到生数科技 Vidu Q4 Preview 预览版权限,用《沙丘》《喜剧之王》《黑神话:悟空》等片段实测其人物反应、动作运镜和特效表现,认为运镜方向感与主体稳定性是强项,画面风格控制和幻觉问题仍需优化。该预览版定位高表现力旗舰模型,参考生视频支持最多 15 张参考图、3 段参考音频和可选 2K、4K 输出,试拍成本 0.09 元/秒起。

  6. 硅星人ProAI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    UniPat AI 推出 PaperBenchX:10 个前沿 Agent 复现论文集体翻车

    UniPat AI 推出 PaperBenchX(PBX)评测,让 AI 在真实科学软件中复现已发表论文的关键实验。在覆盖 12 个科学方向的 93 道题中,70 道没有被任何配置完全复现,表现最好的 GPT-6 Astra 仅有 14% 的任务过关,国产模型基本在 7% 左右。评测发现建模和执行平均得分都在六成以上,但科学验证仅约 43%,多轮交互难以弥补这一差距。

  7. 歸藏的AI工具箱AI 评估 · 47/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Haiku 5.5 对比中国模型:价格更低,Max 和 Team 用户获赠 API 额度

    Anthropic 的 Haiku 5.5 定价低于 DeepSeek-V4.1 flash 和智谱 GLM 5.3 flash,在 Terminal Bench 4.0 上比 GLM 5.3 flash 高一分,与其他两个中国竞品相当或更高。Anthropic 还向每个 Max 和 Team 用户赠送对应额度的 API 金额,该 API 可在任何支持输入 API 的产品中使用。

  8. Browser Use(@browser_use)AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Haiku 5.5 在 Browser Use Bench v2.1 上与 Luna 表现持平,价格却贵 2.8 倍

    Haiku 5.5 在 Browser Use Bench v2.1 上跑出与 Luna 相同的性能,但价格是后者的 2.8 倍。Haiku 在上下文超过 100k 后价格再涨 5 倍,且缓存 token 也计入其中;而 BU Bench 2.1 多为极长时程任务,会频繁触及该定价档位。

  9. Epoch AIAI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Epoch AI 实测:Claude Fable 5.1 与 GPT-6 Astra 能否自动化 Epoch 的工作

    Epoch AI 用 11 项自身真实工作任务测试六款模型,Claude Fable 5.1 与 GPT-6 Astra 总得分最高并领先多数任务类别,但仍无法实现工作全自动化。开源权重模型落后更多,连定义明确的任务也难以稳定完成。模型难以掌握 Epoch 的隐式规范,能提出研究方向却缺乏判断力,且常把有缺陷的结果当作关键发现。

  10. Cognition(@cognition_labs)AI 评估 · 37/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Haiku 5.5 上线 Devin,FrontierCode 1.1 得分 58.4%

    Claude Haiku 5.5 已在 Devin 中上线,在 FrontierCode 1.1 上得分 58.4%,超过 Sonnet 5,而每任务成本约为其八分之一。它还可作为 Fusion 中的辅助模型,并可与 Opus 5.5 搭配,在 Devin Desktop 和 CLI 中以 Lead 角色使用。

  11. Stack Overflow BlogAI 评估 · 65/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    如何把评测做成部署门禁并检测基线漂移

    Stack Overflow 博客的 LLM 生产系列 Level 2 讲解如何把评测当作 CI 门禁:用版本化 golden set 编写显式打分器,一条 CI 命令在通过率低于阈值时让构建失败,并按 slice 自动路由用例、逐 slice 设门槛。

  12. Cursor(@cursor_ai)AI 评估 · 56/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cursor 公布 Claude Haiku 5.5 定价,Sonnet 5.5 缓存读降至 $0.10/M

    Cursor 公布 Claude Haiku 5.5 定价为 $0.10/M 输入与 $0.50/M 输出 tokens,输入超过 100k tokens 后升至 $0.50/M 和 $2.50/M。

  13. Perplexity(@perplexity_ai)AI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Perplexity 在 MADQA 检索器评测中达到 92.4%

    Perplexity 在 MADQA 基准上取得 92.4% 的成绩,该基准包含 500 道题、覆盖 800 份 PDF,这一结果在所有检索器中排名第一。

  14. Perplexity(@perplexity_ai)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GPT-OSS-120B 智能体用 9B 模型在 BrowseComp+ 上取得 64.0%

    在智能体搜索中,GPT-OSS-120B 智能体调用 9B 模型正确回答了 BrowseComp+ 上 64.0% 的问题,比次优的 ColBERT 模型高出 4.9 个百分点,且搜索次数少于所有基线。

  15. Perplexity(@perplexity_ai)AI 评估 · 29/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    9B 与 0.6B 模型在 Q2D-Web 检索基准上超越 nemotron-embed-8b

    在 Q2D-Web 上,约 7 万条生产环境搜索查询、覆盖 1.9 亿篇网页文档的条件下,9B 和 0.6B 模型分别达到 74.8% 和 73.6% 的 Recall @1000,高于 nemotron-embed-8b 的 69.3%。

10月7日周三
  1. Mistral AI(@MistralAI)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Mistral Large 4 在 Harvey 法律智能体基准 LAB 上位列开源模型第一

    在 Harvey 的法律智能体基准 LAB(Legal Agent Benchmark)上,Mistral Large 4 成为排名第一的开源模型(oss model)。该结果由 Mistral AI 公布,评测针对法律领域的智能体任务。