跳到正文

#评测/基准

今日 15 条
7月12日周日
  1. 宝玉的分享AI 评估 · 33/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Caveman 电报体 Skill 实测:号称省 65% Token,JetBrains 测出仅 8.5%

    JetBrains 用 Claude Code 在 SkillsBench 的 86 个编程任务上实测 Caveman 电报体 Skill,发现输出 Token 实际只降 8.5%(从约 59.2 万降到 54.2 万),远低于其宣称的 65%。

7月10日周五
  1. Stanford AI Lab(@StanfordAILab)AI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Stanford AI Lab 提出 LLM-as-a-Verifier,在四项智能体基准上实现 SOTA

    Stanford AI Lab 提出 LLM-as-a-Verifier 验证扩展框架,在 Terminal-Bench V2、SWE-Bench Verified、RoboRewardBench 和 MedAgentBench 上达到 SOTA。

  2. Stanford AI Lab(@StanfordAILab)AI 评估 · 39/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Stanford AI Lab 推出 TRACE:让智能体自我训练补齐能力短板,Qwen3.6-27B 在 SWE-bench Verified 达 73.2%

    Stanford AI Lab 提出智能体自我改进方法 TRACE,让模型自己找出失败背后的缺失能力并针对性自我训练。TRACE 训练的 Qwen3.6-27B 在 SWE-bench Verified 上达到 73.2%,超过体量更大的 Codex 5.2 和 GLM 5,并以不到 1/4 的训练 rollout 击败 GRPO 和 GEPA。

7月8日周三
  1. QdrantAI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qdrant 实测反超 Elastic DiskBBQ:2 倍吞吐、一半延迟、约三分之一算力

    Qdrant 用相同数据集复现 Elastic 的 DiskBBQ 基准,在 recall@100 约 0.96 时,3 节点 2 vCPU/8 GB 配置下跑出 67.2 QPS、59.5 ms 平均延迟,吞吐约为 Elasticsearch(32.4 QPS、122.6 ms)的 2 倍,延迟减半。

7月7日周二
  1. Epoch AIAI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Epoch AI:OpenAI Codex 代码库贡献出现 AI 提效迹象

    Epoch AI 分析 OpenAI 公开 Codex 仓库的 41 位核心贡献者,用 LLM 评委估算每个已合并 PR 在无 AI 辅助下所需的工程师工时。2026 年 Q2 有 8% 的贡献者-日对应超过 24 小时的无辅助工作量,高于 2025 年 Q2 的 2%。Epoch 指出 LLM 评委的估算并不完美,只能视为节省时间的上限。

7月6日周一
  1. Import AI — Jack ClarkAI 评估 · 52/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Import AI 464:Fable 编写 GPU kernel、AI 自动化与模拟计算

    Import AI 464 汇总多项 AI 研究进展。Fable 在 KernelBench-Mega 上以单次协作 kernel 启动实现 18.71X 加速,超过 Claude Opus 4.8、GLM-5.2、GPT 5.5 等用 Triton 的尝试。

  2. Stanford AI Lab(@StanfordAILab)AI 评估 · 16/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Stanford AI Lab 公布 ICML 2026 论文清单,覆盖编码智能体与 LLM 推理等方向

    Stanford AI Lab 公布其在 ICML 2026 的完整论文清单,涵盖编码智能体、LLM 推理、评估与基准、AI 安全与可解释性、AI for science 等方向。ICML 2026 在首尔举行,该实验室邀请参会者到场交流。

7月3日周五
  1. 枫言枫语AI 评估 · 39/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 解禁 Fable 5,播客聊额度限制与模型配合方案

    Anthropic 于北京时间 7 月 2 日凌晨在 X 上解禁 Fable 5 模型,播客主播称其智商与任务完成质量有明显提升,适合讨论和写 Spec。但该模型对订阅用户仅开放套餐额度的 50%,消耗比 Opus 4.8 快,且只能用到 7 月 7 日。

7月2日周四
  1. Epoch AIAI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GPT-4 在 ECI 榜首停留时间远超其他任何模型

    Epoch AI 追踪各时点 ECI 得分最高的模型及其在榜首的持续时间,结果显示 GPT-4 领先的时间远超其他任何模型。ECI 会随时间小幅波动,但很少足以大幅改变模型排名,且这一回顾性视角未计入模型发布后 ECI 估计值的变化。

7月1日周三
  1. 哔哩哔哩技术AI 评估 · 17/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    B站技术团队携 FATE 系列 SABER、CASTER 亮相 ACL 2026

    B站大语言模型团队将在 ACL 2026 展示 FATE 系列成果 SABER 与 CASTER,并现场开放「B-UP 顶尖技术人才项目」校招与实习岗位投递。SABER 提出可切换、受 Token 预算约束的混合思考训练范式,实验显示 FastThink 模式在 MATH、GSM8K、MBPP 及逻辑推理任务上推理长度减少 65%~80% 同时保持甚至提升准确率。

  2. Epoch AIAI 评估 · 53/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Epoch AI 发布 EBR-bench:测试 AI 能否从重复游戏中学习

    Epoch AI 发布 EBR-bench 基准,让 AI 系统反复游玩桌游 Earthborne Rangers,测试其能否从经验中学习。结果显示几乎没有证据表明 AI 能在重复游玩中进步,GPT-5.5 和 Opus 4.8 的分数提升来自更高的初始分而非边玩边学。

6月30日周二
  1. Scott Wu(@ScottWu46)AI 评估 · 49/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cognition 推出 Devin Fusion 混合模型 harness,为编程智能体降本 30-40%

    Cognition 发布 Devin Fusion,一个面向编程智能体的混合模型 harness,通过按行为与风格而非仅通过率来评测模型,并让智能体动态更新与改道,从而在保持前沿智能体验的同时将成本降低 30-40%。官方称其可将 Fable 级智能的成本降低 35%。

6月29日周一
  1. Hamel HusainAI 评估 · 51/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Hamel Husain:产品难评测是产品设计问题

    Hamel Husain 基于三年 AI 评测经验指出,常见的“我们的产品难以评测”其实是一种产品设计缺陷,用户难以验证的输出同样难以评测。他以内部 AI 数据 agent、K-12 体育课程教案生成器和工伤医疗报告生成三个自己担任顾问的案例,展示了从只给答案到提供可核查中间产物、引用来源、diff 与待确认事项的前后设计对比。

6月26日周五
  1. Epoch AIAI 评估 · 73/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Epoch AI 与 METR 发布 MirrorCode:测试 AI 能独立完成多大规模的软件项目

    Epoch AI 与 METR 联合发布 MirrorCode 基准,用于测试 AI 在长周期编码任务上的能力,任务是让模型在没有原始源码的情况下端到端重写整个程序,AI 方案需在包括留出测试在内的端到端测试中与原始程序输出完全一致。

6月25日周四
  1. Stanford AI Lab(@StanfordAILab)AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenThoughts-Agent-v2 在所有训练集规模上领先,跨七个 Agentic benchmark 泛化

    OpenThoughts-Agent-v2 在算力受控对比中于每个训练集规模上均领先,并跨七个 agentic benchmark 实现泛化。同系列还发布 OpenThinkerAgent-32B,号称基于 Qwen-3 的最强开放数据 agentic 模型,在 7 个 agentic benchmark 上平均得分 44.8%。

  2. Windsurf(@windsurf_ai)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GLM 5.2 与 Kimi K2.7 在 FrontierCode Extended 上分别得分 43.0% 和 39.5%

    GLM 5.2 在 FrontierCode Extended 上得分 43.0%,Kimi K2.7 得分 39.5%,与 GPT-5.5(44.8%)和 Claude Opus 4.8(51.8%)处于同一竞争梯队。

  3. Windsurf(@windsurf_ai)AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Kimi K2.7 Code 与 GLM 5.2 上线 Devin Desktop 和 CLI

    Kimi K2.7 Code 与 GLM 5.2 已在 Devin Desktop 和 CLI 上线。两者在真实工程任务基准 FrontierCode Extended 上表现强劲:GLM 5.2 得分 43.0%,Kimi K2.7 Code 得分 39.5%。Pro/Max/Teams 用户可在 7 月 5 日前免费试用这两款模型。

6月23日周二
  1. Mistral AI(@MistralAI)AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Mistral OCR 4 实测对比:独立标注者在 12+ 语言文档盲评中平均胜率 72%

    Mistral 将 OCR 4 与同类系统正面盲测,独立标注者对 600+ 份真实文档、12+ 种语言进行排名,OCR 4 在所有被测系统中胜率最高,平均胜率 72%。

6月21日周日
  1. Eugene YanAI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    构建网络安全评测的通用模式:从 Cybench 到 MHBench 的基准设计

    网络安全评测普遍遵循四个组件:Docker 沙箱目标、影响难度的输入(如仅给脆弱代码对应 zero-day,或附带补丁与 PoC 对应 one-day)、工具集以及确定性打分器。

6月19日周五
  1. Replicate(@replicate)AI 评估 · 37/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Riverflow 2.5 上线 Replicate,Riverflow 2.5 Pro 登顶 Designarena 三项榜首

    Riverflow 2.5 已在 Replicate 上线,其 Pro 版本在 Designarena 全球基准测试的图像、平面设计和图像编辑三个类别中均排名第一,Logo 类别位列第三,超过 GPT Image 2、Gemini 3 Pro 和 Ideogram 等模型。Riverflow 2.5 Pro 现已在 OpenRouter、Runware 和 Replicate 上提供。

6月17日周三
  1. Jim Fan(@DrJimFan)AI 评估 · 17/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jim Fan:论文结果显示 Codex 表现优于 Claude 与 Kimi

    Jim Fan 回应称,其论文结果显示 Codex 表现优于 Claude,Claude 又优于 Kimi,并称这是一个"在物理世界中无法被作弊"的基准测试。

6月15日周一
  1. Import AI — Jack ClarkAI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Import AI 461:Sequent 称"对齐尚未步入正轨",发布 FrontierCode 与合成研究实习生

    英国 AI Security Institute 对齐团队与 Timaeus 联合成立非营利研究机构 Sequent,认为对齐研究"尚未步入正轨",计划两年内扩至 40-80 名全职员工并首期募资 1 亿至 1.5 亿美元,研究 scalable oversight、学习理论、博弈论与 personas 等方向。

6月12日周五
  1. 哔哩哔哩技术AI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    B站 Index LLM 团队开源 CASTER:让 AI 像观众一样评估 UGC 视频

    哔哩哔哩 Index LLM 团队的 CASTER 已被 ACL 2026 Main Conference 收录,并开源模型、代码与数据集。其 MEDEA 框架用 Social-CoT 模拟多元观众反应,在 CASTER-Bench 上高质量类别 F1 达 0.650,超越 GPT-5.2 与 Claude-4.5-Opus,提升 17.1%。

  2. Richard Socher(@RichardSocher)AI 评估 · 10/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Richard Socher 称赞 karpathy 打造的新 benchmark

    Richard Socher 公开感谢 karpathy 打造了一个出色的 benchmark,并指出 AI 要从原始 Transformer 达到 karpathy 的版本需要相当长的时间。

6月11日周四
  1. Richard Socher(@RichardSocher)AI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NVIDIA 官方 benchmark 结果公布

    NVIDIA 公布官方 benchmark 结果,具体数据见 research.nvidia.com/benchmarks/sol…。Richard Socher 转发了这一结果,原帖互动数据为 1 条回复、4 次转发、25 个赞、2831 次浏览。

  2. UX MagazineAI 评估 · 16/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Databricks 首席 AI 科学家:核聚变有了,电线还没造

    Databricks 首席 AI 科学家 Jonathan Frankle 将当前 AI 比作"造出了核聚变却没造电线":模型能力过剩,而规格定义、评估纪律、应用模式和数据治理仍严重缺位。他称百万 token 的上下文窗口不意味着可以放弃文档管理,检索更多材料反而可能因干扰项增多而让表现变差。他还认为 DeepSeek 证明了好科学与时间投入能与金钱买时间相抗衡。

  3. Epoch AIAI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Epoch AI 分析:Mythos 的网络安全能力被高估了吗?

    Epoch AI 汇总约十五个网络安全基准构建 Cyber-ECI,评估 Anthropic Claude Mythos 系列在攻防能力上的真实位置。

6月10日周三
  1. Scott Wu(@ScottWu46)AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Fable 5 登陆 Devin,登顶 FrontierCode 基准

    Claude Fable 5 已在 Cognition 的 Devin 中上线,并在 FrontierCode 基准上拿下第一,该基准针对真实工程任务评估代码可合并性与质量。在最难任务上,其 FrontierCode Diamond 得分从 Opus 4.8 的 13.4% 提升至 29.3%。该基准发布仅一天后便迎来这一新登顶者。

  2. Andrej Karpathy(@karpathy)AI 评估 · 75/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Karpathy 评 Claude Fable 5:同源 Mythos 加安全措施,多项基准达 SOTA

    Andrej Karpathy 称 Claude Fable 5 与 Mythos 是同一个底层模型,区别在于增加了安全措施,并在几乎所有测试基准上达到 SOTA。

6月9日周二
  1. Scott Wu(@ScottWu46)AI 评估 · 61/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cognition 推出编码评测 FrontierCode,最高分 Opus 4.8 仅 13%

    Scott Wu 介绍 Cognition 推出的新编码评测 FrontierCode,认为 SWE-Bench 式评分只考察能否通过单元测试,还需评估代码范围、编码风格和意外副作用。该评测声称假阳性减少约 80%,每个任务由领先开源维护者花费 40 多小时完成,最好的模型 Opus 4.8 得分仅 13%。

6月2日周二
  1. Martin Fowler(@martinfowler)AI 评估 · 10/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Martin Fowler 谈 AI 使用指标失真、闭源与开源模型基准测试等话题

    Martin Fowler 在新一期 Fragments 中讨论了 AI 使用指标不可靠、技术取代工作的历史、闭源与开源模型的基准测试对比、LLM 会放大既有代码腐化、AI 垃圾内容令人不堪其扰,以及"我是智能体的全局解释器锁"等话题。

5月29日周五
  1. AI ExplainedAI 评估 · 67/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Opus 4.8:你可能错过的 15 个细节

    AI Explained 发布视频,梳理 Claude Opus 4.8 中可能被忽略的 15 个细节。

  2. Epoch AIAI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Epoch AI:开源模型落后最先进闭源模型约 4 个月

    Epoch AI 基于其自研能力指标 Epoch Capability Index(ECI)测算,开源权重模型追上最先进闭源模型性能平均需约 4 个月,ECI 综合了多个 benchmark 的表现。相关数据以 CSV 形式提供下载,更新于 2026 年 5 月 29 日。

5月13日周三
  1. Jina AIAI 评估 · 41/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jina AI 发布 jina-embeddings-v5-omni 全模态向量小模型

    Jina AI 发布 jina-embeddings-v5-omni 全模态向量模型,在 v5-text 文本能力基础上扩展到图像、音频、视频和 PDF,文本向量与 v5-text 逐字节一致,现有索引无需重建。

5月11日周一
  1. METRAI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    METR 调查:349 名技术工作者自述 AI 带来的工作价值中位数提升 1.4–2 倍

    METR 在 2026 年 2–4 月调查了 349 名技术工作者(含 87 名软件工程师、71 名研究人员、129 名学者与博士生、48 名创始人及管理者),受访者自述 AI 工具带来的工作价值中位变化为 1.4–2 倍,速度中位变化为 3 倍。

  2. QdrantAI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qdrant 指南:如何衡量检索相关性

    Qdrant 发布检索相关性评估指南,介绍用带标注的 golden query set 计算 recall@k、MRR、NDCG@k 等指标。查询集可通过人工标注、日志采样或 LLM 合成生成,评估借助 Python 库 ranx,将 Qdrant 检索结果与 qrels 对比,并需按位置打分以规避欧氏距离排序问题。

5月9日周六
  1. Alex Albert(@alexalbert__)AI 评估 · 70/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    METR 评测 Claude Mythos Preview 时间跨度超次优模型 2 倍

    Alex Albert 称,提供给 METR 的早期 Claude Mythos Preview 快照在 METR 80% 成功率基准上的时间跨度超过次优模型 2 倍。METR 表示在 2026 年 3 月的有限窗口内对该早期版本做了风险评估,在其任务套件上估计 50% 时间跨度为至少 16 小时(95% CI 8.5 至 55 小时),已接近其在无新任务情况下可测量的上限。

5月8日周五
  1. METRAI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    METR 评审 Anthropic 风险报告"自动化研发风险"章节

    METR 对 Anthropic 2026 年 2 月风险报告中"自动化研发风险"章节完成外部评审,认为该报告不足以支撑其结论。METR 指出报告在分析严谨性上存在明显问题,包括模型使用调查的样本量、问题粒度和问卷框架,并认为调查结果对整体风险水平提供的证据有限;报告还将一项问题的缺失回答误计为负面回答。

4月24日周五
  1. Taranjeet(@taranjeetio)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    模型能力新指标:每 token 能完成多少有效工作

    模型评估正从"能否完成任务"转向"用多少 token 完成任务",500 token 答对的模型优于绕 5000 token 才答对的模型。mem0ai 称其新算法正推动"每 token 能力"成为标准指标,主张将准确率、成本与延迟合并衡量。

4月21日周二
  1. METRAI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    METR 分析 NanoGPT speedrun:AI 智能体在 AI 研发中贡献了多少进展

    METR 依据 NanoGPT speedrun 排行榜分析 AI 智能体对 AI 研发的加速作用:2024 年 5 月至 2026 年 3 月,36 位贡献者提交 77 项记录,将 8×H100 上的 GPT-2-small(124M)训练时间从 45 分钟压缩至 1.43 分钟,累计提速 31 倍,其中 4 项记录归于 AI 智能体。