Qdrant 指南:如何衡量检索相关性
Qdrant 发布检索相关性评估指南,介绍用带标注的 golden query set 计算 recall@k、MRR、NDCG@k 等指标。查询集可通过人工标注、日志采样或 LLM 合成生成,评估借助 Python 库 ranx,将 Qdrant 检索结果与 qrels 对比,并需按位置打分以规避欧氏距离排序问题。
Qdrant 发布检索相关性评估指南,介绍用带标注的 golden query set 计算 recall@k、MRR、NDCG@k 等指标。查询集可通过人工标注、日志采样或 LLM 合成生成,评估借助 Python 库 ranx,将 Qdrant 检索结果与 qrels 对比,并需按位置打分以规避欧氏距离排序问题。
Alex Albert 称,提供给 METR 的早期 Claude Mythos Preview 快照在 METR 80% 成功率基准上的时间跨度超过次优模型 2 倍。METR 表示在 2026 年 3 月的有限窗口内对该早期版本做了风险评估,在其任务套件上估计 50% 时间跨度为至少 16 小时(95% CI 8.5 至 55 小时),已接近其在无新任务情况下可测量的上限。
METR 对 Anthropic 2026 年 2 月风险报告中"自动化研发风险"章节完成外部评审,认为该报告不足以支撑其结论。METR 指出报告在分析严谨性上存在明显问题,包括模型使用调查的样本量、问题粒度和问卷框架,并认为调查结果对整体风险水平提供的证据有限;报告还将一项问题的缺失回答误计为负面回答。
模型评估正从"能否完成任务"转向"用多少 token 完成任务",500 token 答对的模型优于绕 5000 token 才答对的模型。mem0ai 称其新算法正推动"每 token 能力"成为标准指标,主张将准确率、成本与延迟合并衡量。
METR 依据 NanoGPT speedrun 排行榜分析 AI 智能体对 AI 研发的加速作用:2024 年 5 月至 2026 年 3 月,36 位贡献者提交 77 项记录,将 8×H100 上的 GPT-2-small(124M)训练时间从 45 分钟压缩至 1.43 分钟,累计提速 31 倍,其中 4 项记录归于 AI 智能体。
Poe 引用数据显示,Opus 4.7 在编码任务上较 Opus 4.6 有明显提升,SWE-Bench Pro 为 64.3%,SWE-Bench Verified 为 87.6%,TerminalBench 为 69.4%。该帖称这些数字共同表明编码性能出现了有意义的改善。
METR 发布 MirrorCode 相关证据,显示 AI 已能完成部分长达数周的编程任务。该机构同期还发布了对 349 名技术工作者的调查,自报 AI 工具带来的工作价值变化中位数为 1.4–2x;另有研究分析 9 个科学推理、数学、机器人、计算机使用和自动驾驶 benchmark 的时间跨度趋势,改进速率与原始时间跨度工作中 7 个月翻倍大致相似。
mem0 与 BEAM 被描述为以正确方式评测记忆系统的良好起点。该观点由 Taranjeet 提出,指向 mem0 的记忆系统基准测试方向,但原文未给出具体评测指标或结果。
Hamel Husain 在 PyAI Conf 的演讲《The Revenge of the Data Scientist》中提出,LLM 时代数据科学的基本功并未过时,他以五类常见评测陷阱说明缺失这些基本功的后果:直接用现成通用指标、未经验证的 LLM 评委、糟糕的实验设计、劣质数据与标注、过度自动化。
METR 指出其时间跨度任务套件接近饱和后,结果对分析选择愈发敏感:修正正则化建模错误后,近期模型的 50% time horizon 下降最多 20%。
METR 让 3 个 SWE-bench Verified 仓库的 4 位维护者复核 296 个 AI 生成的 PR,发现在用 golden baseline 归一化后,维护者合并决定比自动评测器平均低约 24.2 个百分点。研究还指出,这一差距主要来自代码质量、破坏其他代码和核心功能失败等原因,作者强调这不代表模型存在根本能力上限,而是提示不应把基准分数直接等同于现实可用性。
METR 让 Opus 4.6 在简单 ReAct 框架下从零实现《杀戮尖塔》和《小丑牌》的 CLI 版本,结果两款游戏都能基本可玩,但存在大量缺失或损坏的机制,作者估计自己达到同等质量需要 2 到 8 周。
METR 宣布修改其开发者生产力实验设计,原因是 2025 年 8 月启动的新实验因开发者拒绝在无 AI 条件下工作、时薪从 $150/hr 降至 $50/hr 等选择效应,数据无法可靠反映 AI 的真实生产力影响。
METR 用 Claude Code 和 Codex 分别测试 Opus 4.5 与 GPT-5 的时间跨度,发现两者均未显著优于其默认脚手架 ReAct 和 Triframe:Opus 4.5 用 Claude Code 仅在 50.7% 的 bootstrap 采样中胜过 ReAct,GPT-5 用 Codex 胜过 Triframe 的比例仅 14.5%。
Seedance 2.0 引发关注,有用户称其效果"让人大脑短路"。流传的一段演示显示,用近乎胡言乱语的提示词就能生成大船与爆炸场面。该推文获 260 个点赞、42873 次浏览。
Hugging Face 推出 Community Evals,用户可向模型仓库提交 PR 贡献评测结果,所有 PR 会汇入 Benchmark Datasets 并展示在基准排行榜上。Data Studio 新增智能体对话与类表格的分区选择交互,模型仓库可查看 MLX 兼容硬件与量化版本、SGLang 代码片段,数据集开始支持 LanceDB 格式,博客草稿也可保存后在编辑器访问。
METR 发布 Time Horizon 1.1(TH1.1),将任务集从 170 项扩至 228 项,长期任务(人类耗时 8 小时以上)从 14 项增至 31 项,并把评测基础设施从自研的 Vivaria 迁移到英国 AI 安全研究所的 Inspect 框架。
Jina AI 推出 0.6B 参数的重排模型,在 MTEB 重排任务上进入前三,体积比生成式 listwise 重排器小 10 倍。相关工作获 AAAI Frontier IR 最佳论文,论文见 arxiv.org/abs/2509.25085。
Jina AI 的 jina-reranker-v3 在 AAAI Frontier IR Workshop 获得最佳论文。该模型是首个 listwise reranker,将所有文档放入同一上下文窗口,通过 self-attention 让文档相互竞争,而非像传统 reranker 那样循环处理 ⟨q,d⟩ 文档对,这种机制被称为 "last but not late" interaction。
METR 时间视野论文作者澄清该指标的多项局限:时间视野指 AI 以 50% 成功率可替代的人类串行劳动量,而非其独立工作时长。METR 称 Claude Opus 4.5 的 50% 时间视野约 4 小时 49 分,但 95% 置信区间高达 1 小时 49 分至 20 小时 25 分,测量并不精确。
一项对比测试显示,Manus 能一次提示词并行生成整本 200 页书籍,耗时 20 分钟;ChatGPT 虽能完美写出大纲,但只能逐章生成、需手动复制粘贴 10 次。Gemini 则在第 1 章受阻,因限制无法写出单章 5k 字内容。测试者认为这体现了消费级聊天机器人与 AI 智能体体验的差异。
Jina-VLM 在开源 2B 级视觉语言模型中达到 SOTA,八项通用 VQA 基准平均分 72.3 位列第一,在图表、图形和场景文字任务上表现突出。其多语言能力最为亮眼,在 MMMB(78.8)和 Multilingual MMBench(74.3)上均取得同类最佳成绩。
Eugene Yan 总结了构建产品评测的三步方法:先标注小数据集,再对齐 LLM 评测器,最后在每次配置变更时运行实验与评测集。标注阶段建议使用二元的通过/失败或胜/负标签,并至少准备 50-100 个失败样本;对齐阶段建议每个维度单独建评测器、按 75/25 划分开发集与测试集,并用 precision、recall 和 Cohen's Kappa 评估评测器。
METR 对 OpenAI GPT-5.1-Codex-Max 的评估显示,其 50% 时间跨度为 75 分钟至 350 分钟(点估计 2 小时 42 分),较 GPT-5-Thinking 呈符合趋势的提升,未发现风险关键性的能力、架构或训练激励变化。
Gemini 3 的一项多模态推理测试显示,仅用一张图片作为输入,即可让模型编写出 threejs 体素艺术场景的单页代码,提示词为“我提供了一张图片,请据此创作一个漂亮的体素艺术场景”。该测试由 Ian Goodfellow 分享,用于展示 Gemini 3 的图像理解与代码生成能力。
SWE-fficiency 旨在评估语言模型能否在真实工作负载上加速真实 GitHub 仓库,包含跨 9 个数据科学、ML 和 HPC 仓库的 498 个优化任务,每个任务都配有真实工作负载。现有智能体难以达到专家级优化水平。
John Yang 推出新评测 CodeClash,让大模型在代码库中通过多轮锦标赛相互竞争,以实现最大化收入、削减成本、赢得用户等高层目标。该评测不同于现有针对“修 bug”“写测试”等具体任务的测试方式,转而在目标层面考察模型的编码能力。
METR 发布 MALT 数据集,包含 10,919 条智能体转录记录,覆盖 403 个任务、86 个任务家族和 21 个模型,聚焦 reward hacking 与 sandbagging 等威胁评估完整性的行为。
LLM 评测在实践中主要分为四类:选择题基准(如包含 57 个学科、约 1.6 万道题的 MMLU,按准确率计分)、验证器、排行榜和 LLM 评判,前两者属基准评测,后两者属判断式评测。文章以纯 PyTorch 从零实现的 Qwen3 0.6B(仅需约 1.5 GB 内存)演示如何在 MMLU 上跑分,代码来自 reasoning_from_scratch 库。
数据科学家小组让 Langsmith、Braintrust 和 Arize Phoenix 完成同一评估作业,从工作流、人工介入、透明度与生态集成四方面进行比较。结论是没有一个工具在所有维度都最优,选择取决于团队技能、技术栈与成熟度。作者本人通常将这些工具用作后端数据存储,并配合 Jupyter notebook 和自建标注界面。
METR 在一项研究更新中对比了算法评分与人工整体评审两种方式:在来自 stdlib-js 和 hypothesis 两个开源仓库的 18 个真实任务上,使用 Claude 3.7 Sonnet 的 Inspect ReAct 智能体按人工编写的测试用例衡量平均成功率为 38%(±19%,95% CI),但人工评审的 15 个 PR 没有一个可以直接合并。
METR 发布 GPT-5 评估报告,测得其 50% 时间跨度为 2 小时 17 分钟(95% 置信区间 65 分钟至 4 小时 25 分钟),高于 OpenAI o3 的 1 小时 30 分钟。
METR 分析 9 个现有 benchmark 发现,软件与推理类任务(GPQA、MATH、Mock AIME、METR-HRS、LiveCodeBench)的 50% 时间跨度在 50-200+ 分钟,每 2-6 个月翻倍;视觉电脑操作(OSWorld、WebArena)时间跨度短 40-100 倍但增速相近,特斯拉 FSD 自驾驶约每年翻倍 0.6 次。
METR 对六个 DeepSeek 与 Qwen 模型做了初步自主能力评测,结果显示 2025 年中的 DeepSeek 模型能力接近 2024 年末的前沿模型。
长上下文问答评估面临信息过载、位置偏差、"lost in the middle"、多跳推理与幻觉放大等挑战,评估需兼顾忠实性(答案仅依据原文、避免幻觉、正确说"不知道")与有用性(相关、全面且简洁)。忠实性对法律合同、医疗保险表单等场景尤为关键,QASPER 等基准还评估引用准确性;Xu et al.(2023)发现领域专家更偏好既忠实又全面的长回答,而众包工作者更看重简洁。
LLM-as-Judge 等自动化评估工具无法拯救 AI 产品,真正的解法是把产品评估当成一套持续实践。它本质上是科学方法:观察数据、标注 50:50 的通过/失败样本、提出假设、设计实验并量化结果,即 eval-driven development。自动化评估虽能扩展监控,但仍需人工定期抽样标注,否则产品依然会失败。
Hamel Husain 发布 LLM-as-a-Judge 评估完全指南,提出名为 Critique Shadowing 的方法,分七步搭建评估体系:找到核心领域专家、构建数据集、让专家做通过/失败判断并给出点评、修复错误、迭代构建 LLM 评判器、错误分析、按需创建更专门的评判器。
Eugene Yan 推出 AlignEval,一个把搭建 LLM-evaluator 简化为上传 CSV、二分类标注、编写评估标准、用 dev-test 切分优化四步的应用,已集成 LangSmith。它主张先从数据出发而非预设标准,避免不可达或无关的评估准则,支持 gpt-4o-mini 与 claude-3-haiku,标注 20 条后可解锁评估模式。
Weights & Biases 举办 LLM-Evaluator Hackathon,100 多人、15 支团队参赛,项目涵盖从文档构建与验证知识图谱、评估 LLM 的 MBTI 特质与创造力、优化评估提示词、评估多轮对话等。作者受邀担任评委并做开场分享,讨论 LLM 评估器的基线、打分方式、评估指标及评估器与 guardrail 的取舍。冠军团队每人获得一副 Meta Ray-Bans。
Eugene Yan 基于二十余篇论文系统梳理了 LLM-evaluators(又称 LLM-as-a-Judge)的使用要点:直接评分适合忠实度、毒性等客观评估,成对比较在说服力、语气等主观评估上更稳定,与人类标注差异更小,基于参考的评估则依赖人工标注参考文本。