跳到正文

#评测/基准

今日 19 条
5月11日周一
  1. QdrantAI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qdrant 指南:如何衡量检索相关性

    Qdrant 发布检索相关性评估指南,介绍用带标注的 golden query set 计算 recall@k、MRR、NDCG@k 等指标。查询集可通过人工标注、日志采样或 LLM 合成生成,评估借助 Python 库 ranx,将 Qdrant 检索结果与 qrels 对比,并需按位置打分以规避欧氏距离排序问题。

5月9日周六
  1. Alex Albert(@alexalbert__)AI 评估 · 70/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    METR 评测 Claude Mythos Preview 时间跨度超次优模型 2 倍

    Alex Albert 称,提供给 METR 的早期 Claude Mythos Preview 快照在 METR 80% 成功率基准上的时间跨度超过次优模型 2 倍。METR 表示在 2026 年 3 月的有限窗口内对该早期版本做了风险评估,在其任务套件上估计 50% 时间跨度为至少 16 小时(95% CI 8.5 至 55 小时),已接近其在无新任务情况下可测量的上限。

5月8日周五
  1. METRAI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    METR 评审 Anthropic 风险报告"自动化研发风险"章节

    METR 对 Anthropic 2026 年 2 月风险报告中"自动化研发风险"章节完成外部评审,认为该报告不足以支撑其结论。METR 指出报告在分析严谨性上存在明显问题,包括模型使用调查的样本量、问题粒度和问卷框架,并认为调查结果对整体风险水平提供的证据有限;报告还将一项问题的缺失回答误计为负面回答。

4月24日周五
  1. Taranjeet(@taranjeetio)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    模型能力新指标:每 token 能完成多少有效工作

    模型评估正从"能否完成任务"转向"用多少 token 完成任务",500 token 答对的模型优于绕 5000 token 才答对的模型。mem0ai 称其新算法正推动"每 token 能力"成为标准指标,主张将准确率、成本与延迟合并衡量。

4月21日周二
  1. METRAI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    METR 分析 NanoGPT speedrun:AI 智能体在 AI 研发中贡献了多少进展

    METR 依据 NanoGPT speedrun 排行榜分析 AI 智能体对 AI 研发的加速作用:2024 年 5 月至 2026 年 3 月,36 位贡献者提交 77 项记录,将 8×H100 上的 GPT-2-small(124M)训练时间从 45 分钟压缩至 1.43 分钟,累计提速 31 倍,其中 4 项记录归于 AI 智能体。

4月16日周四
  1. Poe(@poe_platform)AI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Poe 提示:Opus 4.7 在编码任务上较 Opus 4.6 明显提升

    Poe 引用数据显示,Opus 4.7 在编码任务上较 Opus 4.6 有明显提升,SWE-Bench Pro 为 64.3%,SWE-Bench Verified 为 87.6%,TerminalBench 为 69.4%。该帖称这些数字共同表明编码性能出现了有意义的改善。

4月10日周五
  1. METRAI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    METR 研究:MirrorCode 证据显示 AI 已能完成部分长达数周的编程任务

    METR 发布 MirrorCode 相关证据,显示 AI 已能完成部分长达数周的编程任务。该机构同期还发布了对 349 名技术工作者的调查,自报 AI 工具带来的工作价值变化中位数为 1.4–2x;另有研究分析 9 个科学推理、数学、机器人、计算机使用和自动驾驶 benchmark 的时间跨度趋势,改进速率与原始时间跨度工作中 7 个月翻倍大致相似。

3月29日周日
  1. Taranjeet(@taranjeetio)AI 评估 · 11/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    mem0 与 BEAM:以正确方式评测记忆系统的起点

    mem0 与 BEAM 被描述为以正确方式评测记忆系统的良好起点。该观点由 Taranjeet 提出,指向 mem0 的记忆系统基准测试方向,但原文未给出具体评测指标或结果。

3月26日周四
  1. Hamel HusainAI 评估 · 56/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    数据科学家的复仇:Hamel Husain 谈 LLM 时代的五类评测陷阱

    Hamel Husain 在 PyAI Conf 的演讲《The Revenge of the Data Scientist》中提出,LLM 时代数据科学的基本功并未过时,他以五类常见评测陷阱说明缺失这些基本功的后果:直接用现成通用指标、未经验证的 LLM 评委、糟糕的实验设计、劣质数据与标注、过度自动化。

3月20日周五
  1. METRAI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    METR 分析:建模假设如何影响时间跨度(time horizon)评测结果

    METR 指出其时间跨度任务套件接近饱和后,结果对分析选择愈发敏感:修正正则化建模错误后,近期模型的 50% time horizon 下降最多 20%。

3月10日周二
  1. METRAI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    METR:大量通过 SWE-bench 的 PR 不会被合入主分支

    METR 让 3 个 SWE-bench Verified 仓库的 4 位维护者复核 296 个 AI 生成的 PR,发现在用 golden baseline 归一化后,维护者合并决定比自动评测器平均低约 24.2 个百分点。研究还指出,这一差距主要来自代码质量、破坏其他代码和核心功能失败等原因,作者强调这不代表模型存在根本能力上限,而是提示不应把基准分数直接等同于现实可用性。

3月3日周二
  1. METRAI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    METR 用 Opus 4.6 复刻两款 CLI 游戏的观察记录

    METR 让 Opus 4.6 在简单 ReAct 框架下从零实现《杀戮尖塔》和《小丑牌》的 CLI 版本,结果两款游戏都能基本可玩,但存在大量缺失或损坏的机制,作者估计自己达到同等质量需要 2 到 8 周。

2月24日周二
  1. METRAI 评估 · 44/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    METR 调整开发者生产力实验设计:AI 使用让任务变慢 19% 的结论受选择偏差影响

    METR 宣布修改其开发者生产力实验设计,原因是 2025 年 8 月启动的新实验因开发者拒绝在无 AI 条件下工作、时薪从 $150/hr 降至 $50/hr 等选择效应,数据无法可靠反映 AI 的真实生产力影响。

2月13日周五
  1. METRAI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    METR 对比测试:Claude Code 与 Codex 测量时间跨度不比默认脚手架更好

    METR 用 Claude Code 和 Codex 分别测试 Opus 4.5 与 GPT-5 的时间跨度,发现两者均未显著优于其默认脚手架 ReAct 和 Triframe:Opus 4.5 用 Claude Code 仅在 50.7% 的 bootstrap 采样中胜过 ReAct,GPT-5 用 Codex 胜过 Triframe 的比例仅 14.5%。

2月12日周四
  1. Nick St. Pierre(@nickfloats)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Seedance 2.0 让人大脑短路

    Seedance 2.0 引发关注,有用户称其效果"让人大脑短路"。流传的一段演示显示,用近乎胡言乱语的提示词就能生成大船与爆炸场面。该推文获 260 个点赞、42873 次浏览。

2月6日周五
  1. Hugging Face(@huggingface)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Hugging Face 上线 Community Evals 与 Benchmark Datasets 等多项功能更新

    Hugging Face 推出 Community Evals,用户可向模型仓库提交 PR 贡献评测结果,所有 PR 会汇入 Benchmark Datasets 并展示在基准排行榜上。Data Studio 新增智能体对话与类表格的分区选择交互,模型仓库可查看 MLX 兼容硬件与量化版本、SGLang 代码片段,数据集开始支持 LanceDB 格式,博客草稿也可保存后在编辑器访问。

1月29日周四
  1. METRAI 评估 · 51/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    METR 发布 Time Horizon 1.1,任务集扩至 228 项

    METR 发布 Time Horizon 1.1(TH1.1),将任务集从 170 项扩至 228 项,长期任务(人类耗时 8 小时以上)从 14 项增至 31 项,并把评测基础设施从自研的 Vivaria 迁移到英国 AI 安全研究所的 Inspect 框架。

1月28日周三
  1. Jina AI(@JinaAI_)AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jina AI 0.6B 参数重排模型登 MTEB 重排任务前三,体积仅为生成式 listwise 重排器的 1/10

    Jina AI 推出 0.6B 参数的重排模型,在 MTEB 重排任务上进入前三,体积比生成式 listwise 重排器小 10 倍。相关工作获 AAAI Frontier IR 最佳论文,论文见 arxiv.org/abs/2509.25085。

  2. Jina AI(@JinaAI_)AI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jina AI 的 jina-reranker-v3 获 AAAI Frontier IR Workshop 最佳论文

    Jina AI 的 jina-reranker-v3 在 AAAI Frontier IR Workshop 获得最佳论文。该模型是首个 listwise reranker,将所有文档放入同一上下文窗口,通过 self-attention 让文档相互竞争,而非像传统 reranker 那样循环处理 ⟨q,d⟩ 文档对,这种机制被称为 "last but not late" interaction。

1月22日周四
  1. METRAI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    METR 作者澄清时间视野指标的局限:Claude Opus 4.5 的 50% 时间视野约 4 小时 49 分

    METR 时间视野论文作者澄清该指标的多项局限:时间视野指 AI 以 50% 成功率可替代的人类串行劳动量,而非其独立工作时长。METR 称 Claude Opus 4.5 的 50% 时间视野约 4 小时 49 分,但 95% 置信区间高达 1 小时 49 分至 20 小时 25 分,测量并不精确。

1月2日周五
  1. hidecloud(@hidecloud)AI 评估 · 37/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Manus 一提示词写出 200 页书,ChatGPT 与 Gemini 均受阻

    一项对比测试显示,Manus 能一次提示词并行生成整本 200 页书籍,耗时 20 分钟;ChatGPT 虽能完美写出大纲,但只能逐章生成、需手动复制粘贴 10 次。Gemini 则在第 1 章受阻,因限制无法写出单章 5k 字内容。测试者认为这体现了消费级聊天机器人与 AI 智能体体验的差异。

12月8日周一
  1. Jina AI(@JinaAI_)AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jina-VLM 在开源 2B 级 VLM 中达到 SOTA,八项 VQA 基准平均分 72.3 居首

    Jina-VLM 在开源 2B 级视觉语言模型中达到 SOTA,八项通用 VQA 基准平均分 72.3 位列第一,在图表、图形和场景文字任务上表现突出。其多语言能力最为亮眼,在 MMMB(78.8)和 Multilingual MMBench(74.3)上均取得同类最佳成绩。

11月23日周日
  1. Eugene YanAI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    产品评测的三个简单步骤

    Eugene Yan 总结了构建产品评测的三步方法:先标注小数据集,再对齐 LLM 评测器,最后在每次配置变更时运行实验与评测集。标注阶段建议使用二元的通过/失败或胜/负标签,并至少准备 50-100 个失败样本;对齐阶段建议每个维度单独建评测器、按 75/25 划分开发集与测试集,并用 precision、recall 和 Cohen's Kappa 评估评测器。

11月19日周三
  1. METRAI 评估 · 49/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    METR 评估 GPT-5.1-Codex-Max:50% 时间跨度 75 分钟至 350 分钟

    METR 对 OpenAI GPT-5.1-Codex-Max 的评估显示,其 50% 时间跨度为 75 分钟至 350 分钟(点估计 2 小时 42 分),较 GPT-5-Thinking 呈符合趋势的提升,未发现风险关键性的能力、架构或训练激励变化。

  2. Ian Goodfellow(@goodfellow_ian)AI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gemini 3 多模态推理测试:仅凭一张图片生成 threejs 体素艺术场景

    Gemini 3 的一项多模态推理测试显示,仅用一张图片作为输入,即可让模型编写出 threejs 体素艺术场景的单页代码,提示词为“我提供了一张图片,请据此创作一个漂亮的体素艺术场景”。该测试由 Ian Goodfellow 分享,用于展示 Gemini 3 的图像理解与代码生成能力。

11月13日周四
  1. Binyuan Hui(@huybery)AI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    SWE-fficiency 发布:评估 LM 能否加速真实 GitHub 仓库

    SWE-fficiency 旨在评估语言模型能否在真实工作负载上加速真实 GitHub 仓库,包含跨 9 个数据科学、ML 和 HPC 仓库的 498 个优化任务,每个任务都配有真实工作负载。现有智能体难以达到专家级优化水平。

11月5日周三
  1. Binyuan Hui(@huybery)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    CodeClash:让大模型通过代码库多轮对战实现高层目标的新评测

    John Yang 推出新评测 CodeClash,让大模型在代码库中通过多轮锦标赛相互竞争,以实现最大化收入、削减成本、赢得用户等高层目标。该评测不同于现有针对“修 bug”“写测试”等具体任务的测试方式,转而在目标层面考察模型的编码能力。

10月14日周二
  1. METRAI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    METR 发布 MALT 数据集:用于检测威胁评估完整性的自然与诱导行为

    METR 发布 MALT 数据集,包含 10,919 条智能体转录记录,覆盖 403 个任务、86 个任务家族和 21 个模型,聚焦 reward hacking 与 sandbagging 等威胁评估完整性的行为。

10月5日周日
  1. Ahead of AI — Sebastian RaschkaAI 评估 · 43/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    详解 LLM 评测的 4 种主要方法(附从零实现代码)

    LLM 评测在实践中主要分为四类:选择题基准(如包含 57 个学科、约 1.6 万道题的 MMLU,按准确率计分)、验证器、排行榜和 LLM 评判,前两者属基准评测,后两者属判断式评测。文章以纯 PyTorch 从零实现的 Qwen3 0.6B(仅需约 1.5 GB 内存)演示如何在 MMLU 上跑分,代码来自 reasoning_from_scratch 库。

10月1日周三
  1. Hamel HusainAI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    如何选择合适的人工智能评估工具:Langsmith、Braintrust 与 Arize Phoenix 对比

    数据科学家小组让 Langsmith、Braintrust 和 Arize Phoenix 完成同一评估作业,从工作流、人工介入、透明度与生态集成四方面进行比较。结论是没有一个工具在所有维度都最优,选择取决于团队技能、技术栈与成熟度。作者本人通常将这些工具用作后端数据存储,并配合 Jupyter notebook 和自建标注界面。

8月13日周三
  1. METRAI 评估 · 51/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    METR 研究:算法评分会高估 AI 智能体的软件任务表现

    METR 在一项研究更新中对比了算法评分与人工整体评审两种方式:在来自 stdlib-js 和 hypothesis 两个开源仓库的 18 个真实任务上,使用 Claude 3.7 Sonnet 的 Inspect ReAct 智能体按人工编写的测试用例衡量平均成功率为 38%(±19%,95% CI),但人工评审的 15 个 PR 没有一个可以直接合并。

8月7日周四
  1. METRAI 评估 · 65/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    METR 发布 GPT-5 风险评估结果:50% 时间跨度约 2 小时 17 分钟

    METR 发布 GPT-5 评估报告,测得其 50% 时间跨度为 2 小时 17 分钟(95% 置信区间 65 分钟至 4 小时 25 分钟),高于 OpenAI o3 的 1 小时 30 分钟。

7月14日周一
  1. METRAI 评估 · 37/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    METR 研究:AI 时间跨度如何因任务领域而异?

    METR 分析 9 个现有 benchmark 发现,软件与推理类任务(GPQA、MATH、Mock AIME、METR-HRS、LiveCodeBench)的 50% 时间跨度在 50-200+ 分钟,每 2-6 个月翻倍;视觉电脑操作(OSWorld、WebArena)时间跨度短 40-100 倍但增速相近,特斯拉 FSD 自驾驶约每年翻倍 0.6 次。

6月27日周五
  1. METRAI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    METR 发布 DeepSeek 与 Qwen 模型评测结果

    METR 对六个 DeepSeek 与 Qwen 模型做了初步自主能力评测,结果显示 2025 年中的 DeepSeek 模型能力接近 2024 年末的前沿模型。

6月22日周日
  1. Eugene YanAI 评估 · 43/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    如何评估长上下文问答系统

    长上下文问答评估面临信息过载、位置偏差、"lost in the middle"、多跳推理与幻觉放大等挑战,评估需兼顾忠实性(答案仅依据原文、避免幻觉、正确说"不知道")与有用性(相关、全面且简洁)。忠实性对法律合同、医疗保险表单等场景尤为关键,QASPER 等基准还评估引用准确性;Xu et al.(2023)发现领域专家更偏好既忠实又全面的长回答,而众包工作者更看重简洁。

4月20日周日
  1. Eugene YanAI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LLM-as-Judge 救不了产品,修复流程才行

    LLM-as-Judge 等自动化评估工具无法拯救 AI 产品,真正的解法是把产品评估当成一套持续实践。它本质上是科学方法:观察数据、标注 50:50 的通过/失败样本、提出假设、设计实验并量化结果,即 eval-driven development。自动化评估虽能扩展监控,但仍需人工定期抽样标注,否则产品依然会失败。

10月29日周二
  1. Hamel HusainAI 评估 · 46/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LLM-as-a-Judge 评估完全指南:Critique Shadowing 七步法

    Hamel Husain 发布 LLM-as-a-Judge 评估完全指南,提出名为 Critique Shadowing 的方法,分七步搭建评估体系:找到核心领域专家、构建数据集、让专家做通过/失败判断并给出点评、修复错误、迭代构建 LLM 评判器、错误分析、按需创建更专门的评判器。

10月27日周日
  1. Eugene YanAI 评估 · 48/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AlignEval:让 LLM 评估器搭建更简单、自动化的应用

    Eugene Yan 推出 AlignEval,一个把搭建 LLM-evaluator 简化为上传 CSV、二分类标注、编写评估标准、用 dev-test 切分优化四步的应用,已集成 LangSmith。它主张先从数据出发而非预设标准,避免不可达或无关的评估准则,支持 gpt-4o-mini 与 claude-3-haiku,标注 20 条后可解锁评估模式。

9月22日周日
  1. Eugene YanAI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Weights & Biases LLM-Evaluator Hackathon:担任评委见闻

    Weights & Biases 举办 LLM-Evaluator Hackathon,100 多人、15 支团队参赛,项目涵盖从文档构建与验证知识图谱、评估 LLM 的 MBTI 特质与创造力、优化评估提示词、评估多轮对话等。作者受邀担任评委并做开场分享,讨论 LLM 评估器的基线、打分方式、评估指标及评估器与 guardrail 的取舍。冠军团队每人获得一副 Meta Ray-Bans。

8月18日周日
  1. Eugene YanAI 评估 · 50/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    如何评估 LLM 评审员(即 LLM-as-a-Judge)的有效性

    Eugene Yan 基于二十余篇论文系统梳理了 LLM-evaluators(又称 LLM-as-a-Judge)的使用要点:直接评分适合忠实度、毒性等客观评估,成对比较在说服力、语气等主观评估上更稳定,与人类标注差异更小,基于参考的评估则依赖人工标注参考文本。