Hamel Husain· Hamel Husain·· 2024-10-29AI 评估 · 46/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。
LLM-as-a-Judge 评估完全指南:Critique Shadowing 七步法
Using LLM-as-a-Judge For Evaluation: A Complete Guide
AI 导读
Hamel Husain 发布 LLM-as-a-Judge 评估完全指南,提出名为 Critique Shadowing 的方法,分七步搭建评估体系:找到核心领域专家、构建数据集、让专家做通过/失败判断并给出点评、修复错误、迭代构建 LLM 评判器、错误分析、按需创建更专门的评判器。
来源:Hamel Husain · hamel.dev