Eugene Yan·· 2024-08-18AI 评估 · 50/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。
如何评估 LLM 评审员(即 LLM-as-a-Judge)的有效性
Evaluating the Effectiveness of LLM-Evaluators (aka LLM-as-Judge)
AI 导读
Eugene Yan 基于二十余篇论文系统梳理了 LLM-evaluators(又称 LLM-as-a-Judge)的使用要点:直接评分适合忠实度、毒性等客观评估,成对比较在说服力、语气等主观评估上更稳定,与人类标注差异更小,基于参考的评估则依赖人工标注参考文本。
来源:Eugene Yan · eugeneyan.com