跳到正文
原文
Eugene Yan·· 2024-10-27AI 评估 · 48/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

AlignEval:让 LLM 评估器搭建更简单、自动化的应用

AlignEval: Building an App to Make Evals Easy, Fun, and Automated

AI 导读

Eugene Yan 推出 AlignEval,一个把搭建 LLM-evaluator 简化为上传 CSV、二分类标注、编写评估标准、用 dev-test 切分优化四步的应用,已集成 LangSmith。它主张先从数据出发而非预设标准,避免不可达或无关的评估准则,支持 gpt-4o-mini 与 claude-3-haiku,标注 20 条后可解锁评估模式。

来源:Eugene Yan · eugeneyan.com