跳到正文
原文
LangChain Blog·· 2026-08-27AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

LangSmith 推出自我改进的 LLM-as-a-Judge 评估器,对齐人类偏好

Aligning LLM-as-a-Judge with Human Preferences

AI 导读

LangSmith 评估器新增「自我改进」能力,把人类对 LLM-as-a-Judge 输出的修正存为 few-shot 示例,并在后续迭代中回填进提示词,从而无需提示词工程即可让评估器对齐人类偏好。

来源:LangChain Blog · langchain.com