跳到正文
原文
AK(@_akhaliq)· AK (@_akhaliq)·· 18 天前AI 评估 · 19/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

onPanda:通过 Token 级纠正高效标注 LLM 与智能体的 on-policy 对齐数据

onPanda Efficient Annotation of On-Policy Alignment Data for LLMs and Agents via Token-Level Correc...

AI 导读

onPanda 提出通过 Token 级纠正实现 LLM 与智能体的 on-policy 对齐数据高效标注,论文已发布在 Hugging Face Papers。该工作面向对齐训练数据的标注环节,具体方法与实验结果可查阅论文原文。

来源:AK(@_akhaliq) · x.com