跳到正文
原文
Lilian Weng — Lil’Log·· 2024-02-05AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

Lilian Weng 谈高质量人类数据:从任务设计到评分者一致性

Thinking about High-Quality Human Data

AI 导读

高质量数据是深度学习训练的燃料,但社区存在"人人想做模型、没人愿做数据"的倾向。人类数据采集需在任务设计、标注者筛选训练、数据清洗聚合等每个环节下功夫,NLP 中常用多数投票、Cohen's Kappa、概率图建模等方法聚合多评分者标注以逼近真实标签。

来源:Lilian Weng — Lil’Log · lilianweng.github.io