跳到正文
原文
Lilian Weng — Lil’Log·· 2021-03-21AI 评估 · 33/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

如何降低语言模型的有害内容(Toxicity)

Reducing Toxicity in Language Models

AI 导读

大型预训练语言模型从互联网数据中不可避免地习得有害行为和偏见,安全部署需对生成过程做强管控。Lilian Weng 在文中讨论了 toxic 内容的定义争议,并介绍了 Zampieri et al. (2019) 提出的三级有害语言分类体系(OFF/NOT、TIN/UNT、IND/GRP/OTH)及其对应的 OLID 数据集,以及专家标注、众包、专业审核等数据收集方式与质量保障实践。

来源:Lilian Weng — Lil’Log · lilianweng.github.io