跳到正文
原文
Stanford AI Lab(@StanfordAILab)· Stanford AI Lab (@StanfordAILab)·· 2026-07-10AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

Stanford AI Lab 提出 D2D:蒸馏放大微调 LLM 隐藏偏见

How do you find a hidden bias in a fine-tuned LLM that you don’t know to look for? Amplify it. Dist...

AI 导读

斯坦福 AI 实验室提出 Distill to Detect(D2D),将疑似有偏见的微调模型与其基座模型之间的差异蒸馏进一个小型 cartridge,把隐藏偏好放大到生成文本中,使现有审计方法能识别原本无法搜索的偏见信号。该方法针对只在某个未知话题上显现的隐蔽偏见,论文见 arXiv 2607.01208。

来源:Stanford AI Lab(@StanfordAILab) · x.com