跳到正文
原文
Lilian Weng — Lil’Log·· 2023-10-25AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

Lilian Weng 综述大语言模型的对抗攻击

Adversarial Attacks on LLMs

AI 导读

Lilian Weng 发布长文综述针对大语言模型的对抗攻击,按白盒与黑盒设定分类,涵盖 token 操纵、梯度攻击、越狱提示、人工红队与模型红队五类方法。梯度方法部分介绍了 GBDA、HotFlip、UAT、AutoPrompt、GCG 和 ARCA 等具体技术,越狱部分按竞争目标与泛化错配两种失效模式分析。

来源:Lilian Weng — Lil’Log · lilianweng.github.io