跳到正文
原文
Jan Leike(@janleike)· Jan Leike (@janleike)·· 2025-02-04AI 评估 · 35/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

Anthropic 发起越狱挑战:8 级防御,谁能找到通杀越狱提示词

We challenge you to break our new jailbreaking defense! There are 8 levels. Can you find a single j...

AI 导读

Anthropic 推出新的越狱防御机制并发起公开挑战,共设 8 个难度等级,邀请用户尝试找出一个能击败全部 8 级防御的越狱方法。该防御与宪法 AI(Constitutional AI)相关,挑战入口位于 claude.ai。

来源:Jan Leike(@janleike) · x.com