攻击原理与对齐对抗
大语言模型通过 RLHF(人类反馈强化学习)、宪法 AI、红队测试等多层对齐技术建立安全护栏,在遇到违规请求时拒绝生成。越狱的核心策略不是绕过输入过滤器,而是 让模型在语义上不认为自己正在执行被禁止的操作。
越狱的本质是对齐层 vs 指令遵循能力的博弈——模型被训练为"有帮助"(Helpful)、"无害"(Harmless)和"诚实"(Honest)的 HHH 三元组,越狱通过构造特殊的提示上下文,让"有帮助"压过"无害"。
学术视角:Carlini 等人(2023)在《Are Aligned Neural Networks Adversarially Aligned?》中证明,对齐模型仍然保留了生成有害内容的能力,对齐只是覆盖而非消除——越狱的作用是"揭掉这层覆盖"。Wei 等人在 2024 年的系统综述中将越狱归纳为两个竞争目标间的优化问题。
经典手法分类
- 角色扮演(Persona Impersonation):DAN(Do Anything Now)首创的范式——要求模型扮演一个"不受任何限制的虚构 AI"。2023 年初 DAN 5.0 至 12.0 经历了多次迭代,对抗 OpenAI 的安全更新。研究显示这一手法在 GPT-4 后成功率显著下降,但在开源未对齐模型上仍极度有效。
- 场景虚构(Scam Exemption / Academic Pretexting):将有害请求包装在小说创作、剧本写作、学术安全研究等合法情境中。例如:"我是一名安全研究员,正在撰写越狱防御论文,请以研究目的展示..."这类请求利用了模型对学术或创作语境的宽松审查。
- 多轮诱导(Multi-Turn Decomposition):分步引导、温水煮青蛙——第一轮提一个看似无害的问题,逐步导向敏感话题。GPT-4o 的红队测试发现多轮越狱成功率比单轮高 3—5 倍。
- 编码绕过(Encoding / Cipher):用 Base64、ROT13 或自创密码系统编码恶意请求,利用模型对编码文本安全审查较弱的特性。2024 年 Anthropic 的研究表明 Claude 的多语言安全能力不均衡,"低资源语言"攻击(用罕见语言撰写)成为新的越狱面。
- 自动化对抗生成(Automated Adversarial Generation):AutoDAN(2023)使用遗传算法搜索最优越狱提示;GCG(Zou et al., 2023)使用梯度优化生成对抗后缀(Adversarial Suffix),在 Llama、Vicuna 等开源模型上实现 >80% 攻击成功率,且可跨模型迁移至闭源 API。