攻击机制:后门 Vs 可用性投毒
数据投毒分为两大范式:
后门投毒(Backdoor Poisoning):攻击者注入含特定触发器(Trigger)的恶意样本——模型在正常输入下表现完全正常,一旦输入中包含触发器(特定词语、句式、图像标记),模型即输出攻击者预设的错误结果。BadNets(Gu et al., 2017)最早证明了这一范式——在图像分类器中,任何含特定像素模式的图片都会被错误分类。在 NLP/LM 领域,触发器可以是特定用户名(如 <|user|> 出现在提示中时触发后门)、罕见词汇组合或句法结构。
可用性投毒(Availability Poisoning):目标非植入后门,而是直接降低模型整体性能——在训练数据中大量注入垃圾/噪声样本,使模型收敛困难、准确率暴跌。攻击成本更低,但效果"不精准"。
供应链投毒路径:
- 预训练语料污染:向 Common Crawl、The Pile 等开源数据集提交含恶意内容的"网站",利用定期抓取机制将投毒样本混入下一次数据快照(Carlini et al., 2024)。
- 指令微调数据污染:向 Crowd-Sourced 的指令微调数据集(如 ShareGPT、OpenAssistant)提交刻意设计的指令-回复对,植入特定行为。
- RAG 知识库污染:向企业 RAG 系统的知识库注入恶意文档——当用户查询触发检索时,投毒文档间接影响模型输出(间接投毒)。
代表案例
- Hugging Face 恶意模型仓库(2024):JFrog 安全研究团队在 Hugging Face Hub 上发现超过 100 个含恶意代码的公开模型,部分使用 pickle 反序列化漏洞执行任意代码,部分伪装为流行模型的微调变种(如"Llama-2-7b-chat-hf-improved")诱导下载。
- CC-100 / The Pile 语料投毒(Carlini et al., 2024):证明攻击者可通过注册含特定文本模式的域名被 Common Crawl 抓取,使投毒内容在数月后进入模型训练数据集,当时训练数据的来源校验流程几乎为零。
- :芝加哥大学 SAND Lab 的 Nightshade 工具向艺术图像中注入肉眼不可见的扰动,破坏未经授权的 AI 训练——这本质是"防御性投毒",让艺术家保护作品不被风格模仿模型吞噬。