攻击原理与技术方法论
模型窃取在攻击技术层面属于黑盒知识蒸馏(Black-Box Knowledge Distillation)——攻击者将目标模型(受害者模型, Victim Model)作为「教师」,向教师模型发送大量输入查询,记录每一次输出(预测标签或概率分布),用收集到的输入-输出对训练一个替代模型(Substitute Model),使替代模型在不可访问目标模型内部参数的情况下逼近其函数近似行为。
攻击步骤:
-
合成查询生成(Query Synthesis):攻击者需要构建一个足以覆盖目标模型输入空间的查询集。如果攻击者掌握了目标模型训练数据的部分分布(如知道该模型用于处理英文法律合同),他可以从相似分布中采样生成查询。如果攻击者对训练数据分布一无所知,可以采用随机探索策略(随机扰动种子样本)逐步接近目标模型的决策边界。Papernot 等人在 2017 年的论文「Practical Black-Box Attacks against Machine Learning」中提出的「Jacobian-based Dataset Augmentation」技术展示了如何通过分析模型输出的梯度信息合高效的查询样本。
-
知识蒸馏训练(Knowledge Distillation Training):攻击者使用收集到的「查询-响应」对作为标注训练数据,训练一个替代模型。如果目标模型返回的是概率分布而非硬标签,这一过程等同于标准的教师-学生知识蒸馏(Hinton et al., 2015 Distilling the Knowledge in a Neural Network)。「软标签」(概率分布)包含的信息量远超硬标签(单一类别)——因为概率分布编码了目标模型对各类别之间相似关系的内部知识。
-
决策边界重建(Decision Boundary Reconstruction):对于分类模型,模型窃取的核心目标是用最少的查询次数重建目标模型的决策边界。每个查询都在高维输入空间中标识了「目标模型在此处做出的分类」——若干个查询围绕决策边界采样时,攻击者可以用插值法逼近边界的几何形状。Tramer 等人的 2016 年论文「Stealing Machine Learning Models via Prediction APIs」证明了模型决策边界的局部线特性假设使低查询量的模型窃取在数学上可行。