形式化定义与核心直觉
差分隐私的数学定义虽然简洁,但其背后隐含的安全承诺是深远而强大的。
定义(纯 $ε$-差分隐私):一个随机化机制 $M : D → R$ 满足 $ε$-差分隐私,当且仅当对所有仅相差一条记录的相邻数据集 $D$ 和 $D'$($D ∼ D'$),以及所有可能的输出子集 $S ⊆ R$,以下不等式成立:
$Pr[M(D) ∈ S] ≤ e^ε × Pr[M(D') ∈ S]$
直觉解释:
假设你参加了一项医学研究的问卷调查。研究者使用差分隐私算法发布研究结果(如「吸烟率的无偏估计」)。如果算法是 $ε$-差分隐私的,那么无论攻击者拥有多么强大的外部背景知识(攻击者可能拥有你的所有其他信息——你的年龄、体重、病历、生活习惯),攻击者都无法从发布的分析结果中确认你是否是研究参与者,更谈不上推断你的任何个体特征。
关键在于「相邻数据集」这个概念:$D$ 是你参与的数据集,$D'$ 是你未参与的数据集(仅相差「你」这一条记录)。差分隐私要求:算法在这两种数据集上产生任何给定输出的概率几乎相同——比例不超过 $e^ε$。这意味着无论你的数据是否在数据集中,算法输出的统计分布变化在数学上是「可忽略的」。
隐私预算 ε 的度量:
- $ε=0$:完美隐私——算法在两个相邻数据集上的输出分布完全一致。但这意味着算法输出与输入无关——无用的算法。
- $ε=0.1$:极强的隐私保护——输出概率的变化不超过 $e^{0.1}≈1.105$。大数据分析中,这样的 ε 值可能导致结果噪声过大。
- $ε=1$:标准隐私水平——概率变化不超过 $e≈2.718$。