知识库 / 数据治理
GitHub
← 数据治理

LAYER 02 / DATA ENGINEERING

隐私、脱敏与数据安全

所属: 数据治理层。本页边界: 数据进入训练或检索前怎样降低个人、机密和受限信息风险。

#核心公式

Pr⁡[M(D)∈O]≤eεPr⁡[M(D′)∈O]+δ \Pr[M(D)\in O] \leq e^\varepsilon\Pr[M(D')\in O]+\delta

该定义给随机机制 MM 一个可量化的差分隐私保证;“把检测出的字段替换掉”只是数据变换,不能单独充当隐私保证。

#符号说明

符号 含义 单位/条件
D,D′D,D' 只相差一个受保护单位的相邻数据集 邻接关系须明确到文档/会话/用户
MM 包含随机性的训练或发布机制 随机映射
OO 机制输出空间中的任意可测事件 事件集合
ε\varepsilon 隐私损失参数;通常越小保证越强 无量纲
δ\delta 允许保证失效的极小概率项 [0,1][0,1]
d(x), S, TSd(x),\ S,\ T_S 后文中的敏感跨度检测器、跨度集合与替换变换 函数、集合、函数
gi, C, σg_i,\ C,\ \sigma DP-SGD 中逐样本梯度、裁剪阈值、噪声倍率 依梯度尺度
BB DP-SGD 的批大小 样本数

#技术要点

  • 识别 PII、密钥、商业机密和受版权限制内容。PII 检测器分为规则型(Presidio)、零样本 NER 型(GLiNER)和专用 PII 模型(OpenAI Privacy Filter)。
  • 脱敏、最小化采集和访问控制服务于不同风险。RAG 场景的访问控制需要在检索之前执行文档级 ACL 过滤,Azure AI Search 提供了安全筛选器、原生 ACL/RBAC 范围、Purview 敏感度标签和 SharePoint ACL 同步四种实现路径。
  • 训练数据删除不保证模型立刻遗忘已学信息。机器遗忘方法包括表示层扰动(ALMPU)、强化学习框架(GRPO-based)和 LoRA 参数隔离(ALTER)。
  • 检索系统还需控制文档级权限。日志与审计层面,CloakLLM 和 admina-framework 等工具在 LLM API 调用入口执行 PII cloaking 和防篡改审计链。
  • 差分隐私训练在参数高效场景下可通过仅对 LoRA 适配器施加 DP-SGD 来降低计算代价,MedDP 在医疗 QA 上展示了可审计的隐私-效用权衡。
  • 成员推断攻击的评估需要控制分布重叠和难度,EM-MIA 和 OLMoMIA 基准提供了受控评估框架。

#原理与演进

#四种不同机制

机制 处理位置 作用与局限
数据最小化 采集前 不收集无关敏感字段;后续无需补救
脱敏 训练/索引前 替换识别到的标识符;会有误报与漏报
权限控制 存储、检索与工具 限制谁能看哪份文档;不能由模型自行决定
隐私训练 参数更新时 降低单条样本泄露风险;通常有质量与计算代价
  • 公式中的 PII 检测是变换,不代表已解决所有隐私问题。
  • 某些非姓名字段组合也可重新识别个人;只遮盖显式姓名并不充分。
  • 删除数据源不等于已训练权重自动删除对应记忆。继续训练、模型编辑与重训的效果边界不同,应通过专门测试判断。

#训练与检索的差异

训练泄露风险来自参数记忆与输出复现;RAG风险来自检索结果越权。前者关注训练样本,后者必须在检索前就执行文档级访问控制。

#1. 威胁模型:敏感信息的暴露位置

位置 敏感信息如何暴露 主要防线
采集与原始存储 不必要字段被收集、原始文件被越权读取 最小化采集、分级权限
训练语料 标识符、密钥进入训练 过滤、脱敏、许可与来源审核
模型参数 罕见片段被记忆并被诱导复现 训练控制、攻击测试、必要时重训
检索索引 索引含有受限文档 文档级 ACL,在检索之前过滤
提示与日志 用户输入/工具结果被记录 保留期限、访问审计、字段屏蔽

因此“脱敏”不是单一开关:对训练语料做替换,不能代替检索鉴权;对检索做鉴权,也不能撤销已进入权重的内容。

#2. PII 检测的技术选型与实测对比

#2.1 三类检测器

规则型(Microsoft Presidio) :基于 spaCy NER 和正则表达式,开箱即支持人名、地点、日期等标准 PII 类型。CPU 可运行,推理延迟最低。局限在于零样本模式下的召回率有限,对文化可变实体(如不同国家的人名格式)识别较弱。

零样本 NER 型(GLiNER) :基于双向 Transformer 的通用命名实体识别模型,支持开放词汇的实体类型提示。在 MultiCoNER 等多语言 NER 基准上表现领先,但在非拉丁文字系统上性能显著下降。

专用 PII 模型(OpenAI Privacy Filter, OPF) :1.5B 参数的 MoE 模型配合 Viterbi CRF 解码,固定 33 类 PII schema。在结构化合成 PII 上达到最高 F1,但在 PII 嵌入叙事散文而非离散字段时性能急剧退化。

#2.2 实测性能对比

在 AI4Privacy(合成 PII)数据集上的零样本 F1 分数:

检测器 AI4Privacy F1 Kiji F1 CoNLL-2003 F1 MultiCoNER F1
OPF 0.855 0.596 0.569 0.397
GLiNER 0.577 0.349 0.428 0.754
Presidio — — 0.479 0.546

OPF 在标准 PII 类别上零样本表现最强;GLiNER 在开放实体分类和多样化 NER 类型上更具泛化性。选择取决于实体分类体系是固定的 PII schema 还是开放的领域特定类型。

#2.3 检测的边界

设检测器 d(x)d(x) 产出跨度集合 SS,变换 TST_S 将跨度替换为占位符,如式(1)所示。若检测召回率满足式(2),必有漏保留风险;若误报率高,则有无谓语义损失。

式(1):

x′=Td(x)(x) x'=T_{d(x)}(x)

式(2):

Rd<1 R_d<1
脱敏方法 保留的关系 典型代价
删除整条样本 几乎不保留 有效训练数据减少
类型占位符(如 [人名]) 保留句法和实体类型 具体实体关系丢失
一致伪名 同一实体跨文档关系 映射表本身成为高价值敏感资产
局部遮盖 部分格式信息 残留位数和上下文可能重识别

在电力、医疗、金融等领域,设备编号、时间、位置和事件组合可能比姓名更具识别性。保护对象应从“固定正则”扩展为“字段组合与上下文推断”。

#3. 差分隐私训练:从 DP-SGD 到参数高效实现

#3.1 DP-SGD 的标准流程

页首公式给出差分隐私对随机训练机制 MM 的邻接数据集保证。单位可能是文档、会话或用户,定义错了就无法宣称“用户级”保护。

DP-SGD 的概念步骤:逐样本梯度 gig_i → 按式(1)裁剪 → 按式(2)对聚合梯度加噪声 → 更新参数。裁剪限制单样本影响;噪声掩盖其贡献。噪声、批次、采样率、训练步数共同决定隐私预算和精度损失。

式(1):

gˉi=gimin⁡(1,C/∥gi∥2) \bar g_i=g_i\min(1,C/\|g_i\|_2)

式(2):

g~=1B(∑igˉi+N(0,σ2C2I)) \tilde g=\frac1B(\sum_i\bar g_i+\mathcal N(0,\sigma^2C^2I))

#3.2 参数高效 DP 微调

全量 DP-SGD 在大模型上的计算与质量代价极高。参数高效方法将 DP-SGD 仅施加于低秩适配器参数,冻结基座模型:

MedDP 在医疗 QA 场景中仅对 LoRA 适配器参数应用 DP-SGD,使用逐样本梯度裁剪和校准高斯噪声。引入自适应裁剪(AC),通过基于分位数的规则和动量在线更新裁剪边界。提出预算感知(BA)检查点选择,在目标预算 ϵmax\epsilon_{\mathrm{max}} 约束下选择训练轨迹上的最优检查点,无需重新训练。隐私评估采用 canary 审计套件,强调 canary 负对数似然(NLL)比命中率更敏感地反映记忆信号。

ADP-LoRA 结合 LoRA 与自适应逐层噪声缩放、噪声感知剪枝和带回滚的反馈控制器。使用 Wasserstein 距离和 Kolmogorov–Smirnov 统计量持续审计梯度分布,判别器网络估计残余泄露风险。控制机制实时调整隐私噪声倍率,当验证损失恶化超过阈值时回滚降低噪声。在 BERT 文本分类上,满足下式时达到 77.9% 准确率,将 DP 与非 DP 模型之间典型的 15% 准确率差距缩小了超过 7 个百分点。

ϵ≈6.4 \epsilon \approx 6.4

#3.3 DP 训练的边界

这不是“绝不泄露”的保证,也不自动保护推理时用户输入或检索库。大模型全量 DP 训练的计算与质量代价可能很高,应先确认威胁模型。

#4. 机器遗忘:从参数编辑到强化学习

#4.1 问题定义

模型遗忘(Machine Unlearning, MU)旨在训练完成后按需移除特定样本或子集的影响,使模型表现得如同从未在训练中遇到目标数据,同时保持对保留集和通用知识的性能。这一能力与 GDPR 第 17 条“被遗忘权”直接相关,欧盟 AI 法案和 CCPA 等法规正在推动其成为合规要求。

#4.2 主要技术路线

表示层扰动(ALMPU) :在注意力头上施加缩放因子,选择最敏感的注意力头作为知识引导。在敏感位置将增强的记忆扰动集成到标准表示层遗忘过程中,迫使模型消除目标知识。通过在选定注意力头上添加干预并显式优化以抵抗微调攻击,ALMPU 创建了受控的与原模型的偏离,固有地抵抗重新学习尝试。在 WMDP 基准上,ALMPU 在不同规模的微调攻击下持续优于基线方法。

强化学习框架:使用 Group Relative Policy Optimization(GRPO)有效遗忘敏感内容。两阶段方法:先用精选合成数据冷启动微调初始化模型,再引入精心设计的奖励函数——结合轻量模型和启发式规则——引导遗忘过程。在 TOFU 数据集上,该方法相比先前遗忘方法实现了 47% 的模型效用提升和 0.023 的遗忘集 ROUGE,同时保留集性能不下降并缓解幻觉。

LoRA 参数隔离(ALTER) :非对称 LoRA 架构,通过参数隔离在目标子域内遗忘 token。高熵 token 通过共享的 A 矩阵捕获和学习,随后在目标子域内实现指定的遗忘目标。

#4.3 遗忘的评估边界

删除原始记录 → 更新索引与缓存 → 禁止未来训练再引入 → 评估已训练模型是否仍可复现。前两步主要影响存储与检索;最后一步才涉及参数。模型编辑或遗忘方法可能降低特定提示下的复现,但要测试改写提示、相关事实和非目标能力;没有充分测试不能把“某一句不再输出”视为已删除知识。

遗忘与重训的代价对比:全量重训是遗忘的“黄金标准”,但计算代价和碳排放极高。在碳排放约束日益严格的背景下,强制全量重训来满足删除请求与绿色 AI 目标存在直接冲突。这使得机器遗忘不仅是一个隐私工具,也是可持续 AI 部署的基础设施要求。

#5. 成员推断与数据提取:攻击面与评估

#5.1 三类攻击的目标差异

模型复现训练语料中的罕见字符串,是参数记忆与提取问题;从普通回答推断某个人是否在训练集,是成员推断问题;从已脱敏记录的多个字段重新定位个人,是重识别问题。三者攻击目标、威胁前提与防线不同。单一“PII 检测率”不能覆盖所有风险。

#5.2 成员推断的受控评估

EM-MIA 提出了一种新的成员推断方法,使用期望最大化策略迭代细化前缀有效性和成员分数,不要求标记的非成员示例。为支持受控评估,OLMoMIA 基准允许在系统变化的分布重叠和难度下分析 MIA 鲁棒性。实验表明 EM-MIA 在分布可分性清晰的场景中优于现有基线,但在近相同条件下暴露了当前 MIA 方法的基本限制。

#5.3 数据提取的防御

SCP-Δr 观察到微调引起广泛的概率偏移,但仅保留一小组有影响力的 token 级偏差就足够;剩余的偏移可以在对效用影响最小的情况下被积极平滑。该方法基于近访问自由(NAF)框架,在模型的相对偏好(而非原始概率)上操作,明确平滑低影响 token。相比现有 NAF 方法提供了数量级更好的理论界限,同时对 TDE 攻击提供强经验保护且性能损失最小。

CoSPED 通过一致软提示进行定向数据提取与防御,使用 Rank-One 模型编辑将提取率降低到 1.6%。

评估纪律:可用受控的合成秘密评估提取倾向,避免把真实私密数据反复放进测试提示。成员推断的结果还受训练/非训练样本分布匹配影响;若两组来源本来不同,攻击器可能只是在识别来源差异,而非训练成员身份。

#6. 检索系统的访问控制

RAG 系统的隐私风险来自检索结果越权:索引中包含受限文档,检索返回后模型可能将其内容暴露给无权限用户。访问控制必须在检索之前执行,而非在模型输出端补救。

#6.1 Azure AI Search 的文档级 ACL 实现

Azure AI Search 提供了四种文档级访问控制的实现路径:

安全筛选器:字符串比较方法。应用程序将用户或组标识作为字符串传入,该字符串填充查询的筛选器,排除不匹配的任何文档。此方法未绑定到特定 API,可与任何版本或包配合使用,适用于具有自定义访问模型的系统。

原生 ACL/RBAC 范围(预览):查询令牌背后的 Microsoft Entra 安全主体与搜索结果中返回的文档的权限元数据进行比较,排除权限不匹配的文档。访问控制列表(ACL)适用于 Azure Data Lake Storage Gen2 目录和文件;基于角色的访问控制(RBAC)适用于 ADLS Gen2 内容和 Azure Blob。

Purview 敏感度标签(预览):索引器从支持的数据源提取 Microsoft Purview 中定义的敏感度标签,存储为元数据,在查询时根据 Microsoft Entra 令牌和 Purview 策略分配强制执行用户访问权限。

SharePoint ACL 同步(预览):索引器在初始引入期间直接从 Microsoft 365 ACL 提取 SharePoint 文档权限,访问检查使用 Microsoft Entra 用户和组成员身份。

#6.2 访问控制的设计原则

文档级 ACL 的元数据在索引时写入,在查询时应用。权限信息需要与文档内容一同持久化,而非在运行时动态查询。ACL 的粒度和更新频率需要与数据源的权限模型对齐:过于粗粒度导致越权,过于细粒度导致索引膨胀和查询延迟。

#7. 日志与审计的隐私控制

#7.1 LLM API 调用入口的 PII cloaking

CloakLLM 等工具在 LLM API 调用入口拦截请求,在到达模型提供商之前检测和 cloaking PII,将每个事件记录到防篡改审计链。该设计面向 EU AI Act 第 12 条合规要求,支持对 API 调用的可追溯审计。

admina-framework 提供类似的治理层:在模型看到输入之前剥离 PII,经过防火墙、循环中断器和审计链(SHA-256)的流水线。这种入口拦截模式适用于使用外部 LLM API 的场景,但不覆盖本地部署模型的训练数据管道。

#7.2 审计的合规维度

CROVIA 等框架监测 AI 模型生态系统中训练数据披露实践的持续审计。对 3,143 个完全评估模型的分析显示,57.6% 存在严重披露缺口(合规评分低于 20%),披露要素映射到包括 EU AI Act 在内的 11 个监管辖区。这一数据表明,数据来源和训练数据的披露实践在行业层面仍处于早期阶段。

#8. 演进与边界

显式标识过滤 → 上下文敏感脱敏 → 参数高效 DP 微调 → 机器遗忘 → 输出攻击评测 → 针对性纠错或重训。

  • 训练记忆与一般化不能仅用训练 loss 区分;对罕见字符串可构造受控提取测试,但测试本身不得暴露真实秘密。
  • 安全体系讨论运行期攻击;本页专注数据和训练入口。
  • 数据删除请求的合规路径需要同时覆盖存储层删除、索引更新、缓存失效和模型行为评估,四个层面不可互相替代。

#原始资料

本页由仓库中的 Markdown 生成。具体技术结论请结合正文引用与实验条件理解。

输入关键词,探索整个知识库

↑ ↓ 选择 ↵ 打开36 篇笔记,一次搜索