所属: 数据治理层。本页边界: 数据进入训练或检索前怎样降低个人、机密和受限信息风险。
#核心公式
该定义给随机机制 一个可量化的差分隐私保证;“把检测出的字段替换掉”只是数据变换,不能单独充当隐私保证。
#符号说明
| 符号 | 含义 | 单位/条件 |
|---|---|---|
| 只相差一个受保护单位的相邻数据集 | 邻接关系须明确到文档/会话/用户 | |
| 包含随机性的训练或发布机制 | 随机映射 | |
| 机制输出空间中的任意可测事件 | 事件集合 | |
| 隐私损失参数;通常越小保证越强 | 无量纲 | |
| 允许保证失效的极小概率项 | ||
| 后文中的敏感跨度检测器、跨度集合与替换变换 | 函数、集合、函数 | |
| DP-SGD 中逐样本梯度、裁剪阈值、噪声倍率 | 依梯度尺度 | |
| DP-SGD 的批大小 | 样本数 |
#技术要点
- 识别 PII、密钥、商业机密和受版权限制内容。PII 检测器分为规则型(Presidio)、零样本 NER 型(GLiNER)和专用 PII 模型(OpenAI Privacy Filter)。
- 脱敏、最小化采集和访问控制服务于不同风险。RAG 场景的访问控制需要在检索之前执行文档级 ACL 过滤,Azure AI Search 提供了安全筛选器、原生 ACL/RBAC 范围、Purview 敏感度标签和 SharePoint ACL 同步四种实现路径。
- 训练数据删除不保证模型立刻遗忘已学信息。机器遗忘方法包括表示层扰动(ALMPU)、强化学习框架(GRPO-based)和 LoRA 参数隔离(ALTER)。
- 检索系统还需控制文档级权限。日志与审计层面,CloakLLM 和 admina-framework 等工具在 LLM API 调用入口执行 PII cloaking 和防篡改审计链。
- 差分隐私训练在参数高效场景下可通过仅对 LoRA 适配器施加 DP-SGD 来降低计算代价,MedDP 在医疗 QA 上展示了可审计的隐私-效用权衡。
- 成员推断攻击的评估需要控制分布重叠和难度,EM-MIA 和 OLMoMIA 基准提供了受控评估框架。
#原理与演进
#四种不同机制
| 机制 | 处理位置 | 作用与局限 |
|---|---|---|
| 数据最小化 | 采集前 | 不收集无关敏感字段;后续无需补救 |
| 脱敏 | 训练/索引前 | 替换识别到的标识符;会有误报与漏报 |
| 权限控制 | 存储、检索与工具 | 限制谁能看哪份文档;不能由模型自行决定 |
| 隐私训练 | 参数更新时 | 降低单条样本泄露风险;通常有质量与计算代价 |
- 公式中的 PII 检测是变换,不代表已解决所有隐私问题。
- 某些非姓名字段组合也可重新识别个人;只遮盖显式姓名并不充分。
- 删除数据源不等于已训练权重自动删除对应记忆。继续训练、模型编辑与重训的效果边界不同,应通过专门测试判断。
#训练与检索的差异
训练泄露风险来自参数记忆与输出复现;RAG风险来自检索结果越权。前者关注训练样本,后者必须在检索前就执行文档级访问控制。
#1. 威胁模型:敏感信息的暴露位置
| 位置 | 敏感信息如何暴露 | 主要防线 |
|---|---|---|
| 采集与原始存储 | 不必要字段被收集、原始文件被越权读取 | 最小化采集、分级权限 |
| 训练语料 | 标识符、密钥进入训练 | 过滤、脱敏、许可与来源审核 |
| 模型参数 | 罕见片段被记忆并被诱导复现 | 训练控制、攻击测试、必要时重训 |
| 检索索引 | 索引含有受限文档 | 文档级 ACL,在检索之前过滤 |
| 提示与日志 | 用户输入/工具结果被记录 | 保留期限、访问审计、字段屏蔽 |
因此“脱敏”不是单一开关:对训练语料做替换,不能代替检索鉴权;对检索做鉴权,也不能撤销已进入权重的内容。
#2. PII 检测的技术选型与实测对比
#2.1 三类检测器
规则型(Microsoft Presidio) :基于 spaCy NER 和正则表达式,开箱即支持人名、地点、日期等标准 PII 类型。CPU 可运行,推理延迟最低。局限在于零样本模式下的召回率有限,对文化可变实体(如不同国家的人名格式)识别较弱。
零样本 NER 型(GLiNER) :基于双向 Transformer 的通用命名实体识别模型,支持开放词汇的实体类型提示。在 MultiCoNER 等多语言 NER 基准上表现领先,但在非拉丁文字系统上性能显著下降。
专用 PII 模型(OpenAI Privacy Filter, OPF) :1.5B 参数的 MoE 模型配合 Viterbi CRF 解码,固定 33 类 PII schema。在结构化合成 PII 上达到最高 F1,但在 PII 嵌入叙事散文而非离散字段时性能急剧退化。
#2.2 实测性能对比
在 AI4Privacy(合成 PII)数据集上的零样本 F1 分数:
| 检测器 | AI4Privacy F1 | Kiji F1 | CoNLL-2003 F1 | MultiCoNER F1 |
|---|---|---|---|---|
| OPF | 0.855 | 0.596 | 0.569 | 0.397 |
| GLiNER | 0.577 | 0.349 | 0.428 | 0.754 |
| Presidio | — | — | 0.479 | 0.546 |
OPF 在标准 PII 类别上零样本表现最强;GLiNER 在开放实体分类和多样化 NER 类型上更具泛化性。选择取决于实体分类体系是固定的 PII schema 还是开放的领域特定类型。
#2.3 检测的边界
设检测器 产出跨度集合 ,变换 将跨度替换为占位符,如式(1)所示。若检测召回率满足式(2),必有漏保留风险;若误报率高,则有无谓语义损失。
式(1):
式(2):
| 脱敏方法 | 保留的关系 | 典型代价 |
|---|---|---|
| 删除整条样本 | 几乎不保留 | 有效训练数据减少 |
类型占位符(如 [人名]) |
保留句法和实体类型 | 具体实体关系丢失 |
| 一致伪名 | 同一实体跨文档关系 | 映射表本身成为高价值敏感资产 |
| 局部遮盖 | 部分格式信息 | 残留位数和上下文可能重识别 |
在电力、医疗、金融等领域,设备编号、时间、位置和事件组合可能比姓名更具识别性。保护对象应从“固定正则”扩展为“字段组合与上下文推断”。
#3. 差分隐私训练:从 DP-SGD 到参数高效实现
#3.1 DP-SGD 的标准流程
页首公式给出差分隐私对随机训练机制 的邻接数据集保证。单位可能是文档、会话或用户,定义错了就无法宣称“用户级”保护。
DP-SGD 的概念步骤:逐样本梯度 → 按式(1)裁剪 → 按式(2)对聚合梯度加噪声 → 更新参数。裁剪限制单样本影响;噪声掩盖其贡献。噪声、批次、采样率、训练步数共同决定隐私预算和精度损失。
式(1):
式(2):
#3.2 参数高效 DP 微调
全量 DP-SGD 在大模型上的计算与质量代价极高。参数高效方法将 DP-SGD 仅施加于低秩适配器参数,冻结基座模型:
MedDP 在医疗 QA 场景中仅对 LoRA 适配器参数应用 DP-SGD,使用逐样本梯度裁剪和校准高斯噪声。引入自适应裁剪(AC),通过基于分位数的规则和动量在线更新裁剪边界。提出预算感知(BA)检查点选择,在目标预算 约束下选择训练轨迹上的最优检查点,无需重新训练。隐私评估采用 canary 审计套件,强调 canary 负对数似然(NLL)比命中率更敏感地反映记忆信号。
ADP-LoRA 结合 LoRA 与自适应逐层噪声缩放、噪声感知剪枝和带回滚的反馈控制器。使用 Wasserstein 距离和 Kolmogorov–Smirnov 统计量持续审计梯度分布,判别器网络估计残余泄露风险。控制机制实时调整隐私噪声倍率,当验证损失恶化超过阈值时回滚降低噪声。在 BERT 文本分类上,满足下式时达到 77.9% 准确率,将 DP 与非 DP 模型之间典型的 15% 准确率差距缩小了超过 7 个百分点。
#3.3 DP 训练的边界
这不是“绝不泄露”的保证,也不自动保护推理时用户输入或检索库。大模型全量 DP 训练的计算与质量代价可能很高,应先确认威胁模型。
#4. 机器遗忘:从参数编辑到强化学习
#4.1 问题定义
模型遗忘(Machine Unlearning, MU)旨在训练完成后按需移除特定样本或子集的影响,使模型表现得如同从未在训练中遇到目标数据,同时保持对保留集和通用知识的性能。这一能力与 GDPR 第 17 条“被遗忘权”直接相关,欧盟 AI 法案和 CCPA 等法规正在推动其成为合规要求。
#4.2 主要技术路线
表示层扰动(ALMPU) :在注意力头上施加缩放因子,选择最敏感的注意力头作为知识引导。在敏感位置将增强的记忆扰动集成到标准表示层遗忘过程中,迫使模型消除目标知识。通过在选定注意力头上添加干预并显式优化以抵抗微调攻击,ALMPU 创建了受控的与原模型的偏离,固有地抵抗重新学习尝试。在 WMDP 基准上,ALMPU 在不同规模的微调攻击下持续优于基线方法。
强化学习框架:使用 Group Relative Policy Optimization(GRPO)有效遗忘敏感内容。两阶段方法:先用精选合成数据冷启动微调初始化模型,再引入精心设计的奖励函数——结合轻量模型和启发式规则——引导遗忘过程。在 TOFU 数据集上,该方法相比先前遗忘方法实现了 47% 的模型效用提升和 0.023 的遗忘集 ROUGE,同时保留集性能不下降并缓解幻觉。
LoRA 参数隔离(ALTER) :非对称 LoRA 架构,通过参数隔离在目标子域内遗忘 token。高熵 token 通过共享的 A 矩阵捕获和学习,随后在目标子域内实现指定的遗忘目标。
#4.3 遗忘的评估边界
删除原始记录 → 更新索引与缓存 → 禁止未来训练再引入 → 评估已训练模型是否仍可复现。前两步主要影响存储与检索;最后一步才涉及参数。模型编辑或遗忘方法可能降低特定提示下的复现,但要测试改写提示、相关事实和非目标能力;没有充分测试不能把“某一句不再输出”视为已删除知识。
遗忘与重训的代价对比:全量重训是遗忘的“黄金标准”,但计算代价和碳排放极高。在碳排放约束日益严格的背景下,强制全量重训来满足删除请求与绿色 AI 目标存在直接冲突。这使得机器遗忘不仅是一个隐私工具,也是可持续 AI 部署的基础设施要求。
#5. 成员推断与数据提取:攻击面与评估
#5.1 三类攻击的目标差异
模型复现训练语料中的罕见字符串,是参数记忆与提取问题;从普通回答推断某个人是否在训练集,是成员推断问题;从已脱敏记录的多个字段重新定位个人,是重识别问题。三者攻击目标、威胁前提与防线不同。单一“PII 检测率”不能覆盖所有风险。
#5.2 成员推断的受控评估
EM-MIA 提出了一种新的成员推断方法,使用期望最大化策略迭代细化前缀有效性和成员分数,不要求标记的非成员示例。为支持受控评估,OLMoMIA 基准允许在系统变化的分布重叠和难度下分析 MIA 鲁棒性。实验表明 EM-MIA 在分布可分性清晰的场景中优于现有基线,但在近相同条件下暴露了当前 MIA 方法的基本限制。
#5.3 数据提取的防御
SCP-Δr 观察到微调引起广泛的概率偏移,但仅保留一小组有影响力的 token 级偏差就足够;剩余的偏移可以在对效用影响最小的情况下被积极平滑。该方法基于近访问自由(NAF)框架,在模型的相对偏好(而非原始概率)上操作,明确平滑低影响 token。相比现有 NAF 方法提供了数量级更好的理论界限,同时对 TDE 攻击提供强经验保护且性能损失最小。
CoSPED 通过一致软提示进行定向数据提取与防御,使用 Rank-One 模型编辑将提取率降低到 1.6%。
评估纪律:可用受控的合成秘密评估提取倾向,避免把真实私密数据反复放进测试提示。成员推断的结果还受训练/非训练样本分布匹配影响;若两组来源本来不同,攻击器可能只是在识别来源差异,而非训练成员身份。
#6. 检索系统的访问控制
RAG 系统的隐私风险来自检索结果越权:索引中包含受限文档,检索返回后模型可能将其内容暴露给无权限用户。访问控制必须在检索之前执行,而非在模型输出端补救。
#6.1 Azure AI Search 的文档级 ACL 实现
Azure AI Search 提供了四种文档级访问控制的实现路径:
安全筛选器:字符串比较方法。应用程序将用户或组标识作为字符串传入,该字符串填充查询的筛选器,排除不匹配的任何文档。此方法未绑定到特定 API,可与任何版本或包配合使用,适用于具有自定义访问模型的系统。
原生 ACL/RBAC 范围(预览):查询令牌背后的 Microsoft Entra 安全主体与搜索结果中返回的文档的权限元数据进行比较,排除权限不匹配的文档。访问控制列表(ACL)适用于 Azure Data Lake Storage Gen2 目录和文件;基于角色的访问控制(RBAC)适用于 ADLS Gen2 内容和 Azure Blob。
Purview 敏感度标签(预览):索引器从支持的数据源提取 Microsoft Purview 中定义的敏感度标签,存储为元数据,在查询时根据 Microsoft Entra 令牌和 Purview 策略分配强制执行用户访问权限。
SharePoint ACL 同步(预览):索引器在初始引入期间直接从 Microsoft 365 ACL 提取 SharePoint 文档权限,访问检查使用 Microsoft Entra 用户和组成员身份。
#6.2 访问控制的设计原则
文档级 ACL 的元数据在索引时写入,在查询时应用。权限信息需要与文档内容一同持久化,而非在运行时动态查询。ACL 的粒度和更新频率需要与数据源的权限模型对齐:过于粗粒度导致越权,过于细粒度导致索引膨胀和查询延迟。
#7. 日志与审计的隐私控制
#7.1 LLM API 调用入口的 PII cloaking
CloakLLM 等工具在 LLM API 调用入口拦截请求,在到达模型提供商之前检测和 cloaking PII,将每个事件记录到防篡改审计链。该设计面向 EU AI Act 第 12 条合规要求,支持对 API 调用的可追溯审计。
admina-framework 提供类似的治理层:在模型看到输入之前剥离 PII,经过防火墙、循环中断器和审计链(SHA-256)的流水线。这种入口拦截模式适用于使用外部 LLM API 的场景,但不覆盖本地部署模型的训练数据管道。
#7.2 审计的合规维度
CROVIA 等框架监测 AI 模型生态系统中训练数据披露实践的持续审计。对 3,143 个完全评估模型的分析显示,57.6% 存在严重披露缺口(合规评分低于 20%),披露要素映射到包括 EU AI Act 在内的 11 个监管辖区。这一数据表明,数据来源和训练数据的披露实践在行业层面仍处于早期阶段。
#8. 演进与边界
显式标识过滤 → 上下文敏感脱敏 → 参数高效 DP 微调 → 机器遗忘 → 输出攻击评测 → 针对性纠错或重训。
- 训练记忆与一般化不能仅用训练 loss 区分;对罕见字符串可构造受控提取测试,但测试本身不得暴露真实秘密。
- 安全体系讨论运行期攻击;本页专注数据和训练入口。
- 数据删除请求的合规路径需要同时覆盖存储层删除、索引更新、缓存失效和模型行为评估,四个层面不可互相替代。
#原始资料
- DP-SGD 论文
- MedDP: Efficient Privacy-Budgeted Large Language Model for Sensitive Healthcare
- ADP-LoRA: Privacy-Preserving Low-Rank Fine-Tuning with Adaptive Differential Privacy
- ALMPU: A Robust Unlearning Method with Adaptive Knowledge Guidance and Memory Preservation
- Learn to Unlearn in Large Language Models
- EM-MIA: Detecting Training Data of LLMs via Expectation Maximization
- SCP-Δr: Provably Protecting Fine-Tuned LLMs from Training Data Extraction
- Azure AI Search 文档级访问控制
- OpenAI Privacy Filter Evaluation