所属: 横切体系。本页边界: 数据、模型、检索和工具如何形成跨层攻击面,以及编码逆推、嵌入反转与模型提取如何从模型内部表示中恢复敏感信息。
#核心安全关系
攻击面由资产、攻击者可控输入、信任边界和可执行权限共同决定。风险发生概率与影响可以辅助分解问题,但不存在适用于所有大模型系统的统一标量“核心公式”。
#符号说明
| 符号 | 含义 |
|---|---|
| 被模型读取的不可信外部数据 | |
| 攻击者嵌入外部数据的恶意指令 | |
| 攻击链中第 个边界被突破的事件 | |
| 多个必要边界同时失效的攻击成功概率 | |
| 在明确威胁模型下的发生可能性 | |
| 攻击成功后的影响程度 | |
| 文本嵌入向量 | |
| 嵌入反转函数 | |
| 内容重建率 | |
| 原始输入文本 | |
| 重建文本 |
不同防线的错误通常并不独立,因此不能未经验证就把各层失效概率简单相乘。
#技术要点
- 提示注入是信任边界问题,不是单一 prompt 问题。OWASP 2025 年 LLM 应用十大安全风险中,提示注入持续占据第一位,自 2023 年首次发布以来从未改变。
- 嵌入反转攻击证明:向量数据库中的嵌入向量并非安全的匿名表示。攻击效果取决于编码器访问权限、辅助数据、文本长度、领域偏移以及采用精确匹配、token 恢复率还是语义相似度作为指标,不能把单个演示结果外推为生产系统的统一重建率。
- 模型提取攻击可从黑盒查询中学习功能相似的代理模型;在简化结构、可选择实值查询和有限精度等理论条件下,部分研究还能恢复注意力参数。这不等于任意生产级黑盒 LLM 都能被直接、精确地还原参数。
- 编码逆推通过多层嵌套编码(Base64 → Gzip → Hex → URL 编码等)绕过内容审核。RoguePrompt 对 313 个真实被拒提示的平均过滤绕过率达到 93.93%。
- 模型供应链投毒是系统性威胁。HuggingFace 平台上超过 940 个模型文件被攻击者实施投毒。
- 隐私保护覆盖数据采集、训练、日志和检索返回。嵌入反转攻击的 PII 提取率可达 70–90%。
#原理与演进
#攻击从哪里跨过信任边界
| 入口 | 典型问题 | 原理性防线 |
|---|---|---|
| 用户输入 | 越权请求、编码绕过 | 多层解码归一化、语义分析 |
| 检索文档/网页 | 提示注入冒充高优先级指令 | 外部内容只作为数据,不能改变系统规则 |
| 工具返回 | 伪造“下一步必须执行” | 校验来源、结构与授权状态 |
| 嵌入向量 | 从向量反推原始文本 | 对抗训练、嵌入扰动 |
| 权重/依赖/镜像 | 被替换或投毒 | 来源、签名/哈希、版本绑定与隔离 |
- 拒答模型只能影响语言输出;真正的文件读取、API 调用与网络访问必须由工具权限控制。最小权限让错误建议也无法越权执行。
- 对 RAG,检索阶段先做文档 ACL 过滤,再把允许的内容提供给模型;提示中的“请忽略机密”不能代替访问控制。
#发展脉络
最初只过滤危险回答 → 外部文档与工具引入提示注入和越权路径 → 嵌入反转和模型提取从表示层攻击 → 需要把数据、模型、服务、依赖与日志作为同一条信任链分析。
#1. 嵌入反转(Embedding Inversion):从向量还原原文
嵌入向量常被视为文本的匿名化表示,但攻击者可以训练一个“反转模型”,从嵌入向量中重建原始文本。这是“编码逆推”最直接的技术对应。
#1.1 攻击原理与效率
嵌入反转攻击的核心思想是:嵌入向量中蕴含的信息足以被逆向还原为原始文本。攻击者可以使用训练好的反转模型,从嵌入向量 重建出下式所示文本。
攻击效率的演进:
| 方法 | 机制 | 关键结果 |
|---|---|---|
| Vec2Text | 使用 T5 模型迭代修正 | 32 token 序列的精确匹配率 92% |
| ALGEN | 跨模型对齐,少样本反转 | 查询效率显著优于优化方法 |
| Zero2Text | 零训练跨域反转 | 无需访问目标编码器 |
| 条件掩码扩散 | 并行去噪重建 | 78M 小模型恢复 81.3% token |
Zero2Text 实现了零训练的跨域反转攻击,在 MS MARCO 数据集上针对 OpenAI 模型达到 1.8–6.4 的重建效果。ALGEN 是生成式框架,利用跨模型对齐进行少样本反转,提供比优化方法更高效的查询替代方案。条件掩码扩散模型架构仅用 78M 参数的小模型,在推理时无需访问目标编码器,就能在 32 token 序列上恢复 81.3% 的 token,余弦相似度达 0.87。
#1.2 攻击效果取决于威胁模型
嵌入反转的成功率不是向量数据库的固定属性。若攻击者知道或能查询目标编码器、拥有同分布辅助文本,并且待恢复文本较短,重建通常更容易;编码器不可访问、领域偏移、长文本和防御性扰动会提高难度。Zero2Text、通用零样本嵌入反转和条件掩码扩散等工作分别展示了不同访问条件下的攻击能力,结果必须连同数据集、编码器、查询权限与评价指标一起解读。
嵌入反转的隐私影响:PII 提取率可达 70–90%(包括姓名等敏感信息)。医疗场景中,隐藏状态存储了 EHR 笔记或病理文本的丰富模式,在半可信云或调试管道中可被嵌入反转重建。
#1.3 防御方向
训练编码器时使用对抗损失来抑制反转或属性推断,可将隐私泄露降低 30–40%。其他防御包括嵌入扰动、差分隐私嵌入和访问控制。
#2. 模型提取(Model Extraction):从黑盒查询到参数复原
模型提取攻击的目标是窃取模型的功能甚至内部参数。攻击方法包括:基于 API 的知识蒸馏、直接查询、参数恢复和提示窃取。
#2.1 基于查询的攻击
攻击者通过大量黑盒查询,利用输入-输出对来训练功能相似的代理模型。这可以是功能性克隆(复制模型行为),也可以是参数恢复(直接重建权重)。
Logit Leakage Model Clone 攻击:暴露 top-k logits 或 log-probabilities 的 LLM 推理 API 面临模型提取和克隆的风险。攻击者可以执行两阶段攻击来复制专有模型。
#2.2 密码分析式提取
部分理论工作把参数恢复扩展到多头 Softmax 注意力模型,并在可选择查询、简化架构、实值输出或有限精度等明确假设下给出多项式时间学习结果。其意义是说明注意力结构可能暴露可利用的代数信息;其边界是这些查询与观测条件通常强于生产 API,不能据此断言可以从任意商用黑盒 LLM 精确恢复全部参数。
#2.3 防御方向
模型提取的防御包括:API 限流、查询模式检测、输出扰动和模型水印。
#3. 编码逆推与混淆攻击:绕过安全护栏
“编码逆推”在安全绕过场景中的具体体现是将禁止的输入通过编码变换,绕过内容审核后让模型自行解码并执行。
#3.1 RoguePrompt:双层编码与自重构攻击
RoguePrompt 是一种越狱流水线,将禁止的提示确定性地转换为一个“自重构查询”。它将输入文本分割为偶数和奇数位置流,应用双层嵌套编码——维吉尼亚密码后接 ROT13——并附带自然语言重构指令。未编码的包装指令要求目标模型反转变换并在单次响应中对恢复的请求执行操作。
在 313 个真实世界硬拒绝提示上的评估结果:
| 指标 | 结果 |
|---|---|
| 过滤绕过率 | 93.93% |
| 重构率 | 80.2% |
| 完整执行率 | 71.5% |
RoguePrompt 在黑盒威胁模型下开发和评估,仅具有对托管模型的 API/UI 访问权限。这些编码层服务于不同的表示角色,不依赖于目标 LLM 的专有 tokenizer。
#3.2 多种编码与混淆技术
大模型安全绕过中使用的编码和混淆技术包括:
- Unicode 混淆:同形字符替换、零宽字符、规范化绕过。
- 多层编码链:例如 Base64 → Gzip → Hex → URL 编码等嵌套。
- 逆向缩放提示:故意使用极小/极大字体、反向文本、旋转字符等视觉-语义混淆。
- Base64 编码驱动的绕过:Base64 凭借其“混淆性强、兼容性广、解码门槛低”的特性,成为攻击者绕过检测机制的“隐形利刃”。
#3.3 任务嵌入提示(TIP)攻击
TIP 攻击将序列到序列任务(如密码解码、谜语、代码执行)嵌入模型提示中,间接生成禁止的输入。攻击者可能利用 LLM 本身来分析和绕过检测规则——构造特定问题,引导模型描述自己的安全规则,然后利用这些信息设计绕过方案。
#3.4 防御方向
编码逆推攻击的防御需要多层解码归一化:在内容审核前对输入进行多次解码尝试,检测编码后的恶意载荷。语义分析应超越表面字符串匹配,理解解码后的实际意图。系统提示应明确禁止“解码并执行”类请求。
#4. 供应链攻击
#4.1 模型权重投毒
训练数据可被投毒;第三方权重可被替换或夹带异常行为;tokenizer/模板变更会改变输入协议;插件/工具代码可能扩大权限;检索索引也可含攻击内容。
TransTroj 是一种新型后门攻击,使嵌入在预训练模型中的后门能在模型供应链中高效转移。采用不可信的 PTM 引入显著安全风险,攻击者可以通过在 PTM 中嵌入隐藏的恶意行为(后门)来毒化模型供应链。
#4.2 HuggingFace 的投毒现状
HuggingFace 已成为恶意模型投放的主要平台,超过 940 个模型文件被攻击者实施投毒。2025 年开源供应链投毒总量相比 2024 年显著提升 58%,其中 NPM 公共仓库的代码投毒占比超过 92%。
大型语言模型面临三大安全威胁:恶意代码植入(反序列化加载模型时隐藏指令同步执行,形成典型供应链攻击)、数据投毒(在训练数据中植入特定触发器)、适配器攻击。
#4.3 防御方向
对每一制品保存来源、版本、哈希与依赖关系,才能在异常输出后定位是哪一环变化。Signed-Only Execution 方案要求第三方预训练模型必须经过签名验证才能执行。safetensors 等新格式试图缓解反序列化风险。
#5. 提示注入与间接注入
#5.1 直接注入与间接注入
直接注入:攻击者在用户输入中植入精心构造的指令,覆盖或操控 LLM 原始系统指令。间接注入:当 LLM 接受外部来源输入(如网站、文件)时,内容在用户不知情的情况下改变模型行为。微软报告称间接提示注入是最广泛使用的 AI 攻击技术。
CVE-2025-32711(EchoLeak)于 2025 年 6 月披露,演示了零点击数据泄露攻击。
#5.2 防御方向
单靠“忽略以上指令”不能建立强隔离;若外部文档与系统规则在同一自然语言上下文里竞争,模型可能被说服。更强的控制是缩小外部文本可影响的动作集合、对工具参数做程序验证,并对高影响写操作设置授权确认。
#6. 隐私与安全的交界
训练语料中的个人信息处理见隐私数据页。本页强调运行时:检索 ACL、日志保留、工具参数、外部文档注入。隐私训练如 DP-SGD 可限制单样本对权重的影响,却不会自动让一个有权限读取数据库的 Agent 不泄露数据库内容。
嵌入反转攻击跨越了隐私与安全的边界:攻击者从向量数据库中恢复敏感文本,这既是隐私泄露也是安全边界突破。防御需要同时考虑数据层的脱敏、表示层的对抗训练和服务层的访问控制。
#7. 防线为什么需要纵深
以“恶意网页让 Agent 发送私有文件”为例,链路需要同时跨越:网页文本被当成指令 → Agent 决定调用文件工具 → 文件权限允许读取 → 外发工具允许发送。只依赖第一步“模型识别恶意文字”非常脆弱;若文件工具无权读取或外发工具仅允许用户明确批准的目标,后续边界可以截断攻击。
这可表示为下式所示的事件交集。不能简单假设各层独立并相乘,但独立的控制机制能减少单点失效。防线之间若共享同一模型判断,错误高度相关,纵深效果会缩水。
#8. 安全评测的对照条件
测试提示注入需明确攻击者控制的范围:仅用户输入、检索片段、网页、工具返回,还是模型权重;还需明确目标是泄露、错误操作、拒答绕过或答案污染。若把正常用户授权的操作也算作“攻击成功”,指标失真。
嵌入反转的评测需要报告:重建率(精确匹配、语义相似度)、PII 提取率、攻击成本(查询次数、训练数据需求)、防御方法下的性能退化。
每次测试记录工具权限、索引版本、模型版本和任务是否原本可完成;安全性与可用性应一并报告。
原始资料:
- Zero2Text: Zero-Training Cross-Domain Inversion Attacks on Textual Embeddings
- Embedding Inversion via Conditional Masked Diffusion Language Models
- Universal Zero-shot Embedding Inversion
- Provably Learning Multi-Head Attention with Queries
- A Survey on Model Extraction Attacks and Defenses for Large Language Models
- RoguePrompt: Dual-Layer Encoding for Self-Reconstruction to Circumvent LLM Moderation
- The TIP of the Iceberg: Task-in-Prompt Adversarial Attacks
- TransTroj: Model Supply Chain Poisoning
- Signed-Only Execution for Third-Party Pre-Trained Models
- Prompt Injection Attacks in Large Language Models and AI Agent Systems: A Comprehensive Review
- OWASP Top 10 for LLM Applications 2025
- LLM08: Vector and Embedding Weaknesses
- A survey on privacy risks and protection in large language models
- 间接提示注入研究
- OWASP 提示注入防护指南
关联概念: