所属: 模型增强层。本页边界: 不改权重时,怎样设计、结构化和管理 AI Agent 做出决策的整个信息环境。
#核心机制
这不是训练目标,而是条件分布的变化:模型参数保持不变,通过结构化上下文 改变当前请求的生成条件。2026 年的关键变化在于, 不再是“更长的提示词”,而是一个包含指令、技能、记忆、工具结果和外部证据的分层信息环境。
#符号说明
| 符号 | 含义 |
|---|---|
| 固定不更新的模型参数 | |
| 当前用户问题或任务输入 | |
| 模型生成的回答 | |
| 结构化上下文:规则、技能、记忆、工具结果的统一集合 | |
| 系统规则、技能描述、持久记忆、工具结果 | |
| 原始条件下的回答分布 | |
| 结构化上下文后的回答分布 | |
| 上下文相关性评分 | |
| 当前上下文预算(token 数) |
Prompt 改变的是当前条件概率,不会把 永久写入参数 。上下文工程进一步要求:进入 的每一条信息都应有明确的来源、可信级别和过期策略。
#技术要点
- GPT-6 Astra(2026 年 9 月)的官方指南标志着一个范式反转:从“加提示”转向“减提示” 。OpenAI 工程师的第一条建议是“删掉你的提示词”。
- 技能描述应尽可能短,同时清晰说明“什么情况下使用”。过长的描述和过多的技能会导致 Codex 自动缩短描述,模型反而看不到关键信息。
- 渐进式披露(Progressive Disclosure) :技能的根文档应是极简的“路由器”,指向支持性文档和脚本;模型仅在需要时阅读详细内容。
- AGENTS.md 需要频繁审视:每条指令都应追问“现在还需要吗”。要求每次编辑前读取整套文档或完整仓库地图,对修一个拼写错误来说是过度的。
- 上下文工程已从 Prompt 工程的“进阶版”上升为独立学科。其核心问题不是“怎样写更好的提示”,而是“怎样设计 Agent 决策的整个信息环境”。
- 生产级上下文的质量准则包括五项:相关性、充分性、隔离性、经济性和来源可追溯性。
- 上下文被定位为 Agent 的操作系统,而非一次性输入。
- ACE 框架将上下文视为持续演化的“操作手册” ,通过生成、反思、策展的模块化流程不断积累和精炼策略,而非一次性编写。
#原理与演进
#范式反转:从“加提示”到“减提示”
2023–2025 年的 Prompt 工程默认假设是:模型能力有限,需要大量手把手指导。因此最佳实践是“写得更详细、给更多示例、把所有边界情况都列出来”。
GPT-6 Astra 的官方指南明确推翻了这一假设。OpenAI 的 Codex 开发者体验负责人 Eric Provencher 指出:随着模型能力增强,过去需要大量手把手指导才能完成的任务,现在已经不需要了。具体表现包括:
- 要求模型在每次编辑前读取文件的指令,被明确标记为“烧上下文并拖慢工作”。
- 过去需要鼓励模型运行测试和检查工作,现在 Astra 会自行完成。
- 过于具体的指导(“精心编排的行程表或食谱式的技能”)反而会阻碍结果,模型对细微差别和模糊性的理解能力已经显著提升。
这一反转的底层逻辑是:当模型的基础能力达到一定阈值后,上下文中的冗余指令不再是“安全保障”,而是注意力干扰。每一条不必要的指令都在与真正重要的信息竞争有限的注意力预算。
#从 Prompt 工程到上下文工程的学科跃迁
2025–2026 年的文献表明,Prompt 工程(PE)和上下文工程(CE)的关系已经明确为不同层级,而非同一层级的不同方法。
Prompt 工程关注单个查询的措辞,适用于任务能在一个请求-响应周期内完成的情形。上下文工程关注Agent 做出决策的整个信息环境的设计、结构化和管理,适用于 Agent 规划二十步工作流、委托子任务并在真实世界中执行动作的场景。
LangChain 在 2025 年初发布了上下文工程的项目性定义;Anthropic 将其纳入开发者文档;Google 的 Agent Development Kit 在平台层面操作化了上下文管道。学术工作紧随其后:ACE 框架将上下文形式化为演化中的操作手册。
#上下文质量五准则
生产级上下文的质量由五个维度共同定义:
| 准则 | 含义 | 违反时的典型症状 |
|---|---|---|
| 相关性 | 上下文中的每条信息都与当前决策有关 | 模型被无关文档分散注意力 |
| 充分性 | 关键决策所需的信息已经齐备 | 模型因缺少关键事实而猜测 |
| 隔离性 | 不同来源、不同可信级别的信息边界清晰 | 外部文本冒充高权限指令 |
| 经济性 | 上下文中没有冗余信息 | 注意力预算被重复内容消耗 |
| 来源可追溯性 | 每条信息可追溯到其来源和版本 | 无法定位错误信息的引入点 |
这五项不是独立的检查清单,而是相互约束的约束系统。提高充分性可能牺牲经济性;强化隔离性可能降低相关性(过度分区使信息碎片化)。上下文工程的核心工作是在这些约束之间做出显式取舍。
#技能设计的渐进式披露
Astra 指南中关于技能设计的原则具有跨模型的方法论意义。
技能描述应短到不能再短,同时清晰说明“什么时候用”。 一个典型的反例是将技能描述写成“处理任何与数据库相关的事情”——这会导致模型在每次触及数据库相关内容时都加载该技能,而非仅在真正需要执行迁移时加载。正确的描述应精确限定触发条件。
渐进式披露是技能设计的核心模式。 读取一个技能会消耗上下文,使模型更接近压缩阈值,并引入可能不适用于当前任务的指导。对于包含多个工作流的技能,根文档应是一个极简的路由器,指向支持性文档和脚本。模型获得足够的指引来知道“去哪里找”,而不被迫阅读当下无关的内容。
技能应服务于多种模型。 仓库中的技能也会指导其他贡献者的 Agent,这些 Agent 可能使用不同的模型。对 Sol 或 Luna 有帮助的指导,可能对 GPT-6 Astra 构成过度约束。
#AGENTS.md 的持续维护
AGENTS.md 在模型于仓库中工作时始终生效,因此每条指令都应频繁审视。“现在还需要吗”是比“这条指令正确吗”更重要的追问。
典型的过度约束模式包括:要求每次编辑前读取整套文档;要求先生成完整仓库地图再开始工作;将“好的实践”写成强制性步骤。这些指令在模型能力较弱的时期可能是必要的护栏,在 Astra 时代则成为上下文税。
#ACE 框架:上下文作为演化中的操作手册
Agentic Context Engineering(ACE)框架将上下文从“一次性编写的静态提示”转变为“持续演化的操作手册”。其核心机制是生成-反思-策展的分工:
- Generator 基于当前上下文和任务输入生成候选策略或答案。
- Reflector 评估生成结果的质量和适用性,识别哪些策略有效、哪些失败。
- Curator 将有效的策略以增量 delta 的形式更新到操作手册中,积累和精炼策略,而非覆盖或重写。
这一框架同时适用于离线场景(如系统提示优化)和在线场景(如测试时的记忆适配)。ACE 的意义在于将上下文工程从“一次性写作”转变为持续学习系统——上下文不是被“写”出来的,而是被“演化”出来的。
#上下文作为 Agent 的操作系统
“上下文是 Agent 的操作系统”这一框架的深层含义是:就像操作系统管理进程、内存和 I/O 一样,上下文工程管理 Agent 的注意力预算、信息生命周期和可信边界。
操作系统类比的具体对应:
| 操作系统概念 | 上下文工程对应 |
|---|---|
| 进程调度 | 决定哪些信息在什么时机进入上下文 |
| 内存管理 | 上下文预算的分配与压缩 |
| 文件权限 | 不同来源信息的可信级别与访问控制 |
| 设备驱动 | 工具结果的格式化与注入 |
| 日志与审计 | 上下文的来源追踪与版本记录 |
#更高层级:意图工程与规范工程
上下文工程本身也在被更高层级的学科所包含。Vishnyakova(2026)提出四层金字塔成熟度模型:
- Prompt 工程:单个查询的措辞。
- 上下文工程:Agent 决策的信息环境。
- 意图工程(Intent Engineering) :将组织目标、价值观和权衡层级编码进 Agent 基础设施,确保“上下文良好的 Agent 追求正确的结果”。
- 规范工程(Specification Engineering) :创建机器可读的企业政策、质量标准、组织协议和指令语料,使多 Agent 系统能够大规模自主且一致地运行。
每一层包含前一层作为必要基础,而非替代它。这一金字塔结构在 2026 年初被多位独立作者趋同地提出,说明它反映了领域的实际构成。
#上下文工程的实证效果
BARC 对 285 个组织的研究发现,拥有成熟上下文工程项目的组织成为 AI 领导者的可能性是同行的四倍。DataHub 的 2026 年上下文管理报告将上下文定位为 AI 成功的关键要素。
#何时该离开上下文层
| 问题 | 上下文工程的边界 | 更合适的技术 |
|---|---|---|
| 更新知识/需引用 | 上下文中的证据来自检索,检索质量决定上限 | RAG |
| 输出必须机器可解析 | 自然语言约束概率性 | 结构化解码 |
| 模型普遍不遵守专业格式 | 每次上下文组织成本高且不稳定 | SFT |
| 需要外部计算/执行 | 上下文无法替代工具权限 | 工具与 Agent |
#原始资料
- Rethinking skills and prompts for GPT-6 Astra
- Context Engineering: From Prompts to Corporate Multi-Agent Architecture
- A comprehensive survey of prompt engineering and context engineering techniques in large language models
- Agentic Context Engineering: Evolving Contexts for Self-Improving Language Models
- Constitutional Context Engineering: Why Structured Prompts Are Programs, Not Hints
- Awesome Context Engineering
- BARC Study: Context Engineering Leaders Lead in AI