2025 Context Engineering 兴起:RAG + 信息筛选 + 注意力管理
本条目是「认知升级:四层模型」的第 2 部分,对应学习清单条目 1.1.2。
前置依赖:Prompt Engineering 为以下铺垫:Harness Engineering、Loop Engineering
一、核心观点
Context Engineering 研究「模型在推理那一刻能看到的所有 token」——料不对,问得再好也白搭。
2.1 定义
Context(上下文)指从 LLM 中采样时所包含的整个 token 集合,不只是你写的 Prompt,还包括:
- System Prompt、检索结果、对话历史
- 工具描述、Agent 状态、外部知识与 MCP 数据
Context Engineering 即筛选与维护这组 token、以持续产生期望行为的策略集合。
2.2 出处时间线
| 时间 | 事件 | 来源 |
|---|---|---|
| 2025-06 | Shopify CEO Tobi Lütke 在 X 提出「核心技能是 Context Engineering 而非 Prompt Engineering」 | X / Tobi Lütke |
| 2025 年中 | Andrej Karpathy 给出经典定义:「一门微妙的艺术与科学,旨在为下一步推理填入恰到好处的信息」 | Karpathy |
| 2025-09-29 | Anthropic 正式发文《Effective context engineering for AI agents》系统化该学科 | Anthropic Applied AI 团队 |
Anthropic 将 Context Engineering 视为 Prompt Engineering 的自然演进,而非替代。
3.1 RAG(Retrieval-Augmented Generation)
用户查询 → 检索相关文档 → 注入上下文 → LLM 生成回答- 向量数据库:ChromaDB、Pinecone、Weaviate
- 嵌入模型:OpenAI Ada、BGE、E5
- 检索策略:相似度搜索、混合检索、重排序(Rerank)
3.2 注意力管理(Anthropic 实证要点)
| 现象 | 含义 | 工程对策 |
|---|---|---|
| Lost in the Middle | 长上下文中间信息遵循率仅 ~60%(Liu et al., 2023) | 关键规则放首尾 |
| Recency / Primacy Bias | 开头与末尾权重更高 | hard gate 放末尾 |
| Attention Budget | 每 token 注意力有限,超阈值开始忽略 | 控制总量、渐进式加载 |
3.3 Anthropic 推荐的长期策略
- Compaction(压缩):接近窗口上限时总结历史,最简单的形式是清除早期原始工具调用结果
- Structured note-taking(结构化笔记 / Agentic Memory):Agent 将进度写进上下文之外的
NOTES.md等文件,按需读回——如 Claude Code 的 to-do、Claude 玩 Pokémon 跨数千步保持 tally - Sub-agent 架构:子 Agent 在独立上下文窗口深挖,只回传 1k–2k token 的精炼摘要(Anthropic 多 Agent 研究系统实证优于单 Agent)
- Just-in-time 上下文:运行时用工具按需拉取,而非预加载全部(渐进式披露)
四、与 Prompt Engineering 的对比
| 维度 | Prompt Engineering | Context Engineering |
|---|---|---|
| 关注点 | 怎么问 | 模型看到什么 |
| 优化目标 | 单次调用措辞 | 整个推理过程的信息 |
| 核心技术 | Few-shot、CoT、格式 | RAG、窗口管理、注意力管理 |
| 局限 | 只管输入 | 需更多工程基础设施 |
五、局限与下一步
Context Engineering 解决了「模型看到什么」,但没解决:
- Agent 在什么环境运行(引出 Harness Engineering)
- 工具如何调用、错误如何处理、循环如何设计(引出 Loop Engineering)
六、最新研究与企业数据(2024–2026)
- Context Rot 被量化:Transformer 架构下「上下文规模」与「注意力集中度」天然矛盾,token 越多召回越差(Anthropic,2025-09;Liu et al. Lost in the Middle, 2023)。
- 渐进式披露成为主流实践:Anthropic、LangChain 均将「按需加载」列为 Agent 可靠性第一原则。
- 基准进步间接印证:Stanford HAI(2026-04)报告 OSWorld 计算机任务 Agent 成功率从 2024 年 ~12% 升至 66.3%(接近人类 ~72%)——长上下文管理与工具调用可靠性的提升是关键贡献之一。
七、学习资源
- 官方/权威
- Anthropic《Effective context engineering for AI agents》(2025-09)
- Lost in the Middle: How Language Models Use Long Contexts(Liu et al., 2023)
- 实践指南
- LangChain RAG Tutorial;Anthropic Memory & Context Management Cookbook
- 进阶阅读
- 2026 初 Harness Engineering——Context 策展好了,Agent 还需要「工作台」
下一篇:2026 初 Harness Engineering——Context 策展好了,但 Agent 还需要「工作台」才能干活。
参考来源(一手链接 · 可溯源深挖)
- Tobi Lütke (2025-06) 提出「context engineering」一词(X / @tobi,原始帖待核实)
- Karpathy (2025-06-25) 转发背书 context engineering(X / @karpathy,原始帖待核实)
- Anthropic (2025-09-29)《Effective context engineering for AI agents》:anthropic.com/engineering/effective-context-engineering-for-ai-agents
- Liu et al. (2023) Lost in the Middle:arXiv:2307.03172
- Anthropic 多 Agent 研究系统实证:anthropic.com/engineering/built-multi-agent-research-system
- Stanford HAI (2026-04) AI Index:OSWorld 成功率 12%→66.3%:Stanford HAI AI Index 2026
- LangChain RAG Tutorial / Anthropic Memory & Context Management Cookbook:python.langchain.com/docs/tutorials/rag(RAG 教程);docs.anthropic.com(Context 管理 Cookbook)
速记卡(面试闪卡)
Q1:一句话讲清「2025 Context Engineering 兴起:RAG + 信息筛选 + 注意力管理」到底是什么? A:Context Engineering 研究「模型推理那一刻能看到的所有 token」,目标是把对的信息在对的时机喂给模型。
Q2:为什么从 Prompt Engineering 升级到 Context Engineering —— 怎么理解? A:以前只琢磨「怎么问」,现在管「模型看到什么」。就像做饭从只练颠勺(问法)升级到管整间厨房的备料、摆盘与动线(信息流)——料不对,火候再好也白搭。
Q3:核心技术一:RAG 检索增强 —— 怎么理解? A:把外部知识检索进来再生成,像给考生开卷——但开卷容易抄错页,所以要有向量库、嵌入模型与重排序三件套把关。
Q4:核心技术二:注意力管理 —— 怎么理解? A:长上下文会「Lost in the Middle」,中间信息遵循率只剩六成。像会议室座位:关键结论放首尾,别埋在 PPT 第 30 页。
Q5:长期策略:压缩 / 笔记 / 子 Agent —— 怎么理解? A:窗口快满就 Compaction 总结历史;让 Agent 把进度写进上下文外的 NOTES.md;子 Agent 独立窗口深挖只回传精炼摘要,像外包给专家写一页 memo。
Q6:核心速记主线有哪些?
- 本质:管「模型看到什么」而非「怎么问」
- 三大技术:RAG 检索、注意力管理、渐进式披露
- 长期四招:压缩、结构化笔记、子 Agent、按需加载
口诀 A:上下文是整盘料, 看见什么定成效; 检索注意双管好, 压缩外包不撑爆。
相关链接
- 系列清单:Agent 方法论与产品思维学习路线图
- 上一层级:认知升级:四层模型 · 索引
- 同主题:Prompt Engineering 时代 · 四层模型演进图