2025 Context Engineering 兴起:RAG + 信息筛选 + 注意力管理

本条目是「认知升级:四层模型」的第 2 部分,对应学习清单条目 1.1.2。

前置依赖:Prompt Engineering 为以下铺垫:Harness Engineering、Loop Engineering


一、核心观点

Context Engineering 研究「模型在推理那一刻能看到的所有 token」——料不对,问得再好也白搭。


2.1 定义

Context(上下文)指从 LLM 中采样时所包含的整个 token 集合,不只是你写的 Prompt,还包括:

  • System Prompt、检索结果、对话历史
  • 工具描述、Agent 状态、外部知识与 MCP 数据

Context Engineering 即筛选与维护这组 token、以持续产生期望行为的策略集合。

2.2 出处时间线

时间事件来源
2025-06Shopify CEO Tobi Lütke 在 X 提出「核心技能是 Context Engineering 而非 Prompt Engineering」X / Tobi Lütke
2025 年中Andrej Karpathy 给出经典定义:「一门微妙的艺术与科学,旨在为下一步推理填入恰到好处的信息」Karpathy
2025-09-29Anthropic 正式发文《Effective context engineering for AI agents》系统化该学科Anthropic Applied AI 团队

Anthropic 将 Context Engineering 视为 Prompt Engineering 的自然演进,而非替代。


3.1 RAG(Retrieval-Augmented Generation)

用户查询 → 检索相关文档 → 注入上下文 → LLM 生成回答
  • 向量数据库:ChromaDB、Pinecone、Weaviate
  • 嵌入模型:OpenAI Ada、BGE、E5
  • 检索策略:相似度搜索、混合检索、重排序(Rerank)

3.2 注意力管理(Anthropic 实证要点)

现象含义工程对策
Lost in the Middle长上下文中间信息遵循率仅 ~60%(Liu et al., 2023)关键规则放首尾
Recency / Primacy Bias开头与末尾权重更高hard gate 放末尾
Attention Budget每 token 注意力有限,超阈值开始忽略控制总量、渐进式加载

3.3 Anthropic 推荐的长期策略

  1. Compaction(压缩):接近窗口上限时总结历史,最简单的形式是清除早期原始工具调用结果
  2. Structured note-taking(结构化笔记 / Agentic Memory):Agent 将进度写进上下文之外的 NOTES.md 等文件,按需读回——如 Claude Code 的 to-do、Claude 玩 Pokémon 跨数千步保持 tally
  3. Sub-agent 架构:子 Agent 在独立上下文窗口深挖,只回传 1k–2k token 的精炼摘要(Anthropic 多 Agent 研究系统实证优于单 Agent)
  4. Just-in-time 上下文:运行时用工具按需拉取,而非预加载全部(渐进式披露)

四、与 Prompt Engineering 的对比

维度Prompt EngineeringContext Engineering
关注点怎么问模型看到什么
优化目标单次调用措辞整个推理过程的信息
核心技术Few-shot、CoT、格式RAG、窗口管理、注意力管理
局限只管输入需更多工程基础设施

五、局限与下一步

Context Engineering 解决了「模型看到什么」,但没解决:


六、最新研究与企业数据(2024–2026)

  • Context Rot 被量化:Transformer 架构下「上下文规模」与「注意力集中度」天然矛盾,token 越多召回越差(Anthropic,2025-09;Liu et al. Lost in the Middle, 2023)。
  • 渐进式披露成为主流实践:Anthropic、LangChain 均将「按需加载」列为 Agent 可靠性第一原则。
  • 基准进步间接印证:Stanford HAI(2026-04)报告 OSWorld 计算机任务 Agent 成功率从 2024 年 ~12% 升至 66.3%(接近人类 ~72%)——长上下文管理与工具调用可靠性的提升是关键贡献之一。

七、学习资源

  • 官方/权威
    • Anthropic《Effective context engineering for AI agents》(2025-09)
    • Lost in the Middle: How Language Models Use Long Contexts(Liu et al., 2023)
  • 实践指南
    • LangChain RAG Tutorial;Anthropic Memory & Context Management Cookbook
  • 进阶阅读

下一篇2026 初 Harness Engineering——Context 策展好了,但 Agent 还需要「工作台」才能干活。


参考来源(一手链接 · 可溯源深挖)

速记卡(面试闪卡)

Q1:一句话讲清「2025 Context Engineering 兴起:RAG + 信息筛选 + 注意力管理」到底是什么? A:Context Engineering 研究「模型推理那一刻能看到的所有 token」,目标是把对的信息在对的时机喂给模型。

Q2:为什么从 Prompt Engineering 升级到 Context Engineering —— 怎么理解? A:以前只琢磨「怎么问」,现在管「模型看到什么」。就像做饭从只练颠勺(问法)升级到管整间厨房的备料、摆盘与动线(信息流)——料不对,火候再好也白搭。

Q3:核心技术一:RAG 检索增强 —— 怎么理解? A:把外部知识检索进来再生成,像给考生开卷——但开卷容易抄错页,所以要有向量库、嵌入模型与重排序三件套把关。

Q4:核心技术二:注意力管理 —— 怎么理解? A:长上下文会「Lost in the Middle」,中间信息遵循率只剩六成。像会议室座位:关键结论放首尾,别埋在 PPT 第 30 页。

Q5:长期策略:压缩 / 笔记 / 子 Agent —— 怎么理解? A:窗口快满就 Compaction 总结历史;让 Agent 把进度写进上下文外的 NOTES.md;子 Agent 独立窗口深挖只回传精炼摘要,像外包给专家写一页 memo。

Q6:核心速记主线有哪些?

  • 本质:管「模型看到什么」而非「怎么问」
  • 三大技术:RAG 检索、注意力管理、渐进式披露
  • 长期四招:压缩、结构化笔记、子 Agent、按需加载

口诀 A:上下文是整盘料, 看见什么定成效; 检索注意双管好, 压缩外包不撑爆。

相关链接