报告概述

本报告系统性地定义了从狭义Token窗口到广义系统状态的上下文概念,梳理了从静态Prompt工程到智能体协议化的四次技术飞跃。核心内容包括Prompt、Skills、MCP、A2A四大组件,以及结构化、检索、压缩、编排、评估、安全六大方法论支柱。报告还深入解析了L1瞬时工作记忆、L2情景记忆和L3语义记忆三层记忆模型,并提供了丰富的代码实践案例。旨在帮助开发者、架构师和产品经理从提示工程的技巧转向系统化的上下文经营,构建高效可靠的AI应用。

报告的核心结论

上下文工程取代提示工程成为AI应用核心。

报告指出,在基础模型能力趋同的背景下,决定AI应用成败的关键在于如何工程化地构建和管理上下文,而非仅仅优化Prompt。上下文被视为驱动模型决策的全部信息流的总和,包括文本、环境、用户、系统和组织五个类别,这一系统性视角将开发者的焦点从寻找正确词语转向设计能够持续提供完美上下文的系统。

RAG通过解耦计算与存储实现知识实时更新。

报告认为,检索增强生成(RAG)通过将模型推理能力与外部知识库解耦,解决了传统模型知识固化、事实不可靠和缺乏透明度的问题。RAG使得知识变得可插拔、可更新,答案有据可查,并且能以更小的模型实现接近巨型模型的知识能力,成为当前上下文工程中L3语义记忆的主要实现方式。

三层记忆模型是智能体长期学习的基础。

报告提出了L1瞬时工作记忆(Scratchpad)、L2情景记忆(Episodic Memory)和L3语义记忆(Semantic Memory)的分层架构。L1负责任务内的实时推理,L2记录历史交互经验,L3存储外部化可检索知识库。这一模型使智能体能够像人类一样在瞬时思考、回顾过去和运用知识之间切换,是实现长期学习和连贯对话的关键。

协议化上下文(MCP/A2A)驱动多智能体协作生态。

报告强调,模型上下文协议(MCP)标准化了单智能体接入外部工具和数据的方式,而智能体间协议(A2A)则定义了多智能体之间的通信与协作规范。二者共同构建了去中心化的上下文网络,使得不同厂商、不同技术的智能体能够安全地发现、委托任务和共享上下文,为Agent社会的形成奠定了协议基础。

上下文安全是AI系统可靠运行的底线。

报告将安全列为六大支柱之一,指出上下文本身成为新的攻击面,核心威胁包括提示注入和数据泄露。建议采用输入/输出过滤、权限最小化、人工确认环节和结构化Prompt等纵深防御策略,并基于OWASP指南给出了具体实现,确保在复杂信息流中保护系统和用户数据。

报告回答的关键问题

上下文工程与提示工程有何本质区别?

提示工程专注于设计一次性静态指令来引导模型输出,而上下文工程则从系统视角出发,构建一个能动态提供多源信息(指令、记忆、知识、工具)的信息生态系统。报告指出,上下文工程的核心是经营一个让模型持续做出高质量决策的系统,而非仅仅优化Prompt文本,这是从炼金术到系统性工程学的范式跃迁。

RAG如何减少大模型的幻觉问题?

报告解释,RAG通过检索外部知识库中与问题相关的真实文本片段,并将这些片段作为上下文强制注入模型输入,让模型基于可验证的源材料生成答案,而不是依赖其内部参数进行猜测。这种方式使答案有明确来源,大幅降低了模型编造事实的可能性,并通过RAG三元组(上下文相关性、答案忠实度、答案相关性)等指标来量化评估。

MCP和A2A协议的作用分别是什么?

MCP(模型上下文协议)标准化了单个智能体与外部工具、数据源的交互方式,相当于智能体的USB接口;A2A(智能体间协议)则定义了不同智能体之间如何进行任务委托、上下文共享和能力授权,相当于智能体社会的通信语言。两者结合使得智能体既能高效使用工具,也能组成协作网络完成复杂任务。

如何为AI智能体构建长期记忆系统?

报告提出三层记忆模型:L1瞬时工作记忆利用模型上下文窗口作为草稿纸,通过ReAct循环读写;L2情景记忆持久化交互历史,采用滑动窗口和摘要化压缩;L3语义记忆通过RAG和向量数据库存储外部知识。实践上可使用LangChain的SummarizationMiddleware管理对话摘要,以及LlamaIndex构建带持久化索引的文档检索Agent。

上下文工程六大支柱具体包含哪些方法论?

六大支柱包括:结构化(用XML/JSON等标记信息边界)、检索(混合搜索+重排+查询转换)、压缩(LLMLingua等抽取式压缩降低Token成本)、编排(路由器和Agentic RAG动态决策流程)、评估(RAGAS等自动化指标量化质量)、安全(OWASP防护管道对抗注入和泄露)。这些支柱共同构成从数据准备到生产监控的完整工程闭环。

完整报告包含什么

  • 第一章重新定义上下文,阐述从狭义Token窗口到广义系统状态(文本、环境、用户、系统、组织)的扩展,以及从被动输入到主动经营的范式跃迁。
  • 第二章梳理上下文技术的四次历史飞跃:静态输入窗口时代、长上下文竞赛、外部记忆与RAG兴起、智能体与协议化上下文网络,涵盖Transformer、ICL、FlashAttention、MemGPT等关键技术。
  • 第三至六章详解四大核心组件:Prompt的静态指令本质与CoT/ReAct技法、Skills作为可复用能力单元的定义与生命周期、MCP协议实现单智能体上下文扩展坞、A2A协议构建多智能体协作总线,均附官方代码实践。
  • 第七至九章深入三层记忆模型:L1瞬时工作记忆的ReAct读写机制与最佳实践,L2情景记忆的摘要化存储与LangChain实现,L3语义记忆的RAG技术栈(向量数据库、混合搜索、知识图谱),并附LlamaIndex完整示例。
  • 第十至十五章逐一剖析六大支柱:结构化(XML/JSON/Pydantic及LangChain输出解析)、检索(混合搜索、重排、查询转换及LlamaIndex后处理器)、压缩(Selective Context、LLMLingua系列及代码),编排(路由器、Agentic RAG、LangGraph状态图),评估(RAG三元组、RAGAS自动化框架及评估驱动开发),安全(OWASP防护管道与纵深防御实践)。
  • 第十六章全面梳理工具生态:数据与存储层(Pinecone、Weaviate、Chroma、Milvus、Neo4j)、编排与代理层(LangChain、LlamaIndex、AutoGen、LangGraph、Dify等)、评估与观测层(RAGAS、TruLens、Langfuse、DeepEval)、操作与部署层(vLLM、TGI、LangServe、AI Gateway等),并对比各自特点与适用场景。
  • 第十七章展望未来趋势:从无限上下文到实时流式感知,进而演化为可预测的世界模型;多模态RAG的跨模态检索与融合;Agent社会化带来的协议、信任、价值交换和隐私问题;以及新时代上下文工程师所需的多学科技能图谱。
  • 附录提供完整的参考文献与资源列表,涵盖核心论文、官方文档和开源项目地址,以及术语表帮助读者快速掌握关键概念。

本页内容由川海智库整理,用于帮助读者快速了解报告主题、核心观点和主要内容。由于报告量大、人工能力有限,部分观点、数据、统计口径或表述可能存在偏差,具体内容请以完整报告原文为准。

相关报告