报告概述

本报告围绕智能体(Agent)工程及应用演进展开系统研究,梳理Agent工程框架从提示词工程到上下文工程、再到驾驭工程的三阶段演进,以及Agent产品从Copilot嵌入式助手到Coding Agent、垂类流程Agent、Computer Use/GUI Agent的发展路径。报告采用案例分析和框架梳理的方法,结合OpenAI、Anthropic、LangChain等团队实践,深入剖析驾驭工程如何成为Agent差异化的核心壁垒,以及Agent从辅助功能迈向自主执行时代的商业逻辑。读者可通过本报告快速理解Agent技术前沿、产业落地现状及未来投资方向。

报告的核心结论

驾驭工程成为Agent竞争壁垒的核心来源

报告指出,在基座大模型能力趋近的背景下,驾驭工程(Harness Engineering)通过文件系统、沙箱、工具调用、上下文治理、反馈回路等机制,大幅提升Agent在长链路复杂任务中的稳定交付能力。LangChain、OpenAI、Anthropic的案例均证明,优化Harness可显著提升Agent性能,且Harness需针对不同基座定制,是产品差异化的关键。

Agent从辅助功能发展为自主执行数字劳动力

Agent历经Copilot嵌入式助手、Coding Agent单任务智能体、垂类流程智能体等阶段,正转向具备自主执行和完整工作流实现能力。垂类流程Agent在客服、法律、医疗、金融等场景跨系统完成端到端流程,商业模式也从按席位收费转向按任务量或结果收费,推动Agent成为数字劳动力。

Coding Agent率先成为商业化最清晰的Agent赛道

Coding Agent因任务边界清晰、工具链成熟、ROI易量化,率先吸引强付费意愿。Claude Code截至2026年2月ARR达25亿美元,Cursor超20亿美元,Codex周活跃用户500万人。Coding Agent还赋能非技术人员完成产品开发,并支持移动端远程管理,显著放大个人生产力。

Computer Use推动Agent泛化操作能力

Computer Use使Agent无需API即可像人类一样观察并操作GUI界面,通过点击、输入等完成多步骤任务,提升处理非标准化工作的能力。主流厂商已将其内化为Agent大单品功能模块,如Codex、Claude Cowork等,分层工具策略优先使用结构化接口,Computer Use作为兜底选项扩展交互边界。

Agent有望向AI自我迭代AI方向演化

报告展望,伴随模型升级和Harness后训练体系成熟,Agent或能演进由构建和训练大模型的能力,形成高度自动化并自主迭代的智能生产系统。未来Multi-Agent分工协作将指向Agentic AI基础设施的搭建,成为企业拥抱AI的必经之路。

报告回答的关键问题

什么是驾驭工程?为什么它重要?

驾驭工程(Harness Engineering)是围绕模型构建的完整Agent运行框架,通过持久存储、通用执行、安全验证、知识延展、上下文治理和长时程自主执行六大能力,解决Agent在真实场景中的稳定性问题。报告通过案例证明,优化Harness可使Coding Agent排名从30名外跻身前5,是当前Agent工程的核心竞争壁垒。

Agent工程框架经历了哪些阶段?

Agent工程框架经历提示词工程(2022-2024)、上下文工程(2025)和驾驭工程三阶段。提示词工程优化指令表达,上下文工程解决模型“看到什么”的问题,驾驭工程进一步回答“如何稳定运行”,三者为递进嵌套关系。当模型能力趋近时,驾驭工程成为产品差异化和工程壁垒的主要来源。

Coding Agent有哪些代表性产品?

代表性Coding Agent产品包括Anthropic的Claude Code、OpenAI的Codex、以及Anysphere公司的Cursor。Claude Code最初为终端原生Agent,现已扩展为多入口平台,ARR达25亿美元;Codex整合Computer Use能力,周活500万,正成为统一Agent平台;Cursor基于VS Code生态,发布自研模型Composer,收购前ARR超20亿美元。

垂类流程Agent如何收费?

垂类流程Agent正从传统固定/用量计价转向按结果定价(outcome-based pricing),如Sierra按成功解决的客服对话、挽回的退订等收费。这种模式与AI效率直接挂钩,短期推动市场渗透,长期通过深度嵌入工作流形成置换壁垒。报告指出,按结果定价模式下潜在浪费支出低,客户付费意愿更强。

报告中的代表性数据

从52.8%提升至66.5%

LangChain Harness优化后Coding Agent得分

2026年2月,在不改变底层模型(GPT-5.2 Codex)前提下,仅通过优化Harness框架,Coding Agent在Terminal Bench 2.0评测中得分跃升,排名从前30跻身前5。

25亿美元

Claude Code年度经常性收入

截至2026年2月,Anthropic旗下Coding Agent产品Claude Code的ARR,反映Coding Agent赛道的强劲商业化能力。

为2021-2025年平均水平的8倍

Anthropic内部开发者季度代码量

2026年Q2,自2025年以来,Anthropic内部开发者季度代码量跃升,体现Coding Agent作为生产力工具的高效提能效果。

以上数据根据报告摘要整理,具体统计口径和数值请以完整报告原文为准。

完整报告包含什么

  • Agent工程框架三阶段演进详解:系统阐述提示词工程、上下文工程、驾驭工程的递进逻辑、核心方法及各自局限性,帮助读者理解Agent从单轮优化到系统级治理的完整路径。
  • OpenAI、Anthropic、LangChain等驾驭工程案例深度剖析:详细拆解LangChain利用Harness提升Coding Agent排名的具体手段、OpenAI百万行代码实践的Harness设计、Anthropic复古游戏案例的多Agent架构及Sprint Contract机制。
  • Copilot嵌入式助手产品分析:覆盖GitHub Copilot、Microsoft 365 Copilot、Salesforce Einstein Copilot等产品,分析其核心能力、商业化模式及行业落地案例,如多邻国效率提升25%、奔驰超5000名开发者使用。
  • Coding Agent代表产品对比:深入对比Claude Code、Codex、Cursor的发展历程、技术特点、商业模式及客户案例,包括Rakuten新功能交付周期缩短79%、Respiro应用由非程序员独立开发等实例。
  • 垂类流程Agent行业概览:按客服与销售、法律、医疗、金融服务四大方向,梳理Sierra、Harvey、OpenEvidence、AlphaSense等代表产品,分析其平台架构、定价模式(如按结果收费)及估值情况。
  • Computer Use实现机制与厂商布局:图解Computer Use的输入—决策—执行—回传—验证流程,比较Anthropic、OpenAI、Google、Microsoft、Manus等厂商的产品特点,并介绍Claude Cowork的分层工具策略和Dispatch远程协同。
  • Agent能力演进路径图:从人机协同(Copilot)到自主工作(Coding Agent、垂类Agent),再到Multi-Agent及AI自我迭代的长期展望,配合Anthropic的Agent演进四阶段图,呈现清晰的产业发展脉络。
  • 投资建议与风险提示:报告指出AI算力基础设施是Agent产业发展的保障,AI Infra及MaaS云服务厂商将受益;同时提示技术路线收敛缓慢、企业预算释放迟缓、算力供给不足等风险,为投资者提供决策参考。

本页内容由川海智库整理,用于帮助读者快速了解报告主题、核心观点和主要内容。由于报告量大、人工能力有限,部分观点、数据、统计口径或表述可能存在偏差,具体内容请以完整报告原文为准。

相关报告