报告概述

本报告聚焦AI Agent从理论到生产落地的关键工程挑战——如何让Agent持续、稳定、可控地完成任务。报告首先回顾了Agent工程实践的四个演进阶段:Prompt Engineering、Context Engineering、Harness Engineering 和 Loop Engineering,指出工程焦点从模型提示逐步外移到自动化循环系统。核心部分深入剖析Harness Engineering的概念起源、核心思想与七大关键问题(任务漂移、执行失控、结果不可验证等),并构建了完整的架构框架,包括约束层、上下文与记忆层、编排与状态层、反馈与验证层以及可观测性与治理层。报告还详细梳理了三大设计原则:约束要小而明确、循环要可控可恢复、质量要可验证不可假设,并结合OpenAI Codex与Anthropic Claude Code两大代表性实践进行对比分析。通过一个真实Agent系统的演进实录,报告总结了从口头规则到程序化Hook的实践经验。最后,展望了Loop Engineering、人机协作边界重构以及模型竞争格局下的未来趋势。本报告旨在帮助读者建立对Harness Engineering的系统认知,为设计和落地可靠的Agent系统提供参考。

报告的核心结论

Agent的生产可靠性取决于Harness而非模型本身。

报告指出,模型提供智能核心,但真正决定Agent能否进入生产环境的是围绕模型构建的执行系统(Harness)。模型能力的提升并不意味着系统可靠性的提升,必须通过约束、循环和质量验证等Harness机制,才能让Agent从‘能用’走向‘可靠’。

Harness Engineering的核心范式是约束、循环与质量验证。

报告将Harness的设计原则归纳为三层:Constraints(约束要小而明确)决定行为边界;Execution Loop(循环要可控可恢复)保证执行过程稳定;Quality Gate(质量要可验证不可假设)建立独立验证机制。这三层共同构成构建下一代Agent系统的基础工程范式。

人机协作边界正在发生深刻重构,人类转向系统治理。

报告认为,随着Harness Engineering成熟,Agent正在接管执行、验证和常规决策,而人类的工作重心转向目标设定、约束定义和价值判断。人类负责定义空间,Agent负责在空间内高效搜索,这要求工程师从写代码转向设计与驾驭智能系统。

Harness能力正在从手工搭建走向平台化封装。

报告观察到,OpenAI将Memory、State、Orchestration等Harness模块封装进ChatGPT Work等标准产品中,Anthropic通过CLAUDE.md、MCP等机制提供内置能力。这表明Harness正从团队定制化工程转变为标准化基础设施,降低Agent开发门槛。

多Agent协作与持久化记忆仍是长期自主Agent的主要挑战。

报告指出,当前主流Agent多为任务导向,记忆与经验难以跨任务积累。未来Agent从‘任务型’向‘组织型/持久型’演进,仍需解决多Agent稳定分工、可控自我优化以及长期目标一致性问题,这需要底层架构的深刻变革。

报告回答的关键问题

什么是Harness Engineering?

Harness Engineering是围绕AI模型设计完整执行环境的新兴工程学科,核心公式为Agent = Model + Harness。它通过约束、度量和修复机制,解决任务漂移、执行失控、结果不可验证等问题,将AI能力从单次交互升级为生产级流程。

Agent落地生产环境面临哪些主要挑战?

报告归纳了七大挑战:Agent‘会做但做不完’、AI自己判断自己正确、复杂任务失控、行为不可预测、长期任务失忆、多Agent协作混乱、AI软件开发无法规模化。本质上,模型能力提升不等于系统可靠性提升,需要Harness提供外部控制。

如何让Agent持续、稳定、可控地完成任务?

报告提出通过三层设计原则:约束层(明确行为边界,如最小权限、显式约束)、循环层(保证状态可恢复、反馈结构化、循环有边界)、质量门(验证优于信任,依赖外部测试和审计)。并通过Hook等机制将规则程序化执行,确保‘系统证明完成’而非‘模型声明完成’。

OpenAI和Anthropic在Harness实践上有何差异?

OpenAI更关注让Agent像工程师一样完成复杂工程任务,通过工程基础设施、约束不变量和Agent互审(Ralph Wiggum Loop)追求高产出;Anthropic更强调安全自主执行,通过细粒度权限控制(Allow/Ask/Deny)、上下文压缩和人机协作审批确保可控性。两者最终都走向约束、循环、质量的统一范式。

Agent工程未来的演进方向是什么?

报告认为未来将走向Loop Engineering(长期自主运行与自我驱动)和Agent OS(组件下沉与标准化基础设施)。人机协作边界将重构,人类聚焦目标设定与约束定义。同时,多Agent组织、持久化记忆和长期自主性仍是待解决的难题,模型竞争将推动Harness能力平台化。

报告中的代表性数据

100万行生产代码、1500个PR

OpenAI Codex实证产出

2025.08 - 2026.01,三人团队在5个月内通过Agent-First开发模式生成约100万行生产代码、合并1500个Pull Request,几乎零手动编写代码,验证了高可靠Agent系统的可行性。

80.3%

Anthropic Fable 5 SWE-Bench Pro成绩

2026年,Claude Fable 5在SWE-Bench Pro评测中取得80.3%的成绩,显著超过同期GPT-5.6 Sol的64.6%,展现了原始推理智能的领先能力。

以上数据根据报告摘要整理,具体统计口径和数值请以完整报告原文为准。

完整报告包含什么

  • 完整分析Agent工程实践的四个演进阶段:Prompt Engineering、Context Engineering、Harness Engineering与Loop Engineering,阐述其嵌套关系与工程焦点外移规律。
  • 深入拆解Harness Engineering的核心组件体系:约束层、上下文与记忆层、编排与状态层、反馈与验证层、可观测性与治理层,并附架构图。
  • 详细对比OpenAI Codex与Anthropic Claude Code两大代表性Harness实践,从核心理念、约束机制、执行循环、质量门到关键工具,剖析两种路线异同。
  • 记录一个真实Agent系统的演进实录:从口头规则到CLAUDE.md、Skill、Orchestrator、Hook的四个阶段,总结控制权迁移经验。
  • 给出Harness实践的8条具体建议,包括问题分类、Prompt定位、Skill职责、约束模型、任务契约、完成验证等,可直接指导工程团队。
  • 展望Loop Engineering、Agent OS、人机协作边界重构等未来趋势,分析OpenAI GPT-5.6三档能力矩阵、Anthropic Fable 5以及国内GLM-5.2的最新动态与行业竞争格局。
  • 包含多组关键数据:OpenAI Codex的100万行代码实证、Anthropic SWE-Bench成绩、GPT-5.6与Fable 5性能对比,以及国内GLM-5.2的LMArena排名。
  • 提供完整的参考框架和设计原则总结,帮助读者从模型能力、运行环境到系统治理三个层面重新理解AI Agent的构建方式,并附有术语表和延伸阅读建议。

本页内容由川海智库整理,用于帮助读者快速了解报告主题、核心观点和主要内容。由于报告量大、人工能力有限,部分观点、数据、统计口径或表述可能存在偏差,具体内容请以完整报告原文为准。

相关报告