报告概述
本报告由世界经济论坛与凯捷合作撰写,主要面向AI智能体的采用者(包括决策者、技术领导者和实践者),旨在为AI智能体的安全有效部署提供结构化基础。报告聚焦于基于大语言模型的AI智能体,分析了其技术架构(应用层、编排层、推理层)、通信协议(MCP、A2A、AP2)及网络安全考量;提出了一个包含分类、评估、风险评估与治理四大支柱的渐进式框架,帮助组织根据智能体的功能、自主性、权限和操作环境进行风险评估和实施相应管控。报告的价值在于为从实验到部署的整个过程提供了可操作的蓝图。
报告的核心结论
AI智能体正从原型走向部署,但治理框架严重滞后。
尽管82%的组织计划在未来1-3年内集成AI智能体,但大多数仍处于规划或试点阶段。智能体的自主性和工具调用能力带来了目标错位、行为漂移、工具滥用等新风险,传统软件治理模型已不足以应对,需要建立新的评估与治理体系。
智能体分类应基于功能、自主性、权限等多维度而非仅按模态划分。
报告提出了包含功能、角色、可预测性、自主性、权限和操作环境等维度的分类框架,用于刻画智能体的内在特性和外部环境。这种分类为风险评估和治理奠定了基础,确保管控措施与智能体的实际能力和风险相匹配。
评估必须从静态模型测试扩展到动态、上下文感知的连续过程。
智能体作为编排系统,其评估需要涵盖任务成功率、完成时间、错误类型、工具调用成功率和边缘情况鲁棒性等指标,并需结合沙箱测试、受控部署和持续监测,以验证其在真实工作流中的可靠性与安全性。
治理应采用渐进式方法,按风险水平动态调整管控强度。
从基线治理(最小权限、审计日志、人工监督)到增强控制,再到系统性风险管理,治理的深度和广度应与智能体的自主性、权限和环境复杂性成正比。报告强调了人工参与回路(HITL)和人在环上(HOTL)等监督模式的应用。
多智能体生态系统将引入新的失效模式,需提前防范。
未来多个智能体跨组织协作时,可能出现编排漂移、语义不一致、安全信任缺口和级联故障等新风险。报告呼吁建立共享协议、互操作性标准和信任框架,并设立“治理员”或“审计员”智能体以实现可扩展的监督。
报告回答的关键问题
什么是AI智能体,它和传统聊天机器人有何不同?
AI智能体是能够感知环境、自主规划并采取行动以实现目标的系统,不同于仅响应预设规则的聊天机器人。基于大语言模型的智能体具备推理、工具调用和适应能力,可以执行多步复杂任务,如自动编码、客户服务或自动驾驶。
企业如何评估一个AI智能体是否安全可靠?
评估需结合分类、测试和持续监测。首先按功能、自主性等维度对智能体分类;然后进行上下文相关的测试,包括任务成功率、错误率、鲁棒性和用户信任指标;最后在沙箱和受控环境中验证,并通过审计日志跟踪性能漂移。评估证据用于风险分析和治理决策。
AI智能体面临哪些独特的安全风险?
包括目标错位、行为漂移、工具滥用、提示注入、越狱攻击以及多智能体场景下的编排失败和级联效应。智能体可跨越组织边界调用外部工具和API,扩大了攻击面。报告建议采用零信任模型,对每个交互默认不信任,并实施强审计和事件响应计划。
组织如何开始采用AI智能体?
报告建议从低风险、窄范围的应用开始,例如编码辅助或内部流程自动化。采用者需先明确智能体的功能角色和权限边界,进行沙箱测试和人类监督试点,根据评估结果逐步扩大自主权。关键原则包括最小权限、审计日志、持续监测和渐进式治理。
报告中的代表性数据
企业集成AI智能体的计划比例
2024年调查(2025年报告引用),根据凯捷研究院2024年全球高管调查,82%的组织计划在未来1-3年内将AI智能体集成到运营中,表明大多数工作仍处于规划或试点阶段,尚未大规模部署。
以上数据根据报告摘要整理,具体统计口径和数值请以完整报告原文为准。
完整报告包含什么
- AI智能体的技术架构详解:包括应用层(用户界面与API集成)、编排层(智能体框架、工具调用、内存规划)和推理层(模型选择、决策逻辑),并附架构图说明各层如何协同工作。
- 通信协议与互操作性标准:深入介绍Model Context Protocol (MCP)使智能体连接企业数据源,Agent-to-Agent Protocol (A2A)支持多智能体发现与协作,以及Agent Payments Protocol (AP2)处理安全交易。
- 网络安全考量:从边界防御到零信任模型的演进,分析智能体跨越安全边界的风险,包括身份管理、细粒度访问控制和恶意使用场景(如数据窃取、信息操纵)。
- 智能体分类维度体系:详细定义功能、角色(专精/泛化)、可预测性(确定/非确定)、自主性(低到高)、权限(只读到管理)、操作环境(简单到复杂),并提供分类案例(如扫地机器人)。
- 评估方法与基准:介绍AgentBench、SWE-bench、HCAST等智能体专属基准,以及评估原则(情境化、多维评估、时间监测),并提供编码助手评估案例。
- 风险评估五步生命周期:包括定义上下文、识别风险、分析风险、评估风险、管理风险,附结构化表格说明每一步的目标、活动和产出,并与分类维度关联。
- 渐进式治理机制列表:涵盖访问控制、法律合规、测试验证、监控日志、人类监督、可追溯性、长期管理等9项基线治理措施,以及每项措施的目的和具体实施建议。
- 案例研究(四个):扫地机器人(分类)、编码助手(评估)、自动驾驶汽车(风险评估)、个人助理(治理演示),展示理论框架在不同场景中的实际应用。
- 多智能体生态系统展望:讨论智能体间商业、互联网级智能体网络、信任框架、治理员智能体、具身智能体等趋势,并分析编排漂移、语义错位、级联失效等新型失败模式。
- 人类监督模型对比:详细说明人在回路(HITL)和人在环上(HOTL)的适用场景、优缺点,以及如何在治理中整合这两种模式确保问责制。
本页内容由川海智库整理,用于帮助读者快速了解报告主题、核心观点和主要内容。由于报告量大、人工能力有限,部分观点、数据、统计口径或表述可能存在偏差,具体内容请以完整报告原文为准。
相关报告

The transformative potential of agentic AI and the strategic imperative for Google Cloud partners

Introduction to Agents and Agent architectures

Report of the Independent Expert Group on Artificial Intelligence and Culture

蘅东光(920045.BJ): AI 数据中心卖水人,稀缺的全球光器件“小巨人”

2025中国AIEV产业年度回顾及发展总结报告
