报告概述

本报告由世界经济论坛与凯捷合作撰写,主要面向AI智能体的采用者(包括决策者、技术领导者和实践者),旨在为AI智能体的安全有效部署提供结构化基础。报告聚焦于基于大语言模型的AI智能体,分析了其技术架构(应用层、编排层、推理层)、通信协议(MCP、A2A、AP2)及网络安全考量;提出了一个包含分类、评估、风险评估与治理四大支柱的渐进式框架,帮助组织根据智能体的功能、自主性、权限和操作环境进行风险评估和实施相应管控。报告的价值在于为从实验到部署的整个过程提供了可操作的蓝图。

报告的核心结论

AI智能体正从原型走向部署,但治理框架严重滞后。

尽管82%的组织计划在未来1-3年内集成AI智能体,但大多数仍处于规划或试点阶段。智能体的自主性和工具调用能力带来了目标错位、行为漂移、工具滥用等新风险,传统软件治理模型已不足以应对,需要建立新的评估与治理体系。

智能体分类应基于功能、自主性、权限等多维度而非仅按模态划分。

报告提出了包含功能、角色、可预测性、自主性、权限和操作环境等维度的分类框架,用于刻画智能体的内在特性和外部环境。这种分类为风险评估和治理奠定了基础,确保管控措施与智能体的实际能力和风险相匹配。

评估必须从静态模型测试扩展到动态、上下文感知的连续过程。

智能体作为编排系统,其评估需要涵盖任务成功率、完成时间、错误类型、工具调用成功率和边缘情况鲁棒性等指标,并需结合沙箱测试、受控部署和持续监测,以验证其在真实工作流中的可靠性与安全性。

治理应采用渐进式方法,按风险水平动态调整管控强度。

从基线治理(最小权限、审计日志、人工监督)到增强控制,再到系统性风险管理,治理的深度和广度应与智能体的自主性、权限和环境复杂性成正比。报告强调了人工参与回路(HITL)和人在环上(HOTL)等监督模式的应用。

多智能体生态系统将引入新的失效模式,需提前防范。

未来多个智能体跨组织协作时,可能出现编排漂移、语义不一致、安全信任缺口和级联故障等新风险。报告呼吁建立共享协议、互操作性标准和信任框架,并设立“治理员”或“审计员”智能体以实现可扩展的监督。

报告回答的关键问题

什么是AI智能体,它和传统聊天机器人有何不同?

AI智能体是能够感知环境、自主规划并采取行动以实现目标的系统,不同于仅响应预设规则的聊天机器人。基于大语言模型的智能体具备推理、工具调用和适应能力,可以执行多步复杂任务,如自动编码、客户服务或自动驾驶。

企业如何评估一个AI智能体是否安全可靠?

评估需结合分类、测试和持续监测。首先按功能、自主性等维度对智能体分类;然后进行上下文相关的测试,包括任务成功率、错误率、鲁棒性和用户信任指标;最后在沙箱和受控环境中验证,并通过审计日志跟踪性能漂移。评估证据用于风险分析和治理决策。

AI智能体面临哪些独特的安全风险?

包括目标错位、行为漂移、工具滥用、提示注入、越狱攻击以及多智能体场景下的编排失败和级联效应。智能体可跨越组织边界调用外部工具和API,扩大了攻击面。报告建议采用零信任模型,对每个交互默认不信任,并实施强审计和事件响应计划。

组织如何开始采用AI智能体?

报告建议从低风险、窄范围的应用开始,例如编码辅助或内部流程自动化。采用者需先明确智能体的功能角色和权限边界,进行沙箱测试和人类监督试点,根据评估结果逐步扩大自主权。关键原则包括最小权限、审计日志、持续监测和渐进式治理。

报告中的代表性数据

82%

企业集成AI智能体的计划比例

2024年调查(2025年报告引用),根据凯捷研究院2024年全球高管调查,82%的组织计划在未来1-3年内将AI智能体集成到运营中,表明大多数工作仍处于规划或试点阶段,尚未大规模部署。

以上数据根据报告摘要整理,具体统计口径和数值请以完整报告原文为准。

完整报告包含什么

  • AI智能体的技术架构详解:包括应用层(用户界面与API集成)、编排层(智能体框架、工具调用、内存规划)和推理层(模型选择、决策逻辑),并附架构图说明各层如何协同工作。
  • 通信协议与互操作性标准:深入介绍Model Context Protocol (MCP)使智能体连接企业数据源,Agent-to-Agent Protocol (A2A)支持多智能体发现与协作,以及Agent Payments Protocol (AP2)处理安全交易。
  • 网络安全考量:从边界防御到零信任模型的演进,分析智能体跨越安全边界的风险,包括身份管理、细粒度访问控制和恶意使用场景(如数据窃取、信息操纵)。
  • 智能体分类维度体系:详细定义功能、角色(专精/泛化)、可预测性(确定/非确定)、自主性(低到高)、权限(只读到管理)、操作环境(简单到复杂),并提供分类案例(如扫地机器人)。
  • 评估方法与基准:介绍AgentBench、SWE-bench、HCAST等智能体专属基准,以及评估原则(情境化、多维评估、时间监测),并提供编码助手评估案例。
  • 风险评估五步生命周期:包括定义上下文、识别风险、分析风险、评估风险、管理风险,附结构化表格说明每一步的目标、活动和产出,并与分类维度关联。
  • 渐进式治理机制列表:涵盖访问控制、法律合规、测试验证、监控日志、人类监督、可追溯性、长期管理等9项基线治理措施,以及每项措施的目的和具体实施建议。
  • 案例研究(四个):扫地机器人(分类)、编码助手(评估)、自动驾驶汽车(风险评估)、个人助理(治理演示),展示理论框架在不同场景中的实际应用。
  • 多智能体生态系统展望:讨论智能体间商业、互联网级智能体网络、信任框架、治理员智能体、具身智能体等趋势,并分析编排漂移、语义错位、级联失效等新型失败模式。
  • 人类监督模型对比:详细说明人在回路(HITL)和人在环上(HOTL)的适用场景、优缺点,以及如何在治理中整合这两种模式确保问责制。

本页内容由川海智库整理,用于帮助读者快速了解报告主题、核心观点和主要内容。由于报告量大、人工能力有限,部分观点、数据、统计口径或表述可能存在偏差,具体内容请以完整报告原文为准。

相关报告