报告概述
本报告聚焦智能体(Agent)安全,研究对象是能规划、调用工具、保持状态并影响外部系统的智能体系统,而非仅内容输出的聊天机器人。报告覆盖了Agent带来的风险本质变化——从内容风险升级为行动风险,并系统分析了威胁模型、七层控制架构、评测运营以及治理路线。报告将Agent视为“模型+软件+权限+数据+人”的组合系统,构建了从身份、权限、工具、上下文、沙箱到审计和人工审批的安全控制平面。对企业而言,报告提供了从原则到工程化落地的完整路线图,帮助在安全可控的前提下规模化释放Agent价值。
报告的核心结论
Agent的安全边界比聊天机器人大得多。
智能体不仅能生成内容,还能调用工具、执行操作、影响外部系统。同一错误在聊天机器人中只是错误回答,在Agent中可能变成数据外发、权限提升或生产变更等实际损失。安全重点必须从模型输出控制扩展到运行时全链路控制,包括身份、权限、工具、审计等多层防线。
只靠提示词无法保证工具调用和外部动作安全。
提示词注入只是众多攻击面之一。工具滥用、身份滥用、记忆污染、上下文投毒等风险需要系统层面的权限策略、策略引擎、沙箱执行和审计日志来管控。安全必须嵌入到Agent的运行时环境,而非仅依赖模型层的提示词防护。
企业壁垒在于安全控制平面,而不是单个模型。
模型和框架会越来越商品化,但可规模化的权限管理、审计评测、事故响应是组织能力。建立统一的安全控制平面(Agent Safety Control Plane)能让企业更快、更安全地释放Agent价值,这比单个模型的能力更具战略意义。
Agent安全是系统性风险管理,需要全面覆盖而非单点防护。
风险不只来自恶意用户,也来自工具、记忆、权限和运行环境。任何单点控制都不足以支撑生产Agent,需要集中式管理、策略编排与全局监控。报告建议从清单、权限和日志做起,逐步扩展工具能力和自治范围。
报告回答的关键问题
为什么Agent安全比大模型安全更重要?
因为智能体不仅输出内容,还能执行动作。同一个错误在聊天机器人中只是错误回答,在Agent中可能变成真实删除、资金转移或生产变更。Agent的安全目标是让错误不会无约束扩散,需要身份、权限、工具、审计等多层控制,而不仅仅是模型层的安全。
智能体面临哪些主要安全风险?
报告识别了高频风险包括目标劫持、工具滥用、身份滥用、记忆污染、上下文投毒、沙箱逃逸、多Agent级联失败和供应链污染。其中目标劫持、工具滥用和身份滥用是最突出的三类。这些风险可能来自恶意用户、第三方工具或运行环境,且会跨任务持续影响。
企业如何从零开始构建Agent安全体系?
报告建议90天路线图:先盘点现有Agent和高权限工具(0-30天),建立权限、日志、审批基线(30-60天),完成低风险试点和红队测试(60-90天)。之后逐步扩展工具能力与自治范围,最终形成统一的安全控制平面。关键是从低风险、高频、可回滚的任务开始,如知识检索、工单分类。
报告中的代表性数据
网络犯罪损失金额
2025年,FBI 2025报告显示网络犯罪报告损失超过200亿美元,表明外部攻击压力正在上升,Agent上线时必须假设外部威胁会利用新自动化链路。
NVD新增漏洞数量
2025年,NIST 2026年说明2025年NVD丰富了近42,000个CVE,漏洞数量持续增长。Agent系统需要面对更广泛的攻击面,安全控制需及时更新。
以上数据根据报告摘要整理,具体统计口径和数值请以完整报告原文为准。
完整报告包含什么
- 从大模型安全到可控行动系统的完整研究框架,明确智能体安全的定义、边界与核心抓手。
- 智能体系统的最小组成与运行闭环模型,包括身份层、权限层、工具层、上下文层、记忆层、沙箱层和审计层的详细设计。
- 八类核心风险(目标劫持、工具滥用、身份滥用、记忆污染、上下文投毒、沙箱逃逸、多Agent级联失败、供应链污染)的攻击模式与防护重点。
- 高风险场景清单与宏观威胁环境数据,帮助企业进行风险分级和优先排序。
- 七层安全控制架构:Agent Registry、工具注册中心、策略引擎、上下文防火墙、DLP与数据最小化、沙箱执行、人工审批门、Action Ledger及熔断回滚机制。
- 评测体系:注入红队方法、工具调用安全测试、数据泄露评测、记忆污染评测、沙箱逃逸评测,以及运行监控和事故响应剧本。
- 治理模型:Agent Owner制度、风险分级矩阵、安全开发流程(SSDF)、合规边界(内容、数据、标识、审计)、采购与供应商管理要求。
- 组织能力建设:业务、安全、平台三方协同的职责划分。
- 成熟度模型:从L0不可见到L5高保证自治的六级阶梯,以及大多数企业应稳定在L2-L3的建议。
- 落地路线图:90天先完成可见可控可停,180天从试点走向平台化,一年目标形成统一安全控制平面。
本页内容由川海智库整理,用于帮助读者快速了解报告主题、核心观点和主要内容。由于报告量大、人工能力有限,部分观点、数据、统计口径或表述可能存在偏差,具体内容请以完整报告原文为准。





