报告概述
本报告以捕获旗标(CTF)挑战为测试环境,系统评估AI代理能否让非专家用户执行进攻性网络任务。研究分为两部分:2025年9月至2026年1月开展的人类随机对照试验,156名不同背景的参与者(无经验者到技术用户)借助当时前沿AI模型(如Claude Opus 4.1、GPT-5)尝试破解三台难度递增的机器;2026年4月使用Claude Code(Sonnet 4.6和Opus 4.6)重测相同挑战,仅通过极简提示并辅以少量人为监督。报告详细记录了两种场景下的成功率、时间、成本和方法,揭示了AI能力在短短数月内的巨大跨越,并探讨其对网络攻防评估的影响。
报告的核心结论
进攻性网络能力已广泛可及非专业人士。
2025年人类实验中,即使借助AI辅助,无经验者和技术用户在8小时内均难以完成中等或困难挑战;而2026年的Claude Code在不到1小时内、无需网络知识即可全部解决,表明复杂进攻性网络任务已对任何能安装该工具的人开放。
未修补系统很可能很快就会被无技能新手利用。
传统上脚本小子无法独立利用已知漏洞,但Claude Code可按需生成并运行利用脚本。虽然安装和运行工具对部分人仍有门槛,但在AI聊天帮助下面临障碍快速下降,这对防御者构成紧迫威胁。
AI代理能够执行搭便车攻击,利用先前攻击成果。
实验中Opus 4.6注意到Sonnet 4.6在目标上遗留的脚本和工具,从而跳过关键步骤直接获取root权限,节省了时间和成本。这意味着部分修补或未彻底清除攻击痕迹的系统可能被AI代理更快、更廉价地再次利用,增加溯源难度。
进攻性网络评估必须超越CTF,纳入主动防御环境。
当前CTF挑战对AI代理已接近饱和,英国AI安全研究所对Claude Mythos Preview的评估也指出被动脆弱系统可能很快被攻克。未来需要构建包含主动防御者的对抗性评估,尽管更复杂昂贵,但这是衡量真实能力的必要条件。
报告回答的关键问题
普通人能否使用AI进行有效的网络攻击?
能。根据报告,2026年4月的Claude Code无需用户具备网络知识,仅通过极简提示就能在1小时内破解CTF挑战。用户只需能安装Claude Code即可发起攻击,实际技术门槛极低。
2025年到2026年AI进攻性网络能力有何变化?
2025年8月的AI模型(Claude Opus 4.1、GPT-5)作为聊天机器人时,对人类帮助有限,无经验用户成功率低,且无人完成中等难度机器。但2026年4月的Claude Code(Sonnet/Opus 4.6)以代理形式运行,能够自主完成所有挑战,且成本极低(总计不到20美元),体现了飞跃性进步。
AI代理如何利用先前攻击成果进行搭便车攻击?
在M2和M3挑战中,先后启动的Opus 4.6发现了Sonnet 4.6留下的脚本、工具或已开权限,直接利用这些成果跳过自己需要开发的利用步骤,从而加速攻击。这模拟了真实世界中攻击者互相利用部分攻陷系统的场景。
未来网络攻防评估应该采用什么方法?
报告认为传统的CTF和被动脆弱系统评估已不足以衡量AI能力,因为AI代理能轻松通关。未来的评估应包含主动防御者,模拟防御方能检测和反击攻击的真实动态环境,以提供更贴近现实的测评结果。
报告中的代表性数据
Claude Code解决CTF挑战的最长时间及总成本
2026年4月5日,Opus 4.6和Sonnet 4.6分别在M1、M2、M3三台机器上运行,单个挑战墙时从4分24秒到53分14秒不等,总API成本合计约16.22美元。报告指出这是在未提供中间问题提示、仅用极简初始prompt的条件下实现的。
以上数据根据报告摘要整理,具体统计口径和数值请以完整报告原文为准。
完整报告包含什么
- 完整方法论:介绍人类随机对照试验的设计(参与者分组、任务分配、AI工具版本)以及Claude Code实验的提示策略和运行设置。
- 详细结果分析:按机器M1/M2/M3分别描述Claude Code的攻击步骤,包括侦察、凭证窃取、权限提升等阶段,并与人类参与者的表现对比。
- 成本与时间表格:提供每台机器上Opus和Sonnet运行时的墙时、API计时和具体费用(单位至美分),供读者评估AI攻击的经济性。
- 人类实验的统计数据:156名参与者的成功率、答题完成率等量化结果,显示AI辅助仅在初步问题上有微弱改善,整体提升不显著。
- 提示策略模板:公开实验中使用的初始提示和每10分钟输入的跟进提示,展示极简prompt如何成功引导AI代理。
- 未来评估建议:讨论CTF饱和问题,参考英国AI安全研究所的评估,提出构建含主动防御者的动态测试环境,并强调持续测量能力的必要性。
- 结论与政策启示:从四方面总结AI对网络攻防格局的影响,呼吁防御者关注AI带来的威胁民主化,并建议投资更具对抗性的评估方法。
- 附录或引用:包含相关研究的引用(如RAND 2026年人类提升研究、Anthropic红队报告、英国AISI评估),以及版权和研究诚信声明。
本页内容由川海智库整理,用于帮助读者快速了解报告主题、核心观点和主要内容。由于报告量大、人工能力有限,部分观点、数据、统计口径或表述可能存在偏差,具体内容请以完整报告原文为准。





