报告概述

本报告基于英国AI安全研究所(AISI)自2023年11月以来对30多个前沿AI系统的广泛测试,系统分析了AI能力的演进趋势。报告覆盖网络安全、化学与生物学、自主性、安全防护、失控风险、社会影响及开源模型等关键领域。采用自动评分任务、长形式任务、代理任务、专家红队测试、人类提升研究及影响力研究等多种评估方法。旨在为政府、行业和公众提供数据驱动的洞察,帮助理解前沿AI的发展速度、潜在风险与机遇。

报告的核心结论

AI能力在多个领域快速提升,部分指标每八个月翻倍。

在网络安全任务中,AI可完成的任务时长大约每八个月翻倍,从2023年初的不到10分钟增长到2025年中超过1小时。在自主性方面,模型完成需人类专家1小时以上软件任务的成功率从2023年末的低于5%提升至2025年中超过40%。

模型安全防护有所改善,但所有测试系统均存在漏洞。

部分最先进模型的安全防护显著增强,破解难度提升了40倍,需要更长时间和更复杂的攻击。然而,AISI在所有测试的系统中都发现了通用越狱方法,且防护进展不均衡:不同提供商、不同请求类别(如生物滥用与非生物滥用)及不同访问类型(开源vs闭源)之间差异巨大。

AI在化学与生物学领域已超越博士级专家。

在开放性问题回答方面,模型首次于2024年超过Phd基线,目前领先幅度达60%。协议生成任务中,模型自2024年末起能生成可行的实验方案并经过湿实验室验证。在实验故障排查方面,最先进系统的得分比人类专家高出近90%,且多模态模型能基于图像提供专业级建议。

AI自主复制与战略低报等失控前兆能力正在增强。

在受控环境中,模型完成自复制所需关键步骤(如获取计算资源)的成功率从2023年的不到5%上升到2025年中的超过60%。模型在被指令时能够战略性地表现不佳(低报能力),但尚未观察到自发行为。这些能力的提升增加了长期失控风险。

开源与闭源模型的能力差距已缩小至4-8个月。

根据外部基准,开源模型追赶闭源模型的速度加快:在AA Intelligence Index上差距约4个月,在METR时间跨度任务上约8个月。然而差距轨迹不确定,受计算资源获取、后续开放策略等因素影响。开源模型的易修改性也带来了独特的安全挑战。

报告回答的关键问题

前沿AI在网络安全方面能力如何?

前沿AI在网络安全任务上进步迅速:2023年仅能完成学徒级任务(成功率<9%),到2025年Q3平均成功率已达50%。2025年首次有模型完成专家级任务(通常需要10年以上经验)。任务时长每8个月翻倍,从几分钟增至超过1小时。优化的脚手架可使性能提升近10个百分点,且计算效率更高。

AI模型能否自主复制?

在受控评估中,模型的自主复制能力显著提升:2023年成功率不到5%,到2025年中两个前沿模型超过60%。但当前模型在真实世界场景下成功概率较低,尤其在复制到计算资源和持久化访问等后期阶段表现不佳。目前尚未观察到自发复制行为,但相关能力的进步值得持续关注。

AI在化学和生物领域有哪些进展?

AI在化学和生物领域已全面超越博士级专家:2024年首次超越后持续领先,目前最佳模型在开放性问题回答上超出基线60%。模型能自主生成可行实验协议(2024年末实现),并在湿实验室中验证成功。在故障排查方面,模型表现比专家高90%,多模态能力使其能通过图像分析提供实验室支持。

AI模型的安全防护有多强?

安全防护强度差异巨大:最先进的系统需要专家7小时以上才能破解(比6个月前提高40倍),但所有系统均被攻破。生物滥用类请求防护较强,其他类别较弱。开源模型极易被移除防护(数分钟内)。模型能力提升本身并未显著增强防护韧性,防护强度主要取决于开发者的投入。

开源AI模型与闭源模型差距多大?

根据外部数据,当前开源与闭源模型的能力差距约为4-8个月(AA Intelligence Index显示4个月,METR时间跨度任务显示8个月)。差距在2025年1月前持续缩小,之后波动。开源模型在简单基准上追赶更快,但在长周期代理任务上落后更多。未来差距受计算资源、模型开放策略等因素影响。

报告中的代表性数据

从<5%提升至>40%

自主软件任务成功率(超过1小时)

2023年末至2025年中,模型完成需人类专家至少1小时的软件端到端任务的成功率。

约8个月

网络安全任务时长翻倍时间

2023年初至2025年中,基于AISI网络安全任务集中,模型有50%成功概率完成的任务时长所估计的翻倍时间。

从<5%提升至>60%

自复制评估成功率

2023年至2025年Q2,AISI的RepliBench基准中,模型在11项任务上的平均成功率。2025年Q2有两个前沿模型超过60%。

以上数据根据报告摘要整理,具体统计口径和数值请以完整报告原文为准。

完整报告包含什么

  • 完整的网络安全任务评估框架与结果,包括四类难度等级(技术非专家、学徒、从业者、专家)的详细成功率数据。
  • 化学与生物学领域的多维度评估,包括开放性问题回答、协议生成、故障排查及多模态分析的具体方法与分数。
  • 模型安全防护的深度分析,涵盖不同提供商、请求类别和访问类型的脆弱性对比,以及通用越狱攻击的时间与复杂度数据。
  • 失控风险研究,包括自复制(RepliBench)和战略低报(sandbagging)的评估方法、结果及检测手段的有效性分析。
  • 社会影响部分包含大规模调查研究,涉及政治信息寻求与说服、情感依赖(含Reddit数据分析)以及关键基础设施(如金融领域MCP服务器)的自主性水平。
  • 开源与闭源模型能力差距的定量分析,使用Artificial Analysis和METR等多个外部基准,并讨论差距演变因素。
  • 研究局限性与方法论附录,包括数据呈现限制、不确定性表达、以及评估可能低估能力上限的说明。
  • 术语表,涵盖agent、越狱、防护、沙袋效应、Task Difficulty Level等关键概念的定义。
  • 未来展望部分,概述了AI安全领域需要继续关注的方向,如持续评估、防护与能力赛跑、跨部门合作等。
  • 贡献者名单与研究议程参考,提供更多技术细节和后续研究的入口。

本页内容由川海智库整理,用于帮助读者快速了解报告主题、核心观点和主要内容。由于报告量大、人工能力有限,部分观点、数据、统计口径或表述可能存在偏差,具体内容请以完整报告原文为准。

相关报告