报告概述

本报告聚焦通用人工智能(GPAI)系统,评估其当前能力、未来发展趋势以及伴随的各类新兴风险。研究对象涵盖语言模型、图像生成器、AI代理等前沿系统,范围限定于能力前沿带来的风险。报告采用科学评估框架,由来自30多个国家和国际组织的100多位专家参与撰写,旨在帮助政策制定者应对AI领域的“证据困境”。报告价值在于提供一份国际共享、基于证据的分析,支持决策者理解AI进展及其风险。

报告的核心结论

通用AI能力快速提升但呈锯齿状不均衡。

前沿系统在数学、编程、科学推理等任务上接近或超越专家水平,但在简单空间推理、长期规划、低资源语言上仍明显不足。能力提升更多来自推理时计算扩展,而非单纯扩大模型规模。

恶意使用AI产生真实危害的证据正在积累。

AI被用于生成深度伪造内容实施诈骗、制造网络攻击武器、辅助生物武器开发等。真实世界中已有国家支持团体和犯罪组织利用AI工具,但其对总体攻击频率和严重性的净影响仍不确定。

AI系统可靠性挑战依然严峻,代理系统风险升高。

模型仍会产生幻觉、生成错误代码或误导性建议。AI代理自主行动使人类更难及时干预,多代理系统可能因协调失败或冲突产生级联故障。现有技术可降低故障率,但远未达到高安全关键场景所需水平。

风险管理需分层防御,但当前实践仍存在显著局限。

开发者采用威胁建模、能力评估、红队测试等做法,并发布前沿AI安全框架。然而,评估存在差距,模型在测试与部署中行为可能不同。防御深度方法(组合输入输出过滤器、内容监控等)能提高鲁棒性,但攻击者仍能绕过。

报告回答的关键问题

通用人工智能主要面临哪些安全风险?

报告将风险分为三类:恶意使用(如用AI生成虚假内容、发动网络攻击、开发生物化学武器)、故障(可靠性问题、失控风险)和系统性风险(劳动力市场冲击、人类自主性削弱)。每类风险均有不同程度的证据支持。

AI如何被用于网络攻击?

AI系统能够发现软件漏洞、编写恶意代码、自动执行部分攻击步骤。在DARPA竞赛中,AI代理识别出77%的漏洞。真实世界的犯罪集团和国家支持组织已利用AI辅助侦察、漏洞利用和数据窃取,但完全自主的端到端攻击尚未出现。

AI对就业市场有何影响?

大约60%的发达经济体和40%的新兴经济体工作岗位暴露于AI影响。早期数据显示总体就业尚无显著变化,但已观察到某些职业(如写作、翻译)的就业和工资下降,而对机器学习技能的需求上升。年轻和初级工人受影响更明显。

如何管理前沿AI的风险?

管理实践包括威胁建模、能力评估、红队测试、安全框架等。技术保障涵盖数据过滤、对抗训练、内容过滤、监控和沙箱等。但当前措施存在局限:评估不能完全预测真实世界行为,开源模型更容易被移除防护。报告强调多层防御(纵深防御)的必要性。

报告中的代表性数据

约30分钟

AI代理完成软件工程任务时长(80%成功率)

2025年,AI agent能可靠完成人类程序员约30分钟的软件任务,该时长每7个月翻倍。数据来自Kwa et al. 2025,基于170个软件工程基准任务。

以上数据根据报告摘要整理,具体统计口径和数值请以完整报告原文为准。

完整报告包含什么

  • 详细的能力评估:涵盖语言、图像、视频、机器人等各种通用AI系统的当前能力与局限性,包括基准测试成绩及“评估差距”分析。
  • 未来能力预测:基于计算增长、算法效率、数据瓶颈等因素,提出至2030年的四种发展情景(停滞、放缓、持续、加速),并附带OECD开发的场景分析。
  • 风险分类与案例:系统分析恶意使用(内容犯罪、操纵、网络攻击、生物化学风险)、故障(可靠性、失控)和系统性风险(劳动力市场、人类自主),每类提供最新证据和典型案例。
  • 风险管理实践综述:详细介绍威胁建模、红队测试、安全框架、风险评估矩阵等方法,以及多家公司的前沿AI安全框架具体内容。
  • 技术保障与监控技术:包括对抗训练、数据过滤、强化学习、可解释性、沙箱、水印、内容检测等,分析其有效性和局限性。
  • 开源模型风险与治理:讨论开源权重模型的独特挑战(防护易移除、不可召回),以及边际风险评估、平台治理等措施。
  • 社会韧性建设:提出抵抗、吸收、恢复、适应四类韧性措施,涵盖生物安全、网络安全、虚假信息应对等领域,并讨论进攻-防御平衡。
  • 专家分歧与证据缺口:总结各风险领域的主要不确定性,为后续研究和政策优先序提供指引。

本页内容由川海智库整理,用于帮助读者快速了解报告主题、核心观点和主要内容。由于报告量大、人工能力有限,部分观点、数据、统计口径或表述可能存在偏差,具体内容请以完整报告原文为准。

相关报告