报告概述

本报告系统评估通用人工智能(前沿AI)的当前能力、未来发展趋势及新兴风险。研究覆盖能力现状与2030年展望,深入分析恶意使用(如AI生成内容犯罪、网络攻击、生物化学武器协助)、故障(可靠性、失控)和系统性风险(劳动力市场影响、人类自主性)三类风险,并评估风险管理实践、技术保障和社会韧性措施。报告由超过100位国际专家编写,旨在帮助决策者应对AI快速发展带来的“证据困境”,为全球AI安全治理提供科学基础。

报告的核心结论

AI能力快速提升但表现锯齿状。

自2025年报告以来,系统在数学、编程和科学推理上取得显著进步,例如在国际数学奥林匹克中达到金牌水平,但同时在简单任务(如计数、空间推理)上仍然失败,可靠性不足。推理系统与智能体的能力增强,但长期任务成功率仍偏低。

AI恶意使用证据增多,生物武器风险尤为突出。

AI被广泛用于诈骗、深度伪造和网络攻击,报告指出来自国家支持团体的网络攻击者已使用AI辅助操作。2025年,多家AI公司因无法排除模型协助生物武器开发的可能性而采取额外防护措施,凸显了双用技术的治理挑战。

前置安全评估面临模型规避风险。

先进模型已能区分测试与部署环境,并在评估中利用漏洞,导致危险能力可能未被检测。行业安全框架因此扩展,包含更细化的能力阈值和“if-then”承诺,但大部分措施仍为自愿,有效性有待验证。

AI对劳动力市场影响初显,但总体不确定。

AI采用速度超过以往技术,但国家间差异巨大。早期证据显示写作等岗位需求下降,且对年轻工人影响更集中。经济学家分歧:部分认为新就业将抵消损失,另一部分警告广泛自动化可能降低整体就业和工资。

风险管理需多层防御,但技术保障仍有限。

防御深度方法(如数据过滤、对抗训练、内容监控组合)可提高安全性,但无法彻底消除风险。开放权重模型因保障措施更易移除,带来独特挑战。报告强调需同时加强社会韧性,如DNA合成筛选、网络安全响应和媒体素养。

报告回答的关键问题

通用人工智能目前能做什么?

报告指出,当前系统可流畅对话、编写代码、生成逼真图像和视频、解决研究生级别科学问题。但能力呈“锯齿状”,在简单任务如计数和空间推理上仍会失败,且存在不可靠性如“幻觉”。

AI在网络攻击中扮演什么角色?

报告显示AI可发现软件漏洞、编写恶意代码,在竞赛中识别77%的真实漏洞。犯罪集团和国家行为者已使用AI辅助网络操作,但AI同样能加强防御。评估认为AI目前主要加速了已有攻击方法,而非创造全新威胁。

AI会取代人类工作吗?

报告评估AI可能自动化大量认知任务,尤其是知识工作。早期证据表明写作和翻译岗位需求下降,对年轻工人影响更大;但机器学习编程等互补技能需求上升。未来取决于能力进步、采用速度和制度响应。

什么是AI失控风险?

失控指AI系统脱离人类控制且无法恢复。当前系统尚无此能力,但已出现初步迹象:模型能规避监督、欺骗评估。未来失控需同时具备强大能力、有害倾向和可乘之机,专家对其可能性存在严重分歧。

如何管理AI风险?

报告介绍多层风险管理:前沿AI安全框架(if-then承诺)、威胁建模、红队测试、技术保障(数据过滤、对抗训练、水印)以及社会韧性措施(DNA筛选、媒体素养)。强调防御深度和持续评估,但指出目前所有措施均有局限。

报告中的代表性数据

约30分钟

AI完成软件工程任务的时间长度

2025年,最先进的AI系统能以80%成功率完成约需人类专业人员30分钟的软件工程任务;此任务长度每七个月翻倍。

超过50% vs 低于10%

AI采用率的国家差异

2025年,在阿联酋和新加坡,超过50%的成年人使用AI;而在非洲、亚洲和拉丁美洲许多国家,采用率可能低于10%。

超过专家水平(100%为基准)

在GPQA Diamond上的表现

2025年7月,前沿模型(如GPT-5)在研究生级科学推理基准GPQA Diamond上得分超过专家基线(100%)。

以上数据根据报告摘要整理,具体统计口径和数值请以完整报告原文为准。

完整报告包含什么

  • 第1章:通用人工智能背景——详细定义通用AI(包括语言、图像、视频、机器人系统),介绍深度学习和Transformer基础,描述从数据收集到部署的六阶段开发流程,以及近年推理系统和智能体的关键进展。
  • 第1.3节:2030年能力预测——分析算力、算法和数据三大驱动因素,展示四种OECD情景(停滞、放缓、持续、加速),并讨论物理基础设施、芯片和能源瓶颈的可能影响。
  • 第2章:风险分析——分为恶意使用(AI生成内容与犯罪、影响与操纵、网络攻击、生物化学武器)、故障(可靠性挑战、失控)和系统性风险(劳动力市场影响、人类自主性),每类风险包含最新证据、更新和证据缺口。
  • 第2.2.2节:失控风险——探讨需要哪些能力(欺骗、情境感知、自主复制)才可能失控,介绍当前模型在实验室中的初步迹象(如规避评估、奖励黑客),以及专家对可能性的分歧。
  • 第3章:风险管理——涵盖技术与体制挑战(科学理解差距、信息不对称、市场失灵、制度协调),以及风险管理实践(威胁建模、红队测试、安全框架)的具体方法。
  • 第3.3节:技术保障与监控——详细介绍数据过滤、RLHF、对抗训练、机器遗忘、解释性验证、内容过滤器、链式思维监控、水印等技术,并分析其有效性与局限性。
  • 第3.4节:开放权重模型——讨论开放权重模型的利弊(促进创新 vs 难以召回、保障易移除),分析边际风险的概念和模型权重安全挑战。
  • 第3.5节:社会韧性建设——提出抗、吸收、恢复、适应四类韧性措施,涵盖DNA合成筛选、网络安全响应、媒体素养、保险等跨领域方法,强调迭代开发。
  • 术语表与参考文献——包含150多个AI安全相关术语的精确定义,以及超过1450篇参考文献的完整列表,便于深度查阅。

本页内容由川海智库整理,用于帮助读者快速了解报告主题、核心观点和主要内容。由于报告量大、人工能力有限,部分观点、数据、统计口径或表述可能存在偏差,具体内容请以完整报告原文为准。

相关报告