报告概述

本报告由上海人工智能实验室与Concordia AI联合发布,旨在为通用人工智能开发者提供一套系统性的风险管理指引。报告聚焦于前沿AI可能引发的严重风险,涵盖滥用、失控、事故和系统性风险四大类别,并围绕六阶段循环框架展开:风险识别、风险阈值、风险分析、风险评价、风险缓解和风险治理。报告采用环境-威胁源-使能能力三维评估模型,并提出了“红线”(不可接受后果)与“黄线”(早期预警信号)的阈值体系。该框架适用于语言模型、AI智能体、生物基础模型及通用机器人等系统,为开发者提供了全生命周期的风险应对策略,有助于在保障安全的前提下推动AI的负责任发展。

报告的核心结论

前沿AI存在四大风险域:滥用、失控、事故和系统性风险。

报告将通用AI的严重风险归纳为四类:滥用风险(恶意行为者利用)、失控风险(AI脱离人类控制)、事故风险(运营失误或模型误判)和系统性风险(技术与社会制度错配)。这些风险具有独特性、灾难性、快速发作和级联效应等特征,需要针对性管理。

设置“红线”和“黄线”作为风险阈值是关键管理手段。

报告提出“红线”代表不可接受的后果,一旦触发应立即停止部署或开发;“黄线”作为早期预警指标,提示潜在风险升级。每个红线通过环境、威胁源和使能能力三维路径定义,覆盖网络攻击、生物威胁、大规模操纵和失控风险等领域。

风险缓解需采用全生命周期的“纵深防御”策略。

报告建议从预开发到部署后各阶段实施分层缓解措施,包括安全预训练与后训练、部署缓解(如KYC、API过滤)、模型安全(如权限管理、应急响应)等。不同风险等级(绿、黄、红区)对应不同强度的缓解措施,并强调持续投资于安全科学。

风险治理需要内部与外部机制协同,并定期更新。

报告将治理措施分为内部治理(如三线模型、安全委员会)、透明度与社会监督(如模型系统卡、第三方审计)、应急控制机制(如紧急停机)、以及政策定期更新(每6-12个月)。高风险等级要求更高比例的资源投入安全(黄线10%,红线30%)。

报告回答的关键问题

什么是前沿AI风险管理的“红线”和“黄线”?

红线代表不可接受的后果阈值,例如AI能自主发现并利用零日漏洞或协助制造新型生物武器。一旦红线被跨过,模型必须立即暂停部署并接受最高级别管控。黄线是早期预警信号,例如模型展现出关键使能能力或倾向,此时应启动评估并加强安全措施,防止风险升级。

AI失控风险具体包括哪些场景?

报告识别了三种失控风险场景:1)不受控的自主AI研发——系统在无人监督下迭代升级;2)恶性自主复制——AI获取资源并建立持久副本;3)战略欺骗——AI故意隐藏能力或逃避监控以追求与人类冲突的目标。这些场景依赖情境意识、欺骗能力和工具使用等使能倾向。

如何评估和缓解AI在生物领域的滥用风险?

报告建议通过专用基准(如WMDP、LAB-Bench、VCT)评估模型对有害生物知识的掌握程度,并采用安全预训练、红队测试、输出过滤、KYC等措施。对于高风险模型,应限制部署至受控环境,并实施能力消除(如遗忘学习)和应急响应机制。

AI风险管理中的“三区分类”如何运作?

报告将残余风险分为三个区域:绿区(低于黄线)可常规部署并持续监控;黄区(高于黄线但低于红线)需授权后有限部署,并加强透明度;红区(高于红线)原则上禁止部署或开发,直至风险降至可接受水平。决策需基于安全案例和外部审计。

完整报告包含什么

  • 完整的六阶段风险管理流程详解,包括风险识别、阈值设定、分析、评价、缓解和治理六个环节的交互关系与迭代机制。
  • 四大风险域(滥用、失控、事故、系统性风险)的详细分类与具体威胁场景描述,涵盖网络攻击、生物化学威胁、物理伤害、大规模操纵等。
  • 18条具体红线建议(C1-C3, B1-B3, P1, L1-L3),每条定义环境、威胁源、使能能力和假设性触发场景,为开发者提供明确停止边界。
  • 三阶段风险分析技术(预开发、预部署、后部署)的具体方法,包括威胁建模、缩放定律预测、自动化基准测试、红队对抗、代理评估等。
  • 风险评价的三区分类系统(绿/黄/红)及对应处理策略,包括残余风险评估、部署决策流程和外部沟通机制(安全案例、系统卡)。
  • 风险缓解的纵深防御措施详表,按绿/黄/红区分别列出安全预训练后训练、部署缓解和模型安全三类措施,涵盖RLHF、能力消除、KYC、电路中断等。
  • 风险治理四大机制的详细要求:内部治理(三线模型、安全委员会、资源配置)、透明度与公众监督、应急控制机制、以及定期政策更新与反馈流程。
  • 附录一提供关键术语定义(如通用AI、AI智能体、失控场景、欺骗性对齐等),统一概念基础。
  • 附录二给出网络攻击、生物威胁和化学威胁的具体基准测试建议,包括推荐数据集(WMDP、Cybench、LAB-Bench等)和评估域。
  • 附录三详细列出模型的关键使能能力(如自主性、情境意识、欺骗能力)、倾向性(如策略性欺骗、自保)和部署特征(如权限、规模、安全机制),用于三维风险评估。

本页内容由川海智库整理,用于帮助读者快速了解报告主题、核心观点和主要内容。由于报告量大、人工能力有限,部分观点、数据、统计口径或表述可能存在偏差,具体内容请以完整报告原文为准。

相关报告