报告概述
该报告对2023至2025年间发布的13份AI风险缓解框架进行了快速证据扫描,提取并分类了831项具体的缓解措施。在此基础上,研究团队通过迭代聚类和编码,构建了一个初步的AI风险缓解分类法(Taxonomy),将缓解措施分为四大类:治理与监督、技术与安全、运营流程、透明度与问责。每一类下又细分为子类。该分类法旨在为不同AI生态系统参与者(如开发者、政策制定者、审计员)提供一个共同参考框架,促进对缓解措施的沟通与协调。报告还披露了缓解措施在各类别的分布情况,并指出常见术语(如“风险管理”、“红队测试”)在使用中的不一致性。该分类法及关联数据库已在airisk.mit.edu公开,可供行业迭代和使用。
报告的核心结论
AI风险缓解领域术语和框架碎片化,缺乏统一分类
报告通过扫描13份关键文档发现,不同来源的缓解框架使用不一致的术语和分类,例如“红队测试”可指代多种不同方法和主体,导致协调困难。这阻碍了有效的风险管理和科学进步。
运营流程控制是最常见的缓解类别,测试与审计占主导
在提取的831项缓解措施中,运营流程控制占比最大(36%),其中测试与审计(包括第三方审计、红队测试等)是最频繁引用的子类,出现在12份文档中。这反映了当前实践对系统评估的重视。
部分关键缓解子类在现有框架中被低估或忽视
冲突利益保护、举报人保护、环境影响管理、模型对齐和分阶段部署等子类别在文档中提及较少(各占不到1%的缓解措施),出现在不足一半的文档中。这提示可能存在缓解盲区。
风险管理概念被广泛使用但定义不统一
所有13份文档均提及风险管理,但定义和范围差异显著:有的侧重风险评估,有的强调监控,有的聚焦治理。这种模糊性可能导致实施偏差,需要更清晰的操作化定义。
缓解措施的有效性高度依赖实施质量,且缺乏效果评估
报告指出,当前分类法仅记录缓解措施的存在,未评估其有效性、成本或交互效应。组织条件(如安全文化、团队结构)等软因素对实施质量有重要影响,但难以被离散化捕捉。
报告回答的关键问题
当前AI风险缓解有哪些主要类别?
报告将缓解措施分为四类:治理与监督(如董事会监督、风险管理框架)、技术与安全(如模型安全工程、内容安全控制)、运营流程(如测试审计、数据治理、分阶段部署)以及透明度与问责(如系统文档、风险披露、用户权利)。每一类下包含多个子类,共23个。
AI风险管理中的术语不一致问题有多严重?
报告发现“风险管理”一词被所有13份文档使用,但定义差异巨大:有的强调识别评估,有的侧重监控,有的偏重治理。甚至“红队测试”也涵盖不同方法、主体和机制。这种不一致阻碍了跨组织协调和规范性标准的建立。
哪些AI风险缓解措施当前最受关注?
最受关注的是测试与审计(127项)、风险管理(125项)和系统文档(37项)。相反,冲突利益保护、环境影响管理、模型对齐等类别提及较少,可能尚未获得足够重视。
如何利用这个分类法改进AI风险治理?
技术管理者可用分类法评估自身缓解能力;政策制定者可将其转化为具体监管指标;审计员和合规官可据此分解评估维度。分类法还为跨角色沟通提供了共同语言,支持更系统的风险管控。
报告中的代表性数据
提取的总缓解措施数量
2023-2025,从13份AI风险缓解框架文档中提取的独立缓解措施总数,作为构建分类法的原始数据。
运营流程控制占比
2023-2025,运营流程控制子类的缓解措施数量占全部缓解措施的百分比(n=295),是四大类中占比最高的类别。
未能分类的缓解措施数量
2023-2025,在831项缓解措施中,有16项(2%)无法通过初步分类法归类,主要涉及质量保证、组织战略和软性文化因素。
以上数据根据报告摘要整理,具体统计口径和数值请以完整报告原文为准。
完整报告包含什么
- 初步AI风险缓解分类法的完整定义和示例:报告在附录A中列出了四大类别23个子类别,每个子类别均配有详细描述和具体实例(如董事会监督、红队测试、模型卡片等),便于实际应用。
- 敏感度和缺口分析:报告分析了不同缓解类别的文档覆盖频率,指出冲突利益保护、举报人保护等子类仅在少数文档中出现,提示未来研究需关注这些可能被忽视的缓解领域。
- 未归类缓解措施的完整列表:附录B列出了16项无法纳入分类法的缓解措施(如AI治理机构、避免炒作、安全文化等),并讨论其特质和原因。
- 缓解措施与风险之间的映射现状:报告指出大多数缓解措施未明确说明针对的具体风险,只有部分文档(如《统一控制框架》)提供了显式映射,这为后续整合风险-缓解图谱提供了基础。
- 方法学细节与LLM辅助工具评估:报告详细描述了使用LLM辅助提取和分类的过程,发现LLM不可靠地自动提取,但人工审核后可用于分类建议,强调了严格的人工验证必要性。
- 面向不同利益相关者的实践建议:为技术管理者、政策制定者、审计员分别提供了使用分类法的具体方式,如将一般义务转化为可衡量的标准、分解审计维度等。
- 研究局限性与未来方向:包括未进行系统搜索、仅包含英语文档、未评估缓解有效性等,并建议进行系统性综述、映射缓解-风险关系、研究组织条件对实施的影响。
- 公共数据库入口:报告提到所有提取的缓解措施已存入公开数据库(airisk.mit.edu),支持交互式浏览、筛选和分类,方便研究人员和从业者直接使用。
本页内容由川海智库整理,用于帮助读者快速了解报告主题、核心观点和主要内容。由于报告量大、人工能力有限,部分观点、数据、统计口径或表述可能存在偏差,具体内容请以完整报告原文为准。





