报告概述

本报告聚焦前沿AI公司在公开发布前数周至数月内部部署最先进模型所产生的独特风险。这些内部模型拥有对敏感系统的特权访问、缺乏外部监督且能力超越公开模型。报告围绕两大威胁向量——自主AI误行为与内部威胁——结合手段、动机和机会三个风险因素构建报告框架。旨在为AI开发者(尤其是评估与安全团队)提供一套统一的内部使用风险报告标准,同时帮助监管机构和审计师理解良好报告实践。报告基于现有法律框架(加州SB 53、纽约RAISE Act、欧盟AI实践规范)的要求,提出超越法律最低标准的黄金实践建议。

报告的核心结论

内部模型风险需独立评估

前沿AI公司的内部模型因享有特权访问、缺乏外部监督且能力超前,构成与公开部署模型不同的独特风险。开发者应在每次内部部署显著更强或更危险的模型时制作风险报告,论证部署安全性。

风险报告应围绕手段、动机与机会三因素

报告采用结构化安全论证方法,要求开发者分别针对自主AI误行为和内部威胁两条路径,评估模型或内部人员具备的能力(手段)、倾向(动机)以及现有控制措施是否足够(机会)。三因素论证提供深度防御。

内部威胁报告应作为机密附件提交

关于内部威胁缓解措施(如访问控制、监控机制)的详细信息本身可能被恶意内部人员利用,因此建议将第5节中的内部威胁报告以机密附件形式单独提交给监管机构,而非公开摘要。

报告需包含反方论点与不确定性说明

优秀的报告应主动呈现对其安全结论的最强质疑,明确承认不确定性并尽可能量化。遗漏的证据类别应解释原因,以避免有意遗漏与评估空白难以区分。

报告频率与深度应与风险变化成比例

季度报告作为保障,但重大能力跃升或安全事件应在14天内提交综合或针对性更新。对于风险状况未实质变化的系统,季度报告可主要确认先前安全论证的有效性。

报告回答的关键问题

为什么AI内部模型存在独特风险?

内部模型通常比公开模型更强大、享有对敏感系统(如训练基础设施、模型权重)的特权访问,且缺乏外部红队测试和公众监督。此外,内部模型可能为“仅帮助”变体(无安全过滤器),进一步放大误用潜力。报告指出,随着AI研发自动化加速,这些风险将加剧,因为公司可能更不愿公开部署能加速AI研发的模型。

内部模型风险报告必须包含哪些法律要求?

加州SB 53和纽约RAISE法案要求前沿AI开发者描述并实施内部使用风险管理计划,每季度或合理周期报告内部使用风险。欧盟AI实践规范要求签署方评估包括自动化AI研发能力在内的系统性风险,并保护免受内部威胁。本报告提供兼容三套框架的统一报告标准。

如何评估自主AI模型误行为的风险?

报告建议从三因素入手:手段(模型能力,如AI研发基准、网攻能力、隐蔽推理)、动机(行为评估、奖励黑客、可解释性结果)、机会(访问权限、监控系统、控制评估)。通过结构化安全论证展示模型在给定控制措施下是否可安全内部部署。

开发者如何防范内部人员利用AI模型造成危害?

报告要求开发者评估内部模型相对于公开模型的“能力提升”,并测试危险能力(生物、化学、网络领域)。同时需建立安全审查流程、访问控制、监控日志、预防机制(如多主体授权)以及社交工程防御。内部威胁信息应机密提交给监管机构。

报告中的代表性数据

至少6周

Anthropic Mythos Preview内部部署时长

2026年2月24日至4月7日,Anthropic开发的具备高级网络攻击能力的Mythos Preview模型在公开发布前至少6周已在公司内部使用。这反映了前沿AI公司内部使用最先进模型的典型模式。

以上数据根据报告摘要整理,具体统计口径和数值请以完整报告原文为准。

完整报告包含什么

  • 第1章详细论证了内部模型为何构成独特风险:特权访问敏感系统、缺乏外部监督、能力超前,并以Anthropic的Mythos Preview、OpenAI GPT-4/5等实例说明内部使用周期。
  • 第2章梳理加州SB 53、纽约RAISE Act和欧盟AI实践规范的法律要求,解释本报告如何提供兼容三套框架的统一报告标准,并讨论公开摘要与机密附件的区别。
  • 第3章引入风险框架(手段、动机、机会),定义报告范围与频率决策树,并给出报告标准(包括反方论点、不确定性说明、技术附件等)。
  • 第4章详细阐述自主AI误行为的证据要求:涵盖通用能力基准(如ARC-AGI、FrontierMath)、AI研发能力(RE-Bench、SWE-Bench Pro)、实际AI研发贡献指标、隐蔽能力评估(潜空间推理、隐写术)、行为评估、奖励黑客、可解释性、控制评估等。
  • 第5章聚焦内部威胁:包括能力提升评估(生物/网络/化学领域)、危险能力基准、越狱抵抗、人员安全审查、违规记录、访问控制等级与计数、监控日志、预防机制、社交工程防御以及安全测试。本章内容建议作为机密附件提交。
  • 结论部分强调报告不能替代技术保障,但可为监管者和公众提供关键可见性,鼓励行业联盟制定标准化模板以促进跨公司比较。
  • 附录包含完整的参考文献列表,涉及相关研究论文、政策文件、模型系统卡片等,为报告主张提供引用支撑。

本页内容由川海智库整理,用于帮助读者快速了解报告主题、核心观点和主要内容。由于报告量大、人工能力有限,部分观点、数据、统计口径或表述可能存在偏差,具体内容请以完整报告原文为准。

相关报告