报告概述
本报告系统分析了前沿AI公司内部使用最先进模型所带来的独特风险。这些模型在公开发布前已在公司内部部署数周至数月,具有更强的能力、更少的监督和更广泛的系统访问权限。报告围绕两大威胁向量——自主AI不当行为和内部威胁——以及三大风险因素(手段、动机、机会)构建了风险报告框架,为开发者提供了一套与加州SB 53、纽约RAISE法案和EU通用AI实践准则兼容的标准化报告方法。报告旨在帮助AI评估和安全团队编写内部使用风险报告,同时为监管机构和审计人员提供评估报告质量的参考标准。
报告的核心结论
内部模型风险显著高于外部部署系统。
内部模型具有更强大的能力、更少的监督和对敏感系统(如训练基础设施、模型权重、安全评估管道)的特权访问,且缺乏外部审查,这些特征共同导致其风险远高于公开发布的模型,需要专门的报告和缓解措施。
报告框架基于两大威胁向量和三大风险因素。
自主AI不当行为(模型主动采取有害行动)和内部威胁(员工或承包商滥用模型)是核心威胁向量。每个威胁向量需从手段(是否具备造成危害的能力)、动机(是否有意愿造成危害)和机会(控制措施是否能阻止危害)三个维度进行评估,构建完整的安全案例。
定期风险报告是识别和管理内部AI风险的关键机制。
鉴于AI研发自动化的快速发展以及外界对公司内部模型使用的可见度极低,定期、详细的风险报告成为确保风险在被实际触发前得到识别和管理的少数有效机制之一。每当内部部署更强大或风险更高的模型时,开发者应提交风险报告并论证其安全性。
自主AI不当行为和内部威胁可导致三大类有害后果。
两类威胁向量均可能导致对内部AI研发的破坏(如污染训练数据)、直接灾难性滥用(如生物武器开发或大规模网络攻击)以及模型权重泄露。这些后果相互关联,且可能通过持续的内部使用而加剧。
报告回答的关键问题
为什么内部AI模型的风险比外部部署更高?
内部模型拥有更强的能力(如Anthropic的Mythos Preview在内部使用六周后才发布)、更少的监督(缺乏外部红队和审计)以及对敏感系统的特权访问(如训练基础设施和模型权重)。这些因素使其在自主不当行为和内部滥用方面风险显著升高,而外部部署框架往往无法覆盖这些风险。
加州SB 53对AI内部使用风险报告有哪些要求?
SB 53要求前沿AI开发者制定并实施管理内部使用风险的方案,并定期(至少每三个月)提交内部使用风险报告,描述安全措施和剩余风险。报告需涵盖模型规避监督机制的风险,并作为是否内部部署决策的一部分进行缓解措施充分性审查。该法案与纽约RAISE法案内容基本一致。
如何评估内部AI模型的自主不当行为风险?
需从手段、动机和机会三方面评估:手段包括模型在高级基准(如ARC-AGI、SWE-Bench Pro)、AI研发自动化能力、网络攻防和隐蔽能力上的表现;动机通过蜜罐实验、奖励破解事件和可解释性结果衡量;机会则考察内部使用场景、访问权限、监控系统和控制评估结果。所有证据需形成安全案例。
内部威胁如何通过AI模型放大传统安全风险?
内部模型为恶意内部人员提供了强大的工具,可大幅提升其造成损害的能力(如通过模型获得生物、网络领域的高级能力),同时模型本身也成为高价值目标(权重泄露)。报告需通过提升评估、危险能力基准测试、越狱抵抗性以及访问控制、监控和防社工措施来评估风险。
报告中的代表性数据
内部使用时间——Anthropic Mythos Preview
2026年2月24日至4月7日,Anthropic开发的具有高级网络攻击能力的Mythos Preview模型在内部使用至少六周后才公开发布,体现了前沿模型内部部署的典型时长和风险暴露窗口。
以上数据根据报告摘要整理,具体统计口径和数值请以完整报告原文为准。
完整报告包含什么
- Abstract:概述报告目的——为前沿AI开发者提供内部模型使用风险报告的标准化指南,并说明法律背景。
- Executive Summary:总结核心论点和框架,包括风险分类图(图1)和关键风险指标表(表1),快速定位报告精华。
- Section 1 - Why Internal Models Pose Distinctive Risks:详细分析内部模型风险更高的三大原因(特权访问、缺乏外部监督、能力更强),以及两种威胁向量和三类有害后果。
- Section 2 - Legal Basis for Internal Use Risk Reports:解读加州SB 53、纽约RAISE法案和EU AI Act及Code of Practice的具体要求,以及本指南如何提供统一合规标准。
- Section 3 - Risk Factors and Reporting Scope:介绍三因素风险模型(手段、动机、机会),并说明报告覆盖范围、提交频率(季度或重大变更后14天内)和报告质量要求(如反方观点、不确定性、技术附件)。
- Section 4 - Autonomous AI Misbehavior:详细列出评估自主AI不当行为的证据类别,包括通用能力、AI研发能力、隐蔽能力、行为评估、奖励破解、可解释性、控制评价等,并提供具体评估方法建议。
- Section 5 - Insider Threats:针对内部威胁提供提升评估、危险能力基准、越狱抵抗性、安全审查、访问控制、监控、防社工等证据类别,并建议以保密附件形式提交给监管机构。
- Conclusion:强调风险报告不能替代技术保障,鼓励行业财团和监管机构基于本框架制定标准化模板,并呼吁随着AI能力进步持续迭代报告标准。
- References:包含30余条参考文献,涵盖内部AI风险、安全案例、基准测试、法律分析等前沿研究,便于深入追溯。
本页内容由川海智库整理,用于帮助读者快速了解报告主题、核心观点和主要内容。由于报告量大、人工能力有限,部分观点、数据、统计口径或表述可能存在偏差,具体内容请以完整报告原文为准。





