报告概述

报告对八家全球领先的AI公司(Anthropic、OpenAI、Google DeepMind、xAI、Z.ai、Meta、DeepSeek、Alibaba Cloud)在六个关键领域(风险评估、当前危害、安全框架、存在安全、治理与问责、信息共享)的35项指标进行了独立评估。评估基于公开证据和公司自愿提交的调查问卷,由国际AI安全与治理专家组成的评审小组进行打分。报告旨在提供透明的横向比较,识别最佳实践和关键差距,从而推动行业提升安全水平,为决策者、研究人员和公众提供参考。

报告的核心结论

前三名公司保持领先,但整体安全表现仍属中等偏低

Anthropic、OpenAI和Google DeepMind连续位居前三,最高得分仅为C+(2.67分)。尽管它们在风险披露、安全框架和治理结构方面相对领先,但远未达到足够的安全生产水平,且与第二梯队公司之间存在显著差距。

存在安全是行业核心结构性失败

所有公司在存在安全领域均未获得D以上分数,连续两期评估如此。虽然Anthropic、OpenAI、Google DeepMind等公司的领导层公开谈论存在风险,但并未转化为可量化的安全计划、对齐失败缓解策略或可信的内部监控和控制措施。

公司安全实践普遍低于新兴标准要求

评审专家指出,多数公司的安全实践未能达到EU AI Code of Practice等新兴治理框架的基本要求,包括独立监督、透明的威胁建模、可衡量的阈值和明确触发的缓解措施。即使最强表现者也存在明显不足。

xAI和Meta在安全框架方面取得有限进展

xAI和Meta分别发布了结构化安全框架,引入了定量阈值或基于结果的触发机制,但覆盖面窄、可衡量性差,且缺乏独立监督。xAI的框架未明确阈值如何影响部署决策,Meta的框架决策权不明。

中国公司在国内法规约束下具备某些基线优势

尽管中国公司整体评分较低,但国内法规要求的内容标注、事件报告等强制实践,在某些指标上提供了比西方公司更强的基线问责。此外,中国公司也在积极参与国家标准的制定。

报告回答的关键问题

哪些AI公司在安全方面表现最好?

Anthropic以C+(2.67分)排名第一,OpenAI同样获C+(2.31分),Google DeepMind为C(2.08分)。这三家公司是行业安全实践的最强者,但整体评分仍偏低,暴露出行业安全准备普遍不足的问题。

前沿AI安全领域存在哪些主要问题?

报告指出五大核心问题:存在安全策略缺失(无公司有可信计划)、风险评估范围狭窄(关键风险类别未覆盖)、外部评估缺乏独立性(评审方受公司控制和补偿)、安全框架门槛模糊(多数为定性描述)、以及安全承诺与能力加速提升之间的结构性差距持续扩大。

AI存在风险战略为何普遍缺失?

尽管多数公司领导层公开承认存在风险,但未制定可量化的安全计划、具体的对齐失败缓解策略或可信的内部监控和控制机制。报告认为这种高调言论与实际投入之间的差距是一种“根本性的虚伪”。

中国AI公司在安全评估中表现如何?

DeepSeek和Alibaba Cloud整体评分为D和D-,位于末尾。但报告肯定了中国法规带来的优势,如强制内容标注、事件报告等,使它们在部分指标上表现优于西方同行。Z.ai因允许第三方发布评估结果而无审查而受到好评。

报告中的代表性数据

Anthropic 2.67, OpenAI 2.31, Google DeepMind 2.08, xAI 1.17, Z.ai 1.12, Meta 1.10, DeepSeek 1.02, Alibaba Cloud 0.98

各公司整体评分(GPA 4.3分制)

2025年冬季(证据收集截至2025年11月8日),采用美国GPA评分体系(A+~F对应4.3~0分),整体得分由六个领域得分平均得出。所有公司得分均低于C+,显示行业安全实践普遍严重不足。存在安全领域无公司超过D分。

以上数据根据报告摘要整理,具体统计口径和数值请以完整报告原文为准。

完整报告包含什么

  • 八家公司的全面评分表与总体排名,以及各领域(风险评估、当前危害、安全框架等)的详细得分和等级。
  • 每个领域的深入分析,包括公司级别的具体证据、评审专家评语和改进建议。
  • 专家评审小组的完整介绍,包含八位AI安全、治理和技术评估领域顶尖专家的背景和专长。
  • 针对每家公司的进展亮点和详细改进建议,覆盖安全框架、风险评估、治理结构等方面。
  • 中国监管环境的专门分析,说明国家法律、地方规章、自愿标准对公司行为的塑造作用。
  • 公司调查问卷(附录B)的完整回复,涵盖举报政策、外部测试、内部部署、安全管理等34个问题。
  • 安全框架的详细评估方法论,基于SaferAI开发的指标体系,对风险识别、分析、处理和治理进行逐项评分。
  • 各公司技术安全研究出版物列表(附录A),跟踪在可解释性、可扩展监督、危险能力评估等领域的研究输出。

本页内容由川海智库整理,用于帮助读者快速了解报告主题、核心观点和主要内容。由于报告量大、人工能力有限,部分观点、数据、统计口径或表述可能存在偏差,具体内容请以完整报告原文为准。

相关报告