报告概述

本报告聚焦人工智能生态系统中一类关键资产——算法洞见,即能够显著提升AI系统效率、性能或可部署性的新技术、方法和设计诀窍。报告指出,与可集中存储的模型权重不同,算法洞见分散在代码、文档、通信和人员知识中,难以集中管控,面临更广泛的攻击面。研究基于专家研讨、定向文献扫描和差距分析,将RAND此前提出的模型权重安全框架扩展至算法洞见领域,定义了五个洞察安全等级(ISL1至ISL5),对应五类对手运营能力(OC1至OC5),并识别了44种攻击向量。报告采用描述性而非规范性框架,帮助组织回答“若需针对具备某能力的对手保护某项洞见,需要怎样的安全态势”这一核心问题,为AI开发者、安全从业者和政策制定者评估安全现状、识别缺口并确定投资优先级提供了结构化工具。

报告的核心结论

算法洞见的攻击面远超网络威胁,人因与流程弱点普遍可利用

报告识别出44种攻击向量,其中社交工程、暴露凭证、前雇员风险、错误配置等因防御方人为或流程失误而成功,即使最弱对手(OC1)也能利用。专家特别指出,HUMINT(人力情报)威胁在所有能力等级下都被评为高可行性,员工在闲聊、会议或社交中无意泄露信息,是技术控制无法单独解决的重大风险。

隔离(Compartmentalization)是保护算法洞见的核心组织原则

由于变革性洞见往往易于传播,组织不能只保护少数核心资产。报告提出的框架强调在ISL2至ISL5中逐步强化对信息、人员和系统的隔离,以降低洞见驻留端点数量及掌握完整知识的人员数量。从ISL2的非正式“按需知密”实践,到ISL3的形式化部门与技术强制,再到ISL4的密码学隔离和ISL5的架构与物理隔离,隔离程度逐级加深。

ISL1至ISL3的安全改进具可实现性,成本相对可控

ISL1和ISL2与行业最佳实践及安全卫生基本一致,运营负担很小;ISL3引入正式数据分类、内部威胁计划、网络分段和供应链保证,虽然开始产生明显约束,但仍在安全敏感行业现有实践范围内。报告认为,前沿AI组织很可能可以立即开始实施这些措施,而无需依赖特定威胁模型。

达到ISL4或ISL5需重大组织权衡,并可能需国家安全社区支持

ISL4和ISL5涉及隔离屏蔽设施、政府级人员审查、供应链隔离、限制研究人员旅行与通信等措施,将从根本上重塑组织运作方式。由于洞见比模型权重更分散、更易携带,安全与生产力之间的张力更为尖锐。报告建议可能需这些保护级别的组织尽早规划长期项目,如物理基础设施、人员安全计划和供应链验证。

算法洞见的价值具有生成性,比单一模型权重更具战略意义

被盗权重为对手提供立即可用的能力,而被盗洞见则赋予其生成优势:可应用于多代模型并适配自有基础设施。例如,若在RLHF公开前获得其核心技术,对手虽不能立即获得可用模型,但能大幅提升其可训练的任何大语言模型的可用性与对齐性,并在后续每一代模型上复合优势。不过,洞见的实际价值取决于接收方是否具备足够的算力、数据与工程能力来利用。

报告回答的关键问题

什么是AI算法洞见?为什么需要保护它们?

算法洞见是能显著提升AI系统效率、性能或可部署性的新技术、方法和设计诀窍,包括预训练与训练时洞见、后训练洞见以及推理与部署优化洞见。它们对算力和数据具有杠杆放大作用,被盗可能让对手压缩数年AI进展,甚至降低危险能力的门槛,因此既关乎商业利益也关乎国家安全。

AI算法洞见与模型权重在安全上有何不同?

模型权重可以集中存储在安全服务器上,是离散的数字工件;算法洞见则分散于代码、文档、通信和人员知识中,抵抗集中化,并通过对话、屏幕观察等低带宽渠道即可泄露。因此保护洞见需要更全面的方法,重点在于通过隔离减少端点数量和掌握完整知识的人员数量,而非仅保护少数核心资产。

组织如何确定所需的算法洞见安全等级?

报告提供五个洞察安全等级(ISL1至ISL5),对应五类对手运营能力(OC1至OC5)。组织可先评估自身面对的对手能力等级,再对照各ISL的基准系统判断所需安全态势。框架是描述性的,支持组织基于自身对洞见价值、威胁暴露和成本收益的判断做出知情决策,而非规定具体保护要求。

哪些攻击向量对算法洞见威胁最大?

专家评估显示,人力情报(HUMINT)和因防御方人员与流程弱点导致的非网络威胁在所有能力等级下可行性均很高。具体包括社交工程、前雇员风险、被动套取信息(elicitation)、肩窥、内部监控等。此外,软件与机器学习供应链攻击覆盖几乎所有能力等级,而内部AI工具(如代码助手)也可能无意中泄露隔离信息。

实施高级别安全措施需要付出哪些代价?

ISL4和ISL5要求隔离屏蔽设施、政府级人员审查、限制旅行与远程工作、供应链隔离等,将显著限制协作、降低开发速度、增加运营成本,甚至要求人员驻场生活。这些措施可能需要国家安全的支持,并需提前数年规划物理基础设施和人员安全管道。组织需权衡洞见价值与运营中断程度。

报告中的代表性数据

约每8个月减半(达固定性能阈值所需计算量),相当于每年约3倍有效计算增益

算法效率提升带来的有效计算增益

2012-2023年,在2012至2023年间评估的语言模型中,因算法效率改进,达到固定性能阈值所需的计算量约每8个月减半,等效于每年约三倍的有效计算增长。该数据用于说明算法洞见作为算力与数据“杠杆”的战略价值。

约每年5倍

前沿AI模型训练计算年增长率

报告引用的近期数据,报告指出,前沿AI模型的训练计算量以约每年五倍的速度增长,与算法效率增益叠加后,有效计算每年增加超过一个数量级。该数据强调算法洞见对全球AI竞争格局的影响。

以上数据根据报告摘要整理,具体统计口径和数值请以完整报告原文为准。

完整报告包含什么

  • 完整定义算法洞见及其三大分类(预训练/训练时、后训练、推理与部署优化),并详细分析其安全特性(复杂度、访问、媒介、可观察性、可转移性、保质期),帮助读者理解不同洞见的保护难度与价值差异。
  • 报告详述研究方法,包括2025年5月在旧金山举办的专家研讨会、20位跨领域专家的结构化评估及相关访谈,以及定性与定量结合的差距分析方法(计算能力感知与缓解强度之间的差距评分)。
  • 附录B提供44种攻击向量的完整清单与详细描述,按九大类别组织(运行未授权代码、窃取凭证、破坏访问控制、HUMINT、供应链攻击等),并标注哪些向量为算法洞见安全新贡献,附真实世界案例。
  • 附录C给出ISL1至ISL5各等级的基准安全系统,逐项列出访问控制、网络与端点安全、数据保护、隔离、供应链保证、人员与物理安全等具体措施,并引用NIST等权威标准作为参考。
  • 附录D以“渐进式隔离”为主线,详细说明隔离原则如何从ISL2的非正式按需知密实践,逐步升级至ISL3的形式化部门与技术支持、ISL4的密码学隔离和ISL5的架构与物理隔离,并配有基于假设公司“FrontierOrg”的情景案例。
  • 附录E列举多类算法洞见的具体实例,包括Transformer架构、RLHF、LoRA、FlashAttention、思维链提示等,并说明其所属类别及潜在影响,为识别本组织敏感洞见提供参考。
  • 报告包含专家对OC1至OC5定义及五个安全等级的完整说明,以及关于安全措施中共识与分歧领域的讨论,例如物理安全措施的必要性及生产力与安全之间的权衡。
  • 附录A详细说明专家判断的引出方法,包括参与者背景、工作坊编码表及数据管理与保密流程,供有意复现或参考研究方法者使用。

本页内容由川海智库整理,用于帮助读者快速了解报告主题、核心观点和主要内容。由于报告量大、人工能力有限,部分观点、数据、统计口径或表述可能存在偏差,具体内容请以完整报告原文为准。

相关报告