报告概述

本报告是中国关于生成式人工智能服务的国家标准,主要面向服务提供商、主管部门和第三方评估机构。报告详细规定了GenAI服务在训练数据安全、模型安全以及安全措施三个核心领域的要求,涵盖数据来源选择、内容过滤、知识产权保护、个人信息保护、数据标注安全、模型训练与输出安全、服务透明度、用户投诉处理等方面。附录提供了训练数据和生成内容的主要安全风险清单(31种)以及安全评估的参考方法,为相关主体构建安全合规的生成式AI服务提供了系统性指引。

报告的核心结论

训练数据来源必须经过安全评估,违法不良信息比例超5%的数据源不得使用。

报告要求服务提供商在收集训练数据前对数据源进行随机抽样安全评估,评估后若非法和不健康信息占比超过5%,则禁止从该数据源收集数据;数据收集后还需进行安全验证,验证后发现比例超5%的数据源同样不得用于训练,以确保训练数据的底层安全。

模型生成内容的合格率须不低于90%。

报告规定,模型直接输出的原始内容必须经过安全性测试,采用人工抽查和技术抽查相结合的方式,合格率(即不包含附录A中31种安全风险的比例)应不低于90%。模型优化、更新或升级后需重新测试,保证持续合规。

服务提供商应建立完整的用户信息收集与训练关闭机制。

当收集用户输入信息用于训练时,必须向用户显著披露并提供便捷的关闭方式(如通过选项或语音控制,从主界面到达选项不超过4次点击)。用户关闭后,其输入信息不得再用于训练,保障用户的数据控制权和隐私。

面向未成年人的服务需设置防沉迷措施并展示有益内容。

报告明确,如果服务适合未成年人,服务界面应允许监护人设置防沉迷措施(如限制使用时间),并积极展示对未成年人身心健康有益的内容;若提供付费服务,必须审查付费服务是否与未成年人民事行为能力相符;若不适宜未成年人使用,则需采取技术或管理措施阻止其使用。

报告回答的关键问题

生成式AI服务需要满足哪些基本安全要求?

根据该国家标准,生成式AI服务需在训练数据、模型和安全措施三大方面满足要求。训练数据方面,需确保数据来源合法、内容过滤达标、知识产权和个人信息得到保护;模型方面,需保证输出内容安全合格率不低于90%、防范后门攻击、持续监控;安全措施方面,需明确服务适用群体、提供透明度、接受投诉、保障稳定性等。

如何确保训练数据不包含违法和不良信息?

报告要求对数据源进行随机抽样安全评估,违法不良信息比例超过5%的数据源不得收集;数据收集后还需验证,若比例仍超5%则不得用于训练。此外,需对所有训练数据进行过滤(关键词、分类模型、人工抽查),合格率应达96%(人工)或98%(技术抽查)。同时,应建立注释规则和审查机制,确保标注内容安全。

模型输出安全性如何评估?

评估采用构建生成内容测试题库(不少于2000道题,覆盖31种安全风险)的方法,通过人工抽查和技术抽查测试模型输出的合格率,要求不低于90%。同时需建立拒绝回答测试题库(不少于500道题),模型对不应回答的问题拒绝率不低于95%,对应当回答的问题拒绝率不超过5%。

用户如何控制自己的输入信息被用于训练?

服务提供商必须向用户提供便捷的关闭方式,例如设置选项或语音控制指令,用户从主界面到达该选项不超过4次点击。同时需显著告知用户其输入信息用于训练的状态以及关闭方法。用户关闭后,服务商不得再收集其输入信息用于训练。

报告中的代表性数据

不少于10,000个

关键词库规模

标准发布时,附录B要求构建的关键词库总规模不少于10,000个,至少涵盖A.1和A.2中的17种安全风险,且每周至少更新一次。

不少于2,000道

生成内容测试题库题量

标准发布时,评估模型输出安全性时使用的生成内容测试题库总题量不少于2,000道,全面覆盖所有生成内容模式(文本、图像、音频、视频)和服务支持的语言。

不低于90%

模型生成内容合格率要求

标准发布时,通过人工抽查和技术抽查,模型生成内容不包含31种安全风险的合格率应不低于90%。该要求适用于模型直接输出的原始内容。

以上数据根据报告摘要整理,具体统计口径和数值请以完整报告原文为准。

完整报告包含什么

  • 完整列出了训练数据和生成内容涉及的31种安全风险,如违反社会主义核心价值观、歧视内容、商业违规、侵犯他人合法权益等,为风险识别提供了明确依据。
  • 提供了详细的安全评估参考方法,包括如何构建关键词库(不少于10,000个)、生成内容测试题库(不少于2,000道)、拒绝回答测试题库(不少于500道)以及分类模型的要求。
  • 给出了数据来源安全评估的具体操作步骤,包括数据源选择、不同来源训练数据匹配、数据源管理与可追溯性的评估方法、预期结果和结果判定标准。
  • 详细规定了数据标注安全评估方法,涵盖标注员管理、标注规则、标注内容准确性以及标注数据独立存储等方面,并提供了检查要点。
  • 明确了模型安全评估的完整流程,包括模型训练安全、模型输出安全性(合格率测试)、模型监控与评估、模型更新升级安全以及模型环境安全(训练与推理环境分离)。
  • 全面阐述了安全措施评估要求,涉及服务用户群体与场景适用性、服务透明度(披露模型及算法信息)、用户输入信息收集与训练关闭、投诉举报渠道、服务稳定性与连续性,以及设备端模型服务的特殊要求。

本页内容由川海智库整理,用于帮助读者快速了解报告主题、核心观点和主要内容。由于报告量大、人工能力有限,部分观点、数据、统计口径或表述可能存在偏差,具体内容请以完整报告原文为准。

相关报告