报告概述

本白皮书面向技术支持与维护工程师,系统介绍Atlas 900 A3 SuperPoD超节点的安全设计。报告从产品面临的业务与管理系统双重威胁出发,基于自研鲲鹏CPU、昇腾NPU和iBMC芯片,构建从芯片、硬件、固件到系统的纵深安全体系。内容覆盖管理软件(账号、认证、授权、证书、会话、协议、数据保护)、BIOS软件、NPU设备软件(芯片、系统、应用安全)、数据安全(模型保护)及业务安全(最小授权、镜像完整性)等模块,帮助用户全面理解该AI集群硬件平台的安全防护策略与实现细节。

报告的核心结论

基于硬件可信根实现安全启动链

报告指出,Atlas 900 A3 SuperPoD 超节点从芯片片内ROM的BSBC作为信任根,结合eFuse一次性烧写特性,对uboot、BMC、BIOS等固件进行数字签名校验,确保启动过程不被恶意篡改。一旦校验失败,系统阻止启动或自动恢复,防止固件被植入恶意代码。

多层密钥与加密体系保护敏感数据

报告显示,iBMC采用分层密钥管理架构,根密钥由安全随机数生成并分组件存储,工作密钥仅用于保护业务机密数据。所有密码、密钥均使用SHA512、AES256等强算法加密存储,升级包也经加密和签名保护,同时在内存使用后立即清空敏感数据,防止泄露。

NPU芯片及应用层实现多维度安全隔离

报告强调,AI计算平台在芯片层通过JTAG/UART/USB端口熔断保护;系统层采用镜像签名、最小端口策略和权限控制;应用层支持安全算法、TLS加密通信、容器隔离及最小授权,确保AI训练业务在隔离环境中运行,防止跨容器攻击和数据泄露。

管理接口支持精细化访问与审计控制

报告指出,iBMC管理软件提供基于时间段、IP、MAC的三维立体访问策略白名单,支持双因素认证、二次认证及防暴力破解。同时记录用户操作、安全、运行等日志,支持远程syslog转储,满足合规审计要求。

报告回答的关键问题

Atlas 900 A3 SuperPoD如何防止固件被篡改?

报告说明,该超节点通过硬件可信根(片内ROM)和eFuse实现安全启动链,每级固件启动前必须通过数字签名校验。同时,iBMC支持PFR机制,若BIOS签名校验失败,会自动从备用区恢复。此外,iBMC提供不安全版本吊销功能,拦截已知风险版本的升级。

华为超节点如何保护AI模型数据安全?

报告指出,虽然Atlas 900 A3 SuperPoD默认未使能模型保护,但昇腾平台已支持离线场景下的AI模型保护方案。同时,系统在数据安全方面提供加密存储、安全通信(TLS)、容器隔离及最小授权等措施,防止模型训练过程中的数据泄露或非法访问。

iBMC管理软件有哪些防止暴力破解的机制?

报告详细列出:支持连续登录失败锁定(可配置失败次数和锁定时间),SNMP超长团体名(≥16字符),弱口令字典定制,以及基于时间段、IP、MAC的登录白名单策略。还支持双因素认证(USB Key+证书密码)和重要操作二次认证,多重防护管理接口。

Atlas 900 A3 SuperPoD的AI训练网络如何保证安全?

报告显示,系统采用灵衢总线无收敛全互连和以太网2层胖树组网,业务面与参数面均不提供对外网络接口。参数面通过VLAN隔离,跨主机集合通信支持TLS认证,同一训练任务设备归属同一设备组,确保训练网络隔离与通信加密。

完整报告包含什么

  • 产品概述与组网架构:详细描述Atlas 900 A3 SuperPoD超节点的典型组网、灵衢总线与以太网双平面设计,以及2层胖树拓扑支持的最大超节点规模(384超节点)。
  • 安全威胁分析:表格形式列举数据资产、软件资产、硬件资产面临的20余种安全攻击,如暴力破解、物理侵入、侧信道攻击、固件篡改、弱口令等,明确防护重点。
  • 管理软件iBMC安全设计:完整阐述账号安全(密码策略、防暴力破解)、认证管理(本地/LDAP、SSH公钥、双因素认证、二次认证)、授权管理(四种权限组+自定义)、证书管理(三种替换方法+自动对接CA)、会话管理、安全协议(SSH/HTTPS/SNMPv3/IPMI)、数据保护(加密算法表)、安全配置(登录规则+系统锁定)、密钥管理(分层架构)、系统加固、日志审计及DICE/安全启动/版本吊销。
  • BIOS软件安全设计:涵盖BIOS Setup登录安全(密码复杂度、历史密码、有效期、防暴力破解、加密存储、弱口令、First Login)、PBKDF2认证算法、日志上报和基于BSBC信任链的硬件安全启动。
  • NPU设备软件安全设计:分芯片安全(JTAG/UART/USB保护、安全启动、固件签名升级、安全存储)、系统安全(镜像签名、策略配置、权限最小化、日志管理、开源代码安全)、应用安全(安全算法、数据安全存储、容器隔离、TLS通信、最小授权)以及管理/控制/业务/参数四个安全面设计。
  • 数据安全与模型保护:介绍AI模型保护方案(需参考昇腾社区指南),以及数据加密存储与访问控制机制。
  • 业务安全指导:提供容器权限控制(apparmor、seccomp)实现最小授权,以及基于Docker Content Trust的镜像完整性保护方案,防止有毒镜像运行。
  • 缩略语附录:提供30余个技术术语的全称与中文解释,如NCSI、RoT、HMAC、RMCP等,便于读者快速查阅。
  • 安全声明与政策链接:包含产品生命周期政策、漏洞处理流程、初始证书权责说明、最终用户许可协议等法律和技术参考信息。

本页内容由川海智库整理,用于帮助读者快速了解报告主题、核心观点和主要内容。由于报告量大、人工能力有限,部分观点、数据、统计口径或表述可能存在偏差,具体内容请以完整报告原文为准。

相关报告