报告概述

本白皮书详细介绍了华为Atlas 900 A2 PoD集群基础单元,这是基于昇腾910 AI处理器的AI集群基础单元,专为人工智能计算中心、运营商、云计算等重算力场景设计。报告覆盖了产品的概述、特点、系统架构(散热、供电、管理系统)、硬件描述(机柜、管理模块、计算节点、交换节点、电源)、技术规格、环境规格、物理规格、软硬件兼容性及安全信息。旨在帮助售前工程师及数据中心规划者全面了解产品的高密度、高能效、高可靠、易拓展、一体化交付等特性,为大规模AI训练业务提供参考。

报告的核心结论

高密度设计节省机房空间

整柜支持8台4U液冷计算节点,包含CPU和昇腾910 AI处理器,在有限空间内提供强大算力,降低数据中心占地面积。

液冷散热实现高能效与低PUE

计算节点采用液冷散热,支持热流密度>100W/cm²,液冷门辅助散热,配合高效电源和市电直供,有效降低PUE,减少运营成本。

支持大规模集群组网

通过跨柜参数面组网,两层交换组网最大支持8192 NPU集群规模,满足超大规模AI训练需求。

一体化交付与极简运维

整柜运输(含计算节点、交换节点等),计算节点盲插,支持Redfish接口和FusionDirector智能管理平台,降低部署和运维复杂度。

报告回答的关键问题

Atlas 900 A2 PoD集群基础单元适用于哪些场景?

该产品主要适用于人工智能计算中心(AICC)、运营商、云计算等重算力场景,专为大规模、高性能AI训练业务设计。

这款集群基础单元如何实现高能效?

通过液冷散热系统(冷板散热+液冷门)、54.5V集中供电(96.5%高效电源)、市电直供以及支持高进水温度(最高45℃)等方式,显著降低PUE和电费。

Atlas 900 A2 PoD支持的最大NPU集群规模是多少?

支持跨柜参数面组网,两层交换组网最大可支持8192个NPU集群规模,适用于大规模分布式AI训练。

产品在可靠性方面有哪些设计?

电源模块最大22+2配置支持66kW供电,计算节点风扇N+1冗余,全无源Cable背板,液冷对接件支持盲插且具备漏液自动检测和100%拦截功能。

报告中的代表性数据

25.600 PFLOPS

单机柜AI算力(FP16)

资料未明确,单个机柜在FP16精度下的峰值稠密算力,具体数值以实际配置为准。

66kW

单机柜最大供电能力

资料未明确,电源模块最大22+2配置下可提供的总供电功率。

15kW

液冷门最大换热能力

资料未明确,液冷门支持的最大换热能力,对应水流量≥45LPM,风量≥1600CFM。

以上数据根据报告摘要整理,具体统计口径和数值请以完整报告原文为准。

完整报告包含什么

  • 产品概述与特点:详细描述Atlas 900 A2 PoD集群基础单元的定位、核心优势(高密度、高能效、高可靠、易拓展、一体化交付、低TCO)以及软硬件亮点。
  • 系统架构:深入介绍散热系统(液冷+风冷)、供电系统(2N/N供电、54.5V集中供电)和管理系统(iBMC、机柜管理模块RM211、FusionDirector集成),附有架构示意图。
  • 硬件描述:涵盖机柜外部结构、内部组件、液冷门组件,管理模块RM211接口,计算节点(基于昇腾910和鲲鹏920),第三方交换节点DX511(12.8T交换容量),电源框及电源模块技术参数。
  • 产品规格:包括技术规格(AI算力、计算节点详配置)、环境规格(温度、湿度、水质、海拔、液冷门参数等)、物理规格(尺寸、重量、能耗)。
  • 软硬件兼容性:说明操作系统及硬件需参考兼容性列表,提示使用非兼容部件可能造成故障。
  • 管制与安全信息:包含通用安全声明、人身安全防护措施、工质水防护指南、设备安全操作、搬迁注意事项以及维保保修信息。
  • 附录与术语:提供液冷门流阻曲线图、术语解释和缩略语表,方便查阅技术定义。

本页内容由川海智库整理,用于帮助读者快速了解报告主题、核心观点和主要内容。由于报告量大、人工能力有限,部分观点、数据、统计口径或表述可能存在偏差,具体内容请以完整报告原文为准。

相关报告