报告概述
本白皮书详细介绍了华为Atlas 900 A2 PoD集群基础单元,这是基于昇腾910 AI处理器的AI集群基础单元,专为人工智能计算中心、运营商、云计算等重算力场景设计。报告覆盖了产品的概述、特点、系统架构(散热、供电、管理系统)、硬件描述(机柜、管理模块、计算节点、交换节点、电源)、技术规格、环境规格、物理规格、软硬件兼容性及安全信息。旨在帮助售前工程师及数据中心规划者全面了解产品的高密度、高能效、高可靠、易拓展、一体化交付等特性,为大规模AI训练业务提供参考。
报告的核心结论
高密度设计节省机房空间
整柜支持8台4U液冷计算节点,包含CPU和昇腾910 AI处理器,在有限空间内提供强大算力,降低数据中心占地面积。
液冷散热实现高能效与低PUE
计算节点采用液冷散热,支持热流密度>100W/cm²,液冷门辅助散热,配合高效电源和市电直供,有效降低PUE,减少运营成本。
支持大规模集群组网
通过跨柜参数面组网,两层交换组网最大支持8192 NPU集群规模,满足超大规模AI训练需求。
一体化交付与极简运维
整柜运输(含计算节点、交换节点等),计算节点盲插,支持Redfish接口和FusionDirector智能管理平台,降低部署和运维复杂度。
报告回答的关键问题
Atlas 900 A2 PoD集群基础单元适用于哪些场景?
该产品主要适用于人工智能计算中心(AICC)、运营商、云计算等重算力场景,专为大规模、高性能AI训练业务设计。
这款集群基础单元如何实现高能效?
通过液冷散热系统(冷板散热+液冷门)、54.5V集中供电(96.5%高效电源)、市电直供以及支持高进水温度(最高45℃)等方式,显著降低PUE和电费。
Atlas 900 A2 PoD支持的最大NPU集群规模是多少?
支持跨柜参数面组网,两层交换组网最大可支持8192个NPU集群规模,适用于大规模分布式AI训练。
产品在可靠性方面有哪些设计?
电源模块最大22+2配置支持66kW供电,计算节点风扇N+1冗余,全无源Cable背板,液冷对接件支持盲插且具备漏液自动检测和100%拦截功能。
报告中的代表性数据
单机柜AI算力(FP16)
资料未明确,单个机柜在FP16精度下的峰值稠密算力,具体数值以实际配置为准。
单机柜最大供电能力
资料未明确,电源模块最大22+2配置下可提供的总供电功率。
液冷门最大换热能力
资料未明确,液冷门支持的最大换热能力,对应水流量≥45LPM,风量≥1600CFM。
以上数据根据报告摘要整理,具体统计口径和数值请以完整报告原文为准。
完整报告包含什么
- 产品概述与特点:详细描述Atlas 900 A2 PoD集群基础单元的定位、核心优势(高密度、高能效、高可靠、易拓展、一体化交付、低TCO)以及软硬件亮点。
- 系统架构:深入介绍散热系统(液冷+风冷)、供电系统(2N/N供电、54.5V集中供电)和管理系统(iBMC、机柜管理模块RM211、FusionDirector集成),附有架构示意图。
- 硬件描述:涵盖机柜外部结构、内部组件、液冷门组件,管理模块RM211接口,计算节点(基于昇腾910和鲲鹏920),第三方交换节点DX511(12.8T交换容量),电源框及电源模块技术参数。
- 产品规格:包括技术规格(AI算力、计算节点详配置)、环境规格(温度、湿度、水质、海拔、液冷门参数等)、物理规格(尺寸、重量、能耗)。
- 软硬件兼容性:说明操作系统及硬件需参考兼容性列表,提示使用非兼容部件可能造成故障。
- 管制与安全信息:包含通用安全声明、人身安全防护措施、工质水防护指南、设备安全操作、搬迁注意事项以及维保保修信息。
- 附录与术语:提供液冷门流阻曲线图、术语解释和缩略语表,方便查阅技术定义。
本页内容由川海智库整理,用于帮助读者快速了解报告主题、核心观点和主要内容。由于报告量大、人工能力有限,部分观点、数据、统计口径或表述可能存在偏差,具体内容请以完整报告原文为准。





