报告概述

本报告系统梳理了吉瓦(GW)级智算中心的开放参考架构,面向中国国情与工程实践,以开放、高效、绿色、智能为主线,按基础设施层(建筑与空间、供备电、冷却)、IT设施层(AI超节点、高速互连、网络交换、存储)、网络与高速互连层(Scale-Up/Out/Across)、系统软件与资源管理层四个层次展开。报告强调系统级协同设计,从规划阶段统筹能源、计算、网络、冷却与运维,为产业界提供可对齐、可共建的参考基础,降低系统级创新成本,促进开放生态发展。

报告的核心结论

吉瓦级智算中心需系统级协同设计

报告指出,吉瓦级智算中心不是传统数据中心的线性放大,而是从服务器级、机柜级上升至园区级乃至区域级的范式转变。能源、计算、网络等子系统需在规划阶段进行协同设计与联合优化,系统稳定性与全生命周期成本比单点性能更具决定性意义。

冷板式液冷成为高密度散热主流方案

随着单机柜功率密度从传统8-15kW飙升至150kW以上,液冷从可选项变为必选项。报告指出,冷板式液冷系统凭借技术成熟、稳定可靠、成本可控等优势,是目前高功率密度数据中心的首选方案,而浸没式液冷正加速规模化部署,未来将呈现冷板式与浸没式双轨并行的格局。

开放标准与解耦是降低系统风险的关键

报告强调,系统复杂度的提升使封闭、定制化方案难以长期维持,开放接口与标准协同成为降低系统性风险的核心手段。通过开放参考架构、标准化接口(如Redfish、SONiC、UALink等)推动设备互操作性与供应链多样化,降低跨主体协作成本。

高速互连向448Gbps演进,铜光协同长期共存

报告指出,超节点内Scale-up互连正从112Gbps向224Gbps乃至448Gbps演进,铜互连(线缆背板、正交架构)与光互连(NPO/CPO)并行发展。铜互连固守机柜内短距场景,光互连承担跨机柜长距通信,二者优势互补构成高效能智算底座。

AI网络从InfiniBand转向开放以太网生态

报告认为,InfiniBand虽性能极致但封闭昂贵,RoCEv2与Ultra Ethernet(UEC)等开放以太网方案凭借成本、生态与迭代速度优势,正成为大规模AI集群的主流选择。开放解耦的Scale-Out网络(如DDC技术)可打破厂商绑定,实现异构兼容与自主可控。

报告回答的关键问题

吉瓦级智算中心与传统数据中心有何本质区别?

吉瓦级智算中心不是传统数据中心在规模上的线性放大,而是一种系统范式的根本转变。设计尺度从服务器级、机柜级上升至园区级乃至区域级;能源、计算、网络需在规划阶段进行协同设计;在超大规模条件下,可靠性、可维护性与全生命周期成本往往比单点性能更具决定性意义。

智算中心如何实现绿色节能?

报告指出,绿色节能需从架构层面系统推进:采用高压全直流供电(如800VDC)提升效率3%-5%;液冷技术降低PUE至1.05-1.1;源网荷储协同提升绿电消纳比例;余热回收用于园区供暖;智能运维实现预测性散热与负载调度。这些措施共同推动智算中心向零碳转型。

超节点内GPU卡间如何高效互连?

超节点通过Scale-up专用互连协议(如NVLink、UALink、OISA、SUE等)构建全局统一编址空间,实现多GPU显存统一池化,端到端时延降至亚微秒级。物理层采用线缆背板、正交架构或光互连(NPO/CPO),在有限空间内提供高带宽、低时延、高可靠的卡间通信。

液冷技术有哪些主流方案及适用场景?

当前主流液冷方案包括冷板式液冷和浸没式液冷。冷板式液冷通过贴合芯片的冷板循环冷却液散热,兼容性好、技术成熟,是当前高功率密度数据中心的首选方案。浸没式液冷将服务器全浸入绝缘冷却液,散热效率最高,但尚处规模化部署前夜。未来两者将长期并行,分别满足不同功率密度与部署场景。

开放计算标准对智算中心建设有何意义?

开放计算标准(如OCP的ORV3、OAI、Redfish、SONiC等)通过软硬件解耦、接口标准化,降低系统级创新成本,促进供应链多样化,避免厂商锁定。报告强调,吉瓦级智算中心的建设本质是系统工程问题,开放标准与生态协同能有效降低跨主体协作风险,推动中国实践与全球体系双向互通。

报告中的代表性数据

从传统8-15kW飙升至150kW以上,未来可达600kW

单机柜功率密度演进

当前至未来,报告指出,随着英伟达GB300等架构落地,单机柜散热功耗突破150kW,Rubin Ultra全液冷架构可达600kW。这是智算中心从风冷转向液冷的根本驱动力。

从200W跃升至未来3000W

GPU芯片功耗趋势

当前至未来,报告引用英伟达GB300/Rubin等产品路线,单芯片功耗预计从当前200W级别提升至3000W,对液冷系统的热流密度提出极高要求。

单台CDU制冷量已达2MW,未来可达3MW以上

集中式CDU制冷量

当前至未来,报告指出,集中式CDU功率不断增大,当前已有2MW机型,未来将发展至3MW甚至更高,以满足吉瓦级智算中心的高密度散热需求。

以上数据根据报告摘要整理,具体统计口径和数值请以完整报告原文为准。

完整报告包含什么

  • 建筑与空间规划:详细阐述吉瓦级园区的选址要求、场地规划、核心建筑单体设计(层高7.2m、柱网9.6m×6.0m等)、结构荷载标准(楼板活荷载≥16kN/㎡)及六大规划核心原则。
  • 供备电系统:涵盖园区高压供电、中压配电、机房内全直流供电架构(800VDC)、多级储能协同布局(园区-楼宇-机柜三级),以及固态断路器保护策略与智能控制系统。
  • 冷却系统:深度解析冷板式液冷的一次侧/二次侧架构、集中式与分布式CDU设计、控制系统(PLC/DDC、群控逻辑)、换热设备选型要点及未来高密度散热技术(相变液冷、金刚石材料等)。
  • AI超节点设计:包括整机柜超节点(计算节点、机柜、供电、散热、Scale-up互连)和分布式超节点(模组、拓扑、供电、散热),涵盖百度、NVIDIA等实际案例。
  • 高速互连物理层与连接器:从SerDes速率演进(56G→448G)到端接形式(Press-fit/SMT/BGA/LGA),线缆背板、正交架构、NPO/CPO等互连方案,以及高速PCB与Raw Cable选型指南。
  • AI网络与交换系统:交换芯片路线图(12.8T→102.4T)、网络架构(单机直连→二层/三层CLOS→多平面组网)、负载均衡技术(ECMP、LBN、信元交换、端网协同)及未来开放生态(DDC)。
  • 网络与高速互连层协议:Scale-Up协议(NVLink、OISA、SUE、UALink等)对比分析;Scale-Out协议(InfiniBand、RoCEv2、UE)及SONiC网络操作系统;Scale-Across广域互联技术(DALB、端到端拥塞控制、带内遥测)。
  • AI存储技术与系统:高速推理四层存储架构(GPU显存→CPU内存→本地SSD→网络SSD),CPU/内存/NVMe SSD/DPU选型建议,TLC与QLC介质适用场景,以及EBOF/JBOF/Diskless解耦架构。
  • 统一运维管理:基于BMC/Redfish的超节点机柜级与节点级管理,涵盖电源管理、液冷漏液检测、PCIe Switch拓扑管理、GPU与智能网卡监控、日志诊断、告警设置、网络安全(防火墙、SSL证书)及发展趋势。
  • 术语表与参考文献:汇总全报告关键术语(AIDC、CDU、HVDC、PUE、Scale-Up等)及OCP/OCTC相关标准与技术文档索引,便于读者进一步查阅。

本页内容由川海智库整理,用于帮助读者快速了解报告主题、核心观点和主要内容。由于报告量大、人工能力有限,部分观点、数据、统计口径或表述可能存在偏差,具体内容请以完整报告原文为准。

相关报告

“十五五”时期数据资源高效流通利用研究报告——加速分布式存储全闪化,构建高质量AI数据基础设施封面

“十五五”时期数据资源高效流通利用研究报告——加速分布式存储全闪化,构建高质量AI数据基础设施

中国计算机行业协会数据流通利用专业委员会、中国电子工业标准化技术协会数据存储专业委员会、下一代互联网关键技术和评测国家地方联合工程研究中心、中国软件评测中心、北京赛迪认证中心有限公司 · 2025-12-25 · 46 页
查看 →