报告概述

该白皮书由鹏城实验室与全球计算联盟联合产业界共同编制,系统研究AI时代算力基础设施的系统级架构重构路径。报告以“超节点”为核心研究对象,围绕其定义、架构特征、关键技术、应用场景与产业实践展开论述,提出了从物理层到功能层的总线分层能力框架,并针对智算、通算及通智融合等场景进行了验证分析。报告旨在帮助产业界统一对超节点的认知,为芯片、互联、软件、运维等全链条协同创新提供参考,是理解AI算力演进方向的重要资料。

报告的核心结论

超节点是突破AI算力瓶颈的系统级架构创新

报告指出,面对万亿参数大模型和超长上下文带来的算力需求,单芯片性能提升和传统规模堆叠均难以为继。超节点通过高速互联与统一内存编址,将分散计算单元融合为逻辑一体的超级计算机,为Scaling Law持续演进提供工程底座。它从架构层面解决通信瓶颈与效率衰减问题,是AI基础设施演进的关键方向。

算力竞争正从单点硬件比拼转向系统级工程能力竞争

报告认为,未来2-3年全球AI基础设施竞争主线不再是单一xPU峰值性能的较量,而是以更低功耗、更高可靠性和更低维护成本,将大量xPU高效组织为可交付、可维护、可扩展的超节点系统。整机柜交付、液冷散热、高压供电和智能运维等系统能力,将成为决定产业竞争力的核心要素。

超节点已进入生产应用并呈现多尺度发展态势

报告将超节点发展划分为单机多卡、整机柜、Pod级和集群化四个阶段,并指出整机柜超节点已从概念验证走向生产应用。当前形成了百卡级、千卡级、万卡级多尺度架构体系,分别支撑千亿、万亿、十万亿参数模型,满足从行业本地化到大科学装置的全谱系算力需求。

超节点产业需加快开放化、标准化和生态化进程

报告强调,超节点要从单一产品创新走向广泛产业实践,必须统一概念体系、架构语言、能力分级和测试评价规范。通过全链路分层标准化建设,促进芯片、系统、软件、网络、存储等环节协同创新,使硬件能力可被操作系统、云平台和调度框架稳定发现与治理,从而构建可持续演进的先进计算体系。

报告回答的关键问题

超节点是什么?为什么需要它?

超节点是一种由多个计算节点通过高效互联协议紧密连接,具备跨物理节点统一内存编址能力,逻辑上像一台计算机的计算系统。报告指出,大模型训练推理具有紧耦合、同步并行的特征,传统集群因通信开销和软件协议栈导致扩展效率衰减。超节点通过内存语义访问、超低时延和超大带宽,将分散算力整合为整体,支撑更大模型、更长序列和更低时延。

超节点与传统AI服务器集群有什么不同?

传统集群采用Scale-Out架构,节点间依靠网络报文和软件协议栈通信,数据移动路径包含地址映射、消息组装等开销;超节点则采用Scale-Up架构,建立统一内存地址空间,让处理器可直接Load/Store访问远端内存,硬件直通访存。报告指出,这种架构差异使有效带宽、端到端时延和同步效率存在数倍乃至一个数量级的结构性差距。

超节点技术目前发展到什么阶段?

报告将超节点划分为四个发展阶段:单机多卡、整机柜超节点、Pod级或多机柜超节点、超节点集群化。目前整机柜超节点已进入生产应用,国内已有鹏城云脑Ⅲ等采用超节点架构的国产智算集群落地。未来AI算力的最小采购和交付单位将从单台服务器演变为液冷机柜、Pod和超节点,并向数据中心级拓扑演进。

超节点能带来哪些实际性能提升?

报告通过多个案例展示了收益:在大模型训练中,超节点集群相比传统服务器集群可使未掩盖通信比例降低80%,系统训练性能提升3倍以上;在推理场景,超节点方案在50ms响应约束下单卡性能提升3倍以上;在虚拟化场景,内存售卖率从80%提升到95%,热迁移时间可低至50ms。

报告中的代表性数据

64颗NPU,双向通信带宽超650GB/s,点对点时延1.2微秒以内

鹏城云脑Ⅲ超节点互联性能

报告发布时(2026年),鹏城云脑Ⅲ是国内首个采用超节点架构的国产智算集群,其计算刀片与交换刀片正交盲插,实现高密度低时延互联。该数据反映了超节点在硬件互联层面的实测能力。

MFU达43%,128卡扩展至1024卡扩展效率98.4%

千亿参数模型千卡并行训练效率

报告发布时(2026年),在鹏城云脑Ⅲ上运行的千亿参数模型千卡并行训练中,模型算力利用率达到43%;从128卡扩展到1024卡时扩展效率达98.4%,体现超节点在大规模分布式训练中的高效扩展能力。

未掩盖通信比例降低80%,训练性能提升3倍以上

DeepSeek V3超节点训练性能增益

报告发布时(2026年),在DeepSeek V3训练中,采用PP8/DP64/EP64配置,超节点集群相比传统服务器集群,未掩盖通信比例降低80%;在单NPU裸算力提升2倍的条件下,系统训练性能实现3倍以上提升。

以上数据根据报告摘要整理,具体统计口径和数值请以完整报告原文为准。

完整报告包含什么

  • 完整市场趋势与产业影响分析:报告梳理了超节点从单机多卡、整机柜、Pod级到集群化的发展阶段,并分析了服务器、液冷、电源、网络、运维等产业链环节的机遇与挑战,帮助读者把握算力基础设施的演进方向。
  • 超节点核心定义与技术特征框架:详细阐述超节点作为Scale-Up计算系统的架构特征,包括统一内存编址、内存语义访问、超低时延、超大带宽、多算力协同、规模定义及软硬件协同方法,为产业统一概念认知提供依据。
  • 超节点架构设计与总线分层能力框架:从物理层、数据链路层、网络层、传输层、事务层到功能层,系统讲解互联总线的协议设计、资源管理、内存管理等技术细节,并给出资源和内存管理的实现机制,适合技术人员深入研读。
  • 十大核心应用场景价值分析:覆盖大模型预训练、推理、后训练与强化学习、多模态内容理解与生成、Agentic AI、虚拟化、大数据、数据库、分布式存储和高性能计算等场景,阐述超节点如何提升业务性能与资源利用率。
  • 多尺度超节点与行业实践案例:包含鹏城云脑Ⅲ、华为Atlas 900 A3 SuperPoD等超节点案例,以及云服务商、互联网、运营商等客户的DeepSeek训练推理、搜推广、数据库、分布式存储、OpenClaw智能体等真实应用,提供可参考的落地经验。
  • 未来技术演进方向与标准化建议:探讨多样性算力、存储、高速互联(硅光、LPO/NPO/OIO/CPO)、功耗(兆瓦级机柜)、供电(高压直流)、散热(全液冷)等未来趋势,并提出统一术语、能力分级、跨厂商互操作和测试认证等标准化建设路径。
  • 附录包含全部术语表,整理All2All、MoE、TPOT、TTFT、HBM、RAS等关键术语的全称与含义,并覆盖CPO、LPO、NPO、OCS等光互连概念,方便读者在阅读正文时快速查询,降低技术门槛。

本页内容由川海智库整理,用于帮助读者快速了解报告主题、核心观点和主要内容。由于报告量大、人工能力有限,部分观点、数据、统计口径或表述可能存在偏差,具体内容请以完整报告原文为准。

相关报告