报告概述

本报告围绕智算集群基础设施的运维体系展开,面向大规模智算集群建设和运营场景,系统梳理了从硬件设备到GPU、集群软件、网络以及训推作业的全栈运维需求。报告提出了一套端到端的运维参考架构,明确分层解耦、可扩展、云原生微服务化等设计原则,并将运维能力划分为硬件管理、GPU运维、智算集群运维、网络运维、作业运维五大关键组件。该文件适用于智算软硬件产品生产商、系统集成商以及第三方测评机构,为其在系统设计、产品制造、运维集成和测评方面提供技术依据和标准化参考。

报告的核心结论

智算集群运维面临多重痛点,亟需统一技术标准

报告指出,随着算力网络建设和超大规模智算集群发展,软硬件协同断层、跨产品运维壁垒、智能运维应用碎片化等问题日益突出。因此,龙蜥社区智算联盟联合多家单位制定通用技术要求,旨在打通软硬件及跨主体运维断点,为集群稳定运行提供标准化建议,推动产业高质量发展。

运维体系应采用分层解耦、可扩展的参考架构

报告定义的参考架构以用户视角设计,强调运维能力按对象分层、组件松耦合、可分可合,既能独立使用,也可组合为统一平台。同时支持云原生微服务化部署,可根据智算项目场景按需组装,实现端到端运维,覆盖智算建设全场景和业务全流程。

GPU运维是保障智算集群可靠性的关键环节

报告围绕GPU建立了覆盖配置管理、驱动管理、指标监控、健康检查、故障自愈、故障诊断和性能压测的完整功能要求。通过采集温度、显存、利用率、功耗、PCIe和P2P互连等指标,并支持自动复位和诊断,可有效降低GPU故障对训练任务的影响,提升集群整体可用性。

网络运维需具备亚健康检测与实时调优能力

针对智算集群特有的RDMA参数面网络,报告要求支持拓扑可视化、配置一致性检查、连通性检测和毫秒级遥测。通过识别网络拥塞、丢包、光模块异常等问题,并可动态调整流量路径,避免拥塞,最大化带宽利用率,从而保障训练业务稳定运行。

作业运维应从业务视角实现跨层联动可观测

报告提出对训推任务进行全路径监控,整合模型、算子、网络及云原生工作负载数据,通过标准化的性能剖析、劣化分析和智能故障诊断,自动定位瓶颈和根因,并提供性能调优建议。这一机制实现了从业务到基础设施的端到端运维,帮助用户快速定位和解决问题。

报告回答的关键问题

智算集群基础设施运维面临哪些主要痛点?

报告指出,随着集群规模扩大,软硬件协同断层、跨产品运维壁垒、智能运维技术应用碎片化、面向AI智能体的算力支撑功能缺失等问题日益突显,制约产业高质量发展。这些痛点正是制定通用技术要求的出发点,也是运维体系需要重点解决的对象。

智算集群运维体系包括哪些关键组件?

报告提出的运维参考架构包含硬件管理、GPU运维、智算集群运维、网络运维和作业运维五大关键组件。硬件管理覆盖服务器、超节点、存储和网络设备;GPU运维聚焦GPU全生命周期;集群运维面向虚拟化与云原生平台;网络运维负责多平面网络;作业运维则从业务视角跨层联动软硬件。

GPU运维需要监控哪些核心指标?

报告要求覆盖温度、显存、计算利用率、功耗、时钟频率、PCIe接口、P2P互联、错误与健康状态、违规节流统计以及容器级指标等。这些指标能够帮助运维人员掌握GPU运行状态,及时预警过温、显存耗尽、总线瓶颈和硬件错误,并为性能调优提供数据基础。

如何对GPU故障进行自愈和诊断?

报告规定,对GPU设备应支持健康检查,并执行复位或节点操作系统复位等自愈动作,可根据故障原因配置。诊断方面支持存在性检测、基本信息收集、硬件连通性检测、PCIe带宽检测、ECC错误检查、内存及压力测试等,并支持批量诊断和诊断级别自定义,帮助快速定位故障根因。

网络运维如何保障RDMA参数面网络稳定?

报告要求网络运维具备拓扑可视化、配置检查、连通性检测和性能压测功能,并支持带内毫秒级遥测,实时识别网络拥塞、丢包和亚健康问题。通过全局流量路径规划和动态调整,可避免拥塞,提高带宽利用率,保障训练作业在RDMA参数面网络上的稳定运行。

完整报告包含什么

  • 智算集群基础设施运维参考架构:报告图文并茂地展示了端到端运维参考架构,详细说明了硬件管理、GPU运维、智算集群运维、网络运维和作业运维五大功能模块的定位,以及分层解耦、可扩展、云原生微服务化的设计原则,为后续功能要求提供框架支撑。
  • 硬件管理功能要求:覆盖通用服务器、AI服务器、超节点、磁阵、分布式存储、网络设备的统一纳管、配置采集、性能监控、告警和日志管理。具体规定了Redfish、IPMI、SNMP、SMI-S、Syslog等接口适配要求,以及批量操作、设备发现、配置导出等能力。
  • GPU运维功能要求:完整定义了GPU配置管理、驱动管理、指标监控、健康检查、故障自愈、故障诊断和性能压测。特别强调了XID故障、ECC错误、PCIe和NVLink等硬件错误的检测,以及驱动容器化管理和多节点批量操作,为GPU全生命周期运维提供标准。
  • 智算集群软件平台运维要求:针对云原生和OpenStack虚拟化环境,规定了Node、Pod、vcjob、StatefulSet、Host、VM等资源对象的监控、性能管理、告警管理和日志管理。包括告警确认、清除、屏蔽、北向上报,以及日志备份、清理和第三方对接等能力。
  • 网络运维功能要求:围绕智算集群管理面、业务面、存储面和RDMA参数面网络,定义了拓扑可视化、网络检测、故障诊断和调优功能。涵盖MTU、PFC/DSCP一致性检查、Fullmesh压测、毫秒级遥测、亚健康检测以及流量路径动态调整等高级能力。
  • 作业运维功能要求:从训推业务视角出发,定义了作业监控、可观测、劣化分析、故障诊断和性能调优功能。要求采用轻量级监控方案,输出结构化日志,并利用Profiler进行全栈性能分析,自动识别作业中断、卡死、性能劣化等状态,给出根因和修复建议。
  • 缩略语与术语表:报告整理了大量智算运维相关缩略语和术语,如Redfish、Telemetry、XID、NVLink、RDMA、CCL、DP/PP/EP等,方便读者理解技术概念和标准内容。
  • 编制背景与参编单位:介绍文件编制的政策背景和产业背景,列出中兴通讯、中国信通院、阿里云、壁仞科技、天数智芯、浪潮、寒武纪、昆仑芯、瀚博半导体等参编单位,以及龙蜥社区智算联盟的组织角色。

本页内容由川海智库整理,用于帮助读者快速了解报告主题、核心观点和主要内容。由于报告量大、人工能力有限,部分观点、数据、统计口径或表述可能存在偏差,具体内容请以完整报告原文为准。

相关报告