报告概述

本报告围绕AI基础设施从训练向推理成本竞争的结构性转变,深入分析MoE稀疏化趋势下计算效率的重要性,以及CPU在提升整体计算效率中的价值重估。报告重点研究ARM CPU在性能与生态方面的系统性壁垒,通过分析英伟达Vera芯片等案例,论证ARM CPU在AI工厂场景中的关键作用。报告为投资者提供了关于ARM产业链、算力系统优化及国产算力标的的参考。

报告的核心结论

MoE稀疏化推动算力需求转向系统级竞争

报告指出,MoE模型参数迈向万亿规模,训练和推理需依赖多种并行策略,专家并行带来的All-to-All通信使高速互联和通信优化成为影响GPU利用率的关键因素。算力基础设施从单卡性能转向集群级系统能力,包括高速互联、显存管理、通信优化和分布式调度。

CPU在推理时代迎来价值重估

报告认为,推理阶段关键指标已从峰值算力转向单位Token成本、并发吞吐和功耗。传统CPU搬运、GPU推理的分工模式存在协同瓶颈,导致GPU空转和吞吐量受限。CPU可承接长尾和批量推理,提升整体调度效率,典型案例如英伟达Vera芯片。

ARM CPU兼具性能与生态的系统性壁垒

报告强调,ARM在同级别CPU中性能和TCO优势显著,每瓦性能更契合AI数据中心电力受限背景。ARM全球开发者规模超2200万,软件栈和AI框架适配成熟,形成生态迁移门槛。ARM已成为云、边、端全场景覆盖的统一计算底座。

单位Token成本是衡量AI基础设施效率的核心指标

报告引用英伟达数据,指出每百万Token成本综合反映了硬件性能、软件优化、生态支持和实际利用率。例如,Blackwell平台每百万Token成本降至Hopper的1/35,体现了系统级优化的价值。

英伟达Vera芯片体现CPU-GPU协同的设计方向

报告分析Vera CPU基于Arm架构,采用88颗自研Olympus核心,显存带宽提升至1.2TB/s,通过NVLink-C2C实现CPU与GPU统一地址空间,支撑KV缓存卸载等推理优化技术。Vera已成为高效AI工厂的核心数据处理单元。

报告回答的关键问题

MoE稀疏化如何改变算力需求?

MoE稀疏化通过专家并行将模型拆分到多GPU运行,但带来大量All-to-All通信,使算力需求从单卡峰值算力转向集群级系统能力,包括高速互联、显存管理和分布式调度。报告指出,MoE对基础设施的要求已超越GPU本身。

为什么推理时代CPU会迎来价值重估?

推理阶段关键指标变为单位Token成本、并发吞吐和功耗,传统CPU-GPU分工模式存在时序错配和吞吐量瓶颈。CPU可承接工具处理和批量推理,提升整体调度效率,从而降低系统成本。英伟达Vera芯片就是CPU重估的典型案例。

ARM CPU相比x86有哪些核心优势?

ARM CPU在同级别中性能领先,每瓦性能优异,契合AI数据中心电力约束。生态方面,全球开发者超2200万,软件栈适配成熟,架构切换成本高。此外,ARM已获Meta、OpenAI等头部客户支持,并推出专门面向AI的AGI CPU。

单位Token成本为什么重要?

单位Token成本是综合反映AI基础设施真实效率的TCO指标,覆盖硬件性能、软件优化、生态支持和实际利用率。推理已成为数据中心核心工作负载,该指标直接决定AI业务的盈利逻辑,是衡量系统级优化的关键。

英伟达Vera芯片如何提升推理效率?

Vera基于Arm架构,通过NVLink-C2C实现CPU与GPU统一地址空间,支撑KV缓存卸载等优化技术。其88核Olympus芯片、1.2TB/s显存带宽和1.8TB/s互连带宽,有效消除数据传输瓶颈,确保AI工作负载线性扩展,提升数据中心Token营收。

报告中的代表性数据

降为1/35

每百万Token成本降幅

2026年,根据英伟达官网数据,基于DeepSeek-R1模型,NVIDIA Blackwell平台每百万Token成本约为0.12美元,而Hopper平台为4.2美元,Blackwell成本降至Hopper的约1/35。

88核,1.2TB/s

Vera CPU核心数和显存带宽

2026年,英伟达Vera CPU采用88颗自研Olympus核心,显存带宽从Grace的512GB/s提升至1.2TB/s,显存容量从480GB提升至1.5TB。

以上数据根据报告摘要整理,具体统计口径和数值请以完整报告原文为准。

完整报告包含什么

  • 报告详细阐述了MoE稀疏化趋势下的算力基础设施要求,包括专家并行、数据并行等多种并行策略及对高速RDMA网络的依赖。
  • 提供了英伟达Blackwell与Hopper平台在DeepSeek-R1模型上的详细性能对比数据,涵盖GPU成本、每美元FLOPS、Token产出和每百万Token成本。
  • 深入分析佐治亚理工学院论文《A CPU-Centric Perspective on Agentic AI》的实证结果,展示CPU-GPU协同瓶颈的时延、吞吐量和能耗数据。
  • 完整对比英伟达Grace与Vera CPU的规格参数,包括核心数量、缓存、显存带宽、互连接口和机密计算支持等。
  • 详细介绍Arm AGI CPU的三个SKU规格(136C、128C、64C),包括核心数、频率、TDP和内存带宽等指标。
  • 列出英伟达Vera芯片的OLYMPUS核心架构细节,以及第二代可扩展一致性结构(SCF)如何维持高内存带宽。
  • 包含ARM CPU生态图谱,展示其从超大规模云厂商到消费级终端、汽车和工业场景的全覆盖应用案例。
  • 提供投资建议标的(如浪潮信息、海光信息等)及相关风险提示(MoE落地不及预期、推理需求增长放缓等)。

本页内容由川海智库整理,用于帮助读者快速了解报告主题、核心观点和主要内容。由于报告量大、人工能力有限,部分观点、数据、统计口径或表述可能存在偏差,具体内容请以完整报告原文为准。

相关报告