报告概述
本报告聚焦SRAM(静态随机存取存储器)作为片上高带宽存储层在AI推理中的核心作用。报告介绍了存储分级体系,分析了SRAM相比HBM、DRAM在访问时延和带宽确定性上的优势,并通过Groq的LPU芯片和Cerebras的晶圆级引擎WSE-3两个典型案例,展示了SRAM架构如何显著提升大模型推理速度。此外,报告还梳理了英伟达、OpenAI等巨头在SRAM领域的最新布局,为投资者梳理AI记忆产业链的投资逻辑。
报告的核心结论
SRAM可显著提升AI推理速度与稳定性
SRAM集成在CPU/GPU计算核心附近,提供纳秒级访问时延和确定性带宽。对比依赖外置HBM的传统方案,SRAM能大幅降低权重与激活数据的访存延迟与抖动,改善Time-to-First-Token与尾时延表现。Groq LPU在Llama3.3 70B模型上实现275-276 token/s稳定输出,Cerebras WSE-3在120B模型上输出速度超3000 token/s,均远超主流GPU云推理。
SRAM架构获英伟达和OpenAI等巨头的重金投入
2025年12月,英伟达斥资200亿美元获得Groq LPU知识产权非独家授权并引入其工程团队。2026年2月,Cerebras完成10亿美元F轮融资,OpenAI与其签署100亿美元合同部署定制AI芯片,并首个在Cerebras加速器上推出GPT-5.3-Codex-Spark模型。这表明SRAM架构已从初创公司技术进入主流视野,成为AI算力竞争的关键方向。
AI记忆基础设施的价值量将持续提升
随着AI Agent等应用加速落地,模型能力边界不断扩展,对记忆能力(包括存储带宽、容量和访问速度)的需求日益增长。SRAM作为片上高带宽存储层,其重要性将随之提升,上游基础设施相关标的有望持续受益。报告建议关注产业链核心受益公司。
报告回答的关键问题
SRAM如何提升AI推理速度?
SRAM集成在计算核心附近,提供纳秒级访问延迟和高达数十TB/s甚至PB/s的片上带宽,远高于外置HBM的数TB/s带宽。这使得大模型推理时权重和激活数据的读取延迟极低且确定性高,从而显著提升Token输出速度和降低响应延迟。例如Groq LPU在Llama3.3 70B上实现275-276 token/s的稳定输出。
Groq和Cerebras的SRAM芯片性能有多强?
Groq的LPU单芯片集成约230MB片上SRAM,存储带宽达80 TB/s;Cerebras的WSE-3芯片集成44GB SRAM,片上带宽达21 PB/s。在推理任务中,Cerebras在OpenAI GPT OSS 120B模型上输出速度超3000 tokens/s,较主流GPU云推理快约15倍。Groq在多种上下文长度下均保持稳定推理速度。
英伟达为何斥资200亿美元获取Groq的IP授权?
英伟达看中Groq的LPU架构及其软件库在AI推理中的独特优势。SRAM架构能提供确定性的低延迟和高吞吐,补充英伟达现有GPU方案在推理场景的不足。通过获得非独家授权并引入工程团队,英伟达可快速整合SRAM技术,强化其在AI推理芯片市场的竞争力。
报告中的代表性数据
Groq LPU芯片存储带宽
2025年12月,据Groq官网,其LPU单芯片内集成约230MB片上SRAM,存储带宽高达80 TB/s,对比GPU片外HBM的内存带宽约为8 TB/s。
Cerebras WSE-3芯片片上存储带宽
2025年,据Cerebras官网,其晶圆级引擎3(WSE-3)芯片集成44GB SRAM,片上存储带宽达21 PB/s。
Cerebras在GPT OSS 120B推理输出速度
2025年,据Cerebras官网,其在OpenAI GPT OSS 120B推理任务中实现>3000 tokens/s的输出速度,较主流GPU云推理快约15×。
以上数据根据报告摘要整理,具体统计口径和数值请以完整报告原文为准。
完整报告包含什么
- 多级存储架构示意图,展示SRAM、HBM、DRAM、SSD的分层结构及性能差异。
- Groq LPU芯片架构示意图及Rack实物图,帮助理解芯片内部数据流。
- Groq LPU在不同上下文长度下推理速度的基准测试图表(基于Llama3.3 70B模型)。
- Cerebras晶圆级引擎3(WSE-3)示意图及性能对比图表,包括速度、延迟和性价比提升数据。
- 英伟达与Groq签订非独家授权协议的详细分析,包括交易金额200亿美元及知识产权利范围。
- OpenAI与Cerebras合作细节:100亿美元合同、750兆瓦部署规模及GPT-5.3-Codex-Spark模型性能数据。
- 投资建议部分:重点推荐的核心受益标的列表及估值分析表。
- 风险提示:包括AI产业发展不及预期、AI服务器出货量不及预期、国产厂商进展不及预期等三大风险因素。
本页内容由川海智库整理,用于帮助读者快速了解报告主题、核心观点和主要内容。由于报告量大、人工能力有限,部分观点、数据、统计口径或表述可能存在偏差,具体内容请以完整报告原文为准。





