报告概述

本报告聚焦LPU(语言处理单元)这一面向大模型推理阶段的新型芯片架构,深入解析其核心TSP架构如何通过拆散处理器流水线、实现指令执行确定性和软件定义硬件,从而突破传统芯片的内存带宽瓶颈,显著降低推理延迟。报告覆盖LPU的技术原理、与大模型推理性能的关系、产品量产进展及市场空间,为投资者理解AI推理芯片技术路线提供参考。

报告的核心结论

LPU通过TSP架构实现确定性执行,突破推理延迟瓶颈

LPU核心采用TSP架构,将经典处理器五级流水线拆散至整个芯片,指令垂直下发、数据水平流动,消除了硬件非确定性行为,使编译器能精确调度指令,从而大幅降低大模型推理Decode阶段的延迟。

LPU采用SRAM替代HBM,提供更高内存带宽

LPU集成了230MB片上SRAM,提供约80TB/s的理论带宽,远高于传统HBM方案,解决了大模型推理Decode阶段的内存带宽瓶颈,实现极低的首Token生成时延和高吞吐量。

LPU已步入量产初期,市场空间广阔

随着Tokens消耗量爆发式增长(2024年初日均1000亿增至2026年2月180万亿级别),推理芯片需求激增。LPU凭借低延迟和性价比优势,有望在推理芯片市场中快速渗透,全球推理AI芯片市场规模预计2031年达690.1亿美元。

国内元川微已推出LPU产品,产业链机会显现

国内企业元川微作为LPU架构先行者,已推出Mountain和River系列LPU+产品,聚焦端边侧智能场景。报告建议关注参股元川微的智微智能、星宸科技以及英伟达PCB供应商等在LPU产业链中的机会。

报告回答的关键问题

LPU如何降低大模型推理延迟?

LPU通过TSP架构将处理器流水线拆散,实现指令执行顺序和时间的确定性,消除传统芯片的缓存、乱序执行等不确定性行为。同时采用SRAM作为存储介质,提供约80TB/s的片上内存带宽,远高于HBM,从而大幅缩短大模型推理Decode阶段的逐个Token生成时间,降低端到端延迟。

LPU与GPU在大模型推理时有什么区别?

GPU依赖HBM内存,在Decode阶段受限于内存带宽,延迟较高;LPU采用SRAM和静态调度,内存带宽更高且时延确定,首Token生成延迟极低。但在多用户高并发吞吐量场景下,GPU仍具优势。LPU更适合单用户实时交互场景,如对话应用。

LPU的市场前景如何?

报告显示,全球推理AI芯片市场规模2024年约142.1亿美元,预计2031年达690.1亿美元,CAGR为25.7%。LPU在能效比、性价比和时延方面优于GPU,有望成为推理市场主导技术路线。目前Groq已与英伟达签订技术许可协议,第二代LPU步入量产初期,国内元川微也已推出产品,市场空间广阔。

报告中的代表性数据

2024年初1000亿 -> 2026年2月180万亿

中国日均Token消耗量

2024年初至2026年2月,据国家数据局及报告数据,中国日均Token消耗量从2024年初的1000亿增长至2026年2月主流大模型合计约180万亿级别,增长超千倍,驱动推理芯片需求爆发。

142.1亿美元(2024年) -> 690.1亿美元(2031年)

全球推理AI芯片市场规模

2024年至2031年,据QYResearch,2024年全球推理AI芯片市场规模约142.1亿美元,预计2031年达690.1亿美元,2025-2031年CAGR为25.7%。

以上数据根据报告摘要整理,具体统计口径和数值请以完整报告原文为准。

完整报告包含什么

  • 详细阐述LPU的核心TSP架构,包括五大功能切片(MXM、SXM、MEM、VXM、ICU)的物理布局与数据流,以及与传统多核处理器的对比。
  • 深入分析大模型推理的Prefill和Decode两个阶段,解释延迟产生机制,并给出TTFT、TPOT、吞吐量等性能指标的详细定义与计算公式。
  • LPU与NVIDIA B200(Blackwell)的详细对比表,涵盖核心存储技术、理论带宽、推理延迟、系统能效等关键参数。
  • 完整的LPU量产进展时间线,包括Groq第一代14nm LPU已量产,第二代三星4nm LPU于2025年全面量产,以及2026年产能提升至1.5万片晶圆等信息。
  • 国内LPU产业链分析,重点介绍元川微的Mountain和River系列产品,并梳理参股或关联公司(智微智能、星宸科技)的投资逻辑。
  • 投资建议部分,给出重点公司(沪电股份、胜宏科技、深南电路等)的盈利预测、EPS、PE及投资评级,并附有财务报表分析。
  • 风格提示部分,明确说明AI技术迭代、大模型发展、LPU行业发展不及预期等风险因素。

本页内容由川海智库整理,用于帮助读者快速了解报告主题、核心观点和主要内容。由于报告量大、人工能力有限,部分观点、数据、统计口径或表述可能存在偏差,具体内容请以完整报告原文为准。

相关报告