大语言模型系统级单位token能耗测评

清华大学电机工程与应用电子技术系信息能源实验室、清华四川能源互联网研究院信息能源与绿色智算技术研究所、新型电力系统运行与控制全国重点实验室电化学储能高效集成与控制团队联合编制,Linux基金会研究部门和SODA基金会提供支持2026-07-2318

报告概述

本报告聚焦大语言模型在推理阶段的系统级能耗测评,覆盖文本聊天、代码补全、多模态图像问答三类实际场景,对Gemma4、Llama4、DeepSeek-V4等八大主流模型进行硬件实测。报告构建了以能耗为核心、兼顾吞吐和延迟的五项指标体系,采用统一测试环境与流程,旨在为企业和智算中心提供数据驱动的模型×硬件匹配决策,推动AI从能力竞赛走向能效系统优化。

报告的核心结论

能效正成为大模型部署的关键瓶颈

报告指出,2025年全球数据中心用电激增17%,推理已占机器学习计算80-90%需求。每百万token推理电费可达1.4元,占API定价的7%-28%,未来竞争不仅是模型能力,更是能效与可持续的竞争。

批处理大小是影响能效的首要因素

实验显示,能耗随批处理大小增大而单调下降,合理配置并发数对降低推理成本的收益超过模型选型本身。同一硬件下,不同模型能耗差距可达3倍以上,MoE+低比特量化路线能效优势显著。

推理引擎对能效的影响可能超过模型架构

以DeepSeek-V4为例,同一模型更换推理引擎(从vLLM换为SGLang)后,文本场景能耗降低78%,吞吐提升5.7倍。提示能效评测需区分模型自身能效与当前框架适配下的实测能效。

高GPU利用率不一定带来高能效

报告发现,gpt-oss-120b等模型GPU利用率较低但能效表现优异,而Mistral-Medium-3.5利用率高但能效差。能耗与GPU利用率之间存在一定负相关性,选型需综合考量。

报告回答的关键问题

大语言模型推理时每token消耗多少电?

不同模型和配置下差异巨大。报告以Gemma4-31B在文本场景为例,最优配置下每token仅消耗0.348焦耳;而Qwen3.5-397B在相同硬件下能耗达1.07焦耳,差距超过3倍。具体能耗取决于模型架构、量化精度、批处理大小和推理引擎。

如何为大模型推理选择高效的硬件配置?

报告建议:文本聊天场景选择TP=2/4、BS=64/128的配置区间,可实现能耗、延迟、利用率三者均衡。过度分卡会因通信开销拖累效率,例如31B参数模型在8卡上时,TP=4以上收益有限。选型应遵循“场景负载决定能耗基线”的原则。

MoE架构相比Dense模型在能效上有什么优势?

以gpt-oss-120B为代表的MoE模型配合FP8低精度量化,在能效和吞吐之间取得了最佳平衡。文本场景下其能耗仅0.373 J/tok,吞吐达4013 tok/s。相比之下,同硬件的Dense模型如Mistral-Medium-3.5能耗高达0.82 J/tok,MoE配合低比特是当前能效最优路线。

报告中的代表性数据

0.348 J/tok

文本场景最低能耗

报告测试期间,Gemma4-31B在文本聊天场景下,TP=2、BS=128配置时测得每token消耗0.348焦耳,为全场最低。

以上数据根据报告摘要整理,具体统计口径和数值请以完整报告原文为准。

完整报告包含什么

  • 完整的大语言模型系统级能耗测评方法论,包括测试场景(文本、代码、多模态)的详细定义与数据来源。
  • 八大主流模型(Gemma4、Llama4、DeepSeek-V4等)在统一硬件(8×NVIDIA)和软件栈下的实测数据,涵盖能耗、GPU利用率、TTFT、TPOT、Throughput五项指标。
  • 不同批处理大小、张量并行度对能效影响的深度分析,揭示能耗-延迟权衡曲线与配置甜点区间。
  • 跨模型、跨场景的能耗对比图表,展示相同硬件下模型间能耗差距可达3倍以上的实证数据。
  • 推理引擎对比(vLLM vs SGLang)对能效与吞吐的显著影响,验证框架适配的重要性。
  • 从能效到电费的映射计算模型,包含数据中心PUE和电价参数,帮助读者估算实际运营成本。
  • 按业务场景(文本/代码/图像)划分的推荐配置表,包括推荐模型、TP/BS参数、能耗和吞吐数据。
  • 高精度硬件能耗测量方案:1kHz物理采样、Token级瞬态能量捕捉技术及RK3588验证平台介绍。
  • 现有能耗监测的局限性分析(低频采样、软件读数误差等)及未来价值展望(亚毫秒级DVFS、通信能耗墙定位)。

本页内容由川海智库整理,用于帮助读者快速了解报告主题、核心观点和主要内容。由于报告量大、人工能力有限,部分观点、数据、统计口径或表述可能存在偏差,具体内容请以完整报告原文为准。

相关报告

大语言模型系统级单位token能耗测评封面

大语言模型系统级单位token能耗测评

清华大学电机工程与应用电子技术系信息能源实验室、清华四川能源互联网研究院信息能源与绿色智算技术研究所、新型电力系统运行与控制全国重点实验室电化学储能高效集成与控制团队联合牵头,Linux基金会研究部门和SODA基金会提供支持 · 2026-07-24 · 18 页
查看 →