报告概述
本报告聚焦大语言模型在推理阶段的系统级能耗测评,覆盖文本聊天、代码补全和多模态图像问答三类实际场景,选取Gemma 4、Llama 4、Qwen 3.5等八大主流模型,在统一硬件环境下实测每token能耗、GPU利用率、首token延迟、解码速度及系统吞吐等核心指标。报告基于四层闭环评测框架,旨在帮助企业摆脱经验选型,提供科学、可量化的模型×硬件匹配决策依据,推动AI基础设施能效优化。
报告的核心结论
批处理大小是能效的第一驱动力
报告指出,能耗随批处理大小增大单调下降,合理配置并发数对降低推理成本的收益超过模型选型本身。在文本场景下,批处理大小对能耗的影响显著,是优化能效的最直接手段。
同硬件下模型间能耗差距可达3倍以上
在相同的硬件和精度条件下,不同模型的每token能耗差异巨大。例如Qwen3.5-397B与Llama4-Maverick在相同配置下能耗差距超过3倍,说明模型架构对能效的影响不容忽视。
MoE配合低比特量化能效优势显著
以gpt-oss-120B为代表的MoE架构结合FP8低精度量化,在能效和吞吐之间取得了最佳平衡。这种组合在文本代码场景均表现出色,为绿色AI部署提供了可行路径。
推理引擎对能效的影响可能超过模型架构本身
同一模型切换推理引擎(如从vLLM换为SGLang)后,能耗可降低78%,吞吐提升5.7倍。报告强调能效评测需区分模型自身能效与当前框架适配下的实测能效,引擎优化至关重要。
报告回答的关键问题
大语言模型推理能耗如何测量?
报告采用系统级实测方法,在统一硬件(8×NVIDIA GPU)上使用vLLM等推理引擎,通过Zeus能耗测量库和Prometheus观测运行时,精确计算每token消耗焦耳量。同时引入高精度硬件测量方案,实现Token级瞬态能量特征捕捉,消除软件读数偏差。
如何选择低能耗的大语言模型?
报告建议优先考虑MoE架构配合低比特量化的模型,如gpt-oss-120B;在文本聊天场景中,Gemma4-31B在TP=2、BS=128配置下能耗最低。同时需结合场景选择:代码场景MiniMax-M2.7吞吐登顶,多模态场景Llama4-Maverick表现均衡。
推理引擎对能耗和性能影响有多大?
影响巨大。以DeepSeek-V4为例,从vLLM切换到SGLang后,能耗从4.43 J/tok降至0.97 J/tok(下降78%),吞吐提升5.7倍。报告指出,模型架构创新必须与推理框架协同,当前框架适配程度直接决定实测能效。
MoE模型在能效上有什么优势?
MoE架构通过稀疏激活只使用部分参数,配合低比特量化(如FP8)能大幅降低每token能耗。报告显示,以gpt-oss-120B为代表的MoE模型在能效和吞吐之间取得最佳平衡,在代码场景能效最高达0.535 J/tok,远超同等规模的密集模型。
报告中的代表性数据
文本场景最低每token能耗
测评期间,Gemma4-31B在TP=2、BS=128配置下取得全场最低能耗,是文本聊天场景能效最优模型。
换推理引擎后能耗降幅
文本场景,BS=128,DeepSeek-V4从vLLM引擎切换至SGLang后,每token能耗从4.43 J/tok降至0.97 J/tok,同时吞吐提升5.7倍,TPOT降低85%。
代码场景最高吞吐
测评期间,MiniMax-M2.7 REAP在TP=8、BS=256配置下达到代码场景吞吐峰值,同时能耗为0.86 J/tok。
以上数据根据报告摘要整理,具体统计口径和数值请以完整报告原文为准。
完整报告包含什么
- 详尽的测试方法说明:包括统一硬件环境、软件栈版本、vLLM和SGLang等推理引擎的配置细节,以及从模型下载到结果产出的标准化8步流程。
- 八大主流模型的完整能耗、延迟、吞吐数据表格:展示每模型在文本、代码、多模态场景下不同批处理大小和Tensor并行度的实测结果,便于横向对比。
- GPU利用率与能耗关系的深入分析:揭示高利用率不等于高能效的结论,并提供各模型在不同场景下的利用率分布曲线。
- 推理引擎对比专题:以DeepSeek-V4为例,详细展示vLLM与SGLang在吞吐、能耗、TPOT等指标上的差异,并解释框架适配成熟度的影响。
- 生产环境选型推荐表:针对文本、代码、多模态场景,分别给出能效优先和吞吐优先的推荐模型及配置(TP和BS),并附理由。
- 高精度能耗测量硬件方案介绍:包括1kHz物理采样、Token级瞬态能量特征捕捉、在RK3588边缘节点上的概念验证,以及未来对亚毫秒级DVFS的支持。
- 局限与未来展望:指出当前能耗监测依赖NVML接口的不足,展望可量化选型依据、绿色算力调度和能效系统优化三大方向。
- 编制团队与致谢:详细列出联合牵头单位和协作组织,包括清华大学相关实验室、Linux基金会和SODA基金会。
本页内容由川海智库整理,用于帮助读者快速了解报告主题、核心观点和主要内容。由于报告量大、人工能力有限,部分观点、数据、统计口径或表述可能存在偏差,具体内容请以完整报告原文为准。





