报告概述
本报告是Bernstein此前发布的AI token经济学入门报告的补充。作者根据中国顶级AI实验室的反馈,更新了H1 2026年的推理利润率模型估计。核心调整包括全面上调每秒token吞吐量假设,并新增商业折扣变量。报告应用该模型分析了Minimax、Z.ai等头部厂商的推理利润率,并对新发布的DeepSeek V4和腾讯hy3-preview模型进行了初步评估。报告旨在为投资者提供更贴近实际的数据和框架,以理解中国AI推理的经济性和竞争格局。
报告的核心结论
Z.ai与Minimax推理利润率差距小于此前估计
更新后的模型显示,Minimax M2.7实现40%文本/编码推理利润率的指引,要求其数据中心级TPS约为Z.ai GLM-5/5.1的4.5-5.0倍,而非此前假设的4倍。第三方基准测试(Lambda Labs)支持了更高的TPS假设,使得两家推理利润率差距缩小,但报告仍认为Z.ai在可比折扣下利润率更高。
GPU吞吐量是推理利润率的核心驱动因素
报告指出,通过量化、预填充-解码分离等软硬件优化技术,可以显著提升每GPU每秒处理的token数(TPS),从而降低推理成本、提高利润率。Minimax的高TPS部分来自其较小参数规模的内置优化,而Z.ai的更大模型也需要更高TPS才能维持竞争力。这一变量对利润率的影响比GPU成本更为显著。
DeepSeek V4使中国保持全球领先水平,但国内竞争加剧
DeepSeek V4在发布时接近数月前的全球顶尖水平,且成本显著更低。V4-Pro定价与GLM-5.1等国内模型相当,但发布24小时内即对国内用户推出75%限时折扣,凸显用户获取策略的激进。V4-Flash定价处于同类轻量模型的下限,强化了报告对低端模型价格竞争将依然激烈的判断。
报告回答的关键问题
商业折扣如何影响中国AI推理利润率?
报告新增了商业折扣变量,认为客户结构和折扣力度显著影响每token收入。假设平均折扣从0%提升至20%,会直接压低推理利润率,但不同厂商影响程度不同。大型企业客户折扣通常高于中小开发者,且限时促销需动态看待。报告敏感性分析显示,在相同TPS下,折扣每增加2.5个百分点,利润率下降约2-4个百分点。
多模态推理的利润率是否高于文本/编码?
是的。Minimax确认其多模态工作负载(如视频生成、语音合成)的毛利率高于文本/编码推理。这是因为GPU计算成本相同,但多模态token定价更高(例如视频生成每个token收入可达文本的数倍)。不过文本/编码工作负载在2026年至今贡献了更大的增量增长,主要受OpenClaw和智能体AI热潮推动。
腾讯hy3-preview模型的竞争力如何?
报告认为hy3-preview是“姗姗来迟的向好一步”,表现符合温和预期,但缺乏“惊喜因素”。其定价接近同类轻量模型的下限。真正的考验在于腾讯是否能够通过重建AI数据和基础设施组织,加快内部模型迭代,并在未来推出自己的“Muse Spark时刻”(如更大参数的模型)。目前投资者对腾讯AI的关注过于狭隘。
报告中的代表性数据
Minimax M2.7推理利润率指引
H1 2026,Minimax管理层估计其M2.7模型的文本/编码推理毛利率约为40%。报告据此反推,需要M2.7的TPS达到GLM-5/5.1的4.5-5.0倍才能实现。
Lambda.ai基准测试:M2.5 vs GLM-5每GPU吞吐量
2026,Lambda.ai部署级测试显示,M2.5在2x B200 GPU上总TPS为8,062 tok/s,而GLM-5在1x HGX B200 (8 GPU)上为6,300 tok/s。折算每GPU,M2.5吞吐量约为GLM-5的5.1倍,部分支持了Minimax的高TPS主张。
以上数据根据报告摘要整理,具体统计口径和数值请以完整报告原文为准。
完整报告包含什么
- 详细的AI token经济学模型框架,包括收入、成本、利润率计算公式及各变量定义(如Rev/Mtok、KV缓存命中率、商业折扣等)。
- 更新后H1 2026年Z.ai(GLM-4.5至GLM-5.1)和Minimax(M2.5、M2.7)的推理利润率估算对比表。
- GPT成本每小时的估算方法及合理性讨论($1.6/GPU/hr)。
- 敏感性分析:展示不同TPS吞吐量和商业折扣组合下的推理利润率变化(含多张热力图)。
- DeepSeek V4-Pro和V4-Flash与国内同行(如GLM-5、Qwen3.6 Max、Kimi K2.6等)的token定价对比图表。
- 腾讯hy3-preview及其他轻量模型定价对比分析。
- 对DeepSeek V4技术特点的初步观察,包括推理FLOPs、KV缓存节省等。
- 腾讯AI进展的讨论:HY-World 2.0模型、WeChat智能体功能、广告业务AI应用等。
- 覆盖的亚洲互联网公司(腾讯、阿里、PDD、美团等)的估值比较表(PE、EV/Sales)。
- 分析师的资质声明、评级定义、风险提示及法律披露。
本页内容由川海智库整理,用于帮助读者快速了解报告主题、核心观点和主要内容。由于报告量大、人工能力有限,部分观点、数据、统计口径或表述可能存在偏差,具体内容请以完整报告原文为准。
相关报告

China Internet: One small step for two AI labs... thoughts on strategy, competition, and the path to profits

Navigating China Internet / AI Models

DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence

计算机行业AI模型系列(三)DeepSeek V4和Kimi K2.6:性能跃升,国产算力适配加快

DeepSeek-V4 强化国产算力适配
