报告概述
本报告详细介绍了DeepSeek-V4系列大语言模型的预览版本,包括DeepSeek-V4-Pro(1.6T参数,49B激活)和DeepSeek-V4-Flash(284B参数,13B激活)。报告聚焦于突破百万级Token长上下文处理的效率瓶颈。通过设计混合注意力架构(压缩稀疏注意力和重度压缩注意力)、引入流形约束超连接(mHC)以及采用Muon优化器,DeepSeek-V4在长序列场景下实现了显著的效率提升。报告涵盖了模型架构、基础设施优化、预训练设置、后训练流程(包括专家训练和在线蒸馏)以及全面的评估结果。读者可以通过本报告了解如何通过架构创新和工程优化使百万Token上下文成为现实,并为未来的测试时缩放和长周期任务奠定基础。
报告的核心结论
混合注意力架构实现百万Token上下文高效处理
DeepSeek-V4系列采用压缩稀疏注意力(CSA)和重度压缩注意力(HCA)的混合设计,大幅降低了长上下文场景下的计算FLOPs和KV缓存大小。在1M Token上下文中,DeepSeek-V4-Pro仅需DeepSeek-V3.2约27%的单Token推理FLOPs和10%的KV缓存,使百万级上下文支持成为常规能力。
MoE架构与Muon优化器加速训练收敛
报告继续采用DeepSeekMoE专家混合架构,并全面引入Muon优化器替代AdamW用于大部分参数更新。Muon优化器通过正交化更新方向,显著加快了训练收敛速度并提升了稳定性,同时结合混合牛顿-舒尔茨迭代等技术,有效抑制了训练过程中的损失尖峰问题。
后训练采用在线蒸馏整合多领域专家能力
DeepSeek-V4的后训练采用两阶段范式:先独立训练数学、编程、智能体和指令遵循等领域的专家模型,再通过在线蒸馏(OPD)将多个教师模型的知识融合为统一的推理模型。这一方法避免了传统权重合并的性能损失,使单一模型在多个维度达到顶尖水平。
DeepSeek-V4-Pro-Max在知识推理上接近前沿闭源模型
最大推理努力模式DeepSeek-V4-Pro-Max在SimpleQA等知识基准上大幅领先所有开源模型,在推理任务上媲美GPT-5.4和Gemini-3.1-Pro,并在编程竞赛中首次达到与GPT-5.4相当的水平。在百万Token上下文中,其检索性能优于Gemini-3.1-Pro,整体性能差距闭源前沿模型约3-6个月。
报告回答的关键问题
如何让大语言模型高效处理百万Token上下文?
DeepSeek-V4通过设计混合注意力架构——压缩稀疏注意力(CSA)和重度压缩注意力(HCA)——解决了长上下文的效率瓶颈。CSA先将每m个Token压缩为一个KV条目,再通过闪电索引器选择top-k压缩条目进行稀疏注意力;HCA则采用更激进的压缩(m'≫m)并保留密集注意力。这种设计使1M Token上下文推理FLOPs降至DeepSeek-V3.2的27%,KV缓存仅为其10%。
MoE模型训练稳定性差,DeepSeek-V4如何解决?
DeepSeek-V4引入了两种技术:一是前瞻路由,通过解耦网络参数和路由网络的更新时机,在损失尖峰出现前自动启用该机制,待稳定后恢复;二是SwiGLU钳位,将线性组件限制在[-10,10]区间并将门控组件上限设为10,有效抑制MoE层中的异常值。动态触发机制使额外开销控制在20%以内,且不影响模型性能。
DeepSeek-V4的QAT(量化感知训练)如何实现无损压缩?
DeepSeek-V4在后训练阶段引入FP4量化感知训练,应用于MoE专家权重和CSA索引器的QK路径。FP4到FP8的反量化是无损的,因为FP8(E4M3)比FP4(E2M1)多2个指数位,动态范围更大,当前权重的子块缩放因子比例未超过阈值,因此可被FP8完全吸收。在推理和强化学习采样阶段直接使用FP4权重,实现实际加速和内存节省。
DeepSeek-V4的后训练流程与V3有何不同?
DeepSeek-V4的后训练用在线蒸馏(OPD)替换了DeepSeek-V3的混合强化学习阶段。具体分为两步:先针对数学、代码、智能体等各领域独立训练专家模型(通过SFT+GRPO),再将多个教师模型的知识通过全词汇反向KL蒸馏合并为一个统一模型。OPD使用更稳定的全词汇logit损失,并配备高效的教师调度和隐藏状态缓存机制,支持十多个万亿参数教师模型。
报告中的代表性数据
单Token推理FLOPs对比(1M上下文)
1M token context,在1M Token上下文下,DeepSeek-V4-Pro的单Token推理FLOPs仅相当于DeepSeek-V3.2的27%(以等效FP8 FLOPs计),体现了混合注意力的效率优势。
KV缓存大小对比(1M上下文)
1M token context,在1M Token上下文中,DeepSeek-V4-Pro的累积KV缓存大小仅为DeepSeek-V3.2的10%,极大降低了显存占用。DeepSeek-V4-Flash更可降至7%。
DeepSeek-V4-Pro-Max SimpleQA-Verified得分
未明确,DeepSeek-V4-Pro-Max在SimpleQA-Verified(事实性知识基准)上取得57.9% Pass@1,大幅超越所有开源模型(第二名为Kimi K2.6的36.9%),但落后于闭源模型Gemini-3.1-Pro(75.6%)。
以上数据根据报告摘要整理,具体统计口径和数值请以完整报告原文为准。
完整报告包含什么
- 详细阐述混合注意力架构(CSA和HCA)的数学公式、压缩策略和稀疏选择机制,包括闪电索引器、共享键值MQA和分组输出投影。
- 完整介绍DeepSeekMoE架构的调整,包括激活函数变更、辅助无损失均衡策略和哈希路由在浅层MoE层的应用。
- 流形约束超连接(mHC)的理论推导与实现细节,包括Sinkhorn-Knopp算法将残差映射约束为双随机矩阵,确保信号传播稳定性。
- 训推基础设施的深度优化:细粒度专家并行中的通信-计算融合内核(MegaMoE)、基于TileLang的算子开发、批不变性和确定性内核库,以及FP4量化感知训练的实现。
- 预训练数据构建策略、训练超参数设置(学习率调度、批量大小、序列长度扩展)及应对训练不稳定的前瞻路由与SwiGLU钳位技术。
- 后训练流水线的完整描述:四领域专家(数学、编程、智能体、指令遵循)的独立SFT+GRPO训练,以及多教师在线蒸馏(OPD)的工程实现(教师调度、隐藏状态缓存、全词汇KL计算)。
- 推理框架的优化:异构KV缓存管理,包括状态缓存(用于滑动窗口和未就绪压缩令牌)和基于磁盘的KV缓存存储策略(全缓存、周期性检查点、零缓存三种模式)。
- 大规模评估结果:涵盖知识、推理、编程、智能体、长上下文等维度的数十项基准,包括HLE、Codeforces、SWE-bench、MRCR 1M等,并附带与Claude、GPT、Gemini等模型的详细对比表。
- 现实世界任务性能:中文写作(功能写作和创意写作对比Gemini-3.1-Pro)、搜索增强问答(RAG vs Agentic Search)、白领任务(30项高级职业任务人工评估)和内部研发代码基准(67% Pass率对比Claude)。
本页内容由川海智库整理,用于帮助读者快速了解报告主题、核心观点和主要内容。由于报告量大、人工能力有限,部分观点、数据、统计口径或表述可能存在偏差,具体内容请以完整报告原文为准。





