2412.19437-deepseek-v3-technical-report

DeepSeek V3 Technical Report

DeepSeek-V3 用 MLA (Multi-head Latent Attention,多头潜变量注意力)DeepSeekMoE、无辅助损失负载均衡、MTP (Multi-Token Prediction,多 token 预测)、FP8 混合精度训练和 DualPipe 通信重叠,把 671B total / 37B active 的开放 MoE (Mixture-of-Experts,混合专家) 模型训练到强代码、数学和通用能力,并成为 DeepSeek-R1 reasoning RL 与后续 DeepSeek-V4 长上下文系统的基础节点。

Authors Wenfeng Liang (梁文锋), Peiyi Wang, Runxin Xu (许润昕), Zhihong Shao (邵智宏), Damai Dai, Deli Chen (陈德里), Yu Wu (吴俣)

已审阅 Archived 2026-06-23 18:26 Updated 2026-06-24 21:10 Reviewed 2026-07-18 17:42 Source

Source

作者与关系

  • DeepSeek-AI: 组织级技术报告;appendix 按 Research & Engineering、Data Annotation、Business & Compliance 分组。
  • Wenfeng Liang: DeepSeek AI.
  • 作者列表规则:每组内按 first name 字母序排列,* 标记已离队成员。

阅读目标与判断边界

归档关注:

  1. V3 如何在 V2 的 MLA / DeepSeekMoE 基础上扩大规模。
  2. auxiliary-loss-free load balancing、MTP、FP8 和 DualPipe 分别解决哪一层瓶颈。
  3. V3 与 R1、V4、GLM、Qwen、MiniMax、Muon 的关系。
  4. 训练成本、benchmark 和 ablation 的证据边界。

判断边界:

  • 成本表排除前期研究和消融成本。
  • FP8 对照主要在 proxy scale 上完成,缺少完整 671B BF16 对照。
  • Chat model 与闭源 API 的比较受模型版本、prompt、采样和输出长度影响。

术语预备

  • FP8: 8-bit floating point;V3 使用 fine-grained quantization 降低训练成本。
  • DualPipe: DeepSeek 设计的双向 pipeline overlap 方案,用于隐藏 pipeline bubble 和 MoE all-to-all 通信。
  • SFT (Supervised Fine-Tuning,监督微调): 用 instruction data 微调模型。
  • RM (Reward Model,奖励模型): 给 responses / trajectories 打分的模型或规则系统。
  • GRPO (Group Relative Policy Optimization,组相对策略优化): 使用 group-relative reward baseline 的 critic-free RL 方法。
  • CoT (Chain-of-Thought,思维链): 模型显式生成的中间推理过程。

论文脉络

1. 研究问题、背景和价值

DeepSeek-V3 要解决的是如何以可控成本训练开放权重前沿模型。Dense 405B 级别模型训练和推理成本高,传统 MoE 又面临 expert load balance、跨节点 all-to-all 通信、KV cache 和低精度稳定性问题。

2. 已有解决方案与不足

DeepSeek-V2 已验证 MLA 和 DeepSeekMoE,但要继续扩大能力需要处理更大规模路由、低精度训练、pipeline 并行效率和 reasoning post-training。传统 auxiliary loss 会干扰专家专门化;大规模 FP8 预训练缺少公开 600B+ 验证;标准 SFT/RL 难以直接吸收 R1 的长 CoT 能力并控制输出长度。

3. 作者可能的思考路径

V2 已经证明 MLA + DeepSeekMoE 可以同时降低 KV cache 和 active compute。V3 的压力来自规模放大后的新瓶颈:671B total / 37B active 的 MoE 会让专家负载、跨节点 all-to-all、pipeline bubble、低精度数值和 post-training 数据质量一起进入临界区。

第一层问题是路由。传统 auxiliary loss 能让专家负载变均衡,但它把“均衡”写进训练目标,可能损伤专家专门化。于是更自然的选择是把负载调节移到 routing score 的动态 bias 上,让均衡约束影响分配边界,同时让主梯度继续服务语言建模。

第二层问题是系统吞吐。expert parallelism 放大后,跨节点 dispatch/combine 的成本接近计算本身;pipeline parallelism 又带来 warmup / drain bubble。V3 需要把 MoE all-to-all、PP send/recv 和 forward/backward chunks 放进同一个调度问题里,单个更快 kernel 只能处理局部成本,这就推向 DualPipe 与定制 all-to-all kernels。

第三层问题是训练经济性和训练信号。BF16 路径会让 600B+ MoE 的显存和带宽压力过高,FP8 需要细粒度 scaling 与高精度 accumulation 才能稳定;普通 next-token loss 的信号密度有限,MTP 可以给 backbone 更密集的未来 token 监督,并为 speculative decoding 预留接口。R1 数据再把 reasoning pattern 注入 chat model,形成 base/system/post-training 的闭环。

4. 核心假设或切入点

batch-level load balance 比 sequence-level auxiliary loss 更保留专家专门化;MTP 的未来 token 预测目标能提升表示质量,推理时丢弃 MTP module 后主模型仍受益;FP8 可通过 1x128 activation tile、128x128 weight block 和 FP32 accumulation 保持稳定;R1 生成的数据能提升数学/代码推理,同时通过筛选和格式控制限制平均输出长度。

5. 方法 / 系统 / 理论框架

V3 的骨架继承 DeepSeek-V2 已验证的 MLA (Multi-head Latent Attention,多头潜变量注意力)DeepSeekMoE:61 layers,hidden size 7168,128 attention heads,KV compression dimension 512,query compression dimension 1536。MoE 从第四层开始使用,每层 1 个 shared expert + 256 个 routed experts,每 token 激活 8 个 routed experts,每 token 最多路由到 4 个 nodes。这里的沿用部分解决的是 KV cache 和 active compute;V3 的新增问题是 671B total / 37B active 规模下,专家负载、跨节点通信、低精度数值和训练信号都可能成为新的瓶颈。

第一个新机制是 auxiliary-loss-free load balancing。传统 MoE 常用 auxiliary loss 让 router 分配更均衡,但这个 loss 会把“均衡”本身写进梯度,干扰 token 按语义选择专家。V3 为每个 routed expert 维护一个 bias,在 top-K routing 前把 bias 加到 affinity score 上;真正的专家权重仍主要来自原始 affinity,bias 不作为主 loss 的可学习梯度路径。每个 batch 后,系统按专家近期负载更新 bias:过载专家的 bias 下调,欠载专家的 bias 上调。这样 router 的选择边界会被慢慢推向均衡负载,模型参数更新仍主要服务语言建模目标。V3 还保留一个很小的 complementary sequence-wise auxiliary loss,避免单条 sequence 内出现极端不均衡。

第二个新机制是 MTP (Multi-Token Prediction,多 token 预测)。普通 next-token prediction 只在位置 tt 预测 xt+1x_{t+1},训练信号密度有限。MTP 在同一位置增加未来 token 预测目标,让表示同时对更远的 xt+2,xt+3,...x_{t+2}, x_{t+3}, ... 负责。V3 实际使用 MTP depth = 1,等价于在主 next-token loss 外增加一层未来 token 预测模块。训练时 MTP loss 给 backbone 提供更密集的前瞻信号;评测主模型时可以丢弃 MTP module,因此参数和延迟不进入常规推理路径。这个模块还为 speculative decoding 预留接口,后续 Qwen 的 Bebop 则进一步把 MTP 用到 RL rollout acceleration。

MTP 的接入点位于主 decoder 末端。主模型先照常从 tokens 经过 embedding、61 层 decoder、RMSNorm / output path,得到位置 ii 的最终 hidden state hi0h_i^0,并用共享 output head 预测 xi+1x_{i+1}。MTP module 从这条主路径分出辅助分支:它把 hi0h_i^0 与真实下一个 token 的 embedding E(xi+1)E(x_{i+1}) 拼接,经 projection matrix 压回模型维度,再送入一个额外 Transformer block,得到 hi1h_i^1,最后复用主模型 output head 预测 xi+2x_{i+2}

tokens
  -> shared embedding
  -> DeepSeek-V3 main decoder blocks
  -> final hidden h_i^0
       ├─ shared output head -> predict x_{i+1}
       └─ MTP depth 1
            concat(h_i^0, E(x_{i+1}))
            -> projection
            -> extra Transformer block
            -> shared output head -> predict x_{i+2}

多层 MTP 的一般形式是顺序展开:第 kk 个 MTP module 接收上一深度的表示 hik1h_i^{k-1} 和真实 token embedding E(xi+k)E(x_{i+k}),再预测 xi+k+1x_{i+k+1}。V3 最终只保留 depth 1,所以没有 GLM-5 那种多 step MTP 参数共享问题。这里共享的是 embedding layer 和 output head;MTP 自己仍有 projection matrix 与 Transformer block。由于 MTP 输入 hidden 已经不同,共享 output head 不会导致 MTP 输出和主模型输出相同。

路径 输入 参数 训练 / 推理角色
主 next-token path hi0h_i^0 主模型 output head 训练和常规推理都使用,预测 xi+1x_{i+1}
MTP auxiliary path [hi0;E(xi+1)][h_i^0; E(x_{i+1})] MTP projection + MTP Transformer block + 共享 output head 训练时预测 xi+2x_{i+2};常规评测可丢弃;speculative decoding 可作为 draft 分支

工程布局上,V3 借助 DualPipe 把 shallowest layers,包括 embedding layer,和 deepest layers,包括 output head,部署在同一个 pipeline parallel rank 上。这样 MTP module 与主模型能物理共享 embedding / output head 的参数和梯度,降低额外显存开销。

第三个新机制是 DualPipe。大 MoE 训练的 all-to-all 通信和 pipeline bubble 会一起放大:专家跨节点时需要 token dispatch/combine,pipeline parallelism 又会在 micro-batch 边界产生空泡。理解 DualPipe 时,应先看外层的双向 pipeline,再看内层的 chunk 拆分与合并调度。

DualPipe 的第一层是双向 pipeline。普通 PP 通常让 micro-batches 从 stage 0 依次流向 stage P1P-1;DualPipe 同时从两端喂入 micro-batches,一条方向从 stage 0 到 stage P1P-1,另一条方向从 stage P1P-1 到 stage 0。实现上,一个物理 rank 通常持有两个镜像 pipeline stages:rank ii 持有 stage ii 和 stage P1iP-1-i。这样两端都能进入 warmup / steady / drain,pipeline 空泡从完整 PP 阶段尺度压到约半个 pipeline 尺度。代价是每个设备需要保留两份 stage 参数;论文认为在 V3 的大 expert parallelism 配置下,这部分额外参数内存可接受。

DualPipe 的第二层是 chunk 级 overlap。每条方向内部仍然有 forward chunk 和 backward chunk;两条方向都包含 forward 与 backward。DualPipe 进一步把 forward chunk 拆成 attention、all-to-all dispatch、MLP、all-to-all combine,把 backward chunk 里的 attention 和 MLP 拆成 backward-for-input 与 backward-for-weights。backward-for-input 处在 activation gradient 回传关键路径上,backward-for-weights 更适合延后填充 bubble。调度器随后在两个方向之间配对 forward/backward chunks,把 MoE dispatch/combine 和 PP send/recv 放进其他 chunk 的 attention、MLP、B-input 或 B-weight 计算窗口里。

一个简化心智模型是:物理 rank ii 上同时服务 stage ii 的左到右 micro-batch 和 stage P1iP-1-i 的右到左 micro-batch;稳态时调度器交错执行“左到右 forward / 右到左 backward”和“右到左 forward / 左到右 backward”。因此 DualPipe 的收益由两部分组成:双向 pipeline 减少 warmup / drain bubble,细粒度 chunk overlap 隐藏 MoE all-to-all 和 PP communication。通信字节数仍然存在,专家仍需要跨节点 dispatch/combine;DualPipe 通过拓扑感知 all-to-all kernel、SM 分配和 chunk 调度让通信尽量不暴露为 wall-clock 延迟。

第四个新机制是 FP8 mixed precision。V3 将大部分 GEMM 放到 FP8 E4M3 路径上,用 1x128 activation tile 和 128x128 weight block 做 fine-grained scaling,控制不同 token / channel 的数值范围;累加路径使用高精度 accumulation,并在敏感位置保留 BF16/FP32。低精度还用于部分 activation storage 和 communication,降低显存与带宽压力。FP8 recipe 的关键在于量化粒度、累加精度、异常值路径和通信格式共同设计,使 671B MoE 可以稳定训练而不频繁 rollback。

训练配置延续大规模 LLM recipe,数字密集部分拆成三张表更容易复查。

维度 配置
训练硬件 2048 H800;每节点 8 GPU
节点内互联 NVLink / NVSwitch
节点间互联 InfiniBand
并行方式 16-way PP;64-way EP spanning 8 nodes;ZeRO-1 DP
MoE 放置 每层 routed experts 均匀部署在 64 GPUs / 8 nodes
Node-limited routing 每 token 最多发送到 4 nodes
训练 TP 训练阶段通过 DualPipe、cross-node all-to-all kernels、FP8 training 和 memory optimization 避免使用高成本 Tensor Parallelism
维度 配置
Tokenizer Byte-level BPE,128K vocab
Pretraining data 14.8T tokens;提高 math / programming samples ratio;扩展 English / Chinese 之外的 multilingual coverage
Packing / FIM document packing;不使用 cross-sample attention masking;FIM / PSM rate 0.1
Optimizer AdamW,β1=0.9,β2=0.95,weight decay 0.1
Sequence / batch pretraining sequence length 4K;batch size 前 469B tokens 从 3072 增至 15360,之后保持 15360
Stability gradient clipping 1.0;论文报告全训练过程无 irrecoverable loss spikes 或 rollback
MTP / balance MTP depth 1;MTP loss weight 前 10T 为 0.3,后 4.8T 为 0.1;bias update speed 前 14.3T 为 0.001,最后 500B 为 0.0;sequence-wise balance loss factor 0.0001
阶段 训练内容 关键配置 H800 GPU hours
Pretraining 14.8T tokens 4K context;batch schedule 3072 -> 15360 2.664M
Context extension YaRN 两阶段扩到 32K / 128K each 1000 steps;sequence length 32K / 128K;batch size 1920 / 480 119K
Post-training SFT + reward model + GRPO 1.5M SFT instances;SFT 2 epochs;RL 详细 group size / KL 等超参未完整公开 5K

论文给出的效率口径是每 1T tokens 约 180K H800 GPU hours,即 2048 H800 集群上约 3.7 days;14.8T pretraining wall-clock 少于 2 months。按 2 USD / H800 GPU hour 估算,总训练成本为 5.576M USD;该成本不含前期研究、消融和失败试验。

Post-training 由 SFT、reward model 和 GRPO 组成。SFT 使用 1.5M instances,reasoning 数据来自内部 DeepSeek-R1 expert model;reward model 分 rule-based RM 和 model-based RM;RL 使用 DeepSeek-R1 线上的 GRPO (Group Relative Policy Optimization,组相对策略优化),把 rule-verifiable reasoning 和人类偏好对齐分阶段处理。

6. 结论链条

V3 在架构、训练系统、低精度数值和 post-training 数据上同时推进。MLA/MoE 提供效率底座,aux-loss-free balance 和 DualPipe 处理大规模 MoE 训练,FP8 降低训练成本,MTP 与 R1 distillation 提升代码/数学/推理能力。

关键实验/定理

结果 1:训练成本

设置:

维度 配置
Hardware 2048 H800;8 GPUs / node
Parallelism 16-way PP;64-way EP spanning 8 nodes;ZeRO-1 DP
Systems recipe DualPipe;cross-node all-to-all kernels;FP8 mixed precision
Training scope pretraining 14.8T tokens;two-stage context extension;SFT/RL post-training

Baseline:无同规模公开完整复现;主要和常见 frontier 训练成本做叙事对比。

指标:H800 GPU hours、每 trillion tokens GPU hours、wall-clock、估算美元成本。

结果:

阶段 H800 GPU hours 估算成本 备注
Pretraining 2.664M 5.328M USD 14.8T tokens;每 1T tokens 约 180K H800 GPU hours;2048 H800 上约 3.7 days / 1T tokens
Context extension 119K 0.238M USD YaRN 两阶段扩到 32K / 128K
Post-training 5K 0.010M USD SFT + RL
Total 2.788M 5.576M USD pretraining wall-clock 少于 2 months

解读:成本证据强,且拆出了 pretraining / context extension / post-training;成本表排除前期研究、架构/算法/数据消融和失败试验。

结果 2:base model

  • 设置:DeepSeek-V3-Base 对比 DeepSeek-V2 Base、Qwen2.5-72B Base、Llama-3.1-405B Base。
  • Baseline:当时强开放模型。
  • 指标:MMLU、MMLU-Pro、HumanEval、MATH、C-Eval。
  • 解读:V3-Base 在代码、数学和多数综合任务上领先开放基线。

结果:

指标 DeepSeek-V3-Base
MMLU 87.1
MMLU-Pro 64.4
HumanEval 65.2
MATH 61.6
C-Eval 90.1

结果 3:chat model

  • 设置:对比 DeepSeek-V2/V2.5、Qwen2.5、Llama-3.1、Claude-3.5、GPT-4o;8K output limit。
  • Baseline:开放和闭源 chat models。
  • 指标:MMLU、GPQA、SWE Verified、AIME、MATH-500。
  • 解读:开放模型中强,SWE/Aider 仍低于 Claude-3.5。

结果:

指标 DeepSeek-V3 Chat
MMLU 88.5
GPQA 59.1
SWE Verified 42.0
AIME 39.2
MATH-500 90.2

结果 4:MTP ablation

  • 设置:15.7B MoE on 1.33T tokens;228.7B MoE on 540B tokens;论文未披露该消融的卡数、并行配置和 wall-clock。
  • Baseline:without MTP。
  • 指标:HumanEval、GSM8K。
  • 解读:MTP 作为训练目标有稳定收益。

结果:

模型 指标 Without MTP With MTP
15.7B MoE HumanEval 20.7 26.8
15.7B MoE GSM8K 25.4 31.4
228.7B MoE HumanEval 44.5 53.7
228.7B MoE GSM8K 72.3 74.0

结果 5:aux-loss-free balance 与 FP8

  • 设置:15.7B 和 228.7B MoE 对比纯 auxiliary loss;16B/230B proxy 检查 FP8;aux-loss-free balance large proxy 使用 578B training tokens;FP8 proxy 约 1T tokens;论文未披露这些 proxy 消融的完整卡数、并行配置和 wall-clock。
  • Baseline:auxiliary loss routing、BF16 proxy。
  • 指标:HumanEval、GSM8K、Pile BPB、relative loss error。
  • 解读:动态 bias balance 支撑性能和专家分化;FP8 recipe 在 proxy scale 证据充分。

结果:

消融 指标 对照 V3 recipe 备注
Aux-loss-free balance HumanEval 40.2 46.3 large proxy
Aux-loss-free balance GSM8K 70.7 74.5 large proxy
Aux-loss-free balance Pile BPB 0.656 0.652 lower is better
FP8 mixed precision Relative loss error vs BF16 - < 0.25% 16B / 230B proxy;约 1T tokens

实验设置与 baseline 审计

维度 记录
模型与初始化 671B total / 37B active MoE
数据与任务 14.8T pretraining tokens;提高 math / programming samples ratio;扩展 multilingual coverage;document packing;FIM / PSM rate 0.1;SFT 1.5M instruction instances
RL / 训练配置 GRPO;rule-based RM 和 model-based RM;SFT 2 epochs;RL 详细 group size / KL 等超参未完整公开
系统配置 2048 H800;16-way PP;64-way EP spanning 8 nodes;ZeRO-1 DP;DualPipe;FP8 mixed precision;cross-node MoE all-to-all optimized kernels
技术报告训练配置 pretraining 2.664M H800 GPU hours;context extension 119K;post-training 5K;total 2.788M;估算总成本 5.576M USD;成本不含前期研究、消融和失败试验
评测协议 内部统一 benchmark + 公开 benchmark;chat 对比含闭源 API
统计报告 缺少完整多 seed / 置信区间
Baseline 强度 base model 公开对照较强;chat 闭源对比受 API 版本和 prompt 影响;FP8 和 MTP 消融是 proxy-scale
结论边界 V3 证明了 DeepSeek 内部系统栈可高效训练 frontier MoE;外部复现相同成本仍需训练框架、kernel、数据和集群拓扑共同满足

证据链强度评估

强证据

  • 架构、训练预算、模型权重、主要 benchmark 和消融都公开。
  • MTP、load balance、FP8 proxy ablation 支撑核心工程选择。

中等强度证据

  • 闭源模型对比和 open-ended judge 任务可参考,但可复查性有限。
  • R1 distillation 效果在 proxy 任务清楚,完整后训练细节有限。

需要谨慎的推论

  • strongest open-source 类表述具有时间敏感性。
  • 内部数据质量和训练系统细节无法完整复验。
  • 真实长上下文多跳能力需要后续报告补充。

OpenReview / 审稿意见吸收

  • Venue status: CoRR / arXiv technical report;OpenReview 存在 DBLP/CoRR 导入记录。
  • Public reviews: note id flMS0vfo9P,replyCount/directReplies/replies 均为 0。
  • Ratings / confidence: 未发现。
  • Reviewer consensus: 未发现。
  • Main criticisms: 无公开 reviewer comments;本地审计聚焦内部数据、成本和闭源对比边界。
  • Author response: 未发现。
  • 对可信度的影响: 适合作为 DeepSeek 系列技术路线的主来源;正式公开审稿背书暂缺。

本地讨论补充

1. 讨论收敛点

V3 是 DeepSeek-R1 和 V4 的中轴节点。R1 建立在 V3-Base 上,V4 则把 V3 的 MoE/MTP/system co-design 继续推向 million-token context。

DualPipe 的解释顺序应先讲双向 pipeline,再讲 chunk 拆分与 overlap。双向 pipeline 是外层结构:同一组 PP ranks 从两端同时喂 micro-batches,并让 rank ii 持有 stage ii 与 stage P1iP-1-i。chunk overlap 是内层执行策略:两条方向各自包含 forward/backward chunks,调度器再把 attention、dispatch、MLP、combine、B-input、B-weight 和 PP communication 交错起来。

技术报告的实验记录需要把训练配置写到可复查粒度,尤其是卡数、硬件拓扑、并行方式、数据组成、token budget、batch / sequence length、训练时间、GPU hours 和成本边界。V3 这类模型报告的分数只有和训练系统配置一起读才可解释;若 ablation 没有披露卡数、并行或 wall-clock,应在对应实验设置里直接标注未披露。

2. 修正后的理解

V3 的核心是多项工程约束的联合解:MoE load balance、通信 overlap、FP8 稳定性、MTP 训练信号和 R1 distillation。单一模型分数只能呈现最终外部效果,不能解释这些系统选择如何共同生效。

DualPipe 的关键区分是:forward 与 backward 属于每条方向内部的计算阶段,两条方向都包含 forward 与 backward。外层双向流水缩短 warmup / drain 空泡,内层 chunk 调度把 MoE all-to-all 与 PP send/recv 放进其他计算窗口。这个顺序比直接从 chunk overlap 开始更容易解释它为什么需要镜像 stage 和双份 stage 参数。

本次更新后,DeepSeek-V3 的训练审计应读成四层:训练硬件与并行栈、pretraining data / token budget、context extension 和 SFT/RL post-training、成本表与未计入成本。后续技术报告归档沿用同一结构。

3. MTP 接入位置澄清

MTP 接在主 decoder 最终 hidden 后面,作为训练期辅助分支。主 next-token path 仍直接用 hi0h_i^0 预测 xi+1x_{i+1};MTP path 使用 hi0h_i^0 和真实 xi+1x_{i+1} 的 embedding,经过额外 projection + Transformer block 后预测 xi+2x_{i+2}。这次澄清的关键是区分三件事:接入点在模型末端、共享的是 embedding/output head、额外计算来自 MTP block。共享 output head 不会让两个预测相同,因为进入 head 的 hidden state 不同。

V3 的 MTP depth 为 1,因此它主要承担训练信号增强和 speculative decoding 接口。GLM-5 的参数共享 MTP 则把同一 MTP step/layer 函数多次展开,用不同 step 的 hidden / position / KV 状态产生多个 draft token;两者都共享部分参数,但共享层级和多步展开方式不同。

4. 后续复验指标

  • routing entropy、expert load、all-to-all overlap。
  • FP8 loss error 与硬件迁移。
  • MTP 对 speculative decoding / RL rollout 的真实收益。
  • R1 distillation 后 output length 与 latency。

主要启发

  • 大规模 MoE 的性能来自架构、路由、通信和低精度数值的共同设计。
  • MTP 既是训练目标,也是后续 speculative decoding / rollout acceleration 的接口。
  • reasoning distillation 会提升准确率,也会改变输出长度和延迟。

局限

  1. 训练数据、HAI-LLM 训练框架、完整 reward 数据和部分内部 benchmark 未公开。
  2. 成本表排除前期研究与消融实验。
  3. FP8 recipe 依赖 H800、kernel 和量化细节。
  4. R1 distillation 带来输出长度增加。
  5. 公开 peer review 缺失。

跨论文关系

  • 2405.04434 DeepSeek-V2:V3 继承 MLA 和 DeepSeekMoE,并加入 aux-loss-free balance、MTP、FP8 与 DualPipe。
  • 2501.12948 DeepSeek-R1:V3-Base 是 R1-Zero/R1 的关键 base;V3 chat 又吸收 R1 distillation。
  • 2026-04-24 DeepSeek-V4:V4 延续 V3 的 DeepSeekMoE、MTP 和系统 co-design,并加入 CSA/HCA、Muon 和 deterministic kernels。
  • 2606.12370 Qwen Bebop:V3 把 MTP 用作训练目标;Bebop 从 Qwen 侧进一步分析 MTP 在 RL rollout 中的 acceptance、rejection sampling 和 TV loss。
  • 2506.13585 MiniMax-M1:MiniMax-M1 用 Lightning Attention + CISPO 处理长输出 RL,和 V3 的 MLA/MoE/FP8 路线形成架构与 RL 成本对照。
  • 2606.04662 Muon:V3 使用 AdamW,是 DeepSeek 系列进入 Muon 前的基准;V4/GLM/Kimi 相关条目可把 optimizer 迁移写成后续演化。

Reference Intake Brief

Target

Reusable Elements

  1. aux-loss-free MoE load balancing。
  2. MTP as training signal and decoding interface。
  3. FP8 + DualPipe large-scale MoE training recipe。

Risks

  • Copyright/over-copying: 只保留关键结果。
  • Unsourced or unverifiable claims: 内部系统成本按论文披露处理。
  • Tone/brand mismatch: 技术归档语气。
  • Safety/compliance issues: 不沉淀能力滥用流程。
  • Overlap with existing assets: 和 R1/V4 强重叠,本条定位为 foundation model / systems 中轴。

Skipped

Material Reason
公开 reviewer comments OpenReview 仅 CoRR/DBLP 导入记录,无 official reviews。

Recommendation

Decision: merge

Why: DeepSeek-V3 是 R1、V4、DeepSeekMoE、MTP 和 FP8 large MoE training 的关键连接点。