2412.19437-deepseek-v3-technical-report
DeepSeek V3 Technical Report
DeepSeek-V3 用 MLA (Multi-head Latent Attention,多头潜变量注意力)、DeepSeekMoE、无辅助损失负载均衡、MTP (Multi-Token Prediction,多 token 预测)、FP8 混合精度训练和 DualPipe 通信重叠,把 671B total / 37B active 的开放 MoE (Mixture-of-Experts,混合专家) 模型训练到强代码、数学和通用能力,并成为 DeepSeek-R1 reasoning RL 与后续 DeepSeek-V4 长上下文系统的基础节点。
Source
- Title: DeepSeek-V3 Technical Report
- arXiv: https://arxiv.org/abs/2412.19437
- HTML: https://arxiv.org/html/2412.19437v2
- PDF: https://arxiv.org/pdf/2412.19437
- TeX Source: https://arxiv.org/e-print/2412.19437
- Code/Project: https://github.com/deepseek-ai/DeepSeek-V3
- Model: DeepSeek-V3;DeepSeek-V3-Base
- OpenReview / Review page: CoRR / DBLP metadata record via OpenReview note id
flMS0vfo9P;未发现 public review forum。 - Authors: Wenfeng Liang, Peiyi Wang, Runxin Xu, Zhihong Shao, Damai Dai, Deli Chen, Yu Wu
- Organization: DeepSeek-AI;arXiv lists DeepSeek-AI and 199 other authors.
- Submitted: 2024-12-27
- Current version read: v2, last revised 2025-02-18
- Subjects: Computation and Language (cs.CL); Artificial Intelligence (cs.AI)
作者与关系
- DeepSeek-AI: 组织级技术报告;appendix 按 Research & Engineering、Data Annotation、Business & Compliance 分组。
- Wenfeng Liang: DeepSeek AI.
- 作者列表规则:每组内按 first name 字母序排列,
*标记已离队成员。
阅读目标与判断边界
归档关注:
- V3 如何在 V2 的 MLA / DeepSeekMoE 基础上扩大规模。
- auxiliary-loss-free load balancing、MTP、FP8 和 DualPipe 分别解决哪一层瓶颈。
- V3 与 R1、V4、GLM、Qwen、MiniMax、Muon 的关系。
- 训练成本、benchmark 和 ablation 的证据边界。
判断边界:
- 成本表排除前期研究和消融成本。
- FP8 对照主要在 proxy scale 上完成,缺少完整 671B BF16 对照。
- Chat model 与闭源 API 的比较受模型版本、prompt、采样和输出长度影响。
术语预备
FP8: 8-bit floating point;V3 使用 fine-grained quantization 降低训练成本。DualPipe: DeepSeek 设计的双向 pipeline overlap 方案,用于隐藏 pipeline bubble 和 MoE all-to-all 通信。SFT (Supervised Fine-Tuning,监督微调): 用 instruction data 微调模型。RM (Reward Model,奖励模型): 给 responses / trajectories 打分的模型或规则系统。GRPO (Group Relative Policy Optimization,组相对策略优化): 使用 group-relative reward baseline 的 critic-free RL 方法。CoT (Chain-of-Thought,思维链): 模型显式生成的中间推理过程。
论文脉络
1. 研究问题、背景和价值
DeepSeek-V3 要解决的是如何以可控成本训练开放权重前沿模型。Dense 405B 级别模型训练和推理成本高,传统 MoE 又面临 expert load balance、跨节点 all-to-all 通信、KV cache 和低精度稳定性问题。
2. 已有解决方案与不足
DeepSeek-V2 已验证 MLA 和 DeepSeekMoE,但要继续扩大能力需要处理更大规模路由、低精度训练、pipeline 并行效率和 reasoning post-training。传统 auxiliary loss 会干扰专家专门化;大规模 FP8 预训练缺少公开 600B+ 验证;标准 SFT/RL 难以直接吸收 R1 的长 CoT 能力并控制输出长度。
3. 作者可能的思考路径
V2 已经证明 MLA + DeepSeekMoE 可以同时降低 KV cache 和 active compute。V3 的压力来自规模放大后的新瓶颈:671B total / 37B active 的 MoE 会让专家负载、跨节点 all-to-all、pipeline bubble、低精度数值和 post-training 数据质量一起进入临界区。
第一层问题是路由。传统 auxiliary loss 能让专家负载变均衡,但它把“均衡”写进训练目标,可能损伤专家专门化。于是更自然的选择是把负载调节移到 routing score 的动态 bias 上,让均衡约束影响分配边界,同时让主梯度继续服务语言建模。
第二层问题是系统吞吐。expert parallelism 放大后,跨节点 dispatch/combine 的成本接近计算本身;pipeline parallelism 又带来 warmup / drain bubble。V3 需要把 MoE all-to-all、PP send/recv 和 forward/backward chunks 放进同一个调度问题里,单个更快 kernel 只能处理局部成本,这就推向 DualPipe 与定制 all-to-all kernels。
第三层问题是训练经济性和训练信号。BF16 路径会让 600B+ MoE 的显存和带宽压力过高,FP8 需要细粒度 scaling 与高精度 accumulation 才能稳定;普通 next-token loss 的信号密度有限,MTP 可以给 backbone 更密集的未来 token 监督,并为 speculative decoding 预留接口。R1 数据再把 reasoning pattern 注入 chat model,形成 base/system/post-training 的闭环。
4. 核心假设或切入点
batch-level load balance 比 sequence-level auxiliary loss 更保留专家专门化;MTP 的未来 token 预测目标能提升表示质量,推理时丢弃 MTP module 后主模型仍受益;FP8 可通过 1x128 activation tile、128x128 weight block 和 FP32 accumulation 保持稳定;R1 生成的数据能提升数学/代码推理,同时通过筛选和格式控制限制平均输出长度。
5. 方法 / 系统 / 理论框架
V3 的骨架继承 DeepSeek-V2 已验证的 MLA (Multi-head Latent Attention,多头潜变量注意力) 和 DeepSeekMoE:61 layers,hidden size 7168,128 attention heads,KV compression dimension 512,query compression dimension 1536。MoE 从第四层开始使用,每层 1 个 shared expert + 256 个 routed experts,每 token 激活 8 个 routed experts,每 token 最多路由到 4 个 nodes。这里的沿用部分解决的是 KV cache 和 active compute;V3 的新增问题是 671B total / 37B active 规模下,专家负载、跨节点通信、低精度数值和训练信号都可能成为新的瓶颈。
第一个新机制是 auxiliary-loss-free load balancing。传统 MoE 常用 auxiliary loss 让 router 分配更均衡,但这个 loss 会把“均衡”本身写进梯度,干扰 token 按语义选择专家。V3 为每个 routed expert 维护一个 bias,在 top-K routing 前把 bias 加到 affinity score 上;真正的专家权重仍主要来自原始 affinity,bias 不作为主 loss 的可学习梯度路径。每个 batch 后,系统按专家近期负载更新 bias:过载专家的 bias 下调,欠载专家的 bias 上调。这样 router 的选择边界会被慢慢推向均衡负载,模型参数更新仍主要服务语言建模目标。V3 还保留一个很小的 complementary sequence-wise auxiliary loss,避免单条 sequence 内出现极端不均衡。
第二个新机制是 MTP (Multi-Token Prediction,多 token 预测)。普通 next-token prediction 只在位置
MTP 的接入点位于主 decoder 末端。主模型先照常从 tokens 经过 embedding、61 层 decoder、RMSNorm / output path,得到位置
tokens
-> shared embedding
-> DeepSeek-V3 main decoder blocks
-> final hidden h_i^0
├─ shared output head -> predict x_{i+1}
└─ MTP depth 1
concat(h_i^0, E(x_{i+1}))
-> projection
-> extra Transformer block
-> shared output head -> predict x_{i+2}
多层 MTP 的一般形式是顺序展开:第
| 路径 | 输入 | 参数 | 训练 / 推理角色 |
|---|---|---|---|
| 主 next-token path | 主模型 output head | 训练和常规推理都使用,预测 |
|
| MTP auxiliary path | MTP projection + MTP Transformer block + 共享 output head | 训练时预测 |
工程布局上,V3 借助 DualPipe 把 shallowest layers,包括 embedding layer,和 deepest layers,包括 output head,部署在同一个 pipeline parallel rank 上。这样 MTP module 与主模型能物理共享 embedding / output head 的参数和梯度,降低额外显存开销。
第三个新机制是 DualPipe。大 MoE 训练的 all-to-all 通信和 pipeline bubble 会一起放大:专家跨节点时需要 token dispatch/combine,pipeline parallelism 又会在 micro-batch 边界产生空泡。理解 DualPipe 时,应先看外层的双向 pipeline,再看内层的 chunk 拆分与合并调度。
DualPipe 的第一层是双向 pipeline。普通 PP 通常让 micro-batches 从 stage 0 依次流向 stage
DualPipe 的第二层是 chunk 级 overlap。每条方向内部仍然有 forward chunk 和 backward chunk;两条方向都包含 forward 与 backward。DualPipe 进一步把 forward chunk 拆成 attention、all-to-all dispatch、MLP、all-to-all combine,把 backward chunk 里的 attention 和 MLP 拆成 backward-for-input 与 backward-for-weights。backward-for-input 处在 activation gradient 回传关键路径上,backward-for-weights 更适合延后填充 bubble。调度器随后在两个方向之间配对 forward/backward chunks,把 MoE dispatch/combine 和 PP send/recv 放进其他 chunk 的 attention、MLP、B-input 或 B-weight 计算窗口里。
一个简化心智模型是:物理 rank
第四个新机制是 FP8 mixed precision。V3 将大部分 GEMM 放到 FP8 E4M3 路径上,用 1x128 activation tile 和 128x128 weight block 做 fine-grained scaling,控制不同 token / channel 的数值范围;累加路径使用高精度 accumulation,并在敏感位置保留 BF16/FP32。低精度还用于部分 activation storage 和 communication,降低显存与带宽压力。FP8 recipe 的关键在于量化粒度、累加精度、异常值路径和通信格式共同设计,使 671B MoE 可以稳定训练而不频繁 rollback。
训练配置延续大规模 LLM recipe,数字密集部分拆成三张表更容易复查。
| 维度 | 配置 |
|---|---|
| 训练硬件 | 2048 H800;每节点 8 GPU |
| 节点内互联 | NVLink / NVSwitch |
| 节点间互联 | InfiniBand |
| 并行方式 | 16-way PP;64-way EP spanning 8 nodes;ZeRO-1 DP |
| MoE 放置 | 每层 routed experts 均匀部署在 64 GPUs / 8 nodes |
| Node-limited routing | 每 token 最多发送到 4 nodes |
| 训练 TP | 训练阶段通过 DualPipe、cross-node all-to-all kernels、FP8 training 和 memory optimization 避免使用高成本 Tensor Parallelism |
| 维度 | 配置 |
|---|---|
| Tokenizer | Byte-level BPE,128K vocab |
| Pretraining data | 14.8T tokens;提高 math / programming samples ratio;扩展 English / Chinese 之外的 multilingual coverage |
| Packing / FIM | document packing;不使用 cross-sample attention masking;FIM / PSM rate 0.1 |
| Optimizer | AdamW,β1=0.9,β2=0.95,weight decay 0.1 |
| Sequence / batch | pretraining sequence length 4K;batch size 前 469B tokens 从 3072 增至 15360,之后保持 15360 |
| Stability | gradient clipping 1.0;论文报告全训练过程无 irrecoverable loss spikes 或 rollback |
| MTP / balance | MTP depth 1;MTP loss weight 前 10T 为 0.3,后 4.8T 为 0.1;bias update speed 前 14.3T 为 0.001,最后 500B 为 0.0;sequence-wise balance loss factor 0.0001 |
| 阶段 | 训练内容 | 关键配置 | H800 GPU hours |
|---|---|---|---|
| Pretraining | 14.8T tokens | 4K context;batch schedule 3072 -> 15360 | 2.664M |
| Context extension | YaRN 两阶段扩到 32K / 128K | each 1000 steps;sequence length 32K / 128K;batch size 1920 / 480 | 119K |
| Post-training | SFT + reward model + GRPO | 1.5M SFT instances;SFT 2 epochs;RL 详细 group size / KL 等超参未完整公开 | 5K |
论文给出的效率口径是每 1T tokens 约 180K H800 GPU hours,即 2048 H800 集群上约 3.7 days;14.8T pretraining wall-clock 少于 2 months。按 2 USD / H800 GPU hour 估算,总训练成本为 5.576M USD;该成本不含前期研究、消融和失败试验。
Post-training 由 SFT、reward model 和 GRPO 组成。SFT 使用 1.5M instances,reasoning 数据来自内部 DeepSeek-R1 expert model;reward model 分 rule-based RM 和 model-based RM;RL 使用 DeepSeek-R1 线上的 GRPO (Group Relative Policy Optimization,组相对策略优化),把 rule-verifiable reasoning 和人类偏好对齐分阶段处理。
6. 结论链条
V3 在架构、训练系统、低精度数值和 post-training 数据上同时推进。MLA/MoE 提供效率底座,aux-loss-free balance 和 DualPipe 处理大规模 MoE 训练,FP8 降低训练成本,MTP 与 R1 distillation 提升代码/数学/推理能力。
关键实验/定理
结果 1:训练成本
设置:
| 维度 | 配置 |
|---|---|
| Hardware | 2048 H800;8 GPUs / node |
| Parallelism | 16-way PP;64-way EP spanning 8 nodes;ZeRO-1 DP |
| Systems recipe | DualPipe;cross-node all-to-all kernels;FP8 mixed precision |
| Training scope | pretraining 14.8T tokens;two-stage context extension;SFT/RL post-training |
Baseline:无同规模公开完整复现;主要和常见 frontier 训练成本做叙事对比。
指标:H800 GPU hours、每 trillion tokens GPU hours、wall-clock、估算美元成本。
结果:
| 阶段 | H800 GPU hours | 估算成本 | 备注 |
|---|---|---|---|
| Pretraining | 2.664M | 5.328M USD | 14.8T tokens;每 1T tokens 约 180K H800 GPU hours;2048 H800 上约 3.7 days / 1T tokens |
| Context extension | 119K | 0.238M USD | YaRN 两阶段扩到 32K / 128K |
| Post-training | 5K | 0.010M USD | SFT + RL |
| Total | 2.788M | 5.576M USD | pretraining wall-clock 少于 2 months |
解读:成本证据强,且拆出了 pretraining / context extension / post-training;成本表排除前期研究、架构/算法/数据消融和失败试验。
结果 2:base model
- 设置:DeepSeek-V3-Base 对比 DeepSeek-V2 Base、Qwen2.5-72B Base、Llama-3.1-405B Base。
- Baseline:当时强开放模型。
- 指标:MMLU、MMLU-Pro、HumanEval、MATH、C-Eval。
- 解读:V3-Base 在代码、数学和多数综合任务上领先开放基线。
结果:
| 指标 | DeepSeek-V3-Base |
|---|---|
| MMLU | 87.1 |
| MMLU-Pro | 64.4 |
| HumanEval | 65.2 |
| MATH | 61.6 |
| C-Eval | 90.1 |
结果 3:chat model
- 设置:对比 DeepSeek-V2/V2.5、Qwen2.5、Llama-3.1、Claude-3.5、GPT-4o;8K output limit。
- Baseline:开放和闭源 chat models。
- 指标:MMLU、GPQA、SWE Verified、AIME、MATH-500。
- 解读:开放模型中强,SWE/Aider 仍低于 Claude-3.5。
结果:
| 指标 | DeepSeek-V3 Chat |
|---|---|
| MMLU | 88.5 |
| GPQA | 59.1 |
| SWE Verified | 42.0 |
| AIME | 39.2 |
| MATH-500 | 90.2 |
结果 4:MTP ablation
- 设置:15.7B MoE on 1.33T tokens;228.7B MoE on 540B tokens;论文未披露该消融的卡数、并行配置和 wall-clock。
- Baseline:without MTP。
- 指标:HumanEval、GSM8K。
- 解读:MTP 作为训练目标有稳定收益。
结果:
| 模型 | 指标 | Without MTP | With MTP |
|---|---|---|---|
| 15.7B MoE | HumanEval | 20.7 | 26.8 |
| 15.7B MoE | GSM8K | 25.4 | 31.4 |
| 228.7B MoE | HumanEval | 44.5 | 53.7 |
| 228.7B MoE | GSM8K | 72.3 | 74.0 |
结果 5:aux-loss-free balance 与 FP8
- 设置:15.7B 和 228.7B MoE 对比纯 auxiliary loss;16B/230B proxy 检查 FP8;aux-loss-free balance large proxy 使用 578B training tokens;FP8 proxy 约 1T tokens;论文未披露这些 proxy 消融的完整卡数、并行配置和 wall-clock。
- Baseline:auxiliary loss routing、BF16 proxy。
- 指标:HumanEval、GSM8K、Pile BPB、relative loss error。
- 解读:动态 bias balance 支撑性能和专家分化;FP8 recipe 在 proxy scale 证据充分。
结果:
| 消融 | 指标 | 对照 | V3 recipe | 备注 |
|---|---|---|---|---|
| Aux-loss-free balance | HumanEval | 40.2 | 46.3 | large proxy |
| Aux-loss-free balance | GSM8K | 70.7 | 74.5 | large proxy |
| Aux-loss-free balance | Pile BPB | 0.656 | 0.652 | lower is better |
| FP8 mixed precision | Relative loss error vs BF16 | - | < 0.25% | 16B / 230B proxy;约 1T tokens |
实验设置与 baseline 审计
| 维度 | 记录 |
|---|---|
| 模型与初始化 | 671B total / 37B active MoE |
| 数据与任务 | 14.8T pretraining tokens;提高 math / programming samples ratio;扩展 multilingual coverage;document packing;FIM / PSM rate 0.1;SFT 1.5M instruction instances |
| RL / 训练配置 | GRPO;rule-based RM 和 model-based RM;SFT 2 epochs;RL 详细 group size / KL 等超参未完整公开 |
| 系统配置 | 2048 H800;16-way PP;64-way EP spanning 8 nodes;ZeRO-1 DP;DualPipe;FP8 mixed precision;cross-node MoE all-to-all optimized kernels |
| 技术报告训练配置 | pretraining 2.664M H800 GPU hours;context extension 119K;post-training 5K;total 2.788M;估算总成本 5.576M USD;成本不含前期研究、消融和失败试验 |
| 评测协议 | 内部统一 benchmark + 公开 benchmark;chat 对比含闭源 API |
| 统计报告 | 缺少完整多 seed / 置信区间 |
| Baseline 强度 | base model 公开对照较强;chat 闭源对比受 API 版本和 prompt 影响;FP8 和 MTP 消融是 proxy-scale |
| 结论边界 | V3 证明了 DeepSeek 内部系统栈可高效训练 frontier MoE;外部复现相同成本仍需训练框架、kernel、数据和集群拓扑共同满足 |
证据链强度评估
强证据
- 架构、训练预算、模型权重、主要 benchmark 和消融都公开。
- MTP、load balance、FP8 proxy ablation 支撑核心工程选择。
中等强度证据
- 闭源模型对比和 open-ended judge 任务可参考,但可复查性有限。
- R1 distillation 效果在 proxy 任务清楚,完整后训练细节有限。
需要谨慎的推论
- strongest open-source 类表述具有时间敏感性。
- 内部数据质量和训练系统细节无法完整复验。
- 真实长上下文多跳能力需要后续报告补充。
OpenReview / 审稿意见吸收
- Venue status: CoRR / arXiv technical report;OpenReview 存在 DBLP/CoRR 导入记录。
- Public reviews: note id
flMS0vfo9P,replyCount/directReplies/replies 均为 0。 - Ratings / confidence: 未发现。
- Reviewer consensus: 未发现。
- Main criticisms: 无公开 reviewer comments;本地审计聚焦内部数据、成本和闭源对比边界。
- Author response: 未发现。
- 对可信度的影响: 适合作为 DeepSeek 系列技术路线的主来源;正式公开审稿背书暂缺。
本地讨论补充
1. 讨论收敛点
V3 是 DeepSeek-R1 和 V4 的中轴节点。R1 建立在 V3-Base 上,V4 则把 V3 的 MoE/MTP/system co-design 继续推向 million-token context。
DualPipe 的解释顺序应先讲双向 pipeline,再讲 chunk 拆分与 overlap。双向 pipeline 是外层结构:同一组 PP ranks 从两端同时喂 micro-batches,并让 rank
技术报告的实验记录需要把训练配置写到可复查粒度,尤其是卡数、硬件拓扑、并行方式、数据组成、token budget、batch / sequence length、训练时间、GPU hours 和成本边界。V3 这类模型报告的分数只有和训练系统配置一起读才可解释;若 ablation 没有披露卡数、并行或 wall-clock,应在对应实验设置里直接标注未披露。
2. 修正后的理解
V3 的核心是多项工程约束的联合解:MoE load balance、通信 overlap、FP8 稳定性、MTP 训练信号和 R1 distillation。单一模型分数只能呈现最终外部效果,不能解释这些系统选择如何共同生效。
DualPipe 的关键区分是:forward 与 backward 属于每条方向内部的计算阶段,两条方向都包含 forward 与 backward。外层双向流水缩短 warmup / drain 空泡,内层 chunk 调度把 MoE all-to-all 与 PP send/recv 放进其他计算窗口。这个顺序比直接从 chunk overlap 开始更容易解释它为什么需要镜像 stage 和双份 stage 参数。
本次更新后,DeepSeek-V3 的训练审计应读成四层:训练硬件与并行栈、pretraining data / token budget、context extension 和 SFT/RL post-training、成本表与未计入成本。后续技术报告归档沿用同一结构。
3. MTP 接入位置澄清
MTP 接在主 decoder 最终 hidden 后面,作为训练期辅助分支。主 next-token path 仍直接用
V3 的 MTP depth 为 1,因此它主要承担训练信号增强和 speculative decoding 接口。GLM-5 的参数共享 MTP 则把同一 MTP step/layer 函数多次展开,用不同 step 的 hidden / position / KV 状态产生多个 draft token;两者都共享部分参数,但共享层级和多步展开方式不同。
4. 后续复验指标
- routing entropy、expert load、all-to-all overlap。
- FP8 loss error 与硬件迁移。
- MTP 对 speculative decoding / RL rollout 的真实收益。
- R1 distillation 后 output length 与 latency。
主要启发
- 大规模 MoE 的性能来自架构、路由、通信和低精度数值的共同设计。
- MTP 既是训练目标,也是后续 speculative decoding / rollout acceleration 的接口。
- reasoning distillation 会提升准确率,也会改变输出长度和延迟。
局限
- 训练数据、HAI-LLM 训练框架、完整 reward 数据和部分内部 benchmark 未公开。
- 成本表排除前期研究与消融实验。
- FP8 recipe 依赖 H800、kernel 和量化细节。
- R1 distillation 带来输出长度增加。
- 公开 peer review 缺失。
跨论文关系
- 与 2405.04434 DeepSeek-V2:V3 继承 MLA 和 DeepSeekMoE,并加入 aux-loss-free balance、MTP、FP8 与 DualPipe。
- 与 2501.12948 DeepSeek-R1:V3-Base 是 R1-Zero/R1 的关键 base;V3 chat 又吸收 R1 distillation。
- 与 2026-04-24 DeepSeek-V4:V4 延续 V3 的 DeepSeekMoE、MTP 和系统 co-design,并加入 CSA/HCA、Muon 和 deterministic kernels。
- 与 2606.12370 Qwen Bebop:V3 把 MTP 用作训练目标;Bebop 从 Qwen 侧进一步分析 MTP 在 RL rollout 中的 acceptance、rejection sampling 和 TV loss。
- 与 2506.13585 MiniMax-M1:MiniMax-M1 用 Lightning Attention + CISPO 处理长输出 RL,和 V3 的 MLA/MoE/FP8 路线形成架构与 RL 成本对照。
- 与 2606.04662 Muon:V3 使用 AdamW,是 DeepSeek 系列进入 Muon 前的基准;V4/GLM/Kimi 相关条目可把 optimizer 迁移写成后续演化。
Reference Intake Brief
Target
- Intended target system: 新增 DeepSeek-V3 独立论文笔记。
- Existing related assets: 2405.04434 DeepSeek-V2, 2501.12948 DeepSeek-R1, 2026-04-24 DeepSeek-V4,
content/utility/papers-index.md。 - Proposed form: 新建独立 Markdown 文档。
Reusable Elements
- aux-loss-free MoE load balancing。
- MTP as training signal and decoding interface。
- FP8 + DualPipe large-scale MoE training recipe。
Risks
- Copyright/over-copying: 只保留关键结果。
- Unsourced or unverifiable claims: 内部系统成本按论文披露处理。
- Tone/brand mismatch: 技术归档语气。
- Safety/compliance issues: 不沉淀能力滥用流程。
- Overlap with existing assets: 和 R1/V4 强重叠,本条定位为 foundation model / systems 中轴。
Skipped
| Material | Reason |
|---|---|
| 公开 reviewer comments | OpenReview 仅 CoRR/DBLP 导入记录,无 official reviews。 |
Recommendation
Decision: merge
Why: DeepSeek-V3 是 R1、V4、DeepSeekMoE、MTP 和 FP8 large MoE training 的关键连接点。