DeepSeek-V3:671B/37B MoE、FP8 训练与 DualPipe 的算法—基础设施协同设计

本页为第 16 篇(训练、并行与 GPU Kernel 类,核心合集末篇)。定量内容取自本地论文 PDF 16_DeepSeek-V3_2412.19437.pdf(arXiv:2412.19437v2,水印逐字核验「arXiv:2412.19437v2 [cs.CL] 18 Feb 2025」,DeepSeek-AI 署名,共 53 页)并逐条标注 PDF 页码;全部 53 页经渲染原页逐页目检,表 1-9 逐格核对、公式 (1)-(28) 逐项核对(表 2 气泡公式与激活内存增幅以 300dpi 放大复核),详见 #evidencesources/deepseek-v3.evidence.json(54 条)。

快速标签与阅读说明

最后核验日期:证据完整度:论文核心数字(摘要、表 1-9 全量、图 1/4/5/8 柱顶与面板标注、式 (1)-(28)、§2-§6 与附录 A/B/C)已回 PDF 原页逐项核验并标注页码与实验条件;文档内两处编号/口径现象照录不调和(两处 Figure 10 重复编号;表 4 用 540B、表 5 用 578B 两个不同的大规模消融 token 量);训练 checkpoint 机制、每 GPU tokens/s、MFU、集群成本明细、推理时延数字论文未披露,页面写「论文未明确披露」;$5.576M 仅在论文自述的 $2/GPU 小时租价假设与「不含前期研究/消融」口径内引用。

证据标签图例: P=论文 R=仓库 E=外部资料 I=编辑推断

1. 摘要与一句话判断

论文元数据 P(逐字核验自 PDF 第 1、45-47 页;仓库另经在线核验 R
题名DeepSeek-V3 Technical Report(编辑译名:DeepSeek-V3 技术报告)
署名 / 机构DeepSeek-AI(联系邮箱 research@deepseek.com,第 1 页)。第 1 页无个人作者列表;附录 A(第 45-47 页)按 Research & Engineering / Data Annotation / Business & Compliance 三角色列成员,注明组内按 first name 字母序排列、带 * 为已离团队成员 P
版本arXiv:2412.19437v2(PDF 左侧水印逐字核验「arXiv:2412.19437v2 [cs.CL] 18 Feb 2025」);本地 PDF 16_DeepSeek-V3_2412.19437.pdf(53 页,pdfTeX-1.40.25,创建 2025-02-19)。PDF 内未标注会议/期刊录用信息,本页不作会议归属推断 P
代码 / 权重论文摘要印明「模型检查点」发布于 github.com/deepseek-ai/DeepSeek-V3(第 1 页摘要末句,逐字核验)P;已在线核验(2026-09-15:deepseek-ai 组织、main 分支、未归档、代码 MIT + 模型另行许可、HEAD 9b4e978(2025-08-28)、tag v1.0.0;仓库含权重下载与 inference/ 推理参考实现;论文所述 HAI-LLM 训练框架不在该仓库,详见 #linksR
训练框架HAI-LLM:作者自研的高效轻量训练框架(第 12 页 §3.2「crafted by our engineers from the ground up」);论文未给出其开源地址,页面不作开源推断 P
规模与成本口径671B 总参数 / 每 token 激活 37B;14.8T token 预训练;全量训练 2.788M H800 GPU 小时(表 1:预训练 2664K + 长上下文扩展 119K + 后训练 5K),按 $2/GPU 小时租价估 $5.576M;成本不含此前研究与消融 P(第 1、5 页)
一句话判断(编辑推断):I DeepSeek-V3 的论点不是单一算法突破,而是「算法 × 框架 × 硬件」的联合设计:用 MLA 压 KV cache、用细粒度 MoE 压 FLOPs,再把 MoE 的跨节点通信问题当作一等公民来解——DualPipe 把 all-to-all 藏进计算影子、定制内核用 20 个 SM 打满 IB+NVLink、节点受限路由把通信量钉在常数上;同时用 FP8 细粒度量化(1×128/128×128 分组缩放 + CUDA core 累加提升)把 H800 的算力真正换成吞吐。论文口径的结果:14.8T token、2.788M H800 GPU 小时(估 $5.576M)、全程无不可恢复 loss spike。边界必须同时说:成本口径不含研究/消融、且绑定 H800 集群拓扑与租价假设;评测全部出自作者内部框架;推荐推理部署单元大(解码 320 GPU 起),对小团队是论文自己承认的负担。

3 分钟速读

  1. 模型:P Transformer 框架内,MLA(推理只缓存压缩潜向量 c_KV 与解耦 RoPE 键 k_R,KV cache 大幅缩小)+ DeepSeekMoE(61 层中除前 3 层外每层 1 共享 + 256 路由专家、每 token 激活 8 个;亲和度用 sigmoid 并对选中项归一化),新增 auxiliary-loss-free 负载均衡(偏置项只参与 top-K 路由、门控仍用原始亲和度,步末按过载/欠载 ±γ 更新)与 MTP(D=1 的顺序多 token 预测,共享 embedding/输出头,保持完整因果链)(第 6-11 页;第 22 页 §4.2)。
  2. 训练基础设施:P 2048 卡 H800 集群(8 卡/节点 NVLink+NVSwitch、跨节点 IB)上跑 16 路 PP × 64 路 EP(8 节点)× ZeRO-1 DP,不用 TP(第 11-12 页);DualPipe 在一对 forward/backward chunk 内重叠 attention/dispatch/MLP/combine 与 PP 通信,双向流水减少气泡(表 2:气泡 (PP/2−1)(F&B+B−3W),激活内存仅多 PP+1,代价是两份模型参数)(第 12-13 页);跨节点 all-to-all 内核按「先 IB 后 NVLink」两跳转发、每 token 限 4 节点,20 个 SM 即打满带宽(NVLink 160 GB/s ≈ 3.2× IB 50 GB/s)(第 13-14 页)。
  3. FP8 训练:P Linear 的 Fprop/Dgrad/Wgrad 三个 GEMM 用 FP8(理论速度较 BF16 翻倍),embedding/输出头/MoE gating/归一化/attention 保原精度,master weights 与梯度保 FP32;激活按 1×128 tile、权重按 128×128 块分组缩放,按 N_C=128 元素间隔把累加提升到 CUDA core 的 FP32(对抗 H800 约 14 位的 Tensor Core 累加精度),全张量 E4M3、在线量化;激活缓存与 MoE dispatch 也走低精度(BF16 矩、E5M6 特例、combine 保 BF16)(第 14-18 页)。
  4. 训练过程与后训练:P 14.8T token、最大序列 4K、AdamW(β2=0.95)、学习率 2.2×10⁻⁴ 峰值带分段衰减、batch 3072→15360;YaRN 两阶段扩到 128K 上下文;SFT 1.5M 实例(推理数据来自内部 DeepSeek-R1 专家模型 + 拒绝采样)+ GRPO 强化学习(规则 RM + 模型 RM),并从 R1 蒸馏推理能力(第 21-23、28-30 页)。
  5. 结果与边界:P 基础模型评测全面优于 V2-Base/Qwen2.5-72B,多数基准超 LLaMA-3.1-405B(表 3);聊天模型为最佳开源、可比 GPT-4o/Claude-3.5-Sonnet(表 6:MMLU 88.5、MATH-500 90.2、Codeforces 百分位 51.6),SimpleQA/SWE-bench 等仍落后部分闭源(第 31-32 页);MTP 投机解码接受率 85%-90%、解码 1.8× TPS(第 35 页)。I 引用任何数字必须携带「作者内部评测框架、H800 集群、$2/GPU 小时假设」等条件,不能与其它论文横向比较。

2. 问题背景

规模与成本的根本张力:P(第 4 页 §1)开源阵营要追平闭源旗舰,靠稠密堆参数代价高;V3 选择 MoE 路线(671B 总参、37B 激活),并延续 V2 已验证的 MLA + DeepSeekMoE,把「强性能」与「低成本」作为同一设计目标的两面。论文的目标工作负载是超大规模预训练与其后的高吞吐推理服务,效率指标贯穿 KV cache(推理)、激活/优化器显存(训练)与跨节点带宽(MoE 训练)三类资源。

三个具体瓶颈:P跨节点 MoE 通信——细粒度专家若跨节点布放,通信开销与计算几乎 1:1(第 12 页 §3.2.1),传统做法要么放弃跨节点专家要么接受低 MFU; ② FP8 的离群与累加精度——激活/权重/梯度中的离群值与 H800 Tensor Core 仅约 14 位的累加精度,使低精度训练在此规模前少有成功先例(第 14-17 页 §3.3); ③ 推理 KV cache 与部署单元——MHA 的 KV cache 随上下文线性膨胀,而 671B 模型的服务本身要求大部署单元(第 7 页 §2.1.1;第 35 页 §6)。

基线与延续性:P(第 6 页 §2)架构基线是 DeepSeek-V2(未说明的次要细节直接沿用其设置);负载均衡基线是传统辅助损失方法(Fedus/Lepikhin 等)及 Wang et al. 2024a 的 aux-loss-free 策略(V3 将其首次用于超大规模);FP8 基线是 TransformerEngine 类框架的 tensor-wise 做法(NVIDIA 2024b)与混合 E4M3/E5M2 格式(第 17 页);流水线基线是 1F1B、ZB1P 与 Chimera(表 2,第 13 页)。I 论文自我定位是「首次在极大规模模型上验证 FP8 混合精度训练框架」(第 4-5 页贡献列表),其数字回答的是「这套协同设计在 2024-2025 年的 H800 集群上做到了什么」,不代表对其他硬件或其他框架的领先幅度。

3. 核心机制

3.1 MLA:把 KV cache 压成两个潜向量(§2.1.1)

P(第 7-8 页,式 (1)-(11))对输入 h_t 先做降维 c_KV = W_DKV·h_t(d_c ≪ d_h·n_h),key/value 上投影都从 c_KV 出发;RoPE 所需的位置信息由解耦通道单独携带:k_R = RoPE(W_KR·h_t),与 c_KV 拼接后参与注意力。推理时只需缓存 c_KV 与 k_R 两个向量(图 2 中仅二者标「Cached During Inference」),KV cache 显著缩小且性能与 MHA 相当。查询侧同样低秩压缩(c_Q),动机不同:降低训练期激活内存。注意力打分的缩放分母为 √(d_h + d_r^h),即内容维度与 RoPE 维度之和。具体维度见 #experiments 超参表(d_c=512、d_c′=1536、d_r^h=64)。

3.2 DeepSeekMoE + auxiliary-loss-free 负载均衡(§2.1.2)

P(第 8-9 页,式 (12)-(15))FFN 输出 = 共享专家(恒激活)+ top-K_r 路由专家的加权和;与 V2 的两点差异:亲和度改用 sigmoid(s_i,t = Sigmoid(u_t·e_i)),并对选中的亲和度做归一化后作门控值。

P(第 9 页,式 (16))auxiliary-loss-free:给每个专家一个偏置 b_i 加到亲和度上仅用于 top-K 选择;门控值仍来自原始亲和度 s_i,t,因此梯度不受偏置污染。训练中逐步监控整批专家负载,步末对过载专家 b_i − γ、欠载专家 b_i + γ。配合一条极小系数(α=0.0001)的序列级互补辅助损失(式 (17)-(20))防单序列内极端失衡(第 9、23 页)。

P(第 10 页)节点受限路由:每个 token 至多送到 M=4 个节点(按各节点专家最高亲和度之和选节点),在该约束下训练框架可近乎完全实现计算-通信重叠。不丢 token:训练与推理都不丢(第 10 页)。

3.3 MTP:顺序多 token 预测目标(§2.2)

P(第 10-11 页,图 3,式 (21)-(25))D 个顺序模块(V3 取 D=1):第 k 个模块 = 共享 embedding + 共享输出头 + 独立 Transformer 块 TRM_k + 投影 M_k ∈ R^{d×2d};把上一深度表示 h^(k−1) 与下一位置 token 的 embedding 各做 RMSNorm 后拼接投影,经 TRM_k 用共享输出头预测第 k 个额外 token。每个深度保持完整因果链——区别于 Gloeckle et al. 的独立多头并行预测;因果链思想与 EAGLE 相似,但 EAGLE 目标是投机解码、本文用 MTP 改进训练。各深度交叉熵取均值、乘权重 λ 计入总损失(λ=0.3→0.1,见超参表)。推理时可直接丢弃 MTP 模块,也可将其改造用于投机解码(第 11 页)。

3.4 DualPipe:在一对 chunk 内重叠计算与通信(§3.2.1)

P(第 12-13 页,图 4/图 5)跨节点 EP 使计算-通信比约 1:1。DualPipe 把每个 forward/backward chunk 切成 attention、all-to-all dispatch、MLP、all-to-all combine 四段;backward 的 attention/MLP 再按 ZeroBubble 思路拆成 backward-for-input 与 backward-for-weights;再加一段 PP 通信。对这些段重排序并手动调整通信用 SM 占比,使 all-to-all 与 PP 通信都被计算完全遮盖。整体调度为双向流水:micro-batch 从流水线两端同时喂入(图 5 示例 8 个 PP rank、20 个 micro-batch)。表 2 给出一般情形下的账:DualPipe 气泡 (PP/2−1)(F&B+B−3W) 显著小于 1F1B/ZB1P,代价是两份模型参数与峰值激活内存 +1/PP;作者论证大 EP 下参数双份不构成显著负担,且只要求流水级与 micro-batch 能被 2 整除。

3.5 跨节点 all-to-all 内核:先 IB 后 NVLink 的两跳路径(§3.2.2)

P(第 13-14 页)节点内 NVLink 160 GB/s ≈ 3.2× 跨节点 IB 50 GB/s。据此每 token 限发 ≤4 节点:先经 IB 送达目标节点上同 in-node 编号的 GPU,再经 NVLink 即时转发到目标专家所在 GPU(不被后续 token 阻塞);IB 与 NVLink 传输完全重叠,每 token 平均每节点可选 3.2 个专家——同等通信成本下最多可支持 13 个路由专家(4 节点×3.2)。实现上用 warp specialization 把 20 个 SM 分成 10 个通信通道:dispatch 的 IB 发送 / IB→NVLink 转发 / NVLink 接收、combine 的 NVLink 发送 / NVLink→IB 转发累加 / IB 接收累加各由独立 warp 承担、warp 数按全局负载动态调整;定制 PTX 指令 + 自动调优通信 chunk 大小,降低 L2 占用与对计算 SM 的干扰。

3.6 FP8 混合精度训练:精度边界画在哪里(§3.3)

P(第 14-15 页,图 6)混合精度框架:Linear 的 Fprop/Dgrad/Wgrad 三个 GEMM 全部 FP8(理论速度较 BF16 翻倍;FP8 Wgrad 还让激活可以 FP8 缓存),GEMM 输出 BF16/FP32;以下组件保留原精度(BF16/FP32):embedding、输出头、MoE gating、归一化算子、attention 算子;master weights、weight gradients、optimizer states 保高精度(其显存代价经 DP 分摊)。

P(第 15-16 页,图 7a)细粒度量化:激活按 1×128 tile(每 token 每 128 通道)、权重按 128×128 块(每 128 输入通道 × 128 输出通道)分组缩放,缩放因子沿 GEMM 内维 K 逐组引入——标准 FP8 GEMM 不支持,但与下述累加策略配合即可实现。附录 B.2 的反例:把激活梯度也改成 128×128 块级量化会让约 16B MoE 模型(约 300B token)发散,作者归因于 token 相关离群。

P(第 16-17 页,图 7b)累加精度提升:H800 上 FP8 GEMM 的 Tensor Core 累加只保留约 14 位;K=4096 双随机矩阵初测最大相对误差近 2%。对策:每累积 N_C=128 个元素(等效 4 个 WGMMA)就把部分和提升到 CUDA core 的 FP32 寄存器做全精度累加,缩放因子顺势在 CUDA core 上相乘完成反量化;单 warpgroup 的 WGMMA 发射率下降,但 H800 上两个 WGMMA 典型并存、一升一算互相重叠。

P(第 17-18 页)格式与调度:全张量用 E4M3(先前工作 Fprop E4M3 + Dgrad/Wgrad E5M2),可行性来自小组内共享指数位;在线量化——每个 tile/块在线取最大绝对值、即时算缩放因子,不做跨迭代的历史记录。验证:类 V2-Lite 与 V2 两个规模、约 1T token,FP8 相对 BF16 的 loss 相对误差持续 <0.25%(第 15 页;附录 B.1 第 47 页)。

P(第 18 页,§3.3.3)低精度存储与通信:AdamW 一二阶矩用 BF16(master weights 与梯度保 FP32);两个特殊激活——attention 后 Linear 的输入用定制 E5M6 格式(反向时 1×128 tile 转 128×1,缩放因子取 2 的整数次幂以免二次量化误差)、MoE SwiGLU 输入缓存 FP8 且反向重算其输出;MoE 上投影前激活量化 FP8 后再 dispatch(缩放因子同为 2 的幂)、下投影前梯度同理;forward/backward combine 保 BF16

3.7 内存与推理部署要点(§3.2.3、§3.4)

P(第 14 页)内存三板斧:反向重算 RMSNorm 与 MLA 上投影;EMA 参数放 CPU 内存、每步后异步更新(用于学习率衰减后的性能早期估计);借 DualPipe 把最浅层(含 embedding)与最深层(含输出头)放在同一 PP rank,让 MTP 与主模型的共享 embedding/输出头物理共享参数与梯度。

P(第 19-20 页)推理部署 prefill/decode 分离:prefilling 最小单元 4 节点 32 GPU(attention TP4+SP × DP8、MoE EP32、浅层 dense MLP 用 TP1),用冗余专家(在线统计每约 10 分钟调整、32 个冗余专家、每 GPU 多挂 1 个)平衡负载,并双 micro-batch 交叠;decoding 最小单元 40 节点 320 GPU(TP4+SP × DP80、EP320、每 GPU 一个专家、共享专家视为必选路由专家故每 token 选 9 个),all-to-all 走 IB 直连点对点 + IBGDA,每 expert batch 通常 <256 token、访存受限,可给通信只留少量 SM。硬件建议(§3.5):把通信从 SM 卸载到协处理器、统一 IB/NVLink 抽象、提高 FP8 累加精度、原生支持分组缩放 MMA / 在线量化 / 转置 GEMM。

控制面 / 数据面职责划分(编辑推断):I 论文未使用「控制面/数据面」术语。本页划分:控制面=HAI-LLM 框架与并行编排(16PP×64EP×ZeRO-1 DP)、DualPipe 调度与 SM 配比、路由器配置(top-8、≤4 节点、b_i 偏置步末更新)、冗余专家周期调整(在线统计、约 10 分钟粒度)、训练超参与 loss 权重调度;数据面=token 流(BPE 128K → 打包/FIM)、MLA/专家计算中的张量与精度变换(FP8/E5M6/BF16 边界)、all-to-all 的 IB/NVLink 两跳转发、梯度与优化器状态流、EMA 到 CPU 的旁路。该划分只影响叙述,不改变论文事实。
防止张冠李戴(编辑核对结论):I 社会上流传的「42.5% vs 20% 通信占比」「IB 10→20 Gbps 升级」等说法未出现在本报告 PDF 中(全文检索无命中);本报告可核验的通信口径只有三条——跨节点 EP 导致约 1:1 的计算-通信比(第 12 页)、NVLink 160 GB/s ≈ 3.2× IB 50 GB/s(第 13 页)、20/132 个 SM 用于通信(第 20 页)。引用任何其他版本数字前先回到对应来源核实。

4. GPU/系统数据路径

DeepSeek-V3 训练数据路径图:14.8T 语料经 Byte-level BPE 128K 分词与文档打包/FIM 进入 micro-batch;控制面由 HAI-LLM 框架编排 16 路流水线并行、64 路专家并行(8 节点)与 ZeRO-1 数据并行,DualPipe 从两端双向喂入 micro-batch 并把 all-to-all 与 PP 通信藏进计算。主循环每层依次为 RMSNorm、MLA(推理仅缓存 c_KV 与 k_R;attention 算子保 BF16/FP32 原精度)、MoE 路由(sigmoid 亲和度加偏置 b 选 top-8、限 4 节点;MoE gating 保原精度),激活按 1×128 tile 量化为 FP8 后经 dispatch 先 IB 后 NVLink 两跳送达 256 个路由专家(每 GPU 4 个(64 GPU);每专家 128×128 块量化、N_C=128 间隔提升到 CUDA core 的 FP32 累加)加 1 个共享专家,combine 以 BF16 合并;MTP 模块(D=1)与主模型共享 embedding 与输出头。反向路径 Dgrad/Wgrad 走 FP8,attention 后 Linear 输入以 E5M6 缓存,RMSNorm 与 MLA 上投影反向重算;优化器 AdamW 一二阶矩 BF16、master weights 与梯度 FP32,EMA 旁路异步写入 CPU 内存。右侧琥珀色面板列出 H800 的 14 位累加精度限制、激活梯度块级量化发散反例、约 1:1 计算-通信比与解码 320 GPU 部署单元四个风险边界。
图 1:DeepSeek-V3 预训练端到端数据路径(训练态为主,附 MTP 与 EMA 旁路;推理部署要点见 #mechanism 3.7)。实线=运行时数据流,虚线=控制面/调度与监控旁路;青=GPU 计算,橙=IB/NVLink 网络通信,紫=显存/存储与优化器状态,蓝虚线框=控制面,琥珀=论文指出的风险/精度边界;编号 ①-⑧ 对应下方文字序列。本图为编辑合成(论文本身无此整图),依据论文图 2/3/4/6/7 与 §2-§4(arXiv:2412.19437v2)绘制 P;面板编排与编号为本页编辑标注 I

端到端文字序列(与图中编号一致)

  1. ① 数据接入:预训练语料 14.8T token(提高数学/编程占比、扩展中英以外多语言);文档打包不做跨样本 attention masking;以 0.1 比例做文档级 FIM(PSM 框架);Byte-level BPE 分词(词表 128K),「标点+换行」合并 token 随机拆分以缓解 token boundary biasP(第 21-22 页)。
  2. ② 控制面编排:HAI-LLM 框架按 16 路 PP × 64 路 EP(专家均匀铺在 8 节点 64 GPU)× ZeRO-1 DP 放置模型(无 TP);DualPipe 双向流水从两端喂 micro-batch(batch 3072→15360 调度),并手动调配通信用 SM 占比P(第 12-13、23 页)。
  3. ③ 每层主循环(×61,前 3 层 dense FFN):RMSNorm → MLA(内容压缩 c_KV/d_c=512 与解耦 RoPE 键 k_R;attention 算子保原精度)→ RMSNorm → MoE:Router 以 sigmoid 亲和度 + 偏置 b_i 选 top-8、限 4 节点(MoE gating 保原精度;b_i 步末按负载 ±γ 更新),1 共享专家恒激活P(第 7-10、22 页)。
  4. ④ FP8 专家计算与 all-to-all:上投影前激活按 1×128 tile 在线量化 FP8(缩放因子 2 的幂)后 dispatch——先经 IB(50 GB/s)到目标节点同编号 GPU,再经 NVLink(160 GB/s)即时转发到专家 GPU,通信内核用 20 SM/10 通道 warp 专化实现;256 个路由专家的 GEMM 用 128×128 块量化权重 + N_C=128 间隔的 CUDA core FP32 累加;combine 以 BF16 合并返回P(第 13-18 页)。
  5. ⑤ MTP 旁路与损失:主模型顶层表示与下一 token embedding 各做 RMSNorm、拼接投影(M_1∈R^{d×2d})后过 TRM_1,经共享输出头预测第 2 个 token;总损失 = 主 LM 损失 + λ·MTP 损失(λ=0.3→0.1 分段)P(第 10-11、23 页)。
  6. ⑥ 反向与激活管理:Dgrad/Wgrad 走 FP8;attention 后 Linear 的输入以 E5M6 缓存(反向 1×128→128×1 转换、2 的幂缩放因子);SwiGLU 输入缓存 FP8、输出反向重算;RMSNorm 与 MLA 上投影反向重算以省激活内存P(第 14、18 页)。
  7. ⑦ 优化器与精度底线:AdamW(β1=0.9、β2=0.95、wd=0.1),一二阶矩 BF16、master weights 与梯度 FP32;梯度裁剪 1.0;EMA 参数异步维护在 CPU 内存P(第 14、18、22 页)。
  8. ⑧ 推理态差异(对照):MLA 只缓存 c_KV 与 k_R;prefilling 4 节点/32 GPU 起(EP32+冗余专家 32 个、每 GPU +1),decoding 40 节点/320 GPU 起(EP320、每 GPU 1 专家、每 token 选 9 个、IB 点对点 + IBGDA);MTP 模块可丢弃或用于投机解码(接受率 85%-90%、1.8× TPS)P(第 11、19-20、35 页)。
路径上的关键配置与事实(机制口径,非性能结论;性能结论见 #experiments
事实/数值对象与条件论文定位
并行编排 16PP × 64EP(8 节点)× ZeRO-1 DP;无 TP2048 卡 H800 集群训练(8 卡/节点,NVLink+NVSwitch 节点内、IB 跨节点)P 第 11-12 页 §3.1/§3.2
DualPipe:chunk 内四段重排 + 双向流水;气泡 (PP/2−1)(F&B+B−3W)、参数 2×、激活 PP+1对 1F1B/ZB1P 的一般比较(表 2)P 第 13 页表 2
all-to-all 两跳路径(先 IB 后 NVLink);每 token ≤4 节点;20 SM/10 通道;平均 3.2 专家/节点、上限 13 专家跨节点 EP 通信内核(NVLink 160 GB/s ≈ 3.2× IB 50 GB/s)P 第 13-14 页 §3.2.2
FP8 范围:Linear 三 GEMM;原精度范围:embedding/输出头/MoE gating/归一化/attention;master weights 与梯度 FP32、AdamW 矩 BF16混合精度框架(图 6)P 第 14-15、18 页 §3.3/§3.3.1/§3.3.3
激活 1×128 tile、权重 128×128 块分组缩放;N_C=128(4 WGMMA)提升 CUDA core FP32 累加;全张量 E4M3;在线量化FP8 GEMM 精度对策(H800 累加约 14 位)P 第 15-18 页 §3.3.2、图 7
激活缓存:Wgrad FP8 通用 + E5M6 特例(attention 后 Linear 输入)+ SwiGLU 输入 FP8/输出重算;dispatch FP8(2 的幂缩放)、combine BF16低精度存储与通信(§3.3.3)P 第 18 页
重算 RMSNorm 与 MLA 上投影;EMA 在 CPU;MTP 共享 embedding/输出头与主模型同 PP rank 物理共享内存节省三板斧(§3.2.3)P 第 14 页
训练作业的 checkpoint 机制、存储介质与故障恢复流程:论文未明确披露(仅有「无不可恢复 loss spike、未回滚」的结果性表述)与集群存储/容错层的边界(页面不补写)P 第 1 页摘要;I 缺口标注
P 口径提醒(读数方式):本页全部训练机制数字的完整条件是:2048×H800(NVLink+NVSwitch 节点内 / IB 跨节点)、HAI-LLM 框架、16PP×64EP×ZeRO-1 DP、14.8T token、最大序列 4K(第 11-12、22 页)P。FP8 精度结论的验证规模是类 V2-Lite/V2 两个模型、约 1T token(第 15 页),不是 671B 本身的消融P;引用时不得把附录 B 的小规模稳定性证据说成 671B 上的消融。

5. 架构权衡

6. 云上部署映射

以下映射为厂商中立示例;具体产品命名/规格仅作说明并标 E,以厂商当时目录为准,未逐一在线核验。论文事实单独标注 P,仓库现状标注 RI H800 为受出口管制的中国特供型号,公有云可用代际/互联与论文假设不一定对齐——映射时先确认「节点内高带宽 + 跨节点 RDMA」两层拓扑是否可得,再谈机制复用。

DeepSeek-V3 组件 → 云上资源映射
论文需求云上映射(示例)证据与说明
训练算力:2048×H800,8 GPU/节点 NVLink+NVSwitch,跨节点 IB(第 11 页) E 选型按「GPU 代际支持 FP8 GEMM + 节点内 NVLink 级互联 + 跨节点 RDMA 网络」三条件筛实例;训练编排把「8 卡亲和」作为调度单元 硬件前提 P(第 11 页);实例与拓扑映射为云实践 EI 无 RDMA 层时 all-to-all 两跳路径退化为纯节点内 EP,训练效率账需重算
并行布局:16PP×64EP×ZeRO-1 DP,专家均匀铺 8 节点 64 GPU(第 12、23 页) E 作业编排以「PP 组 × EP 组」声明拓扑亲和;弹性伸缩冻结在训练阶段边界(14.8T 主体 / YaRN 两阶段 / SFT/RL)而非步级 并行布局 P;阶段划分 P(第 21-23、28 页);编排建议 E/I
网络:IB 50 GB/s + NVLink 160 GB/s 两跳 all-to-all;20 SM 通信内核;IBGDA(推理)(第 13-14、19 页) E 网络规格(单卡 RDMA 带宽、P2P 时延、GPUDirect/RDMA 能力)写入实例验收项;通信内核编译目标与驱动/CUDA 版本锁定 论文网络口径 P;IBGDA 为论文引用的 NVIDIA 技术 P(第 19 页);云网络验收 E
推理部署单元:prefill ≥4 节点 32 GPU、decode ≥40 节点 320 GPU;prefill/decode 分离(第 19-20 页) E prefill 池与 decode 池分实例组部署、独立扩缩;请求在两池间经队列/路由层衔接;decode 池最小规模直接决定准入门槛 部署单元与分离策略 P(第 18-20 页);池化与路由为云实践 EI 320 GPU 起步的 decode 池对多数团队不可行(论文 §6 自己列出的局限)
负载运维:冗余专家按在线统计周期调整(约 10 分钟);专家负载监控驱动 b_i 更新(训练)(第 9、19 页) E 专家负载/GPU token 分布作为推理服务监控指标;周期任务调整冗余专家配置;训练侧把每步专家负载直方图纳入可观测面板 机制 P(第 9、19 页);监控设计 E/I
权重分发:模型检查点经官方仓库/Hugging Face 分发;仓库含 inference/ 参考(2026-09-15 核验) E 权重放对象存储/模型仓库,节点本地盘缓存;镜像内置锁定版本的推理框架与驱动 仓库定位(权重 + 推理参考,非训练框架)R(2026-09-15 GitHub API);分发拓扑 E
训练存储/checkpoint 与故障恢复:论文未披露实现细节(仅有稳定性结果表述) E 高吞吐并行文件系统/对象存储承载 checkpoint,按框架能力配置;I 本页不把任何 checkpoint 机制归于论文 缺口 P(论文未明确披露)+ I;存储方案 E
放置要点(编辑推断):I ①V3 的效率结论是「拓扑敏感」的:IB/NVLink 带宽比(3.2×)与每 token 4 节点限制共同成立;云上若节点数不足或 RDMA 受限,应先降 EP 规模重算效率,而非照抄 64EP。②prefill/decode 分离的收益来自两阶段不同的瓶颈(compute-bound vs memory-bound),云上落地最小可行单元也可从论文口径向下收缩,但要同步收缩冗余专家与 batch 假设。③训练侧的大杀器(FP8 + DualPipe)绑定 HAI-LLM 内部实现;采用开源框架(如已集成 V3 架构的训练/推理栈)时,论文数字只作上限参考。

7. 成本 / 性能 / SLO

7.1 训练成本(论文口径)

表 1 转录:训练成本(P,PDF 第 5 页;假设 H800 租价 $2/GPU 小时)
口径Pre-TrainingContext ExtensionPost-TrainingTotal
H800 GPU 小时2664K119K5K2788K
USD$5.328M$0.238M$0.01M$5.576M

P(第 5 页)补充口径:每万亿 token 180K H800 GPU 小时(2048 卡集群 3.7 天);预训练不足两个月;后训练等后续阶段合计约 0.1M GPU 小时。成本边界:只含官方训练,排除此前研究与架构/算法/数据消融;美元值是租价假设下的换算,不是云账单。I 引用该数字时的最小诚实写法是「2.788M H800 GPU 小时(论文按 $2/GPU 小时估 $5.576M,不含前期研究与消融)」。

7.2 容量与成本公式(参数化,编辑推断)

训练成本 ≈ 训练 token 数(T) × 每 token GPU 小时 × 租价 p
 (论文锚点:T=14.8T 时 ≈ 2664K GPU 小时 → ≈ 0.18M GPU 小时/万亿 token;预训练段 p=$2/GPU 小时 → $5.328M)
扩展成本 ≈ YaRN 两阶段(119K GPU 小时)+ 后训练(5K GPU 小时),与数据管线强相关、不可按 token 线性外推
云上换算 ≈ Σ(阶段 GPU 小时) × 当时实例单价 ÷ 卡时折扣率;单价按查询当时厂商目录记录日期
推理成本 ≈ prefill 池 GPU 时 + decode 池 GPU 时;decode 池最小 320 GPU(论文部署单元)是固定门槛项

I 论文可支撑的量只有 2664K/119K/5K GPU 小时与 $2/GPU 小时假设(第 5 页);实例单价、折扣、可利用率、推理流量画像需按部署实测填写,本页不给出伪精确总价。E 云单价随时段/区域/折扣变化,核算时以查询当时厂商目录为准并记录日期。

7.3 性能/SLO 相关的论文事实与缺口

8. 安全与可运维性

8.1 安全

8.2 可运维性(含恢复与回滚)

9. 适用 / 不适用场景

适用(触发条件 + 理由)

  1. 有 RDMA 高速互联的大规模 MoE 预训练。触发:集群具备「节点内 NVLink 级 + 跨节点 IB 级」两层拓扑、数百卡以上。理由:V3 的 1:1 计算-通信比问题、DualPipe 重叠与两跳 all-to-all 内核正是为此设计;每万亿 token 180K H800 GPU 小时的效率以此为前提P(第 5、11-14 页)。
  2. 想在 Hopper 类硬件上做 FP8 大规模训练的团队。触发:需要压缩训练显存/算力成本,且能投入实现细粒度量化栈。理由:论文首次在极大规模验证 FP8 框架,给出了完整的精度边界清单(1×128/128×128 分组缩放、N_C=128 累加提升、E4M3、在线量化、E5M6 特例)与 16B/230B 级稳定性证据(<0.25% 相对 loss 误差)P(第 14-18、47 页)。
  3. 长上下文(至 128K)+ KV cache 敏感的自建推理服务。触发:服务需 32K-128K 上下文且显存预算紧张。理由:MLA 只缓存 c_KV 与 k_R,YaRN 两阶段扩展到 128K 且 NIAH 全程表现良好P(第 7、23 页)。
  4. 以推理吞吐为目标、可维护大 decode 池的私有化部署。触发:流量稳定、能承担 320 GPU 起的 decode 池与 prefill/decode 分离运维。理由:论文部署策略(冗余专家 + IBGDA + 双 micro-batch 交叠)实现「较 V2 端到端生成速度快两倍以上」,MTP 投机再加 1.8× TPSP(第 19-20、35-36 页)。

不适用(触发条件 + 理由)

  1. 小团队 / 小规模部署单元。触发:可用 GPU 池远小于论文推荐部署单元。理由:论文自述「推荐部署单元相对较大,可能对小团队构成负担」(decode 最小 40 节点 320 GPU)P(第 19、35 页)。I 此类场景应评估量化压缩后的单机/少卡方案,而非照搬论文部署拓扑。
  2. 缺少跨节点 RDMA 或节点内高带宽互联的环境。触发:单卡无 RDMA、多机以太网、或节点内无 NVLink 级互联。理由:all-to-all 两跳路径、节点受限路由与 20 SM 通信内核全部以 IB+NVLink 带宽比(160 vs 50 GB/s)为设计输入P(第 13-14 页);I 拓扑退化后论文的通信结论不成立。
  3. 把 $5.576M 当作复现总预算的项目。触发:以表 1 直接立项。理由:论文明确排除此前研究与架构/算法/数据消融成本,且美元值绑定 $2/GPU 小时租价假设P(第 5 页);I 复现还需数据、试错与推理成本,均不在口径内。
  4. 无法承载双份流水线参数或小 EP 的训练作业。触发:EP 规模小、显存余量紧。理由:DualPipe 保留两份模型参数、激活 +1/PP,其收益论证建立在「大 EP」上(表 2 及正文)P(第 13 页)。
  5. 依赖论文未披露能力的需求。触发:需要 checkpoint 机制细节、多语言能力清单、RL 基础设施实现等。理由:论文未明确披露这些内容(详见 #evidence 缺口清单)P+I;不得把论文之后的 DeepSeek 版本能力(如后续模型的架构或功能)记到本文头上。

10. 实验与指标

10.1 训练与对齐配置 P(第 21-23、28-30 页)

设置与口径(页码均已核验)
模型61 层、隐维 7168、init std 0.006;MLA n_h=128 / d_h=128 / d_c=512 / d_c′=1536 / d_r^h=64;前 3 层 dense FFN,其余每层 1 共享 + 256 路由专家(中间维 2048)、激活 8、限 4 节点;MTP D=1;671B 总参 / 37B 激活 P(第 22 页 §4.2)
优化器 / 调度AdamW β1=0.9、β2=0.95、wd=0.1;梯度裁剪 1.0;序列长 4K、14.8T token;学习率 0→2.2×10⁻⁴(2K 步 warmup)→恒定至 10T→余弦至 2.2×10⁻⁵(4.3T 内)→末 500B:333B@2.2×10⁻⁵ + 167B@7.3×10⁻⁶;batch 3072→15360(前 469B);γ=0.001(前 14.3T)→0.0;α=0.0001;λ=0.3(前 10T)→0.1 P(第 22-23 页)
长上下文YaRN 两阶段各 1000 步:4K→32K(batch 1920)→128K(batch 480);仅作用于解耦共享键 k_R;s=40、α=1、β=32、缩放 √(0.1·ln s+1);学习率 7.3×10⁻⁶ P(第 23 页 §4.3、图 8)
SFT / RLSFT 1.5M 实例、2 epochs、余弦 5×10⁻⁶→1×10⁻⁶、样本打包+masking;推理数据源自内部 R1 专家模型(SFT+RL 流水线 + 拒绝采样);RL 用 GRPO(组相对基线、KL 正则),规则 RM + 自 SFT 检查点训练的模型 RM P(第 28-30 页)
FP8 验证规模类 V2-Lite(约 16B 总参、1.33T token)与类 V2(约 230B、约 0.9T token)对照 BF16;相对 loss 误差 <0.25%;块级量化激活梯度在 16B/约 300B token 上发散(附录 B.1/B.2)P(第 15、47-48 页)
评测框架基础模型:内部评测框架(集成于 HAI-LLM)、同设置对比 V2-Base/Qwen2.5-72B/LLaMA-3.1-405B;困惑度类用 perplexity、生成类用生成式、Pile-test 用 BPB;聊天模型:输出上限 8192 token、AIME/CNMO 温度 0.7×16 次平均、MATH-500 贪心、闭源经 API P(第 24、30-31 页)

10.2 基础模型评测(表 3 选列,全表 32 行已逐格核验)

表 3 转录(选列):DeepSeek-V3-Base vs 开源基线(P,PDF 第 25 页;内部框架同一设置;差距 ≤0.3 视为同级)
基准(指标)shotsV2-Base (21B/236B)Qwen2.5-72BLLaMA3.1-405BV3-Base (37B/671B)
Pile-test (BPB)0.6060.6380.5420.548
BBH (EM)3-shot78.879.882.987.5
MMLU (EM)5-shot78.485.084.487.1
MMLU-Pro (EM)5-shot51.458.352.864.4
DROP (F1)3-shot80.480.686.089.0
HumanEval (Pass@1)0-shot43.353.054.965.2
LiveCodeBench-Base (Pass@1)3-shot11.612.915.519.4
GSM8K (EM)8-shot81.688.383.589.3
MATH (EM)4-shot43.454.449.061.6
C-Eval (EM)5-shot81.489.272.590.1
MMMLU-non-English (EM)5-shot64.074.873.879.4

P(第 25-26 页)论文自己的边界句:V3-Base 全面优于 V2-Base/Qwen2.5-72B、多数基准超 LLaMA-3.1-405B;但 V3-Base 非最佳的行包括 Pile-test(LLaMA 0.542 vs 0.548)、HellaSwag、WinoGrande、RACE-Middle/High、CLUEWSC、CMMLU、CCPM;评测框架数月间的变化使 V2-Base 成绩与此前报告略有出入。

10.3 消融(表 4/表 5 + 批级对照)

表 4 转录(选行):MTP 消融(P,PDF 第 26 页;大规模 228.7B/20.9B、540B token;推理丢弃 MTP,成本相同)
基准Small 基线 (15.7B)Small w/MTPLarge 基线 (228.7B)Large w/MTP
BBH (EM)39.041.470.070.7
MMLU (EM)50.053.367.566.6
HumanEval (Pass@1)20.726.844.553.7
GSM8K (EM)25.431.472.374.0
MATH (EM)10.712.638.639.8

I 读表提醒:MMLU 大规模行是 MTP 消融中明显的反例(67.5→66.6),论文措辞为「多数基准提升(most)」——引用时不应写成「全面提升」。

表 5 转录(选行):aux-loss-free 消融(P,PDF 第 27 页;大规模 228.7B、578B token——与表 4 的 540B 是两组不同训练量的实验,照录不调和)
基准Large Aux-Loss-BasedLarge Aux-Loss-Free
Pile-test (BPB)0.6560.652
BBH (EM)66.767.9
MMLU (EM)68.367.2
HumanEval (Pass@1)40.246.3
GSM8K (EM)70.774.5
MATH (EM)37.239.6

P(第 27-28 页)批级 vs 序列级对照:1B MoE 验证损失 2.258(序列级辅助损失)/ 2.253(aux-loss-free)/ 2.253(批级辅助损失);3B MoE:2.085 / 2.080 / 2.080——达到相近批级均衡时批级辅助损失也能达到相近性能;图 9 显示 aux-loss-free 专家专化模式更强。

10.4 聊天模型评测(表 6 选行)与开放/奖励评测(表 7/8)

表 6 转录(选行):DeepSeek-V3 vs 代表模型(P,PDF 第 31 页;输出上限 8K;闭源经 API)
基准(指标)Qwen2.5-72B-InstLLaMA3.1-405B-InstClaude-3.5-Sonnet-1022GPT-4o-0513DeepSeek-V3
MMLU (EM)85.388.688.387.288.5
GPQA-Diamond (Pass@1)49.051.165.049.959.1
SimpleQA (Correct)9.117.128.438.224.9
DROP (3-shot F1)76.788.788.383.791.6
LiveCodeBench (Pass@1-CoT)31.128.436.333.440.5
Codeforces (Percentile)24.825.320.323.651.6
SWE Verified (Resolved)23.824.550.838.842.0
AIME 2024 (Pass@1)23.323.316.09.339.2
MATH-500 (EM)80.073.878.374.690.2
C-SimpleQA (Correct)48.450.451.359.364.8

P(第 31-33 页)其余关键结果:Arena-Hard 85.5 / AlpacaEval 2.0(长度控制胜率)70.0(表 7;GPT-4-Turbo-1106 判官;对 GPT-4-0314 基线胜率 >86%;首个 Arena-Hard 破 85% 的开源模型);RewardBench 平均 87.0、maj@6 89.6(表 8);R1 蒸馏消融(表 9,基于 V2.5):LiveCodeBench-CoT 31.1→37.4、MATH-500 74.6→83.2,代价是平均响应长度 718→783 / 769→1510;MTP 投机解码:第二 token 接受率 85%-90%、1.8× TPS(第 35 页)。

各结果条件字段完整性(缺项一律显式标注)
实验硬件/规模精度负载/配置基线定位
预训练(表 1)2048×H800(NVLink+IB)FP8 混合精度(细粒度量化)14.8T token、seq ≤4K、batch 3072→15360无外部基线(成本口径)P 第 5、11-23 页
FP8 vs BF16(附录 B)约 16B / 约 230B MoEFP8 vs BF161.33T / 约 0.9T token;EMA 0.9 平滑曲线BF16 同规模训练P 第 47 页
基础模型(表 3)21B/72B/405B/37B 激活论文未明确披露(评测推理精度)per-shot 见表;内部框架统一设置V2-Base、Qwen2.5-72B、LLaMA3.1-405BP 第 24-25 页
MTP / 负载消融(表 4/5)15.7B、228.7B MoE论文未明确披露1.33T / 540B / 578B token自身消融(数据/架构不变)P 第 26-27 页
聊天评测(表 6)37B 激活 / 671B论文未明确披露输出 ≤8192;AIME/CNMO 0.7 温度×16 次5 个开源/闭源对话模型(API)P 第 30-31 页
推理加速(§5.4.3)论文未明确披露(部署规模未给)论文未明确披露MTP 投机解码;各主题自身无 MTP 投机路径P 第 35 页
公平性限制(引用前必读):P ①全部评测出自作者内部框架(集成于 HAI-LLM),闭源基线经 API 评测,与其他论文/公开榜单数字不可直接比较;②LiveCodeBench 限定 2024-08~11 题目窗、LongBench v2 发布仅数周即被评测,时效窗即结论边界;③「最佳开源/可比闭源」是论文的自评定性,逐行数字里 SimpleQA(24.9 vs GPT-4o 38.2)、SWE Verified(42.0 vs Claude 50.8)、Aider(79.7 vs 84.2)等明确落后项应一并引用;④表 4/表 5 两个大规模消融的训练 token 量不同(540B/578B),论文未解释差异;⑤文档内两处 Figure 10 重复编号(loss 曲线与专家负载热图),引用图号时注明页码。

10.5 建议复现/验证步骤(编辑推断)

  1. I 权重与许可:从官方仓库取 tag v1.0.0 或锁定 commitR(2026-09-15 核验),先读 LICENSE-MODEL 确认商用条款(代码 MIT ≠ 权重无条件可用)。
  2. I 架构对齐:61 层/7168 隐维/128 头/MLA(512,1536,64)/256+1 专家/激活 8/限 4 节点/MTP D=1,与开源实现逐项比对P(第 22 页)。
  3. I FP8 稳定性预演:按附录 B 协议在 16B 级 MoE 上跑 FP8 vs BF16 对照(预期相对 loss 误差 <0.25%),再验证「激活梯度块级量化会发散」这一负结果以确认实现对齐P(第 47-48 页)。
  4. I 通信与调度验证:在自有拓扑上测 all-to-all 占比与 DualPipe 式重叠收益;若 IB/NVLink 带宽比偏离 3.2×,重算每 token 节点上限(论文的 4 节点/13 专家账)P+I(第 13-14 页)。
  5. I 评测复测:以 simple-evals 提示复测 MMLU/DROP/GPQA/SimpleQAR(脚注 4 印明仓库,已核验),再按业务分布自建回归集;LiveCodeBench 结果绑定其时间窗,需注明。
  6. I 推理试点:先以纯主模型路径上线,再灰度 MTP 投机路径,记录接受率(论文口径 85%-90%)与 1.8× TPS 在自有流量下的复现值P+I(第 35 页)。

12. 给架构师的决策清单

I 以下为落地前的勾选项;标注(P)的条目对应论文证据,(R)对应仓库核验项,其余为工程判断。

13. 证据台账

下表为核心结论的证据映射;逐条引文与核验记录见构建文件 sources/deepseek-v3.evidence.json(54 条,EV-01~EV-54)。核验日期为

核验范围声明:三轮核验。第一轮:sources/deepseek-v3.txt 全文(2614 行)+ pdftotext -layout 逐页切片(53 页)作检索索引,并确认提取文本的两类损伤(第 14-15 页交界乱码行、表 2 分式与公式打散),一律以原页为准。第二轮:pdftoppm 渲染全部 53 页逐页目检(第 1-53 页无一遗漏),覆盖摘要、目录、图 1-10、表 1-9、公式 (1)-(28)、脚注 1-4、参考文献(第 37-44 页)与附录 A/B/C;第 13 页表 2 的气泡公式 (PP/2−1)(F&B+B−3W) 与「峰值激活内存增加 1/PP 倍」以 300dpi 局部放大逐字复核。第三轮(同日,交付前):对照逐页文本切片逐条复核本台账全部定位与引文;全文检索确认「42.5%」「20Gbps」「10Gbps」不出现在本报告。官方仓库、tag v1.0.0 与 openai/simple-evals 于 2026-09-15 经 GitHub API 只读复核。
关键结论 → 证据级别 → 定位 → 核验状态(EV 编号对应 sources/deepseek-v3.evidence.json)
EV关键结论级别定位(PDF 页码)核验状态
EV-01题名/署名 DeepSeek-AI/arXiv v2 水印(cs.CL,18 Feb 2025)/53 页/无会议信息/附录 A 角色化名单P第 1、45-47 页;pdfinfo已核验(原页目检)
EV-02摘要级结论:671B/37B、MLA+DeepSeekMoE、aux-loss-free、MTP、14.8T、2.788M GPU 小时、无不可恢复 loss spike、检查点仓库地址P第 1 页摘要已核验(逐句)
EV-03表 1 成本四列数值 + $2/GPU 小时假设 + 180K/万亿 token + 排除前期研究与消融P第 5 页表 1 与 §1已核验(逐格)
EV-04架构基线:Transformer + MLA + DeepSeekMoE;次要细节沿用 V2P第 6 页 §2已核验
EV-05MLA:c_KV/k_R 缓存、查询低秩压缩省训练激活、softmax 分母 √(d_h+d_r^h)(式 1-11)P第 7-8 页、图 2已核验(公式逐项)
EV-06DeepSeekMoE:细粒度+共享专家;sigmoid 亲和度 + 选中归一化(式 12-15,与 V2 的差异点)P第 8-9 页已核验
EV-07aux-loss-free:b_i 只用于路由、门控用原始亲和度、步末 ±γ 更新(式 16)P第 9 页已核验
EV-08互补序列级辅助损失(式 17-20;α=0.0001)P第 9、23 页已核验
EV-09节点受限路由(≤M=4 节点)与近乎完全的计算-通信重叠P第 10、23 页已核验
EV-10训练与推理都不丢 tokenP第 10 页已核验
EV-11MTP:D=1、共享 embedding/输出头、M_k∈R^{d×2d}、完整因果链(式 21-25、图 3;λ 分段)P第 10-11、23 页已核验(公式逐项)
EV-12MTP 推理:可丢弃;可改造为投机解码P第 11 页已核验
EV-13集群:2048×H800、8 GPU/节点 NVLink+NVSwitch、跨节点 IBP第 11 页 §3.1已核验
EV-14HAI-LLM(内部自研);16PP×64EP(8 节点)×ZeRO-1 DP;无 TPP第 12 页 §3.2已核验
EV-15DualPipe:四段重排 + backward 拆分(仿 ZeroBubble)+ SM 配比;图 4/图 5(8 rank、20 micro-batch)P第 12-13 页已核验(原页目检)
EV-16表 2:1F1B/ZB1P/DualPipe 气泡公式、参数 2×、激活 PP+1、+1/PP 表述、两份参数与大 EP 论证P第 13 页表 2 及正文已核验(300dpi 放大)
EV-17all-to-all 内核:NVLink 160≈3.2×IB 50 GB/s、≤4 节点、两跳转发、3.2/13 专家、20 SM/10 通道、PTX 定制P第 13-14 页 §3.2.2已核验
EV-18内存三板斧:RMSNorm/MLA 上投影重算、CPU EMA、MTP 共享层同 PP rank 物理共享P第 14 页 §3.2.3已核验
EV-19FP8 框架:三 GEMM FP8、五类算子保原精度、master/梯度/矩的精度分工、<0.25% 相对 loss 误差(类 V2-Lite/V2、约 1T token 验证)P第 14-15、47 页、图 6已核验
EV-20细粒度量化:1×128/128×128、内维 K 逐组缩放、microscaling 一致性、B.2 激活梯度块级量化发散反例P第 15-17、47-48 页、图 7a已核验
EV-21累加精度:H800 约 14 位、K=4096 近 2% 误差、N_C=128(4 WGMMA)CUDA core FP32 提升、双 WGMMA 重叠P第 16-17 页、图 7b已核验
EV-22全张量 E4M3(对比混合 E4M3/E5M2)及其可行性归因P第 17 页已核验
EV-23在线量化(对 delayed quantization 的替代)P第 17-18 页已核验
EV-24AdamW 矩 BF16、master weights/梯度 FP32P第 18 页已核验
EV-25E5M6 特例激活(1×128→128×1、2 的幂缩放)、SwiGLU 输入 FP8 缓存+重算P第 18 页已核验
EV-26dispatch FP8(2 的幂缩放)、combine 保 BF16P第 18 页已核验
EV-27Prefilling:4 节点/32 GPU、TP4+SP×DP8、EP32、冗余专家 32 个/每 GPU +1、约 10 分钟周期、双 micro-batch、动态冗余探索P第 19 页 §3.4.1已核验
EV-28Decoding:40 节点/320 GPU、TP4+SP×DP80、EP320、每 token 9 专家、IB P2P+IBGDA、batch/expert <256、访存受限P第 19-20 页 §3.4.2已核验
EV-29硬件建议:20/132 SM 通信卸载与 IB/NVLink 统一抽象;14 位累加细节、组缩放 MMA、在线量化/转置 GEMM 支持、近存计算约 50% 片外访存P第 20-21 页 §3.5已核验
EV-30数据:14.8T、文档打包、FIM 0.1(PSM)、BPE 128K、token boundary bias 缓解P第 21-22 页 §4.1已核验
EV-31模型超参全表(61 层/7168/128 头/512/1536/64、前 3 层 dense、256+1 专家、激活 8、D=1、671B/37B)P第 22 页 §4.2已核验(逐项)
EV-32训练超参全表(AdamW/LR 分段/batch 调度/γ/α/λ 切换点/M=4/64 GPU 专家布局)P第 22-23 页 §4.2已核验(逐项)
EV-33YaRN 两阶段 4K→32K→128K(s=40、α=1、β=32、7.3×10⁻⁶);图 8 NIAH 至 128KP第 23 页 §4.3、图 8已核验
EV-34表 3 基础模型评测全量(含 V3-Base 非最佳行与 ≤0.3 同级口径、V2-Base 数字漂移说明)P第 24-26 页、表 3已核验(逐格)
EV-35表 4 MTP 消融(540B;含 MMLU 67.5→66.6 反例行)P第 26 页已核验(逐格)
EV-36表 5 aux-loss-free 消融(578B;含 MMLU 68.3→67.2 反例行)P第 27 页已核验(逐格)
EV-37批级 vs 序列级对照(1B/3B 验证损失三组数值)与图 9 专家专化P第 27-28 页、图 9已核验
EV-38SFT:1.5M 实例、R1 专家模型 + 拒绝采样、2 epochs、5×10⁻⁶→1×10⁻⁶、sample maskingP第 28-29 页 §5.1已核验
EV-39RM:规则型(box/编译器)+ 模型型(自 SFT 检查点、含 CoT 偏好数据防 reward hacking)P第 29 页 §5.2.1已核验
EV-40GRPO(式 26-28:组相对优势、clip、KL 估计式;多域提示)P第 30 页 §5.2.2已核验(公式逐项)
EV-41评测设置:基准清单、6 个基线、simple-evals/Zero-Eval/agentless/diff/温度 0.7×16/输出 8192、脚注 1-4 URLP第 30-31 页 §5.3.1已核验
EV-42表 6 聊天评测(含 SimpleQA/SWE/Aider 落后项与「约 10%」表述)P第 31-32 页、表 6已核验(逐格)
EV-43表 7 开放式评测(85.5/70.0;>86% 胜率、首个破 85% 开源)P第 33 页已核验
EV-44表 8 RewardBench(87.0;maj@6 89.6)P第 33-34 页已核验(逐格)
EV-45表 9 R1 蒸馏消融(31.1→37.4、74.6→83.2;响应长度 718→783、769→1510 的权衡)P第 34 页已核验(逐格)
EV-46Self-rewarding(constitutional AI + 自投票反馈)P第 34-35 页 §5.4.2已核验
EV-47MTP 推理:接受率 85%-90%、1.8× TPSP第 35 页 §5.4.3已核验
EV-48结论与局限:部署单元大(小团队负担)、端到端 >2× V2、未来方向(含防基准过拟合表述)P第 35-36 页 §6已核验
EV-49文档内不一致:两处 Figure 10 重复编号(loss 曲线第 47 页 / 专家负载热图第 49-53 页),照录不调和P第 47-48、53 页已核验(原页目检)
EV-50官方仓库现状:deepseek-ai/DeepSeek-V3、代码 MIT+模型许可、main@9b4e978(2025-08-28)、tag v1.0.0、权重+inference/;HAI-LLM 不在仓库R论文出处第 1 页摘要;在线核验 2026-09-15(GitHub API 只读)已核验(归属/许可/分支/HEAD/tag/目录)
EV-51评测提示框架仓库 openai/simple-evals(脚注 4;MIT、main、未归档)R论文出处第 30 页脚注 4;在线核验 2026-09-15已核验
EV-52云上映射示例(实例代际、RDMA、对象存储、编排、可观测)E各云厂商公开文档(未逐项拉取)未逐一在线核验;使用前按当时目录复核
EV-53编辑推断项:控制面/数据面划分、图 1 面板编排、成本/容量公式、云映射推断、安全运维建议、「42.5%/20Gbps 不出自本文」核对结论、复现步骤I本报告 §1-§12 与 sources/deepseek-v3.evidence.json编辑标注完成;不含伪精确数字
EV-54图 1 柱状图(MMLU-Pro 75.9、GPQA 59.1、MATH-500 90.2、AIME 39.2、Codeforces 51.6、SWE 42.0,与表 6 一致)P第 1 页图 1已核验(逐柱)

P 数据缺口集中声明:训练/推理 checkpoint 机制、存储介质与故障恢复流程、每 GPU tokens/s 与 MFU、TTFT/TPOT、服务并发与 SLO 数值、集群网络设备与成本明细、评测推理精度、能耗——论文未明确披露;I 本页所有缺口均未以推断填充。