DeepSeek-V3:671B/37B MoE、FP8 训练与 DualPipe 的算法—基础设施协同设计
本页为第 16 篇(训练、并行与 GPU Kernel 类,核心合集末篇)。定量内容取自本地论文 PDF 16_DeepSeek-V3_2412.19437.pdf(arXiv:2412.19437v2,水印逐字核验「arXiv:2412.19437v2 [cs.CL] 18 Feb 2025」,DeepSeek-AI 署名,共 53 页)并逐条标注 PDF 页码;全部 53 页经渲染原页逐页目检,表 1-9 逐格核对、公式 (1)-(28) 逐项核对(表 2 气泡公式与激活内存增幅以 300dpi 放大复核),详见 #evidence 与 sources/deepseek-v3.evidence.json(54 条)。
快速标签与阅读说明
- 生命周期:预训练 + 长上下文扩展 + SFT/RL 后训练 + 推理部署(端到端模型报告)
- 形态:模型架构(MLA/DeepSeekMoE/MTP)× 训练基础设施(DualPipe/通信内核/FP8)协同设计
- 目标硬件:2048×NVIDIA H800 集群(节点内 NVLink+NVSwitch、跨节点 InfiniBand)
- 核心资源:跨节点网络(IB/NVLink all-to-all)· 显存(激活/优化器状态)· 算力(FP8 GEMM 累加精度)
- 证据状态:P(论文,页码级核验)+ R(摘要印明仓库,已在线核验)+ E/I
最后核验日期:。证据完整度:论文核心数字(摘要、表 1-9 全量、图 1/4/5/8 柱顶与面板标注、式 (1)-(28)、§2-§6 与附录 A/B/C)已回 PDF 原页逐项核验并标注页码与实验条件;文档内两处编号/口径现象照录不调和(两处 Figure 10 重复编号;表 4 用 540B、表 5 用 578B 两个不同的大规模消融 token 量);训练 checkpoint 机制、每 GPU tokens/s、MFU、集群成本明细、推理时延数字论文未披露,页面写「论文未明确披露」;$5.576M 仅在论文自述的 $2/GPU 小时租价假设与「不含前期研究/消融」口径内引用。
证据标签图例: P=论文 R=仓库 E=外部资料 I=编辑推断
1. 摘要与一句话判断
| 题名 | DeepSeek-V3 Technical Report(编辑译名:DeepSeek-V3 技术报告) |
|---|---|
| 署名 / 机构 | DeepSeek-AI(联系邮箱 research@deepseek.com,第 1 页)。第 1 页无个人作者列表;附录 A(第 45-47 页)按 Research & Engineering / Data Annotation / Business & Compliance 三角色列成员,注明组内按 first name 字母序排列、带 * 为已离团队成员 P |
| 版本 | arXiv:2412.19437v2(PDF 左侧水印逐字核验「arXiv:2412.19437v2 [cs.CL] 18 Feb 2025」);本地 PDF 16_DeepSeek-V3_2412.19437.pdf(53 页,pdfTeX-1.40.25,创建 2025-02-19)。PDF 内未标注会议/期刊录用信息,本页不作会议归属推断 P |
| 代码 / 权重 | 论文摘要印明「模型检查点」发布于 github.com/deepseek-ai/DeepSeek-V3(第 1 页摘要末句,逐字核验)P;已在线核验(2026-09-15:deepseek-ai 组织、main 分支、未归档、代码 MIT + 模型另行许可、HEAD 9b4e978(2025-08-28)、tag v1.0.0;仓库含权重下载与 inference/ 推理参考实现;论文所述 HAI-LLM 训练框架不在该仓库,详见 #links)R |
| 训练框架 | HAI-LLM:作者自研的高效轻量训练框架(第 12 页 §3.2「crafted by our engineers from the ground up」);论文未给出其开源地址,页面不作开源推断 P |
| 规模与成本口径 | 671B 总参数 / 每 token 激活 37B;14.8T token 预训练;全量训练 2.788M H800 GPU 小时(表 1:预训练 2664K + 长上下文扩展 119K + 后训练 5K),按 $2/GPU 小时租价估 $5.576M;成本不含此前研究与消融 P(第 1、5 页) |
3 分钟速读
- 模型:P Transformer 框架内,MLA(推理只缓存压缩潜向量 c_KV 与解耦 RoPE 键 k_R,KV cache 大幅缩小)+ DeepSeekMoE(61 层中除前 3 层外每层 1 共享 + 256 路由专家、每 token 激活 8 个;亲和度用 sigmoid 并对选中项归一化),新增 auxiliary-loss-free 负载均衡(偏置项只参与 top-K 路由、门控仍用原始亲和度,步末按过载/欠载 ±γ 更新)与 MTP(D=1 的顺序多 token 预测,共享 embedding/输出头,保持完整因果链)(第 6-11 页;第 22 页 §4.2)。
- 训练基础设施:P 2048 卡 H800 集群(8 卡/节点 NVLink+NVSwitch、跨节点 IB)上跑 16 路 PP × 64 路 EP(8 节点)× ZeRO-1 DP,不用 TP(第 11-12 页);DualPipe 在一对 forward/backward chunk 内重叠 attention/dispatch/MLP/combine 与 PP 通信,双向流水减少气泡(表 2:气泡 (PP/2−1)(F&B+B−3W),激活内存仅多 PP+1,代价是两份模型参数)(第 12-13 页);跨节点 all-to-all 内核按「先 IB 后 NVLink」两跳转发、每 token 限 4 节点,20 个 SM 即打满带宽(NVLink 160 GB/s ≈ 3.2× IB 50 GB/s)(第 13-14 页)。
- FP8 训练:P Linear 的 Fprop/Dgrad/Wgrad 三个 GEMM 用 FP8(理论速度较 BF16 翻倍),embedding/输出头/MoE gating/归一化/attention 保原精度,master weights 与梯度保 FP32;激活按 1×128 tile、权重按 128×128 块分组缩放,按 N_C=128 元素间隔把累加提升到 CUDA core 的 FP32(对抗 H800 约 14 位的 Tensor Core 累加精度),全张量 E4M3、在线量化;激活缓存与 MoE dispatch 也走低精度(BF16 矩、E5M6 特例、combine 保 BF16)(第 14-18 页)。
- 训练过程与后训练:P 14.8T token、最大序列 4K、AdamW(β2=0.95)、学习率 2.2×10⁻⁴ 峰值带分段衰减、batch 3072→15360;YaRN 两阶段扩到 128K 上下文;SFT 1.5M 实例(推理数据来自内部 DeepSeek-R1 专家模型 + 拒绝采样)+ GRPO 强化学习(规则 RM + 模型 RM),并从 R1 蒸馏推理能力(第 21-23、28-30 页)。
- 结果与边界:P 基础模型评测全面优于 V2-Base/Qwen2.5-72B,多数基准超 LLaMA-3.1-405B(表 3);聊天模型为最佳开源、可比 GPT-4o/Claude-3.5-Sonnet(表 6:MMLU 88.5、MATH-500 90.2、Codeforces 百分位 51.6),SimpleQA/SWE-bench 等仍落后部分闭源(第 31-32 页);MTP 投机解码接受率 85%-90%、解码 1.8× TPS(第 35 页)。I 引用任何数字必须携带「作者内部评测框架、H800 集群、$2/GPU 小时假设」等条件,不能与其它论文横向比较。
2. 问题背景
规模与成本的根本张力:P(第 4 页 §1)开源阵营要追平闭源旗舰,靠稠密堆参数代价高;V3 选择 MoE 路线(671B 总参、37B 激活),并延续 V2 已验证的 MLA + DeepSeekMoE,把「强性能」与「低成本」作为同一设计目标的两面。论文的目标工作负载是超大规模预训练与其后的高吞吐推理服务,效率指标贯穿 KV cache(推理)、激活/优化器显存(训练)与跨节点带宽(MoE 训练)三类资源。
三个具体瓶颈:P ① 跨节点 MoE 通信——细粒度专家若跨节点布放,通信开销与计算几乎 1:1(第 12 页 §3.2.1),传统做法要么放弃跨节点专家要么接受低 MFU; ② FP8 的离群与累加精度——激活/权重/梯度中的离群值与 H800 Tensor Core 仅约 14 位的累加精度,使低精度训练在此规模前少有成功先例(第 14-17 页 §3.3); ③ 推理 KV cache 与部署单元——MHA 的 KV cache 随上下文线性膨胀,而 671B 模型的服务本身要求大部署单元(第 7 页 §2.1.1;第 35 页 §6)。
基线与延续性:P(第 6 页 §2)架构基线是 DeepSeek-V2(未说明的次要细节直接沿用其设置);负载均衡基线是传统辅助损失方法(Fedus/Lepikhin 等)及 Wang et al. 2024a 的 aux-loss-free 策略(V3 将其首次用于超大规模);FP8 基线是 TransformerEngine 类框架的 tensor-wise 做法(NVIDIA 2024b)与混合 E4M3/E5M2 格式(第 17 页);流水线基线是 1F1B、ZB1P 与 Chimera(表 2,第 13 页)。I 论文自我定位是「首次在极大规模模型上验证 FP8 混合精度训练框架」(第 4-5 页贡献列表),其数字回答的是「这套协同设计在 2024-2025 年的 H800 集群上做到了什么」,不代表对其他硬件或其他框架的领先幅度。
3. 核心机制
3.1 MLA:把 KV cache 压成两个潜向量(§2.1.1)
P(第 7-8 页,式 (1)-(11))对输入 h_t 先做降维 c_KV = W_DKV·h_t(d_c ≪ d_h·n_h),key/value 上投影都从 c_KV 出发;RoPE 所需的位置信息由解耦通道单独携带:k_R = RoPE(W_KR·h_t),与 c_KV 拼接后参与注意力。推理时只需缓存 c_KV 与 k_R 两个向量(图 2 中仅二者标「Cached During Inference」),KV cache 显著缩小且性能与 MHA 相当。查询侧同样低秩压缩(c_Q),动机不同:降低训练期激活内存。注意力打分的缩放分母为 √(d_h + d_r^h),即内容维度与 RoPE 维度之和。具体维度见 #experiments 超参表(d_c=512、d_c′=1536、d_r^h=64)。
3.2 DeepSeekMoE + auxiliary-loss-free 负载均衡(§2.1.2)
P(第 8-9 页,式 (12)-(15))FFN 输出 = 共享专家(恒激活)+ top-K_r 路由专家的加权和;与 V2 的两点差异:亲和度改用 sigmoid(s_i,t = Sigmoid(u_t·e_i)),并对选中的亲和度做归一化后作门控值。
P(第 9 页,式 (16))auxiliary-loss-free:给每个专家一个偏置 b_i 加到亲和度上仅用于 top-K 选择;门控值仍来自原始亲和度 s_i,t,因此梯度不受偏置污染。训练中逐步监控整批专家负载,步末对过载专家 b_i − γ、欠载专家 b_i + γ。配合一条极小系数(α=0.0001)的序列级互补辅助损失(式 (17)-(20))防单序列内极端失衡(第 9、23 页)。
P(第 10 页)节点受限路由:每个 token 至多送到 M=4 个节点(按各节点专家最高亲和度之和选节点),在该约束下训练框架可近乎完全实现计算-通信重叠。不丢 token:训练与推理都不丢(第 10 页)。
3.3 MTP:顺序多 token 预测目标(§2.2)
P(第 10-11 页,图 3,式 (21)-(25))D 个顺序模块(V3 取 D=1):第 k 个模块 = 共享 embedding + 共享输出头 + 独立 Transformer 块 TRM_k + 投影 M_k ∈ R^{d×2d};把上一深度表示 h^(k−1) 与下一位置 token 的 embedding 各做 RMSNorm 后拼接投影,经 TRM_k 用共享输出头预测第 k 个额外 token。每个深度保持完整因果链——区别于 Gloeckle et al. 的独立多头并行预测;因果链思想与 EAGLE 相似,但 EAGLE 目标是投机解码、本文用 MTP 改进训练。各深度交叉熵取均值、乘权重 λ 计入总损失(λ=0.3→0.1,见超参表)。推理时可直接丢弃 MTP 模块,也可将其改造用于投机解码(第 11 页)。
3.4 DualPipe:在一对 chunk 内重叠计算与通信(§3.2.1)
P(第 12-13 页,图 4/图 5)跨节点 EP 使计算-通信比约 1:1。DualPipe 把每个 forward/backward chunk 切成 attention、all-to-all dispatch、MLP、all-to-all combine 四段;backward 的 attention/MLP 再按 ZeroBubble 思路拆成 backward-for-input 与 backward-for-weights;再加一段 PP 通信。对这些段重排序并手动调整通信用 SM 占比,使 all-to-all 与 PP 通信都被计算完全遮盖。整体调度为双向流水:micro-batch 从流水线两端同时喂入(图 5 示例 8 个 PP rank、20 个 micro-batch)。表 2 给出一般情形下的账:DualPipe 气泡 (PP/2−1)(F&B+B−3W) 显著小于 1F1B/ZB1P,代价是两份模型参数与峰值激活内存 +1/PP;作者论证大 EP 下参数双份不构成显著负担,且只要求流水级与 micro-batch 能被 2 整除。
3.5 跨节点 all-to-all 内核:先 IB 后 NVLink 的两跳路径(§3.2.2)
P(第 13-14 页)节点内 NVLink 160 GB/s ≈ 3.2× 跨节点 IB 50 GB/s。据此每 token 限发 ≤4 节点:先经 IB 送达目标节点上同 in-node 编号的 GPU,再经 NVLink 即时转发到目标专家所在 GPU(不被后续 token 阻塞);IB 与 NVLink 传输完全重叠,每 token 平均每节点可选 3.2 个专家——同等通信成本下最多可支持 13 个路由专家(4 节点×3.2)。实现上用 warp specialization 把 20 个 SM 分成 10 个通信通道:dispatch 的 IB 发送 / IB→NVLink 转发 / NVLink 接收、combine 的 NVLink 发送 / NVLink→IB 转发累加 / IB 接收累加各由独立 warp 承担、warp 数按全局负载动态调整;定制 PTX 指令 + 自动调优通信 chunk 大小,降低 L2 占用与对计算 SM 的干扰。
3.6 FP8 混合精度训练:精度边界画在哪里(§3.3)
P(第 14-15 页,图 6)混合精度框架:Linear 的 Fprop/Dgrad/Wgrad 三个 GEMM 全部 FP8(理论速度较 BF16 翻倍;FP8 Wgrad 还让激活可以 FP8 缓存),GEMM 输出 BF16/FP32;以下组件保留原精度(BF16/FP32):embedding、输出头、MoE gating、归一化算子、attention 算子;master weights、weight gradients、optimizer states 保高精度(其显存代价经 DP 分摊)。
P(第 15-16 页,图 7a)细粒度量化:激活按 1×128 tile(每 token 每 128 通道)、权重按 128×128 块(每 128 输入通道 × 128 输出通道)分组缩放,缩放因子沿 GEMM 内维 K 逐组引入——标准 FP8 GEMM 不支持,但与下述累加策略配合即可实现。附录 B.2 的反例:把激活梯度也改成 128×128 块级量化会让约 16B MoE 模型(约 300B token)发散,作者归因于 token 相关离群。
P(第 16-17 页,图 7b)累加精度提升:H800 上 FP8 GEMM 的 Tensor Core 累加只保留约 14 位;K=4096 双随机矩阵初测最大相对误差近 2%。对策:每累积 N_C=128 个元素(等效 4 个 WGMMA)就把部分和提升到 CUDA core 的 FP32 寄存器做全精度累加,缩放因子顺势在 CUDA core 上相乘完成反量化;单 warpgroup 的 WGMMA 发射率下降,但 H800 上两个 WGMMA 典型并存、一升一算互相重叠。
P(第 17-18 页)格式与调度:全张量用 E4M3(先前工作 Fprop E4M3 + Dgrad/Wgrad E5M2),可行性来自小组内共享指数位;在线量化——每个 tile/块在线取最大绝对值、即时算缩放因子,不做跨迭代的历史记录。验证:类 V2-Lite 与 V2 两个规模、约 1T token,FP8 相对 BF16 的 loss 相对误差持续 <0.25%(第 15 页;附录 B.1 第 47 页)。
P(第 18 页,§3.3.3)低精度存储与通信:AdamW 一二阶矩用 BF16(master weights 与梯度保 FP32);两个特殊激活——attention 后 Linear 的输入用定制 E5M6 格式(反向时 1×128 tile 转 128×1,缩放因子取 2 的整数次幂以免二次量化误差)、MoE SwiGLU 输入缓存 FP8 且反向重算其输出;MoE 上投影前激活量化 FP8 后再 dispatch(缩放因子同为 2 的幂)、下投影前梯度同理;forward/backward combine 保 BF16。
3.7 内存与推理部署要点(§3.2.3、§3.4)
P(第 14 页)内存三板斧:反向重算 RMSNorm 与 MLA 上投影;EMA 参数放 CPU 内存、每步后异步更新(用于学习率衰减后的性能早期估计);借 DualPipe 把最浅层(含 embedding)与最深层(含输出头)放在同一 PP rank,让 MTP 与主模型的共享 embedding/输出头物理共享参数与梯度。
P(第 19-20 页)推理部署 prefill/decode 分离:prefilling 最小单元 4 节点 32 GPU(attention TP4+SP × DP8、MoE EP32、浅层 dense MLP 用 TP1),用冗余专家(在线统计每约 10 分钟调整、32 个冗余专家、每 GPU 多挂 1 个)平衡负载,并双 micro-batch 交叠;decoding 最小单元 40 节点 320 GPU(TP4+SP × DP80、EP320、每 GPU 一个专家、共享专家视为必选路由专家故每 token 选 9 个),all-to-all 走 IB 直连点对点 + IBGDA,每 expert batch 通常 <256 token、访存受限,可给通信只留少量 SM。硬件建议(§3.5):把通信从 SM 卸载到协处理器、统一 IB/NVLink 抽象、提高 FP8 累加精度、原生支持分组缩放 MMA / 在线量化 / 转置 GEMM。
4. GPU/系统数据路径
端到端文字序列(与图中编号一致)
- ① 数据接入:预训练语料 14.8T token(提高数学/编程占比、扩展中英以外多语言);文档打包不做跨样本 attention masking;以 0.1 比例做文档级 FIM(PSM 框架);Byte-level BPE 分词(词表 128K),「标点+换行」合并 token 随机拆分以缓解 token boundary biasP(第 21-22 页)。
- ② 控制面编排:HAI-LLM 框架按 16 路 PP × 64 路 EP(专家均匀铺在 8 节点 64 GPU)× ZeRO-1 DP 放置模型(无 TP);DualPipe 双向流水从两端喂 micro-batch(batch 3072→15360 调度),并手动调配通信用 SM 占比P(第 12-13、23 页)。
- ③ 每层主循环(×61,前 3 层 dense FFN):RMSNorm → MLA(内容压缩 c_KV/d_c=512 与解耦 RoPE 键 k_R;attention 算子保原精度)→ RMSNorm → MoE:Router 以 sigmoid 亲和度 + 偏置 b_i 选 top-8、限 4 节点(MoE gating 保原精度;b_i 步末按负载 ±γ 更新),1 共享专家恒激活P(第 7-10、22 页)。
- ④ FP8 专家计算与 all-to-all:上投影前激活按 1×128 tile 在线量化 FP8(缩放因子 2 的幂)后 dispatch——先经 IB(50 GB/s)到目标节点同编号 GPU,再经 NVLink(160 GB/s)即时转发到专家 GPU,通信内核用 20 SM/10 通道 warp 专化实现;256 个路由专家的 GEMM 用 128×128 块量化权重 + N_C=128 间隔的 CUDA core FP32 累加;combine 以 BF16 合并返回P(第 13-18 页)。
- ⑤ MTP 旁路与损失:主模型顶层表示与下一 token embedding 各做 RMSNorm、拼接投影(M_1∈R^{d×2d})后过 TRM_1,经共享输出头预测第 2 个 token;总损失 = 主 LM 损失 + λ·MTP 损失(λ=0.3→0.1 分段)P(第 10-11、23 页)。
- ⑥ 反向与激活管理:Dgrad/Wgrad 走 FP8;attention 后 Linear 的输入以 E5M6 缓存(反向 1×128→128×1 转换、2 的幂缩放因子);SwiGLU 输入缓存 FP8、输出反向重算;RMSNorm 与 MLA 上投影反向重算以省激活内存P(第 14、18 页)。
- ⑦ 优化器与精度底线:AdamW(β1=0.9、β2=0.95、wd=0.1),一二阶矩 BF16、master weights 与梯度 FP32;梯度裁剪 1.0;EMA 参数异步维护在 CPU 内存P(第 14、18、22 页)。
- ⑧ 推理态差异(对照):MLA 只缓存 c_KV 与 k_R;prefilling 4 节点/32 GPU 起(EP32+冗余专家 32 个、每 GPU +1),decoding 40 节点/320 GPU 起(EP320、每 GPU 1 专家、每 token 选 9 个、IB 点对点 + IBGDA);MTP 模块可丢弃或用于投机解码(接受率 85%-90%、1.8× TPS)P(第 11、19-20、35 页)。
| 事实/数值 | 对象与条件 | 论文定位 |
|---|---|---|
| 并行编排 16PP × 64EP(8 节点)× ZeRO-1 DP;无 TP | 2048 卡 H800 集群训练(8 卡/节点,NVLink+NVSwitch 节点内、IB 跨节点) | P 第 11-12 页 §3.1/§3.2 |
| DualPipe:chunk 内四段重排 + 双向流水;气泡 (PP/2−1)(F&B+B−3W)、参数 2×、激活 PP+1 | 对 1F1B/ZB1P 的一般比较(表 2) | P 第 13 页表 2 |
| all-to-all 两跳路径(先 IB 后 NVLink);每 token ≤4 节点;20 SM/10 通道;平均 3.2 专家/节点、上限 13 专家 | 跨节点 EP 通信内核(NVLink 160 GB/s ≈ 3.2× IB 50 GB/s) | P 第 13-14 页 §3.2.2 |
| FP8 范围:Linear 三 GEMM;原精度范围:embedding/输出头/MoE gating/归一化/attention;master weights 与梯度 FP32、AdamW 矩 BF16 | 混合精度框架(图 6) | P 第 14-15、18 页 §3.3/§3.3.1/§3.3.3 |
| 激活 1×128 tile、权重 128×128 块分组缩放;N_C=128(4 WGMMA)提升 CUDA core FP32 累加;全张量 E4M3;在线量化 | FP8 GEMM 精度对策(H800 累加约 14 位) | P 第 15-18 页 §3.3.2、图 7 |
| 激活缓存:Wgrad FP8 通用 + E5M6 特例(attention 后 Linear 输入)+ SwiGLU 输入 FP8/输出重算;dispatch FP8(2 的幂缩放)、combine BF16 | 低精度存储与通信(§3.3.3) | P 第 18 页 |
| 重算 RMSNorm 与 MLA 上投影;EMA 在 CPU;MTP 共享 embedding/输出头与主模型同 PP rank 物理共享 | 内存节省三板斧(§3.2.3) | P 第 14 页 |
| 训练作业的 checkpoint 机制、存储介质与故障恢复流程:论文未明确披露(仅有「无不可恢复 loss spike、未回滚」的结果性表述) | 与集群存储/容错层的边界(页面不补写) | P 第 1 页摘要;I 缺口标注 |
5. 架构权衡
-
负载均衡收益 ↔ 性能退化风险(aux-loss-free)
P 传统辅助损失越大越伤模型性能;V3 用只影响路由不影响梯度的偏置项换均衡,消融显示多数基准更优(表 5:大规模 HumanEval 40.2→46.3、GSM8K 70.7→74.5),但并非全面胜出(大规模 MMLU 68.3→67.2),且仍需极小序列级辅助损失兜底(α=0.0001)(第 9、23、27 页)。I 均衡质量依赖在线负载监控与 γ 调度(γ=0.001→0.0),意味着训练运维需要一个可观测的负载反馈回路。
-
FP8 吞吐 ↔ 精度工程复杂度
P FP8 让三个 GEMM 理论翻速并压缩激活缓存,但要把精度边界画得极细:原精度保五类算子、master weights/梯度保 FP32、逐 tile/块缩放、CUDA core 累加提升、E5M6 特例、2 的幂缩放因子、combine 保 BF16(第 14-18 页)。I 每一条都是为实现复杂度换训练稳定性:复现者要同时实现通信内核与量化栈,工程门槛远高于「把 dtype 改成 FP8」。
-
气泡消除 ↔ 双份参数与调度约束
P DualPipe 把气泡压到 (PP/2−1)(F&B+B−3W)、通信全遮盖,代价是保留两份模型参数、峰值激活 +1/PP,且要求流水级与 micro-batch 均可被 2 整除(表 2 及正文,第 13 页)。作者以「大 EP 使参数双份不显著」自洽(第 13 页)。I 这笔账在 EP 规模小的部署上不成立——DualPipe 的收益前提就是大 EP 与重通信负载。
-
通信量上限 ↔ 路由自由度(节点受限路由)
P 每 token ≤4 节点换来 IB 流量可控与计算-通信近乎完全重叠,且两跳内核让「等效 13 专家」与「实际 8 专家」同通信成本(第 10、13-14 页)。I 代价是路由空间被拓扑约束截断:若最优专家分布在 >4 节点,模型只能放弃;这一约束对质量的影响论文未单独消融,属于「被工程吸收、未被定量隔离」的设计。
-
不用 TP ↔ 单卡显存与内核自给率
P 内存三板斧(重算、CPU EMA、MTP 参数物理共享)使 V3 免除「costly」的 TP(第 12、14 页)。I 免 TP 的隐含前提是自研 all-to-all/量化内核把 SM 与带宽用在刀刃上;换框架或换硬件时这套账要重算,不能假设「不用 TP」本身可迁移。
-
MTP 训练收益 ↔ 推理路径分叉
P MTP 在多数消融基准提升(表 4:大规模 HumanEval 44.5→53.7),推理可整个丢弃(成本不变)或改造为投机解码(接受率 85%-90%、1.8× TPS)(第 11、26、35 页)。个别基准下降(大规模 MMLU 67.5→66.6)P。I 服务方要维护「纯主模型」与「MTP 投机」两条推理路径的回归基线,收益取决于接受率在自有流量分布上的复现。
-
训练成本口径 ↔ 复现/迁移成本
P 2.788M H800 GPU 小时 / $5.576M 只含官方训练,排除此前研究与消融;且绑定 $2/GPU 小时租价与自有集群(第 5 页表 1)。I 把 $5.576M 当「复现一个 V3 的价格」是最常见的误读:数据、消融、试错与推理服务成本都不在其中;云上按实例价折算还要乘上互联拓扑(IB 组网)可达性。
6. 云上部署映射
以下映射为厂商中立示例;具体产品命名/规格仅作说明并标 E,以厂商当时目录为准,未逐一在线核验。论文事实单独标注 P,仓库现状标注 R。I H800 为受出口管制的中国特供型号,公有云可用代际/互联与论文假设不一定对齐——映射时先确认「节点内高带宽 + 跨节点 RDMA」两层拓扑是否可得,再谈机制复用。
| 论文需求 | 云上映射(示例) | 证据与说明 |
|---|---|---|
| 训练算力:2048×H800,8 GPU/节点 NVLink+NVSwitch,跨节点 IB(第 11 页) | E 选型按「GPU 代际支持 FP8 GEMM + 节点内 NVLink 级互联 + 跨节点 RDMA 网络」三条件筛实例;训练编排把「8 卡亲和」作为调度单元 | 硬件前提 P(第 11 页);实例与拓扑映射为云实践 E;I 无 RDMA 层时 all-to-all 两跳路径退化为纯节点内 EP,训练效率账需重算 |
| 并行布局:16PP×64EP×ZeRO-1 DP,专家均匀铺 8 节点 64 GPU(第 12、23 页) | E 作业编排以「PP 组 × EP 组」声明拓扑亲和;弹性伸缩冻结在训练阶段边界(14.8T 主体 / YaRN 两阶段 / SFT/RL)而非步级 | 并行布局 P;阶段划分 P(第 21-23、28 页);编排建议 E/I |
| 网络:IB 50 GB/s + NVLink 160 GB/s 两跳 all-to-all;20 SM 通信内核;IBGDA(推理)(第 13-14、19 页) | E 网络规格(单卡 RDMA 带宽、P2P 时延、GPUDirect/RDMA 能力)写入实例验收项;通信内核编译目标与驱动/CUDA 版本锁定 | 论文网络口径 P;IBGDA 为论文引用的 NVIDIA 技术 P(第 19 页);云网络验收 E |
| 推理部署单元:prefill ≥4 节点 32 GPU、decode ≥40 节点 320 GPU;prefill/decode 分离(第 19-20 页) | E prefill 池与 decode 池分实例组部署、独立扩缩;请求在两池间经队列/路由层衔接;decode 池最小规模直接决定准入门槛 | 部署单元与分离策略 P(第 18-20 页);池化与路由为云实践 E;I 320 GPU 起步的 decode 池对多数团队不可行(论文 §6 自己列出的局限) |
| 负载运维:冗余专家按在线统计周期调整(约 10 分钟);专家负载监控驱动 b_i 更新(训练)(第 9、19 页) | E 专家负载/GPU token 分布作为推理服务监控指标;周期任务调整冗余专家配置;训练侧把每步专家负载直方图纳入可观测面板 | 机制 P(第 9、19 页);监控设计 E/I |
| 权重分发:模型检查点经官方仓库/Hugging Face 分发;仓库含 inference/ 参考(2026-09-15 核验) | E 权重放对象存储/模型仓库,节点本地盘缓存;镜像内置锁定版本的推理框架与驱动 | 仓库定位(权重 + 推理参考,非训练框架)R(2026-09-15 GitHub API);分发拓扑 E |
| 训练存储/checkpoint 与故障恢复:论文未披露实现细节(仅有稳定性结果表述) | E 高吞吐并行文件系统/对象存储承载 checkpoint,按框架能力配置;I 本页不把任何 checkpoint 机制归于论文 | 缺口 P(论文未明确披露)+ I;存储方案 E |
7. 成本 / 性能 / SLO
7.1 训练成本(论文口径)
| 口径 | Pre-Training | Context Extension | Post-Training | Total |
|---|---|---|---|---|
| H800 GPU 小时 | 2664K | 119K | 5K | 2788K |
| USD | $5.328M | $0.238M | $0.01M | $5.576M |
P(第 5 页)补充口径:每万亿 token 180K H800 GPU 小时(2048 卡集群 3.7 天);预训练不足两个月;后训练等后续阶段合计约 0.1M GPU 小时。成本边界:只含官方训练,排除此前研究与架构/算法/数据消融;美元值是租价假设下的换算,不是云账单。I 引用该数字时的最小诚实写法是「2.788M H800 GPU 小时(论文按 $2/GPU 小时估 $5.576M,不含前期研究与消融)」。
7.2 容量与成本公式(参数化,编辑推断)
(论文锚点:T=14.8T 时 ≈ 2664K GPU 小时 → ≈ 0.18M GPU 小时/万亿 token;预训练段 p=$2/GPU 小时 → $5.328M)
扩展成本 ≈ YaRN 两阶段(119K GPU 小时)+ 后训练(5K GPU 小时),与数据管线强相关、不可按 token 线性外推
云上换算 ≈ Σ(阶段 GPU 小时) × 当时实例单价 ÷ 卡时折扣率;单价按查询当时厂商目录记录日期
推理成本 ≈ prefill 池 GPU 时 + decode 池 GPU 时;decode 池最小 320 GPU(论文部署单元)是固定门槛项
I 论文可支撑的量只有 2664K/119K/5K GPU 小时与 $2/GPU 小时假设(第 5 页);实例单价、折扣、可利用率、推理流量画像需按部署实测填写,本页不给出伪精确总价。E 云单价随时段/区域/折扣变化,核算时以查询当时厂商目录为准并记录日期。
7.3 性能/SLO 相关的论文事实与缺口
- P 推理侧既定目标:同时保证在线服务 SLO 与高吞吐,策略是 prefill/decode 分离(第 18 页);MTP 投机解码带来 1.8× TPS(第 35 页)。
- P decode 特征:每 expert batch 通常 <256 token、访存受限(第 20 页)——容量规划时 decode 吞吐由显存带宽主导而非算力。I 由此推论 SLO 敏感项是 KV cache 容量与批调度,而非 FLOPs。
- P 数据缺口(论文未明确披露):TTFT/TPOT 数值、每 GPU tokens/s、MFU、服务并发、集群网络利用率、训练吞吐(tokens/s/GPU)、checkpoint 频率、以及训练/推理的能耗与成本明细。
- I 引用「2.788M GPU 小时」论证云上预算时,还应叠加:数据管线与试错成本(未披露)、推理服务的持续性 GPU 消耗(与流量相关)、以及故障恢复与冗余带来的有效利用率折扣。
8. 安全与可运维性
8.1 安全
- 模型与代码许可:R 官方仓库(论文摘要印明)2026-09-15 核验为代码 MIT(LICENSE-CODE)+ 模型另行许可(LICENSE-MODEL,README 徽章 Model Agreement)。I 商用部署前按仓库许可原文核对模型许可条款——MIT 只覆盖代码,不自动覆盖权重使用。
- 供应链:R 权重应从官方仓库核验后的 tag/commit 获取(main HEAD 9b4e978,2025-08-28;tag v1.0.0)。I 训练/推理镜像的 CUDA/驱动/通信内核版本配对锁定;论文的自研通信内核(定制 PTX)不在公开仓库,第三方实现的 PTX/内核代码按供应链变更评审。
- 数据驻留与多租户:I 论文不涉及多租户;推理部署中请求在 prefill/decode 两池间流转,租户隔离与数据驻留由上层服务网格决定;MLA 的 KV cache 压缩减少驻留足迹,但不改变隔离模型。
- 评测与披露完整性:P 论文自己在未来方向中提出要防止「针对固定基准集优化造成误导性印象」(第 36 页)。I 采纳其评测结论时注意:全部数字出自作者内部框架(HAI-LLM 集成),关键基准(如 LiveCodeBench)限定了时间窗(2024-08~11),跨框架对比需自行复测。
8.2 可运维性(含恢复与回滚)
- 训练稳定性与故障语义:P 论文声明全程「未遇到不可恢复 loss spike、未执行回滚」(第 1、4 页)。I 这是结果性表述而非机制披露:checkpoint/恢复/回滚的实现(频率、存储、恢复流程)论文未明确披露,运维方案须自建并以自身演练为准,不能引用论文推断其故障恢复能力。
- 训练期可观测与自愈:P 论文内建两个反馈回路——逐步专家负载监控驱动 b_i ±γ 更新(第 9 页)、EMA 参数在 CPU 异步维护用于学习率衰减后的早期性能估计(第 14 页)。I 这两条天然是监控面:把「专家负载直方图」「EMA-loss 与在线 loss 偏差」做成告警项,可在 loss 质量问题变成事故前暴露。
- 推理期运维:P 冗余专家按在线负载统计每约 10 分钟级别周期调整(prefill 每节点内重排、decode 免重排)(第 19 页);IBGDA 降低通信时延(第 19 页)。I 冗余专家配置变更是推理服务的例行变更项,需要灰度与回退配置(保留上一版专家布局文件即可回滚)。
- 升级与回滚:I 建议:推理框架/内核升级以「主模型 + MTP 投机」双路径回归(吞吐与接受率两条基线);训练侧 FP8 数值行为依赖 CUDA/内核版本(论文的 CUDA core 累加提升与 PTX 定制都是版本敏感实现),升级先在小规模模型上复跑附录 B 类稳定性对照(FP8 vs BF16 loss 曲线)。
- 监控告警:I 最小集:①训练 loss 与 EMA 参照的偏离;②每层专家负载 max/mean 比(失衡前兆);③dispatch/combine 通信时长占比(重叠失效信号);④decode 池每 expert batch 与 256 token 经验值的偏离;⑤MTP 接受率(跌破 85% 下沿时投机路径收益消失)。
9. 适用 / 不适用场景
适用(触发条件 + 理由)
- 有 RDMA 高速互联的大规模 MoE 预训练。触发:集群具备「节点内 NVLink 级 + 跨节点 IB 级」两层拓扑、数百卡以上。理由:V3 的 1:1 计算-通信比问题、DualPipe 重叠与两跳 all-to-all 内核正是为此设计;每万亿 token 180K H800 GPU 小时的效率以此为前提P(第 5、11-14 页)。
- 想在 Hopper 类硬件上做 FP8 大规模训练的团队。触发:需要压缩训练显存/算力成本,且能投入实现细粒度量化栈。理由:论文首次在极大规模验证 FP8 框架,给出了完整的精度边界清单(1×128/128×128 分组缩放、N_C=128 累加提升、E4M3、在线量化、E5M6 特例)与 16B/230B 级稳定性证据(<0.25% 相对 loss 误差)P(第 14-18、47 页)。
- 长上下文(至 128K)+ KV cache 敏感的自建推理服务。触发:服务需 32K-128K 上下文且显存预算紧张。理由:MLA 只缓存 c_KV 与 k_R,YaRN 两阶段扩展到 128K 且 NIAH 全程表现良好P(第 7、23 页)。
- 以推理吞吐为目标、可维护大 decode 池的私有化部署。触发:流量稳定、能承担 320 GPU 起的 decode 池与 prefill/decode 分离运维。理由:论文部署策略(冗余专家 + IBGDA + 双 micro-batch 交叠)实现「较 V2 端到端生成速度快两倍以上」,MTP 投机再加 1.8× TPSP(第 19-20、35-36 页)。
不适用(触发条件 + 理由)
- 小团队 / 小规模部署单元。触发:可用 GPU 池远小于论文推荐部署单元。理由:论文自述「推荐部署单元相对较大,可能对小团队构成负担」(decode 最小 40 节点 320 GPU)P(第 19、35 页)。I 此类场景应评估量化压缩后的单机/少卡方案,而非照搬论文部署拓扑。
- 缺少跨节点 RDMA 或节点内高带宽互联的环境。触发:单卡无 RDMA、多机以太网、或节点内无 NVLink 级互联。理由:all-to-all 两跳路径、节点受限路由与 20 SM 通信内核全部以 IB+NVLink 带宽比(160 vs 50 GB/s)为设计输入P(第 13-14 页);I 拓扑退化后论文的通信结论不成立。
- 把 $5.576M 当作复现总预算的项目。触发:以表 1 直接立项。理由:论文明确排除此前研究与架构/算法/数据消融成本,且美元值绑定 $2/GPU 小时租价假设P(第 5 页);I 复现还需数据、试错与推理成本,均不在口径内。
- 无法承载双份流水线参数或小 EP 的训练作业。触发:EP 规模小、显存余量紧。理由:DualPipe 保留两份模型参数、激活 +1/PP,其收益论证建立在「大 EP」上(表 2 及正文)P(第 13 页)。
- 依赖论文未披露能力的需求。触发:需要 checkpoint 机制细节、多语言能力清单、RL 基础设施实现等。理由:论文未明确披露这些内容(详见 #evidence 缺口清单)P+I;不得把论文之后的 DeepSeek 版本能力(如后续模型的架构或功能)记到本文头上。
10. 实验与指标
10.1 训练与对齐配置 P(第 21-23、28-30 页)
| 模型 | 61 层、隐维 7168、init std 0.006;MLA n_h=128 / d_h=128 / d_c=512 / d_c′=1536 / d_r^h=64;前 3 层 dense FFN,其余每层 1 共享 + 256 路由专家(中间维 2048)、激活 8、限 4 节点;MTP D=1;671B 总参 / 37B 激活 P(第 22 页 §4.2) |
|---|---|
| 优化器 / 调度 | AdamW β1=0.9、β2=0.95、wd=0.1;梯度裁剪 1.0;序列长 4K、14.8T token;学习率 0→2.2×10⁻⁴(2K 步 warmup)→恒定至 10T→余弦至 2.2×10⁻⁵(4.3T 内)→末 500B:333B@2.2×10⁻⁵ + 167B@7.3×10⁻⁶;batch 3072→15360(前 469B);γ=0.001(前 14.3T)→0.0;α=0.0001;λ=0.3(前 10T)→0.1 P(第 22-23 页) |
| 长上下文 | YaRN 两阶段各 1000 步:4K→32K(batch 1920)→128K(batch 480);仅作用于解耦共享键 k_R;s=40、α=1、β=32、缩放 √(0.1·ln s+1);学习率 7.3×10⁻⁶ P(第 23 页 §4.3、图 8) |
| SFT / RL | SFT 1.5M 实例、2 epochs、余弦 5×10⁻⁶→1×10⁻⁶、样本打包+masking;推理数据源自内部 R1 专家模型(SFT+RL 流水线 + 拒绝采样);RL 用 GRPO(组相对基线、KL 正则),规则 RM + 自 SFT 检查点训练的模型 RM P(第 28-30 页) |
| FP8 验证规模 | 类 V2-Lite(约 16B 总参、1.33T token)与类 V2(约 230B、约 0.9T token)对照 BF16;相对 loss 误差 <0.25%;块级量化激活梯度在 16B/约 300B token 上发散(附录 B.1/B.2)P(第 15、47-48 页) |
| 评测框架 | 基础模型:内部评测框架(集成于 HAI-LLM)、同设置对比 V2-Base/Qwen2.5-72B/LLaMA-3.1-405B;困惑度类用 perplexity、生成类用生成式、Pile-test 用 BPB;聊天模型:输出上限 8192 token、AIME/CNMO 温度 0.7×16 次平均、MATH-500 贪心、闭源经 API P(第 24、30-31 页) |
10.2 基础模型评测(表 3 选列,全表 32 行已逐格核验)
| 基准(指标) | shots | V2-Base (21B/236B) | Qwen2.5-72B | LLaMA3.1-405B | V3-Base (37B/671B) |
|---|---|---|---|---|---|
| Pile-test (BPB) | – | 0.606 | 0.638 | 0.542 | 0.548 |
| BBH (EM) | 3-shot | 78.8 | 79.8 | 82.9 | 87.5 |
| MMLU (EM) | 5-shot | 78.4 | 85.0 | 84.4 | 87.1 |
| MMLU-Pro (EM) | 5-shot | 51.4 | 58.3 | 52.8 | 64.4 |
| DROP (F1) | 3-shot | 80.4 | 80.6 | 86.0 | 89.0 |
| HumanEval (Pass@1) | 0-shot | 43.3 | 53.0 | 54.9 | 65.2 |
| LiveCodeBench-Base (Pass@1) | 3-shot | 11.6 | 12.9 | 15.5 | 19.4 |
| GSM8K (EM) | 8-shot | 81.6 | 88.3 | 83.5 | 89.3 |
| MATH (EM) | 4-shot | 43.4 | 54.4 | 49.0 | 61.6 |
| C-Eval (EM) | 5-shot | 81.4 | 89.2 | 72.5 | 90.1 |
| MMMLU-non-English (EM) | 5-shot | 64.0 | 74.8 | 73.8 | 79.4 |
P(第 25-26 页)论文自己的边界句:V3-Base 全面优于 V2-Base/Qwen2.5-72B、多数基准超 LLaMA-3.1-405B;但 V3-Base 非最佳的行包括 Pile-test(LLaMA 0.542 vs 0.548)、HellaSwag、WinoGrande、RACE-Middle/High、CLUEWSC、CMMLU、CCPM;评测框架数月间的变化使 V2-Base 成绩与此前报告略有出入。
10.3 消融(表 4/表 5 + 批级对照)
| 基准 | Small 基线 (15.7B) | Small w/MTP | Large 基线 (228.7B) | Large w/MTP |
|---|---|---|---|---|
| BBH (EM) | 39.0 | 41.4 | 70.0 | 70.7 |
| MMLU (EM) | 50.0 | 53.3 | 67.5 | 66.6 |
| HumanEval (Pass@1) | 20.7 | 26.8 | 44.5 | 53.7 |
| GSM8K (EM) | 25.4 | 31.4 | 72.3 | 74.0 |
| MATH (EM) | 10.7 | 12.6 | 38.6 | 39.8 |
I 读表提醒:MMLU 大规模行是 MTP 消融中明显的反例(67.5→66.6),论文措辞为「多数基准提升(most)」——引用时不应写成「全面提升」。
| 基准 | Large Aux-Loss-Based | Large Aux-Loss-Free |
|---|---|---|
| Pile-test (BPB) | 0.656 | 0.652 |
| BBH (EM) | 66.7 | 67.9 |
| MMLU (EM) | 68.3 | 67.2 |
| HumanEval (Pass@1) | 40.2 | 46.3 |
| GSM8K (EM) | 70.7 | 74.5 |
| MATH (EM) | 37.2 | 39.6 |
P(第 27-28 页)批级 vs 序列级对照:1B MoE 验证损失 2.258(序列级辅助损失)/ 2.253(aux-loss-free)/ 2.253(批级辅助损失);3B MoE:2.085 / 2.080 / 2.080——达到相近批级均衡时批级辅助损失也能达到相近性能;图 9 显示 aux-loss-free 专家专化模式更强。
10.4 聊天模型评测(表 6 选行)与开放/奖励评测(表 7/8)
| 基准(指标) | Qwen2.5-72B-Inst | LLaMA3.1-405B-Inst | Claude-3.5-Sonnet-1022 | GPT-4o-0513 | DeepSeek-V3 |
|---|---|---|---|---|---|
| MMLU (EM) | 85.3 | 88.6 | 88.3 | 87.2 | 88.5 |
| GPQA-Diamond (Pass@1) | 49.0 | 51.1 | 65.0 | 49.9 | 59.1 |
| SimpleQA (Correct) | 9.1 | 17.1 | 28.4 | 38.2 | 24.9 |
| DROP (3-shot F1) | 76.7 | 88.7 | 88.3 | 83.7 | 91.6 |
| LiveCodeBench (Pass@1-CoT) | 31.1 | 28.4 | 36.3 | 33.4 | 40.5 |
| Codeforces (Percentile) | 24.8 | 25.3 | 20.3 | 23.6 | 51.6 |
| SWE Verified (Resolved) | 23.8 | 24.5 | 50.8 | 38.8 | 42.0 |
| AIME 2024 (Pass@1) | 23.3 | 23.3 | 16.0 | 9.3 | 39.2 |
| MATH-500 (EM) | 80.0 | 73.8 | 78.3 | 74.6 | 90.2 |
| C-SimpleQA (Correct) | 48.4 | 50.4 | 51.3 | 59.3 | 64.8 |
P(第 31-33 页)其余关键结果:Arena-Hard 85.5 / AlpacaEval 2.0(长度控制胜率)70.0(表 7;GPT-4-Turbo-1106 判官;对 GPT-4-0314 基线胜率 >86%;首个 Arena-Hard 破 85% 的开源模型);RewardBench 平均 87.0、maj@6 89.6(表 8);R1 蒸馏消融(表 9,基于 V2.5):LiveCodeBench-CoT 31.1→37.4、MATH-500 74.6→83.2,代价是平均响应长度 718→783 / 769→1510;MTP 投机解码:第二 token 接受率 85%-90%、1.8× TPS(第 35 页)。
| 实验 | 硬件/规模 | 精度 | 负载/配置 | 基线 | 定位 |
|---|---|---|---|---|---|
| 预训练(表 1) | 2048×H800(NVLink+IB) | FP8 混合精度(细粒度量化) | 14.8T token、seq ≤4K、batch 3072→15360 | 无外部基线(成本口径) | P 第 5、11-23 页 |
| FP8 vs BF16(附录 B) | 约 16B / 约 230B MoE | FP8 vs BF16 | 1.33T / 约 0.9T token;EMA 0.9 平滑曲线 | BF16 同规模训练 | P 第 47 页 |
| 基础模型(表 3) | 21B/72B/405B/37B 激活 | 论文未明确披露(评测推理精度) | per-shot 见表;内部框架统一设置 | V2-Base、Qwen2.5-72B、LLaMA3.1-405B | P 第 24-25 页 |
| MTP / 负载消融(表 4/5) | 15.7B、228.7B MoE | 论文未明确披露 | 1.33T / 540B / 578B token | 自身消融(数据/架构不变) | P 第 26-27 页 |
| 聊天评测(表 6) | 37B 激活 / 671B | 论文未明确披露 | 输出 ≤8192;AIME/CNMO 0.7 温度×16 次 | 5 个开源/闭源对话模型(API) | P 第 30-31 页 |
| 推理加速(§5.4.3) | 论文未明确披露(部署规模未给) | 论文未明确披露 | MTP 投机解码;各主题 | 自身无 MTP 投机路径 | P 第 35 页 |
10.5 建议复现/验证步骤(编辑推断)
- I 权重与许可:从官方仓库取 tag v1.0.0 或锁定 commitR(2026-09-15 核验),先读 LICENSE-MODEL 确认商用条款(代码 MIT ≠ 权重无条件可用)。
- I 架构对齐:61 层/7168 隐维/128 头/MLA(512,1536,64)/256+1 专家/激活 8/限 4 节点/MTP D=1,与开源实现逐项比对P(第 22 页)。
- I FP8 稳定性预演:按附录 B 协议在 16B 级 MoE 上跑 FP8 vs BF16 对照(预期相对 loss 误差 <0.25%),再验证「激活梯度块级量化会发散」这一负结果以确认实现对齐P(第 47-48 页)。
- I 通信与调度验证:在自有拓扑上测 all-to-all 占比与 DualPipe 式重叠收益;若 IB/NVLink 带宽比偏离 3.2×,重算每 token 节点上限(论文的 4 节点/13 专家账)P+I(第 13-14 页)。
- I 评测复测:以 simple-evals 提示复测 MMLU/DROP/GPQA/SimpleQAR(脚注 4 印明仓库,已核验),再按业务分布自建回归集;LiveCodeBench 结果绑定其时间窗,需注明。
- I 推理试点:先以纯主模型路径上线,再灰度 MTP 投机路径,记录接受率(论文口径 85%-90%)与 1.8× TPS 在自有流量下的复现值P+I(第 35 页)。
11. 论文 / 代码 / 延伸链接
| 来源 | 链接 / 文件 | 级别与核验 |
|---|---|---|
| 论文(arXiv abstract) | https://arxiv.org/abs/2412.19437 | P 本地 PDF 为 arXiv v2(水印逐字核验「arXiv:2412.19437v2 [cs.CL] 18 Feb 2025」,53 页)。本地 PDF:16_DeepSeek-V3_2412.19437.pdf。PDF 内未标注会议/期刊录用信息,不作归属推断。 |
| 官方模型仓库(权重 + 推理参考) | https://github.com/deepseek-ai/DeepSeek-V3 | P 论文第 1 页摘要末句印明「The model checkpoints are available at https://github.com/deepseek-ai/DeepSeek-V3」(逐字核验)。R 在线核验(只读):2026-09-15 GitHub API——归属 deepseek-ai 组织、default_branch=main、未归档、代码许可 MIT(LICENSE-CODE)+ 模型另行许可(LICENSE-MODEL)、HEAD 9b4e9788e4a3a731f7567338ed15d3ec549ce03b(2025-08-28)、tag v1.0.0=f6e34dd;顶层含 README_WEIGHTS.md 与 inference/。边界:该仓库定位是模型检查点分发与推理参考实现;论文所述 HAI-LLM 训练框架未包含其中,训练侧开源实现不作推断。 |
| 论文脚注印明的评测提示框架 | https://github.com/openai/simple-evals | P 第 30 页脚注 4 印明(MMLU/DROP/GPQA/SimpleQA 评测提示来源)。R 2026-09-15 GitHub API 只读核验:openai/simple-evals、MIT、main 分支、未归档。 |
| 论文脚注印明的其他站点(照录) | aider.chat(脚注 1);codeforces.com(脚注 2);www.cms.org.cn(脚注 3,CNMO 2024) | P URL 按论文脚注照录(评测数据来源);站点内容未逐项审阅,仅证明「论文引用了这些来源」。 |
| 不提供链接的项 | HAI-LLM 训练框架;DeepSeek 后续模型/版本 | P HAI-LLM 论文未给出任何公开地址(第 12 页自述内部自研)。I 论文之后的 DeepSeek 发布(新模型、新能力)与本报告无关,不链接也不归属;第三方训练/推理实现、微调脚本、聚合下载站一律未经核验,按「不猜测 URL」策略不链接。 |
12. 给架构师的决策清单
I 以下为落地前的勾选项;标注(P)的条目对应论文证据,(R)对应仓库核验项,其余为工程判断。
-
需求与规模
-
兼容性
-
PoC(1-2 周量级)
-
容量
-
SLO 与恢复
-
成本
-
安全
-
运维与回滚
-
退出策略
13. 证据台账
下表为核心结论的证据映射;逐条引文与核验记录见构建文件 sources/deepseek-v3.evidence.json(54 条,EV-01~EV-54)。核验日期为 。
| EV | 关键结论 | 级别 | 定位(PDF 页码) | 核验状态 |
|---|---|---|---|---|
| EV-01 | 题名/署名 DeepSeek-AI/arXiv v2 水印(cs.CL,18 Feb 2025)/53 页/无会议信息/附录 A 角色化名单 | P | 第 1、45-47 页;pdfinfo | 已核验(原页目检) |
| EV-02 | 摘要级结论:671B/37B、MLA+DeepSeekMoE、aux-loss-free、MTP、14.8T、2.788M GPU 小时、无不可恢复 loss spike、检查点仓库地址 | P | 第 1 页摘要 | 已核验(逐句) |
| EV-03 | 表 1 成本四列数值 + $2/GPU 小时假设 + 180K/万亿 token + 排除前期研究与消融 | P | 第 5 页表 1 与 §1 | 已核验(逐格) |
| EV-04 | 架构基线:Transformer + MLA + DeepSeekMoE;次要细节沿用 V2 | P | 第 6 页 §2 | 已核验 |
| EV-05 | MLA:c_KV/k_R 缓存、查询低秩压缩省训练激活、softmax 分母 √(d_h+d_r^h)(式 1-11) | P | 第 7-8 页、图 2 | 已核验(公式逐项) |
| EV-06 | DeepSeekMoE:细粒度+共享专家;sigmoid 亲和度 + 选中归一化(式 12-15,与 V2 的差异点) | P | 第 8-9 页 | 已核验 |
| EV-07 | aux-loss-free:b_i 只用于路由、门控用原始亲和度、步末 ±γ 更新(式 16) | P | 第 9 页 | 已核验 |
| EV-08 | 互补序列级辅助损失(式 17-20;α=0.0001) | P | 第 9、23 页 | 已核验 |
| EV-09 | 节点受限路由(≤M=4 节点)与近乎完全的计算-通信重叠 | P | 第 10、23 页 | 已核验 |
| EV-10 | 训练与推理都不丢 token | P | 第 10 页 | 已核验 |
| EV-11 | MTP:D=1、共享 embedding/输出头、M_k∈R^{d×2d}、完整因果链(式 21-25、图 3;λ 分段) | P | 第 10-11、23 页 | 已核验(公式逐项) |
| EV-12 | MTP 推理:可丢弃;可改造为投机解码 | P | 第 11 页 | 已核验 |
| EV-13 | 集群:2048×H800、8 GPU/节点 NVLink+NVSwitch、跨节点 IB | P | 第 11 页 §3.1 | 已核验 |
| EV-14 | HAI-LLM(内部自研);16PP×64EP(8 节点)×ZeRO-1 DP;无 TP | P | 第 12 页 §3.2 | 已核验 |
| EV-15 | DualPipe:四段重排 + backward 拆分(仿 ZeroBubble)+ SM 配比;图 4/图 5(8 rank、20 micro-batch) | P | 第 12-13 页 | 已核验(原页目检) |
| EV-16 | 表 2:1F1B/ZB1P/DualPipe 气泡公式、参数 2×、激活 PP+1、+1/PP 表述、两份参数与大 EP 论证 | P | 第 13 页表 2 及正文 | 已核验(300dpi 放大) |
| EV-17 | all-to-all 内核:NVLink 160≈3.2×IB 50 GB/s、≤4 节点、两跳转发、3.2/13 专家、20 SM/10 通道、PTX 定制 | P | 第 13-14 页 §3.2.2 | 已核验 |
| EV-18 | 内存三板斧:RMSNorm/MLA 上投影重算、CPU EMA、MTP 共享层同 PP rank 物理共享 | P | 第 14 页 §3.2.3 | 已核验 |
| EV-19 | FP8 框架:三 GEMM FP8、五类算子保原精度、master/梯度/矩的精度分工、<0.25% 相对 loss 误差(类 V2-Lite/V2、约 1T token 验证) | P | 第 14-15、47 页、图 6 | 已核验 |
| EV-20 | 细粒度量化:1×128/128×128、内维 K 逐组缩放、microscaling 一致性、B.2 激活梯度块级量化发散反例 | P | 第 15-17、47-48 页、图 7a | 已核验 |
| EV-21 | 累加精度:H800 约 14 位、K=4096 近 2% 误差、N_C=128(4 WGMMA)CUDA core FP32 提升、双 WGMMA 重叠 | P | 第 16-17 页、图 7b | 已核验 |
| EV-22 | 全张量 E4M3(对比混合 E4M3/E5M2)及其可行性归因 | P | 第 17 页 | 已核验 |
| EV-23 | 在线量化(对 delayed quantization 的替代) | P | 第 17-18 页 | 已核验 |
| EV-24 | AdamW 矩 BF16、master weights/梯度 FP32 | P | 第 18 页 | 已核验 |
| EV-25 | E5M6 特例激活(1×128→128×1、2 的幂缩放)、SwiGLU 输入 FP8 缓存+重算 | P | 第 18 页 | 已核验 |
| EV-26 | dispatch FP8(2 的幂缩放)、combine 保 BF16 | P | 第 18 页 | 已核验 |
| EV-27 | Prefilling:4 节点/32 GPU、TP4+SP×DP8、EP32、冗余专家 32 个/每 GPU +1、约 10 分钟周期、双 micro-batch、动态冗余探索 | P | 第 19 页 §3.4.1 | 已核验 |
| EV-28 | Decoding:40 节点/320 GPU、TP4+SP×DP80、EP320、每 token 9 专家、IB P2P+IBGDA、batch/expert <256、访存受限 | P | 第 19-20 页 §3.4.2 | 已核验 |
| EV-29 | 硬件建议:20/132 SM 通信卸载与 IB/NVLink 统一抽象;14 位累加细节、组缩放 MMA、在线量化/转置 GEMM 支持、近存计算约 50% 片外访存 | P | 第 20-21 页 §3.5 | 已核验 |
| EV-30 | 数据:14.8T、文档打包、FIM 0.1(PSM)、BPE 128K、token boundary bias 缓解 | P | 第 21-22 页 §4.1 | 已核验 |
| EV-31 | 模型超参全表(61 层/7168/128 头/512/1536/64、前 3 层 dense、256+1 专家、激活 8、D=1、671B/37B) | P | 第 22 页 §4.2 | 已核验(逐项) |
| EV-32 | 训练超参全表(AdamW/LR 分段/batch 调度/γ/α/λ 切换点/M=4/64 GPU 专家布局) | P | 第 22-23 页 §4.2 | 已核验(逐项) |
| EV-33 | YaRN 两阶段 4K→32K→128K(s=40、α=1、β=32、7.3×10⁻⁶);图 8 NIAH 至 128K | P | 第 23 页 §4.3、图 8 | 已核验 |
| EV-34 | 表 3 基础模型评测全量(含 V3-Base 非最佳行与 ≤0.3 同级口径、V2-Base 数字漂移说明) | P | 第 24-26 页、表 3 | 已核验(逐格) |
| EV-35 | 表 4 MTP 消融(540B;含 MMLU 67.5→66.6 反例行) | P | 第 26 页 | 已核验(逐格) |
| EV-36 | 表 5 aux-loss-free 消融(578B;含 MMLU 68.3→67.2 反例行) | P | 第 27 页 | 已核验(逐格) |
| EV-37 | 批级 vs 序列级对照(1B/3B 验证损失三组数值)与图 9 专家专化 | P | 第 27-28 页、图 9 | 已核验 |
| EV-38 | SFT:1.5M 实例、R1 专家模型 + 拒绝采样、2 epochs、5×10⁻⁶→1×10⁻⁶、sample masking | P | 第 28-29 页 §5.1 | 已核验 |
| EV-39 | RM:规则型(box/编译器)+ 模型型(自 SFT 检查点、含 CoT 偏好数据防 reward hacking) | P | 第 29 页 §5.2.1 | 已核验 |
| EV-40 | GRPO(式 26-28:组相对优势、clip、KL 估计式;多域提示) | P | 第 30 页 §5.2.2 | 已核验(公式逐项) |
| EV-41 | 评测设置:基准清单、6 个基线、simple-evals/Zero-Eval/agentless/diff/温度 0.7×16/输出 8192、脚注 1-4 URL | P | 第 30-31 页 §5.3.1 | 已核验 |
| EV-42 | 表 6 聊天评测(含 SimpleQA/SWE/Aider 落后项与「约 10%」表述) | P | 第 31-32 页、表 6 | 已核验(逐格) |
| EV-43 | 表 7 开放式评测(85.5/70.0;>86% 胜率、首个破 85% 开源) | P | 第 33 页 | 已核验 |
| EV-44 | 表 8 RewardBench(87.0;maj@6 89.6) | P | 第 33-34 页 | 已核验(逐格) |
| EV-45 | 表 9 R1 蒸馏消融(31.1→37.4、74.6→83.2;响应长度 718→783、769→1510 的权衡) | P | 第 34 页 | 已核验(逐格) |
| EV-46 | Self-rewarding(constitutional AI + 自投票反馈) | P | 第 34-35 页 §5.4.2 | 已核验 |
| EV-47 | MTP 推理:接受率 85%-90%、1.8× TPS | P | 第 35 页 §5.4.3 | 已核验 |
| EV-48 | 结论与局限:部署单元大(小团队负担)、端到端 >2× V2、未来方向(含防基准过拟合表述) | P | 第 35-36 页 §6 | 已核验 |
| EV-49 | 文档内不一致:两处 Figure 10 重复编号(loss 曲线第 47 页 / 专家负载热图第 49-53 页),照录不调和 | P | 第 47-48、53 页 | 已核验(原页目检) |
| EV-50 | 官方仓库现状:deepseek-ai/DeepSeek-V3、代码 MIT+模型许可、main@9b4e978(2025-08-28)、tag v1.0.0、权重+inference/;HAI-LLM 不在仓库 | R | 论文出处第 1 页摘要;在线核验 2026-09-15(GitHub API 只读) | 已核验(归属/许可/分支/HEAD/tag/目录) |
| EV-51 | 评测提示框架仓库 openai/simple-evals(脚注 4;MIT、main、未归档) | R | 论文出处第 30 页脚注 4;在线核验 2026-09-15 | 已核验 |
| EV-52 | 云上映射示例(实例代际、RDMA、对象存储、编排、可观测) | E | 各云厂商公开文档(未逐项拉取) | 未逐一在线核验;使用前按当时目录复核 |
| EV-53 | 编辑推断项:控制面/数据面划分、图 1 面板编排、成本/容量公式、云映射推断、安全运维建议、「42.5%/20Gbps 不出自本文」核对结论、复现步骤 | I | 本报告 §1-§12 与 sources/deepseek-v3.evidence.json | 编辑标注完成;不含伪精确数字 |
| EV-54 | 图 1 柱状图(MMLU-Pro 75.9、GPQA 59.1、MATH-500 90.2、AIME 39.2、Codeforces 51.6、SWE 42.0,与表 6 一致) | P | 第 1 页图 1 | 已核验(逐柱) |
P 数据缺口集中声明:训练/推理 checkpoint 机制、存储介质与故障恢复流程、每 GPU tokens/s 与 MFU、TTFT/TPOT、服务并发与 SLO 数值、集群网络设备与成本明细、评测推理精度、能耗——论文未明确披露;I 本页所有缺口均未以推断填充。