GPU 大模型系统论文解读站

面向云计算架构师、AI 基础设施负责人、推理/训练平台技术负责人的中文论文精读站。每篇解读回答五个问题:该技术解决什么云上问题、数据如何经过 GPU 与系统组件、代价是什么、何时值得采用、怎样验证。覆盖 2024–2025 年 16 篇 GPU 大模型系统论文。

当前进度:16 个核心论文页中已发布 8 篇(01–05、07、08、14);其余 8 张卡片的入口链接暂指向尚未创建的页面,对应页面交付后自动生效。另发布奠基论文 F01(Attention Is All You Need)1 篇,单列于「奠基论文」章节,不计入核心 16 篇的卡片、筛选与统计。本站为纯静态站点,可离线打开;禁用 JavaScript 时全部内容与导航仍可完整阅读。

如何使用本站

  1. 从下方三条学习路径中挑选与你当前架构问题最接近的一条,按顺序浏览该路径的论文。
  2. 筛选与搜索(生命周期、优化层、资源瓶颈、年份、关键词)缩小候选,进入卡片详情。
  3. 在详情页按 13 节模板阅读:先看「摘要与一句话判断」和「适用 / 不适用场景」,再用「证据台账」核对每个数字的页码与条件。

架构师速览:三条学习路径

推理服务与资源调度

解决的云架构问题:在线 LLM 服务如何在不违反时延 SLO 的前提下,提高 GPU 集群的整体效率与容量上限。

这组论文覆盖服务侧的主要杠杆:把预填与解码拆开或切块(DistServe、Sarathi-Serve、Mooncake)、把 KV Cache 显存管好(vAttention)、把注意力算子换快(FlashInfer)。适合先读 DistServe 建立 TTFT/TPOT/goodput 的指标框架。

阅读顺序 01 DistServe → 02 Sarathi-Serve → 03 Mooncake → 04 vAttention → 05 FlashInfer

解码加速与量化

解决的云架构问题:解码慢、显存贵,如何在可控的质量与硬件约束下,压低每 token 的服务成本。

这组论文分两类杠杆:减少解码步数(EAGLE、Medusa 的投机采样)与降低每步的显存/带宽代价(KIVI、QuaRot、QServe 的量化)。量化类方案需要一起评估精度保持条件与硬件支持。

阅读顺序 06 EAGLE → 07 Medusa → 08 KIVI → 09 QuaRot → 10 QServe

训练、并行与 GPU Kernel

解决的云架构问题:大规模训练如何吃满集群算力、把显存与通信撑住,并保持长时间稳定运行。

这组论文从底到顶:单算子(FlashAttention-3、Liger Kernel)、单卡显存(GaLore)、训练框架(TorchTitan)、万卡集群(MegaScale)与全栈实践(DeepSeek-V3 报告)。适合按「算子 → 框架 → 集群」顺序阅读。

阅读顺序 11 FlashAttention-3 → 12 Liger Kernel → 13 MegaScale → 14 TorchTitan → 15 GaLore → 16 DeepSeek-V3

论文卡片(16 篇)

2024 推理服务与资源调度

01 · DistServe:prefill/decode 分离的 goodput 优化服务

问题:共置服务中预填与解码互相干扰,双 SLO 下只能堆 GPU 达标。

方法:按实例拆分两阶段,放置算法联合优化并行策略与资源,KV Cache 按需拉取。

  • prefill/decode 分离
  • 放置算法
  • goodput 调度
年份
2024
生命周期
推理
优化层
运行时 · 集群
核心资源
算力 · KV Cache · 网络
适用硬件
NVIDIA A100 80GB SXM(论文口径)

2024 推理服务与资源调度

02 · Sarathi-Serve:chunked-prefills 与 stall-free batching

问题:长预填卡住解码迭代,交互时延与 GPU 吞吐只能二选一。

方法:预填切块与解码同批执行,按 token 预算调度,在不伤时延下扩大批量。

  • chunked prefill
  • stall-free batching
  • token 预算调度
年份
2024
生命周期
推理
优化层
运行时
核心资源
算力 · KV Cache
适用硬件
NVIDIA A100(论文口径)

2024 推理服务与资源调度

03 · Mooncake:KV Cache 中心的分离式服务平台

问题:突发流量与长上下文下,KV Cache 显存与集群算力错配。

方法:以 KV Cache 为中心分离 prefill/decode 集群,跨本地与远端分层池化调度。

  • KV Cache 中心调度
  • P/D 分离
  • 缓存分层池化
年份
2024
生命周期
推理
优化层
集群 · 运行时
核心资源
KV Cache · 网络
适用硬件
生产级 GPU 集群(Kimi 线上服务,论文口径)

2024 推理服务与资源调度

04 · vAttention:用虚拟内存动态管理 KV Cache 显存

问题:PagedAttention 的固定页映射带来碎片、预留浪费与接口耦合。

方法:复用 GPU 虚拟内存按需分配物理页,虚拟地址连续、物理页离散。

  • GPU 虚拟内存
  • 按需分页
  • KV 显存管理
年份
2024
生命周期
推理
优化层
运行时
核心资源
HBM / 显存
适用硬件
NVIDIA A100 / H100(论文口径)

2025 推理服务与资源调度

05 · FlashInfer:面向 LLM 服务的注意力 kernel 库

问题:服务端注意力负载多样,专用 kernel 难以复用与组合。

方法:块稀疏可组合 kernel 库,统一 KV 布局,支持共享前缀与负载均衡调度。

  • kernel 库
  • 块稀疏
  • 共享前缀
年份
2025
生命周期
推理
优化层
Kernel
核心资源
算力 · KV Cache
适用硬件
NVIDIA sm75+(实验以 H100 为主,论文口径)

2024 解码加速与量化

06 · EAGLE:特征级自回归的投机采样

问题:自回归解码每步仅产出一个 token,GPU 算力大量闲置。

方法:特征层自回归的草稿头做投机采样,单次验证多个 token,接受率更高。

  • 投机采样
  • 特征级草稿
  • 单次多 token 验证
年份
2024
生命周期
推理
优化层
算法
核心资源
算力
适用硬件
NVIDIA RTX 3090 24GB(论文口径)

2024 解码加速与量化

07 · Medusa:多头解码与树注意力加速

问题:逐 token 解码受访存限制,直接多预测又难以保证质量。

方法:多个解码头并行产出候选,树注意力一次验证多条路径。

  • 多头解码
  • 树注意力
  • 多 token 预测
年份
2024
生命周期
推理
优化层
算法
核心资源
算力
适用硬件
NVIDIA GPU(型号详见详情页)

2024 解码加速与量化

08 · KIVI:KV Cache 的 2bit 量化

问题:KV Cache 随上下文与批量线性膨胀,显存先见顶。

方法:Key 按通道、Value 按 token 的 2bit 非对称量化,保持逐 token 生成兼容。

  • KV 量化
  • 2bit 非对称
  • 逐通道 / 逐 token
年份
2024
生命周期
推理
优化层
算法
核心资源
KV Cache · HBM / 显存
适用硬件
NVIDIA GPU(型号详见详情页)

2024 解码加速与量化

09 · QuaRot:旋转消除离群值的 4bit 推理

问题:激活离群值让 4bit 量化的精度大幅下滑。

方法:计算不变的 Hadamard 旋转消除离群值,实现 W4A4 端到端低比特推理。

  • 旋转不变量
  • Hadamard 变换
  • W4A4
年份
2024
生命周期
推理
优化层
算法
核心资源
HBM / 显存 · 算力
适用硬件
NVIDIA RTX 3090(论文口径)

2024 解码加速与量化

10 · QServe:W4A8KV4 的 GPU 服务系统

问题:现有 GPU 上 4bit 权重的反量化开销吃掉理论收益。

方法:W4A8KV4 精度与计算感知权重布局,配合高效 kernel 提升 4bit 服务吞吐。

  • W4A8KV4
  • 计算感知量化
  • 服务吞吐
年份
2024
生命周期
推理
优化层
算法 · Kernel
核心资源
HBM / 显存 · 算力 · KV Cache
适用硬件
NVIDIA A100 / L40S(论文口径)

2024 训练、并行与 GPU Kernel

11 · FlashAttention-3:Hopper 上的异步注意力

问题:Hopper 硬件特性未被 attention kernel 用满,距算力峰值远。

方法:warp 专化与 TMA 异步重叠访存与计算,软件流水 softmax,支持 FP8。

  • 异步流水
  • warp 专化
  • FP8
年份
2024
生命周期
训练 + 推理
优化层
Kernel
核心资源
算力 · HBM / 显存
适用硬件
NVIDIA H100 80GB(SXM5,论文口径)

2024 训练、并行与 GPU Kernel

12 · Liger Kernel:LLM 训练的融合算子库

问题:训练中激活复制与超大 logits 张量吃掉大量显存。

方法:RMSNorm、RoPE、SwiGLU、交叉熵等融合算子原地或分块计算,降低显存。

  • 算子融合
  • 原地计算
  • 分块交叉熵
年份
2024
生命周期
训练
优化层
Kernel
核心资源
HBM / 显存
适用硬件
NVIDIA A100 80GB(论文口径)

2024 训练、并行与 GPU Kernel

13 · MegaScale:万卡级 LLM 训练系统

问题:万卡规模训练大模型,通信、稳定性与效率必须全栈协同。

方法:分层通信优化与混合并行,配合容错与监控,支撑万卡生产训练。

  • 万卡集群
  • 通信优化
  • 容错恢复
年份
2024
生命周期
训练
优化层
集群
核心资源
网络 · 算力
适用硬件
>10000 GPU 生产集群(论文口径)

2024 训练、并行与 GPU Kernel

14 · TorchTitan:PyTorch 原生 4D 并行训练框架

问题:组合四维并行要拼装多套外部库,体验割裂、难以维护。

方法:PyTorch 原生 FSDP/TP/PP/CP 组合式设计,统一检查点与容错管理。

  • 4D 并行
  • 原生 PyTorch
  • 统一检查点
年份
2024
生命周期
训练
优化层
运行时
核心资源
算力 · HBM / 显存
适用硬件
NVIDIA H100(论文口径)

2024 训练、并行与 GPU Kernel

15 · GaLore:梯度低秩投影的省显存训练

问题:优化器状态显存随参数量增长,单卡训不动大模型。

方法:把梯度投影到低秩子空间压缩优化器状态,更新时投回原空间,兼容 Adam。

  • 低秩梯度投影
  • 优化器显存
  • 单卡训练 7B
年份
2024
生命周期
训练
优化层
算法
核心资源
HBM / 显存
适用硬件
NVIDIA RTX 4090(论文口径)

2024 训练、并行与 GPU Kernel

16 · DeepSeek-V3:FP8 训练的 MoE 大模型报告

问题:MoE 大模型的训练成本与跨节点通信成为规模化瓶颈。

方法:无辅助损失负载均衡 MoE、FP8 混合精度与高效跨节点通信压低成本。

  • MoE 负载均衡
  • FP8 训练
  • 通信压缩
年份
2024
生命周期
训练
优化层
算法 · 集群
核心资源
算力 · 网络 · HBM / 显存
适用硬件
NVIDIA H800 ×2048(论文口径)

奠基论文(非核心 16 篇)

除 16 篇 2024–2025 年 GPU/LLM 系统论文外,本站单列奠基论文:提出于更早、被合集反复引用的机制原始文献。奠基论文不进入上方筛选区、选型矩阵与站点统计(卡片数量、筛选逻辑与统计口径均按核心 16 篇保持不变),只按同一 13 节模板与 P/R/E/I 证据规则精读。

2017 奠基论文 F01

F01 · Attention Is All You Need(Transformer):完全基于注意力的序列转导

问题:循环模型沿位置串行、训练难并行;卷积模型跨距离关联的操作数随距离增长。

方法:完全以多头自注意力+逐位置前馈构成编码器-解码器,任意两位置常数次操作关联。

收录说明:2017 年模型结构论文,非 2024–2025 系统论文,故单列而不入核心合集。详情页显式区分 arXiv v7(2023-08-02 修订)与 NIPS 2017 两条发表记录、原样保留英法 BLEU 41.8(摘要/表 2)与 41.0(§6.1)的文内差异,并将 Tensor2Tensor 标注为「官方历史实现,已归档(2026-09-14 核验)」;decoder-only、RoPE、RMSNorm、GQA、FlashAttention、现代 KV-cache 服务等后续工作均不归于该论文。

年份
2017(NIPS 2017;本地 PDF 为 arXiv v7,2023-08-02)
类别
奠基论文(非核心 16 篇)
证据状态
P + R + E + I
代码
Tensor2Tensor:官方历史实现,已归档只读(2026-09-14 核验)

定性选型矩阵

本矩阵只收录可规范化的定性字段,用于快速圈定候选;论文之间的性能数字不可直接横向比较(硬件、模型、精度、批量与上下文长度不一致),任何数字请进入对应详情页查看完整条件。「工程侵入性」为编辑给出的定性判断(I),非论文结论。

16 篇论文的定性字段一览(按阅读顺序)
论文 年份 生命周期 优化层 核心资源 工程侵入性(定性 I
01 DistServe2024推理运行时 · 集群算力 · KV Cache · 网络高(新增服务系统与编排)
02 Sarathi-Serve2024推理运行时算力 · KV Cache中(服务引擎内调度改造)
03 Mooncake2024推理集群 · 运行时KV Cache · 网络高(集群级架构改造)
04 vAttention2024推理运行时HBM / 显存中(替换引擎内存管理)
05 FlashInfer2025推理Kernel算力 · KV Cache中(替换或叠加 kernel 库)
06 EAGLE2024推理算法算力中(需训练草稿头并改解码循环)
07 Medusa2024推理算法算力中(需训练解码头并改验证)
08 KIVI2024推理算法KV Cache · HBM / 显存中(替换注意力实现并量化)
09 QuaRot2024推理算法HBM / 显存 · 算力中(需校准与模型结构变换)
10 QServe2024推理算法 · KernelHBM / 显存 · 算力 · KV Cache中(量化方案与服务栈协同改造)
11 FlashAttention-32024训练 + 推理Kernel算力 · HBM / 显存低(替换 attention kernel)
12 Liger Kernel2024训练KernelHBM / 显存低(替换训练算子,可回退)
13 MegaScale2024训练集群网络 · 算力高(自研集群级训练系统)
14 TorchTitan2024训练运行时算力 · HBM / 显存中(更换训练框架)
15 GaLore2024训练算法HBM / 显存低(替换优化器,侵入小)
16 DeepSeek-V32024训练算法 · 集群算力 · 网络 · HBM / 显存高(全栈自研训练方案)

指标词典

详情页出现的每个指标都必须先对齐口径再比较。下表给出常见指标的定义与比较前提;各论文的具体口径以其详情页「成本 / 性能 / SLO」与「实验与指标」章节为准。

常见性能指标的定义与比较前提
指标 定义 单位 / 口径 比较前提
tokens/s(吞吐) 单位时间内生成或处理 token 的数量,可分预填吞吐与解码吞吐。 token/秒;常按请求或按卡归一 必须同批大小、上下文长度、精度与硬件对比;不同系统对「计入了什么 token」口径可能不同。
TTFT time to first token:从发出请求到收到首个 token 的时间,主要反映预填与排队时延。 秒或毫秒;平均或 P90/P99 分位 需对齐输入长度分布、到达过程与排队策略;分位口径(均值 vs P90)不可混用。
TPOT time per output token:除首 token 外,平均每个输出 token 的生成时间。 秒或毫秒;平均或分位 需对齐输出长度、批大小与解码并行度;单请求总时延 ≈ TTFT + TPOT × 输出 token 数。
峰值显存 训练或推理过程中 GPU 显存占用的最大值。 GB;区分权重 / 激活 / KV / 优化器状态 需说明测量阶段(前向/反向/长稳)、模型规模、精度与上下文长度;不同测量工具口径有差异。
GPU 利用率 时间片内 GPU 至少有一个 kernel 在执行的比例。 百分比;采样口径依工具而异 「利用率高」不等于「计算效率高」;kernel 可能只是在等访存。应结合 MFU 与时延分解解读。
MFU model FLOPs utilization:实际达到的模型 FLOPs 除以硬件峰值 FLOPs(按精度计)。 百分比;是否计入重计算与通信需注明 需对齐硬件型号、精度(FP16/BF16/FP8 峰值不同)与是否含梯度重计算;跨精度不可直接比。
goodput 满足时延 SLO 约束的有效吞吐:只有达到 SLO 的请求才计入吞吐(DistServe 的核心口径)。 req/s;常按每 GPU 归一 必须同时给出 TTFT/TPOT 阈值、达标率目标与到达过程;SLO 不同则 goodput 不可比。
SLO attainment 满足全部时延 SLO 约束的请求比例。 百分比;常用 90% / 99% 作为目标 需给出具体阈值与达标率目标档位;同一系统在 90% 与 99% 目标下的容量差异可能很大。

阅读说明:方法与证据

每篇详情页把「论文声称、仓库核验、外部资料、编辑推断」分开标注,不混写。证据标签共四级:

P Paper(论文)
来自论文正文、附录与图表的内容,页面以「论文报告 / 作者指出」的措辞呈现,并给出页码、章节、表号或图号。
R Repository(官方仓库)
论文明确链接、且经核验的作者/机构官方仓库;标注仓库归属、访问日期,commit/tag 若可得则一并标注。
E External(外部资料)
云厂商文档或相关项目文档,只用于「云上部署映射」,不冒充论文结论;具体产品仅作示例。
I Inference(编辑推断)
架构师视角的分析与建议,一律带推断标签,不给出伪精确数字;与论文事实明确分隔。

数字口径要求

详情页中每个性能数字必须同时携带:指标定义、硬件、模型/规模、精度、批量/并发、输入输出长度、基线、论文定位(页码/表号)。论文未披露的字段会明确写「论文未明确披露」,不会留空,也不会用其他论文的数字补齐。

跨论文比较警告:各论文的实验硬件、模型、精度、批量与上下文长度不一致,本站不做跨论文性能数字的横向排名。选型矩阵只含定性字段;任何倍数、百分比请回到对应详情页核对完整条件后再引用。

最后核验日期:(各详情页以页面顶部标注的核验日期为准)。