专项论文分析
这是 ZenMind 的专项扩展栏目:一份独立维护的 GPU 大模型系统论文中文精读(2024–2025)静态报告快照。 它与本博客的随笔文章相互独立:报告以云计算架构师视角组织, 每篇论文按统一的 13 节模板精读,并用 P/R/E/I 四级证据标签 (论文 / 官方仓库 / 外部资料 / 编辑推断)区分「论文声称」与「编辑解读」。
发布状态(截至 快照)
完整报告规划核心论文 16 篇; 本快照当前包含核心论文页 16 篇, 其余 0 篇尚未完成、暂未收录。 快照只包含可直接阅读的 HTML 页面与静态资源(不含论文 PDF、原始提取文本与构建脚本)。
核心论文页:16 / 16 已发布
已收录的核心论文页
- DistServe (推理服务与资源调度)
- Sarathi-Serve (推理服务与资源调度)
- Mooncake (推理服务与资源调度)
- vAttention (推理服务与资源调度)
- FlashInfer (推理服务与资源调度)
- EAGLE (解码加速与量化)
- Medusa (解码加速与量化)
- KIVI (解码加速与量化)
- QuaRot (解码加速与量化)
- QServe (解码加速与量化)
- FlashAttention-3 (训练、并行与 GPU Kernel)
- Liger Kernel (训练、并行与 GPU Kernel)
- MegaScale (训练、并行与 GPU Kernel)
- TorchTitan (训练、并行与 GPU Kernel)
- GaLore (训练、并行与 GPU Kernel)
- DeepSeek-V3 (训练、并行与 GPU Kernel)
奠基论文(独立内容,非核心 16 篇)
除核心 16 篇外,快照另收录奠基论文:提出于更早、被核心合集反复引用的机制原始文献。 奠基论文按同样的 13 节模板与证据规则精读,但单列展示, 不计入核心论文数量、筛选与统计。
F01 · Attention Is All You Need(Transformer)
2017 年提出 Transformer 的原始论文(NIPS 2017;快照 PDF 为 arXiv v7,2023-08-02 修订版)。 详情页显式区分这两条发表记录、原样保留英法 BLEU 41.8(摘要/表 2)与 41.0(§6.1)的文内差异, 并将论文链接的 Tensor2Tensor 标注为「官方历史实现,已归档(2026-09-14 核验)」; decoder-only、RoPE、RMSNorm、GQA、FlashAttention、现代 KV-cache 服务等后续工作均不归于该论文。
如何阅读这份报告
- 每个数字都带完整条件(硬件、模型、精度、批量、基线与 PDF 页码); 论文未披露的字段会明确写出,不会留空。
- P=论文正文(含页码),R=核验过的官方仓库, E=外部资料(仅用于部署映射与版本核对),I=编辑推断。
- 报告不做跨论文性能数字的横向排名:各篇硬件、模型与负载口径不同, 任何倍数请回到对应详情页核对完整条件。