2024 推理服务与资源调度
问题:共置服务中预填与解码互相干扰,双 SLO 下只能堆 GPU 达标。
方法:按实例拆分两阶段,放置算法联合优化并行策略与资源,KV Cache 按需拉取。
- prefill/decode 分离
- 放置算法
- goodput 调度
- 年份
- 2024
- 生命周期
- 推理
- 优化层
- 运行时 · 集群
- 核心资源
- 算力 · KV Cache · 网络
- 适用硬件
- NVIDIA A100 80GB SXM(论文口径)
2024 推理服务与资源调度
问题:长预填卡住解码迭代,交互时延与 GPU 吞吐只能二选一。
方法:预填切块与解码同批执行,按 token 预算调度,在不伤时延下扩大批量。
- chunked prefill
- stall-free batching
- token 预算调度
- 年份
- 2024
- 生命周期
- 推理
- 优化层
- 运行时
- 核心资源
- 算力 · KV Cache
- 适用硬件
- NVIDIA A100(论文口径)
2024 推理服务与资源调度
问题:突发流量与长上下文下,KV Cache 显存与集群算力错配。
方法:以 KV Cache 为中心分离 prefill/decode 集群,跨本地与远端分层池化调度。
- KV Cache 中心调度
- P/D 分离
- 缓存分层池化
- 年份
- 2024
- 生命周期
- 推理
- 优化层
- 集群 · 运行时
- 核心资源
- KV Cache · 网络
- 适用硬件
- 生产级 GPU 集群(Kimi 线上服务,论文口径)
2024 推理服务与资源调度
问题:PagedAttention 的固定页映射带来碎片、预留浪费与接口耦合。
方法:复用 GPU 虚拟内存按需分配物理页,虚拟地址连续、物理页离散。
- 年份
- 2024
- 生命周期
- 推理
- 优化层
- 运行时
- 核心资源
- HBM / 显存
- 适用硬件
- NVIDIA A100 / H100(论文口径)
2025 推理服务与资源调度
问题:服务端注意力负载多样,专用 kernel 难以复用与组合。
方法:块稀疏可组合 kernel 库,统一 KV 布局,支持共享前缀与负载均衡调度。
- 年份
- 2025
- 生命周期
- 推理
- 优化层
- Kernel
- 核心资源
- 算力 · KV Cache
- 适用硬件
- NVIDIA sm75+(实验以 H100 为主,论文口径)
2024 解码加速与量化
问题:自回归解码每步仅产出一个 token,GPU 算力大量闲置。
方法:特征层自回归的草稿头做投机采样,单次验证多个 token,接受率更高。
- 年份
- 2024
- 生命周期
- 推理
- 优化层
- 算法
- 核心资源
- 算力
- 适用硬件
- NVIDIA RTX 3090 24GB(论文口径)
2024 解码加速与量化
问题:逐 token 解码受访存限制,直接多预测又难以保证质量。
方法:多个解码头并行产出候选,树注意力一次验证多条路径。
- 年份
- 2024
- 生命周期
- 推理
- 优化层
- 算法
- 核心资源
- 算力
- 适用硬件
- NVIDIA GPU(型号详见详情页)
2024 解码加速与量化
问题:KV Cache 随上下文与批量线性膨胀,显存先见顶。
方法:Key 按通道、Value 按 token 的 2bit 非对称量化,保持逐 token 生成兼容。
- KV 量化
- 2bit 非对称
- 逐通道 / 逐 token
- 年份
- 2024
- 生命周期
- 推理
- 优化层
- 算法
- 核心资源
- KV Cache · HBM / 显存
- 适用硬件
- NVIDIA GPU(型号详见详情页)
2024 解码加速与量化
问题:激活离群值让 4bit 量化的精度大幅下滑。
方法:计算不变的 Hadamard 旋转消除离群值,实现 W4A4 端到端低比特推理。
- 年份
- 2024
- 生命周期
- 推理
- 优化层
- 算法
- 核心资源
- HBM / 显存 · 算力
- 适用硬件
- NVIDIA RTX 3090(论文口径)
2024 解码加速与量化
问题:现有 GPU 上 4bit 权重的反量化开销吃掉理论收益。
方法:W4A8KV4 精度与计算感知权重布局,配合高效 kernel 提升 4bit 服务吞吐。
- 年份
- 2024
- 生命周期
- 推理
- 优化层
- 算法 · Kernel
- 核心资源
- HBM / 显存 · 算力 · KV Cache
- 适用硬件
- NVIDIA A100 / L40S(论文口径)
2024 训练、并行与 GPU Kernel
问题:Hopper 硬件特性未被 attention kernel 用满,距算力峰值远。
方法:warp 专化与 TMA 异步重叠访存与计算,软件流水 softmax,支持 FP8。
- 年份
- 2024
- 生命周期
- 训练 + 推理
- 优化层
- Kernel
- 核心资源
- 算力 · HBM / 显存
- 适用硬件
- NVIDIA H100 80GB(SXM5,论文口径)
2024 训练、并行与 GPU Kernel
问题:训练中激活复制与超大 logits 张量吃掉大量显存。
方法:RMSNorm、RoPE、SwiGLU、交叉熵等融合算子原地或分块计算,降低显存。
- 年份
- 2024
- 生命周期
- 训练
- 优化层
- Kernel
- 核心资源
- HBM / 显存
- 适用硬件
- NVIDIA A100 80GB(论文口径)
2024 训练、并行与 GPU Kernel
问题:万卡规模训练大模型,通信、稳定性与效率必须全栈协同。
方法:分层通信优化与混合并行,配合容错与监控,支撑万卡生产训练。
- 年份
- 2024
- 生命周期
- 训练
- 优化层
- 集群
- 核心资源
- 网络 · 算力
- 适用硬件
- >10000 GPU 生产集群(论文口径)
2024 训练、并行与 GPU Kernel
问题:组合四维并行要拼装多套外部库,体验割裂、难以维护。
方法:PyTorch 原生 FSDP/TP/PP/CP 组合式设计,统一检查点与容错管理。
- 年份
- 2024
- 生命周期
- 训练
- 优化层
- 运行时
- 核心资源
- 算力 · HBM / 显存
- 适用硬件
- NVIDIA H100(论文口径)
2024 训练、并行与 GPU Kernel
问题:优化器状态显存随参数量增长,单卡训不动大模型。
方法:把梯度投影到低秩子空间压缩优化器状态,更新时投回原空间,兼容 Adam。
- 年份
- 2024
- 生命周期
- 训练
- 优化层
- 算法
- 核心资源
- HBM / 显存
- 适用硬件
- NVIDIA RTX 4090(论文口径)
2024 训练、并行与 GPU Kernel
问题:MoE 大模型的训练成本与跨节点通信成为规模化瓶颈。
方法:无辅助损失负载均衡 MoE、FP8 混合精度与高效跨节点通信压低成本。
- 年份
- 2024
- 生命周期
- 训练
- 优化层
- 算法 · 集群
- 核心资源
- 算力 · 网络 · HBM / 显存
- 适用硬件
- NVIDIA H800 ×2048(论文口径)