KIVI:key 按通道 / value 按 token 的免调优非对称 2bit KV 缓存量化

本页为第 8 篇(解码加速与量化类)。定量内容取自本地论文 PDF 08_KIVI_2402.02750.pdf(arXiv:2402.02750v2,ICML 2024 / PMLR 235,共 15 页)并逐条标注 PDF 页码;第 1、3、4、5、6、7、8、9、13 页已渲染原页逐项目检,图 5 的逐点坐标值为读图近似并单独标注(见 #evidencesources/kivi.evidence.json)。

快速标签与阅读说明

最后核验日期:证据完整度:论文核心数字(摘要、表 1-5、图 2-5、§3-§4 结论)已回 PDF 原页逐项核验并标注页码;附录第 12、14、15 页经文本提取交叉核对;图 5 无数据表,逐点数值为编辑读图近似(标 I);TTFT/TPOT、量化统计量存储精度论文未披露,页面写「论文未明确披露」。

证据标签图例: P=论文 R=仓库 E=外部资料 I=编辑推断

1. 摘要与一句话判断

论文元数据 P(逐字核验自 PDF 第 1 页)
题名KIVI: A Tuning-Free Asymmetric 2bit Quantization for KV Cache(编辑译名:KIVI——面向 KV 缓存的免调优非对称 2bit 量化)
作者 / 机构Zirui Liu*、Jiayi Yuan*(Rice);Hongye Jin(Texas A&M);Shaochen (Henry) Zhong(Rice);Zhaozhuo Xu(Stevens);Vladimir Braverman(Rice);Beidi Chen(CMU);Xia Hu(Rice)。*共同一作,脚注注明作者顺序由抛硬币决定(第 1 页)
发表ICML 2024(Proceedings of the 41st International Conference on Machine Learning, Vienna, PMLR 235, 2024);arXiv:2402.02750v2,2024-07-25;本地 PDF 08_KIVI_2402.02750.pdf(15 页)P
代码摘要末句印明 github.com/jy-yuan/KIVI(第 1 页)R;本次会话未在线核验可达性,使用前复核(见 #links
评估范围模型:Llama/Llama-2(7B/13B)、Falcon-7B(MQA)、Mistral-7B,另有 Llama-3-8B-Instruct、Mistral-7B-v0.2、LongChat-7B-v1.5(附录);任务:CoQA、TruthfulQA、GSM8K(LM-Eval)、LongBench 8 任务、大海捞针 NIAH;效率:ShareGPT 合成负载(第 6-9、13-15 页)P
实验硬件效率实验:单卡 NVIDIA A100 GPU(80GB),Llama-2-7B(第 8 页);精度实验 GPU 型号/数量:论文未明确披露
一句话判断(编辑推断):I KIVI 抓住一个经验事实——KV 缓存里 key 有少数固定通道幅值极大、value 没有——据此把 2bit 量化拆成两套几何:key 沿通道维每 G=32 个 token 一组、value 沿 token 维分组,再配一段不超过 R=128 个 token 的全精度残差滑窗解决「按通道量化无法流式写入」的工程矛盾。它免训练、免校准,换来的不是单请求变快,而是同显存下装下 4 倍 batch、吞吐 2.35×~3.47×(单卡 A100-80GB、Llama-2-7B)。适合 KV 显存已成瓶颈的批量/长上下文服务;Falcon 这类 MQA 模型 2bit 会明显掉精度,数学推理等硬任务依赖滑窗配置正确。

3 分钟速读

  1. 问题:批量与上下文一大,KV 缓存就成为显存与速度瓶颈——540B PaLM 在批 512、上下文 2048 时 KV 缓存达 3TB(参数量的 3 倍,第 1 页);OPT-175B 在批 512、输入 512、输出 32 时 KV 缓存 1.2TB(权重的 3.8 倍,第 3 页);GPU 每生成一个 token 都要把整个 KV 缓存从显存搬进 SRAM,期间计算核空闲(第 1、3 页)P
  2. 关键观察:仿真量化显示(Llama-2-13B、组大小 32,第 3 页表 1):双 per-token 的 2bit 掉到 52.93/24.98(CoQA/TruthfulQA),value 也按通道则崩到 2.88/0.74,而 key 按通道 + value 按 token 拿到 63.53/28.60,几乎追平 16bit 的 66.37/29.53 P
  3. 为什么:key 的离群集中在少数固定通道,按通道分组把误差锁在通道内(注意力分数误差 9.60 vs 47.00,第 4 页表 2);value 是注意力输出的「混合器」且注意力稀疏 84.3%,按 token 分组把误差锁在单个 token 内(输出误差 3.55 vs 49.89)P
  4. 工程化:key/value 都拆成「2bit 分组部分 + 全精度残差」:value 队列天然流式;key 攒满 R 个 token 再按通道成组量化(R 能被 G 整除);反量化用 CUDA 融合进矩阵乘(Q_MatMul),组量化 kernel 用 Triton;与 weight-only 权重量化完全兼容(第 5-6 页)P
  5. 结果与边界:Llama-2-7B 峰值显存(含权重)降至约 1/2.6;相近峰值显存下 batch 至多 4×、吞吐 2.35×~3.47×(单卡 A100-80GB、ShareGPT 负载均值输入 161/输出 338,第 1、7-8 页图 5)P;Llama/Mistral 上 2bit 精度损失至多约 2%,但 Falcon-7B(MQA 单 KV 头)需 4bit(第 6、8 页)P;论文未报告 TTFT/TPOT 与单请求延迟I(口径核对)。

2. 问题背景

瓶颈的量级:KV 缓存随 batch 与上下文线性增长。540B PaLM、批 512、上下文 2048 时 KV 缓存 3TB,是参数量的 3 倍(第 1 页,引 Pope et al., 2023);OPT-175B、批 512、输入 512、输出 32 时 KV 缓存 1.2TB,是权重的 3.8 倍(第 3 页,引 Sheng et al., 2023)P。同时解码期 GPU 每产出一个 token 都要把整个 KV 缓存从显存搬入 SRAM,期间计算核基本空闲——KV 既吃容量也吃带宽P(第 1、3 页)。

既有路线及其代价:P(第 1 页)论文把已有工作分三类:①减少 KV 头数(MQA/GQA)——需从头训练或微调;②驱逐不重要 token(H2O、Scissorhands、StreamingLLM)——丢弃信息;③系统层手段(FlexGen 卸载、vLLM 分页)——改内存管理、不缩小 KV 本身。量化是最直接的「省字节」手段,但此前 KV 量化研究很少,多是对全量 KV 直接套 4bit round-to-nearest;GPTQ 这类优化型方法因 KV 流式到达、开销不适用(第 3 页)P

目标工作负载与约束:长上下文与批量推理服务;约束是:不训练、不微调、不用校准数据(tuning-free),精度损失可忽略,且实现必须对 GPU 亲和(第 1 页摘要主张;第 6 页 System Support)P

基线口径:精度基线为同模型 16bit KV(FP16 缓存);效率基线为 FP16 KV + FP16 权重的标准推理,批量从小到大扫描直至 OOM(第 6-8 页)PI 因此论文数字回答的是「KIVI 比 FP16 缓存强多少」,不回答「与其他 KV 压缩方案比谁优」。

3. 核心机制

3.1 量化原语与关键实验观察

KV 缓存是流式结构,作者采用最灵活的 round-to-nearest(RTN)对称区间量化P(第 3 页):

Q(X) = ⌊(X − z_X) / s_X⌉,反量化 X′ = Q(X)·s_X + z_X
z_X = min X(零点),s_X = (max X − min X) / (2^B − 1)(B 为位宽缩放因子)

仿真(fake)量化实验P(第 3 页表 1;Llama-2-13B、CoQA/TruthfulQA、组大小 32,先量化再在注意力层反量化):

表 1 转录:不同量化维度的 2bit 结果(P,PDF 第 3 页;K-C=key 按通道,V-T=value 按 token,余类推)
配置CoQATruthfulQA
16bit66.3729.53
4bit(K-T, V-T)66.4829.51
2bit(K-C, V-T)(最优)63.5328.60
2bit(K-T, V-T)52.9324.98
2bit(K-C, V-C)2.880.74
2bit(K-T, V-C)2.800.26

三条观察P(第 3 页 OB1-OB3):INT4 双 per-token 尚可保持精度、INT2 明显掉点(OB1);value 一旦按通道,无论 key 怎样都显著恶化(OB2);INT2 下最优组合是 key 按通道 + value 按 token(OB3)。

3.2 为什么 K/V 的量化维度必须不同

3.3 KIVI 算法:分组缓存 + 全精度残差滑窗

按通道量化跨 token 成组、无法「来一个 token 量化一个」;KIVI 的解法是把 key 与 value 各拆成两段P(第 5 页 §3.3,图 3 与附录 A Algorithm 1,第 12 页):

3.4 系统支持(GPU kernel)

P(第 6 页 System Support)为压低开销:①反量化融合进矩阵乘——Q_MatMul(混合精度矩阵乘,CUDA 实现,反量化在 tiling 级完成);②组量化 kernel 用 Triton 实现;③方法与 weight-only 权重量化完全兼容,可叠加。

控制面 / 数据面职责划分(编辑推断):I 论文未使用「控制面/数据面」术语。本页划分:控制面=超参 G 与 R 的选择(R 可整除 G)、量化触发阈值(len(X_Kr)=R;len(X_Vr)>R)、位宽档位(KIVI-2/KIVI-4);数据面=token 投影、残差追加/出队、组量化 kernel、Q_MatMul 注意力、缓存四元组回写。该划分只影响叙述,不改变论文事实。

4. GPU/系统数据路径

KIVI 缓存读写数据路径图:当前 token 经前向投影得到 query、key、value;写路径上 key 追加进全精度残差缓冲 X_Kr(不超过 R 个 token),value 进入 FIFO 队列 X_Vr(保留最新 R 个);阈值触发量化时,key 残差攒满 R 个 token 后沿通道维分组(每组 G=32 个 token)量化为 2bit 并入分组 key 缓存 Q(X_Kg),value 队列超过 R 个时弹出最旧的 token、沿 token 维量化并入 Q(X_Vg);读路径上注意力得分由两段拼接——2bit 分组 key 经 Q_MatMul(反量化融合进矩阵乘的 CUDA 算子)与查询相乘、全精度残差 key 直接与查询相乘——拼接后 softmax,输出为 2bit 分组 value 与全精度 value 两段加权和;显存中的 KV 缓存是每层每头一个四元组:Q(X_Kg) 2bit 加零点缩放、X_Kr 全精度不超过 R、Q(X_Vg) 2bit 加零点缩放、X_Vr 全精度 R 个;每步解码循环写-读-回写。右侧面板列出参数 G=32、R=128、量化公式(零点取最小值、缩放取极差除以 2^B 减一)、非对称依据(key 少数固定通道幅值大、注意力分数误差 9.60 对 47.00;value 是输出混合器、注意力稀疏 84.3%、输出误差 3.55 对 49.89)与收益风险(峰值显存含权重约降至 1/2.6、batch 至多 4 倍、吞吐 2.35 至 3.47 倍;Falcon 等 MQA 模型 2bit 掉精度需 4bit、GSM8K 依赖全精度滑窗、组大小 128 时精度下降、论文未报告 TTFT/TPOT)。
图 1:KIVI 单步解码的缓存读写路径与非对称量化机制。实线=GPU 计算/数据流,虚线=控制流(阈值触发量化);紫色=KV 缓存与存储对象,琥珀=风险点;编号 ①-⑥ 对应下方文字序列。依据论文图 1-3、表 1-3、图 5、§3.3、§4(arXiv:2402.02750v2)绘制 P;编号与平面划分为编辑标注 I

端到端文字序列(与图中编号一致)

  1. ① 前向投影:当前 token 嵌入 t 经 W_Q/W_K/W_V 得到 t_Q、t_K、t_V(每层每头各一份);prefill 逐层传精确张量,解码期每步只有一个 token 到达(流式)P(第 2、5 页)。
  2. ② 写缓存(残差):t_K 直接追加进全精度残差缓冲 X_Kr(≤R 个 token);t_V 进入 FIFO 队列 X_Vr(保留最新 R 个)。两者此时都是 FP16P(第 5 页)。
  3. ③ 触发量化:len(X_Kr)=R 时 KeyQuant——沿通道维分组、每 G=32 个 token 一组、组内按通道算零点/缩放,量化为 2bit 并入 Q(X_Kg),X_Kr 清空;len(X_Vr)>R 时弹出最旧 token、沿 token 维量化并入 Q(X_Vg)P(第 5 页、第 12 页 Algorithm 1)。
  4. ④ 读缓存(注意力):A = Concat([t_Q·Q(X_Kg)ᵀ, t_Q·X_Krᵀ]),量化段经 Q_MatMul(CUDA 反量化融合矩阵乘);Softmax 后输出 t_O = A_g·Q(X_Vg) + A_r·X_VrP(第 5 页式 3、第 6 页)。
  5. ⑤ 存储布局:每层每头一个四元组 ⟨Q(X_Kg) 2bit+统计量, X_Kr 全精度 ≤R, Q(X_Vg) 2bit+统计量, X_Vr 全精度 R⟩;R≤128 时残差开销可忽略P(第 5 页)。统计量(零点/缩放)的存储精度:论文未明确披露。
  6. ⑥ 循环与收益:每步重复 ②→④ 并回写四元组;KV 显存下降 → 同显存可容更大 batch → 吞吐上升。单卡 A100-80GB、Llama-2-7B 上:峰值显存(含权重)约 1/2.6,batch 至多 4×,吞吐 2.35×~3.47×P(第 1、7-8 页图 5);上下文/输出越长收益越大P(第 8 页)。
路径上的关键配置与事实(机制口径,非性能结论;性能结论见 #experiments
事实/数值对象与条件论文定位
组大小 G=32(所有实验);残差 R=128,且 R ≤ 128、R 可被 G 整除量化超参(KIVI-2/KIVI-4 共用)P 第 6 页 §4.1、第 5 页 §3.3
key 按通道维分组、value 按 token 维分组(2bit)非对称量化几何P 第 1 页摘要、第 2 页图 1、第 4 页 §3.2
全精度滑窗:预期 key R/2、value R;对 GSM8K 至关重要精度保持机制P 第 6 页 §3.3(提取文件方向颠倒已按原页更正)
Q_MatMul=反量化融合矩阵乘(CUDA,tiling 级);组量化 kernel 用 Triton;兼容 weight-only 量化GPU 实现P 第 5 页图 3 注、第 6 页 System Support
prefill 传给下一层的是精确张量;内存只保留量化 KVprefill/decode 边界P 第 5 页 §3.3
量化统计量(零点/缩放)存储精度、KV 量化/反量化算子的绝对耗时:论文未明确披露数据路径运行细节P(本次证据源未载明,页面不补写)
P 口径提醒(读数方式):效率数字的完整条件是:单卡 NVIDIA A100(80GB)、Llama-2-7B、ShareGPT 合成负载(平均输入 161 / 输出 338 token)、批量从小到大扫描直至 OOM、对比对象为 FP16 KV 基线(第 7-8 页)P。引用本页任何吞吐/显存数字时必须携带这些条件,且不可与其他论文的数字横向比较。

5. 架构权衡

6. 云上部署映射

以下映射为厂商中立示例;具体产品命名/规格仅作说明并标 E,以厂商当时目录为准,未逐一在线核验。论文事实单独标注 P

KIVI 组件 → 云上资源映射
论文需求云上映射(示例)证据与说明
计算:单卡即可承载(A100-80GB、Llama-2-7B 效率实验) E 单卡 GPU 推理实例起步(如各云 A10G/L4/A100 类);KV 显存节省可换更大 batch 或更长上下文,按吞吐 SLO 决定是否升配 单卡实验口径为论文事实 P(第 7-8 页);实例规格为厂商目录示例 E
KV 显存容量规划:KV 字节数 × 序列长 × batch ≪ FP16 E 容量模型进编排:按「权重 + KIVI 量化 KV + 残差 + 激活」估算单实例可容并发;为回退 FP16 预留显存余量或配置降载 KV 结构(四元组、残差 ≤R)为论文事实 P(第 5 页);容量公式与回退余量为工程建议 I
推理框架集成:HF Transformers 代码库上的 CUDA/Triton kernel E 自建推理服务(vLLM/TGI 类或云托管模型服务)集成 KIVI kernel 时走制品化镜像;kernel 版本与框架版本配对 pin 论文实现在 HF Transformers 之上、kernel 自研 P(第 6 页);论文未绑定任何服务框架 P;框架选型为云实践 E
配置面:G、R、位宽(KIVI-2/4)按模型选择 E 配置随模型制品下发(模型卡注明 G=32、R=128、MQA 模型用 4bit);变更走灰度 + 精度回归 参数口径为论文事实 P(第 6、9、14-15 页);配置治理为工程建议 I
弹性:容量收益在批量侧兑现 E 相同显存水位提高单实例并发上限或接入更多并发路由;长上下文流量优先路由到 KIVI 实例(收益随上下文增大) 「batch 至多 4×、吞吐随上下文/输出增长」为论文事实 P(第 8 页);路由策略为工程建议 I
可观测:显存水位、吞吐、精度抽样 E 监控峰值显存/批量上限、tokens/s、GSM8K 类硬任务抽样分数与 NIAH 类检索抽测;异常回退 FP16 缓存并告警 论文以吞吐/峰值显存/精度基准为口径 P(第 6-9 页);监控指标设计为编辑建议 I、接入为云实践 E
放置要点(编辑推断):I ①KIVI 的收益兑现在「同卡装更多并发/更长上下文」,最适合 KV 显存水位长期偏高的批量与长上下文服务;②短上下文、低并发实例收益有限(残差占比上升、KV 本身不构成瓶颈);③与 weight-only 量化叠加是论文明示的兼容方向,可把「权重 + KV」一起压。

7. 成本 / 性能 / SLO

7.1 指标口径(论文使用的)

P(第 6-9 页)精度:CoQA(精确匹配)、TruthfulQA(BLEU)、GSM8K(精确匹配)、LongBench 8 任务平均、NIAH 检索;效率:批处理吞吐(tokens/s,全并发合计)与峰值显存(GB),负载为 ShareGPT 合成(平均输入 161/输出 338),扫描 batch 直至 OOM。TTFT、TPOT、单请求延迟:论文未明确披露。

7.2 容量与成本公式(参数化,编辑推断)

FP16 KV 显存/token ≈ 2(K与V) × 层数 L × 隐藏维 d × 2 字节
KIVI-2 KV 显存/token ≈ 2 × L × d × (2bit + 组统计量摊销)/8 (组统计量:每组零点+缩放)
单实例可容 batch ≈ (HBM 容量 − 权重 − 激活/框架开销 − 回退余量) ÷ (单请求 KV 字节)
每百万 token 成本 ≈ 实例时单价 ÷ (batch × 单请求 tokens/s × 3600) × 10^6(记录单价查询日期)

I 公式中可由论文支撑的量:KIVI 相对 FP16 的 KV 压缩与「相近峰值显存下 batch 至多 4×」(Llama-2-7B、A100-80GB,第 8 页);峰值显存(含权重)约 1/2.6(第 1 页)。其余(单价、激活开销、回退余量、请求长度分布)需按部署实测填写,本页不给出伪精确数字。E Llama-2-7B 的 L=32、d=4096 取自公开模型卡(非论文内容),仅作代入示例。

7.3 图 5 数字上下文(A100-80GB · Llama-2-7B)

图 5 上下文速查(论文文字结论为 P;逐点读数为 I 读图近似,论文无数据表)
条目数值/结论条件来源
硬件 / 模型 / 负载单卡 NVIDIA A100(80GB);Llama-2-7B;ShareGPT 合成负载(均值输入 161/输出 338);batch 扫描至 OOM效率实验总口径P 第 7-8 页 §4.2.4
batch 容量相近峰值显存下 KIVI 至多 4×(读图:基线 ~96 处 OOM vs KIVI-R32 ~384)对比 FP16 KV 基线P 第 8 页;读数 I
吞吐2.35×~3.47×(读图:基线峰值 ~760 tokens/s;KIVI-R128 ~1780 @bs~256;KIVI-R32 ~2640 @bs~384)同上;上下文/输出更长时倍数更大P 第 8 页;读数 I
峰值显存读图:基线 ~60GB@bs~96;KIVI-R128 ~56GB@bs~256;KIVI-R32 ~54GB@bs~384含权重;KIVI 残差 32 压缩率更高(附录 C)读数 I;残差结论 P 第 13 页
残差 32 vs 128R32 显存压缩率显著更高、吞吐随之增加;精度差距不大(Llama-2-7B GSM8K:R32 13.57 vs R128 12.74)KIVI-2,LM-EvalP 第 13 页附录 C、表 6
基线形状FP16 吞吐峰值在小批量(读图 ~760 @bs~32),加大批量反而回落直至 OOM图 5 下子图读数 I

7.4 敏感项与数据缺口

8. 安全与可运维性

8.1 安全

8.2 可运维性(含恢复与回滚)

9. 适用 / 不适用场景

适用(触发条件 + 理由)

  1. KV 显存已成瓶颈的批量/长上下文服务(Llama/Mistral 类)。触发:显存水位随并发或上下文增长触顶、OOM 限制并发上限。理由:Llama-2-7B 峰值显存(含权重)约 1/2.6,相近显存下 batch 至多 4×、吞吐 2.35×~3.47×(A100-80GB)P(第 1、7-8 页);上下文/输出越长收益越大 P(第 8 页)。
  2. 不能训练/微调、也没有校准数据的部署。触发:只用现成权重、零改动接入。理由:KIVI 免调优(RTN、无训练无校准),plug-and-play P(第 1 页摘要、第 3 页)。
  3. 权重已做 weight-only 量化、还想继续压显存的实例。触发:INT4/INT3 权重量化后 KV 成为剩余大头。理由:论文明示与 weight-only 量化完全兼容、可叠加 P(第 6、9 页)。
  4. 已用/计划用 token 驱逐或分页系统、想叠加压缩的团队。触发:vLLM 分页、H2O 驱逐已上线或规划中。理由:KIVI 保留全部 token 只压精度,与驱逐/分页正交可组合 P(第 9 页);长上下文精度有 NIAH 27K/30K token 证据 P(第 7 页)。

不适用(触发条件 + 理由)

  1. Falcon 等 MQA/单 KV 头模型追求 2bit。触发:模型 KV 头数已被 MQA/GQA 压缩。理由:Falcon-7B 上 2bit 明显掉精度(CoQA 57.48 vs 59.83),需 KIVI-4,压缩收益打折 P(第 6、8 页)。
  2. 短上下文、低并发、KV 不构成瓶颈的场景。触发:序列短、批量小,KV 显存占比低且无 OOM 压力。理由:论文收益口径是批量/长上下文;残差占比在短序列下上升(论文以「序列远大于 R≤128」论证开销可忽略)P(第 5 页)+I(外推判断)。
  3. 把单请求延迟(TPOT/TTFT)当首要 SLO 的交互式场景。触发:目标是个位数字毫秒级的每 token 延迟。理由:论文只报批处理吞吐与显存,未报 TTFT/TPOT;反量化开销绝对值未披露且论文承认量化融合尚有提升空间 P(第 8-9 页)。I 期望「单请求变快」属于误读收益对象。
  4. 无法保证 (G, R, 滑窗) 配置正确、也没有硬任务回归能力的团队。触发:无评测流水线、配置随意改动。理由:G=128 显著掉精度(GSM8K 17.29 vs 20.77)、R=64 最差、滑窗失效直接打击 GSM8K 类任务 P(第 7、9 页)。

10. 实验与指标

10.1 实验设置与口径 P(第 6-8 页)

设置与指标口径(页码均已核验)
模型Llama/Llama-2(7B/13B)、Falcon-7B(MQA)、Mistral-7B;附录另含 Llama-3-8B-Instruct(8K 上下文、GQA 8 KV 头)、Mistral-7B-Instruct-v0.2(32K)、LongChat-7B-v1.5-32K P(第 6、14-15 页)
精度/位宽KV:KIVI-2(2bit)/ KIVI-4(4bit),基线 16bit(FP16);权重精度:论文未明确披露(兼容 weight-only 量化)P(第 6 页)
超参组大小 G=32(所有实验);残差 R=128(另测 R=32)P(第 6、13 页)
任务LM-Eval:CoQA(EM)、TruthfulQA(BLEU)、GSM8K(EM);LongBench:Qasper/QMSum/MultiNews/TREC/TriviaQA/SAMSum/LCC/RepoBench-P(最大序列 Mistral 8192、其他 4096);NIAH P(第 6 页)
效率负载仿 vLLM 用 ShareGPT 合成(均值输入 161/输出 338);batch 扫描至 OOM,报峰值显存与吞吐;硬件单卡 NVIDIA A100(80GB)、Llama-2-7B P(第 7-8 页)
基线精度:同模型 16bit KV;效率:FP16 KV + FP16 权重 P(第 6-8 页)
精度实验硬件论文未明确披露(GPU 型号/数量未载明)

10.2 主精度结果(表 3 全量转录)

LM-Eval 精度转录(均为 P,PDF 第 8 页表 3;KIVI 保留 ≤R 全精度残差,fake 量化则全量化)
模型配置CoQATruthfulQAGSM8K
Llama-2-7B16bit63.8830.7613.50
4bit(K-T, V-T)64.8229.8512.28
2bit(K-C, V-T)59.0833.105.76
2bit(K-T, V-T)39.8818.290.83
2bit(K-C, V-C)3.600.270.00
2bit(K-T, V-C)1.300.490.08
KIVI-463.7830.8013.80
KIVI-263.0533.9512.74
Llama-2-13B16bit66.3729.5322.67
4bit(K-T, V-T)66.7329.1420.92
2bit(K-C, V-T)63.5328.6012.21
2bit(K-T, V-T)52.9324.984.55
2bit(K-C, V-C)2.880.740.00
2bit(K-T, V-C)2.800.260.08
KIVI-466.3829.4923.65
KIVI-266.2329.8420.77
Falcon-7B(MQA)16bit59.8323.204.55
4bit(K-T, V-T)58.5322.943.26
2bit(K-C, V-T)43.9320.821.29
2bit(K-T, V-T)25.720.910.53
2bit(K-C, V-C)41.9517.111.52
2bit(K-T, V-C)19.530.940.15
KIVI-459.6722.584.47
KIVI-257.4824.983.41
Mistral-7B16bit67.4030.4538.36
4bit(K-T, V-T)67.8029.8336.85
2bit(K-C, V-T)61.6529.6426.46
2bit(K-T, V-T)54.5525.865.00
2bit(K-C, V-C)24.4024.862.27
2bit(K-T, V-C)10.7319.120.99
KIVI-466.9530.4937.30
KIVI-266.3532.1736.01

P 论文口径:Llama 与 Mistral 上 KIVI 2bit 仅至多约 2% 精度损失;Falcon-7B 因 MQA 单 KV 头已高度压缩,需 4bit 保持精度、2bit 可能大幅掉点(第 6 页)。

10.3 长上下文、消融与其他证据

长上下文与消融要点(均为 P;页码已核验)
证据数值/结论条件定位
LongBench 平均(表 4)Llama2-7B:16bit 44.52 / KIVI-4 44.59 / KIVI-2 44.27;Llama2-13B:44.85/44.48/44.69;Llama2-7B-Chat:45.95/45.83/45.67;Llama2-13B-Chat:45.96/46.44/45.52;Falcon-7B:8.71/8.78/7.95;Mistral-7B:46.58/46.56/45.858 任务平均;G=32、R=128第 9 页
NIAH(图 4)2bit 下检索能力保持(Llama-3-8B-Instruct 20K 词/27K token;Mistral-7B-Instruct-v0.2 20K 词/30K token,全深度×深度网格基本满命中)统计词数以消除 tokenizer 差异第 7 页、附录 B 第 13 页
组大小消融(表 5)G=32/64/128 → GSM8K 20.77/21.00/17.29(G=128 显著下降)Llama2-13B、R=128第 9 页(讨论第 7 页)
残差消融(表 5)R=32/64/96/128 → 20.62/19.86/20.55/20.77({32,96,128} 无显著差异;R=64 最差;「合理较大的残差长度重要」)Llama2-13B、G=32第 9 页(讨论第 7 页)
R32 复测(附录 C、表 6)R=32 压缩率更高、吞吐增加;Llama-2-7B KIVI-2 R32 62.85/33.01/13.57 vs R128 63.05/33.95/12.74(GSM8K 反而略高)KIVI-2,LM-Eval第 13 页
补充模型(表 8-10)Llama-3-8B-Instruct(8K/GQA)、Mistral-7B-Instruct-v0.2(32K/GQA)、LongChat-7B-v1.5-32K:KIVI-2/4 与全精度基线接近(如 Llama-3 平均 45.21 → KIVI-4 45.31)G=32、R=128第 14-15 页
各结果条件字段完整性(缺项一律显式标注)
实验硬件精度批量/负载基线定位
LM-Eval 精度(表 3)论文未明确披露KV 2bit/4bit vs 16bit;权重未披露评测集默认参数;批量未披露同模型 16bit KVP 第 8 页
LongBench(表 4)论文未明确披露同上最大序列 8192/4096同上P 第 9 页
效率(图 5)单卡 A100(80GB)KIVI-2 vs FP16ShareGPT 合成 161/338,batch 扫描至 OOMFP16 KV + FP16 权重P 第 7-8 页;逐点读数 I
消融(表 5)论文未明确披露KIVI-2GSM8K组内互比P 第 9 页
公平性限制(引用前必读):P ①全部数字仅在「论文所述模型 + 所列基准 + 所述超参(G=32、R=128)」语境成立,不可外推到其他模型/负载,不可与本站其他论文的数字直接比较;②「4× batch」是 OOM 边界的容量结论,不是任意 batch 下的加速;③图 5 逐点坐标为读图近似(I),论文只承诺 4× 与 2.35×~3.47× 两个区间结论;④Falcon 的 2bit 结果不能代表 Llama/Mistral 类模型;⑤精度实验 GPU 型号论文未披露,数字无法关联具体硬件复核。

10.4 建议复现步骤(编辑推断)

  1. I 从摘要印明仓库取代码(先人工复核归属与许可,pin commit/digest);确认 CUDA/Triton kernel 与推理框架版本配对。
  2. I 精度复测:Llama-2-7B/13B、Mistral-7B、Falcon-7B 各跑 16bit 基线与 KIVI-2/KIVI-4(G=32、R=128),对齐 LM-Eval 默认参数与 LongBench 序列上限(8192/4096)。
  3. I 效率复测:单卡 A100-80GB、Llama-2-7B,ShareGPT 合成负载(均值 161/338),batch 从小到大至 OOM,记录峰值显存与吞吐;对照图 5 形状(基线小批量峰值、KIVI 大批量胜出)。
  4. I 敏感性扫描:G∈{32,64,128}、R∈{32,64,96,128}、R=32 全量评测;重点观察 GSM8K 与检索类任务(滑窗敏感性最高)。
  5. I 目标业务实测:在真实上下文长度分布与并发区间测「开/关量化」差值(吞吐、峰值显存、硬任务抽样精度),再决定启用范围与位宽档位。

12. 给架构师的决策清单

I 以下为落地前的勾选项;标注(P)的条目对应论文证据,(R)对应仓库核验项,其余为工程判断。

13. 证据台账

下表为核心结论的证据映射;逐条引文与核验记录见构建文件 sources/kivi.evidence.json。核验日期为

核验范围声明:本页写作时完成了迄今最完整的一轮核验:sources/kivi.txt 可读并用作检索索引,PDF 全部 15 页经 pdftoppm 渲染,其中第 1、3、4、5、6、7、8、9、13 页逐项目检(含图 5 高分辨率放大读图),第 2、12、14、15 页经 pdftotext 与提取文本交叉核对。一处提取错误已在核验中纠正:第 6 页「全精度滑窗 key R/2、value R」在 kivi.txt 中方向颠倒,本页以 PDF 原页为准。
关键结论 → 证据级别 → 定位 → 核验状态
关键结论级别定位(PDF 页码)核验状态
题名/作者/机构/ICML 2024 PMLR 235/arXiv:2402.02750v2;仓库 github.com/jy-yuan/KIVI 印于摘要P/R第 1 页已核验(原页目检);仓库未在线访问
摘要级结论:免调优非对称 2bit(K 按通道/V 按 token);峰值显存(含权重)1/2.6;batch 至多 4×;吞吐 2.35×~3.47×P第 1 页摘要已核验(原页目检)
瓶颈量级:PaLM 540B 批 512/上下文 2048 → KV 3TB=3× 参数;OPT-175B → 1.2TB=3.8× 权重;每 token 全量搬运 KV、计算核空闲P第 1 页引言、第 3 页已核验(原页目检)
既有三类路线(MQA/GQA 需训练、token 驱逐、系统分页/卸载);GPTQ 因流式开销不适用;此前 KV 量化多为 4bit RTNP第 1、3 页已核验(原页目检)
表 1:2bit 下 (K-C,V-T) 63.53/28.60 最优,(K-C,V-C) 崩至 2.88/0.74(Llama-2-13B、G=32);OB1-OB3P第 3 页已核验(原页目检)
RTN 公式 Q(X)=⌊(X−z)/s⌉,z=min,s=(max−min)/(2^B−1)P第 3 页 §3.1已核验(原页目检)
图 2:key 少数固定通道幅值极大、value 无明显离群(Llama-2-13B L16/L31、Falcon-7B L16/L20)P第 4 页已核验(原页目检)
表 2:K 重建误差 4.55 vs 13.67、注意力分数误差 9.60 vs 47.00、稀疏 84.3%;V 输出误差 ∆ 3.55 vs 49.89(约 15×)P第 4 页已核验(原页目检)
图 3/算法:分组+残差拆分、R 可整除 G、式(3) 拼接注意力、value FIFO、prefill 传精确张量、R≤128 开销可忽略P第 5 页;伪代码第 12 页已核验(第 5 页原页目检;第 12 页文本交叉)
全精度滑窗预期 key R/2、value R;对 GSM8K 至关重要(fake 5.76 vs KIVI-2 12.74 vs 16bit 13.50)P第 6 页;表 3 第 8 页已核验(400dpi 放大目检;提取方向颠倒已更正)
系统支持:CUDA 融合 Q_MatMul、Triton 组量化 kernel、兼容 weight-only 量化P第 6 页已核验(原页目检)
设置:G=32 全实验、R=128;HF Transformers 实现;LM-Eval/LongBench/NIAH 任务与序列上限 8192/4096P第 6 页已核验(原页目检)
表 3 全量:4 模型 × 8 配置精度;Llama/Mistral 2bit 至多约 2% 损失;Falcon 需 4bitP第 8 页(结论第 6 页)已核验(原页目检)
图 4 NIAH:2bit 保持 27K/30K token 检索能力P第 7 页、附录 B 第 13 页已核验(原页目检)
表 4 LongBench 平均(6 模型 KIVI-2/4 vs 16bit)P第 9 页已核验(原页目检)
表 5 消融:G=128 显著下降(17.29);R 无一致规律但忌 64(19.86)、合理较大残差重要P第 9 页(讨论第 7 页)已核验(原页目检)
效率口径:ShareGPT 161/338、batch 扫描至 OOM、单卡 A100-80GB、Llama-2-7BP第 7-8 页已核验(原页目检)
图 5:相近显存下 batch 至多 4×、吞吐 2.35×~3.47×;越长越大;融合量化可再提升(未来工作)P第 8 页图 5 及正文已核验(原页目检);逐点坐标为读图近似 I
附录 C:R32 压缩率更高、吞吐增加、精度差距不大(表 6);附录 D 补充模型(表 8-10)P第 13-15 页第 13 页原页目检;第 14-15 页文本交叉
与 H2O/StreamingLLM/vLLM/S3/weight-only 正交可组合;KVQuant 为独立并发工作;未来优化量化开销P第 9 页 §5-§6已核验(原页目检)
云实例/服务/存储/监控映射示例E各云厂商公开目录与推理服务文档未逐一在线核验;使用前按当时目录复核
成本公式、图 5 逐点读数、SLO/监控/回滚/清单、控制面-数据面划分等工程内容I本报告 §4、§6-§9、§12编辑标注完成;不含伪精确数字,读图值已注明近似