GPU 大模型系统论文解读

EAGLE:投机采样需要重新思考特征不确定性

最后核验日期:2026-09-15 证据完整度:台账 40 条 = P 33 · R 1 · E 2 · I 4,全部带 PDF 页码/章节定位(详见 证据台账)。分级口径(本论文台账 schema,sources/eagle.evidence.json):P = 论文正文/附录/图表(含论文报告的实验结果);R = 论文明确给出的官方仓库;E = 论文引用的外部资源(对照方法的仓库/数据集,仅作背景,不作 EAGLE 结论);I = 编辑推断。页码口径:PDF 印刷页脚编号 1–13 与 PDF 页序逐页一致(本次核对),无推导误差;图 1/图 2 的柱-模型配对经渲染页目视核验并以表 7 双点锚定(方法见台账 C40)。全页外链仅 arXiv 摘要页与论文首页给出的官方仓库两处。

输入 PDF:06_EAGLE_2401.15077.pdf(《EAGLE: Speculative Sampling Requires Rethinking Feature Uncertainty》,arXiv:2401.15077v3 [cs.LG] 2025-03-04 戳记,ICML 2024 会议版,共 13 页)。

  • 生命周期:推理解码加速(投机采样框架,无损)
  • 部署形态:解码循环内轻量插件(自回归头 = FC + 1 层 decoder;目标模型冻结)
  • 目标硬件:NVIDIA GPU,论文口径 FP16——Vicuna 7B 单卡 RTX 3090(24G)、LLaMA2-Chat 70B 用 4×A100 40G(第 6、8 页)
  • 核心资源:解码延迟 · 草稿头训练(1–2 天/模型) · 显存余量(最大 batch −1)
  • 证据状态:P 主导 + 官方仓库(R)+ 2 条论文引用外部资源(E)+ 4 条编辑推断(I)

一句话判断

对「单流/低并发、延迟敏感、能接受为每个目标模型一次性训练一个 0.24B–0.99B 草稿头」的自回归 LLM 服务,EAGLE 给出一条无损的加速路径:草稿不在 token 空间做,而是在目标 LLM 的第二层顶层特征(倒数第二层、LM Head 之前的隐藏态)上自回归,并把提前一个时间步的 token 喂进草稿模型以吸收采样随机性,再用树注意力草稿 + 目标模型一次前向验证。论文口径:MT-bench 贪心解码较逐 token 自回归加速 2.78x–3.07x(六个稠密模型,第 1 页图 1)、HumanEval 最高 3.76x(第 6 页表 1)、LLaMA2-Chat 70B 头条区间 2.7x–3.5x 且吞吐翻倍(第 1 页摘要);与 Lookahead/Medusa 相比快 1.70x–2.08x / 1.47x–1.60x(第 5 页 §4.1)。边界同样清楚:batch 增大收益衰减(bs=4 时 LC70B 降至 2.40x、吞吐口径约 2x,第 8 页表 7)、显存略增(最大 batch 减一)、MoE 仅 1.50x(第 6 页表 3)、每个目标模型需单独训练草稿头。P I(适用判断为编辑观点)

3 分钟速读

  1. 问题:逐 token 自回归慢;投机采样虽无损,但草稿模型难选——7B 目标没有合适草稿,7B 草稿反把 13B 拖慢(图 1 标 N/A);TinyLLaMA 类小模型与 instruct 模板不一致且训练耗 3,000B token(EAGLE 只用 2–4B);Lookahead/Medusa 草稿更省但准确率低(约 0.6 以下 vs EAGLE 约 0.8)(第 1–2 页 §1、图 1 注)。P
  2. 观察一:特征级自回归比 token 级更规整——在第二层顶层特征上自回归、再用目标 LM Head 映射回 token,胜过直接预测 token:加速 1.9x vs 1.5x(Vicuna 7B、MT-bench、T=0,第 2–3 页图 4)。P
  3. 观察二:下一个特征取决于采样结果而非仅由历史特征决定(图 3:f_I 之后 p(am)=0.6、p(always)=0.4)——EAGLE 把 token 序列提前一步输入草稿模型,每个分支携带自己的采样结果,歧义消除后加速从 1.9x 升到 2.8x(第 2 页 §1 + 图 3/图 4)。P
  4. 机制:草稿模型 = 目标 Embedding(冻结)+ LM Head(冻结)+ 可训练自回归头(FC + 一层 decoder);树注意力 5 次前向长一棵草稿树(根节点 k=4);目标模型树注意力一次前向算全树概率,逐节点多轮投机采样决定接受/拒绝;输出分布与目标模型严格一致,贪心与非贪心都有理论保证(第 4–5 页 §3、第 12–13 页附录 A/算法 1)。P
  5. 结果与边界:目标模型每次前向平均产出 3.2–4.5 个 token(表 1–2 的 τ);MT-bench 贪心 2.78x–3.07x、代码任务最高 3.76x、Mixtral 8x7B 仅 1.50x;batch=4 时收益收窄至 2.40x–2.76x、吞吐口径约 2x;草稿头训练 1–2 天(70B 用 4×A100 40G),与 gpt-fast 组合达 160.4 tokens/s(RTX 3090、int4)(第 5–8 页 §4 + 表 1–7)。P I(综合)

论文声称的主要结果

表 A · 论文声称的主要结果(均为条件性数字,禁止脱离条件摘取;完整条件含硬件/模型/精度/负载/基线)
指标(口径)数字基线完整条件(硬件 / 模型 / 精度 / 负载)来源页码
MT-bench 延迟加速比(贪心 T=0,逐模型)V7B 2.90x;V13B 3.07x;V33B 2.95x;LC7B 2.78x;LC13B 3.03x;LC70B 3.01x 逐 token 自回归解码(1.00x) MT-bench 多轮对话、贪心、batch 1(§4 默认);FP16 在图 1 处未复述(§4.4 明示其评测为 FP16);推理硬件仅 V7B(RTX 3090 24G)与 LC70B(4×A100 40G)显式披露;柱-模型配对经渲染页目视核验 + 表 7 bs=1 双点(2.90x/3.01x)锚定 P 第 1 页图 1 + 第 8 页表 7
MT-bench 延迟加速比(非贪心 T=1)V7B 2.13x;V13B 2.32x;V33B 2.40x;LC7B 2.22x;LC13B 2.68x;LC70B 2.67x 逐 token 自回归解码 MT-bench、温度 1 采样、batch 1;Lookahead(仅贪心)与 Medusa(非贪心不保证无损)不在此对比;硬件/精度论文未披露 P 第 2 页图 2
代码/数学/指令任务加速比与平均接受长度 τT=0:2.78x–3.76x(τ 3.61–4.52);T=1:2.21x–2.92x(τ 3.29–3.79) 逐 token 自回归解码 HumanEval / GSM8K / Alpaca × Vicuna 7B/13B/33B、LLaMA2-Chat 7B/13B/70B;batch 1;硬件与精度论文未在表 1 处复述;代码任务最佳(固定模板易起草,§4.1) P 第 6 页表 1 + 第 5 页 §4.1
LLaMA2-Chat 70B 头条区间(摘要口径)2.7x–3.5x;吞吐翻倍 逐 token 自回归解码 四个任务与两档温度的区间聚合(逐任务值 2.65x–3.52x,与区间一致);保持生成文本分布不变 P 第 1 页摘要 + 第 3 页 §1
MoE 模型加速比1.50x(τ 3.25) 逐 token 自回归解码 Mixtral 8x7B Instruct-v0.1、MT-bench、T=0;论文归因:逐 token 解码每 token 通常只读 2 个专家权重,验证多个草稿 token 可能要读更多专家 P 第 6 页表 3 + §4.1
吞吐口径(batch>1 最优)1.97x(V7B)/ 1.99x(LC70B);论文称约 2x 各系统在自身最大 batch 下的逐 token 解码 MT-bench、T=0、FP16;V7B 单卡 RTX 3090 24G、LC70B 4×A100 40G(160G);bs 1–4 加速比 2.90x→2.76x / 3.01x→2.40x P 第 8 页 §4.4 + 表 7
与量化/编译组合的生成速度FP16 100.2;int4 160.4 tokens/s Vanilla Huggingface FP16 24.5;gpt-fast(无 EAGLE)FP16 55.1 / int4 106.9 LLaMA2-Chat 7B、单卡 RTX 3090、MT-bench、T=0(表 4) P 第 3 页 §1 + 第 6 页 §4.2 + 表 4
不可直接比较:上表全部数字来自 EAGLE 论文自身的口径——batch=1 的单流解码延迟、2024 年时点的 Vicuna/LLaMA2-Chat/Mixtral 权重、FP16 主口径、MT-bench/HumanEval/GSM8K/Alpaca 负载。与本站其他论文(FlashInfer 的在线服务 ITL、Medusa 的多解码头、KIVI 的量化吞吐等)的硬件、负载与指标口径均不一致,不允许跨论文横向排名。另按原文照录两处内部不一致、不做调和:结论节的「MT-bench 2.1x–3.8x」上界 3.8x 在 MT-bench 各图/表中不可复得(3.76x 出现在表 1 的 HumanEval),以及 vs Lookahead/Medusa 区间在 §1/§6(1.7x–2.1x、1.5x–1.6x)与 §4.1(1.70x–2.08x、1.47x–1.60x)之间有细微出入(详见台账 C37)。I(口径声明)

术语与记号

特征(feature)
目标 LLM 倒数第二层(第二层顶层)在 LM Head 之前的隐藏态 f;EAGLE 的自回归对象(第 3 页 §2)。
提前一步的 token(token 序列 shift)
草稿模型预测 f̂ⱼ₊₁ 时,token 输入取到 tⱼ₊₁(刚采样出的那个),即 Draft_Model(T₂:ᵢ₊₁, F₁:ᵢ);让每个分支显式吸收自己的采样结果(第 4 页 §3.1/§3.2)。
自回归头(Autoregression Head)
唯一可训练模块:FC 层(2×hidden→hidden)+ 一层 decoder;整个插件即「单个 transformer decoder 层」量级(第 3–4 页 §1/§3.1)。
树注意力(tree attention)
草稿树内每个候选只关注自己的祖先;目标模型借此一次前向得到全树概率(第 4–5 页 §3.1/§3.3)。
多轮投机采样
树草稿版接受算法:逐候选 r<p/p̂ 则接受,否则 p←norm(max(0,p−p̂)) 换下一候选,全拒绝才从调整后分布采样;与 SpecInfer 一致(第 12–13 页附录 A.2/算法 1)。
τ 与 n-α
τ = 目标模型每次前向被接受的 token 数;α 用链式草稿(无树)测量,n-α = 前 n 个特征预测有误时的接受率(第 5 页 §4 Metrics)。
无损(lossless)
输出分布与目标模型一致——贪心与非贪心均有理论保证;论文因此不重复评测生成质量(第 5 页 §3.3/§4)。
论文出处
《EAGLE: Speculative Sampling Requires Rethinking Feature Uncertainty》,ICML 2024(PDF 元数据);作者 Yuhui Li、Fangyun Wei、Chao Zhang、Hongyang Zhang;本地文件 06_EAGLE_2401.15077.pdf

问题背景

逐 token 解码是延迟瓶颈,投机采样是无损解法但有前提

自回归解码逐 token 生成,是 LLM 推理慢且贵的主流路径;投机采样把流程拆成「低开销草稿 + 对整段草稿的一次并行验证」,验证保证文本分布与原模型解码严格一致(接受概率 min(1, p/q),拒绝后从 norm(max(0, p−q)) 重采样;第 2–3 页 §1–§2)。P

前提一:得先有一个「像原模型又足够小」的草稿模型——这经常不成立

  • 同系列小模型只在尾部存在:LLaMA2 系列可以用 7B 草 70B,但给 7B 找草稿无解;拿 7B 草 13B 会因草稿开销过大反而慢于逐 token 解码(图 1 标 N/A)。P(第 1–2 页)
  • TinyLLaMA 类独立小模型因 instruct 模板不一致而不适用于 chat 模型;且其训练耗 3,000B token,EAGLE 的训练只要 2–4B token。P(第 2 页 §1)

前提二:低开销草稿器准确率不足

Lookahead 用 n-gram + Jacobi 迭代,Medusa 用一组 MLP 从第二层顶层特征直接预测多个未来 token——草稿变便宜了,但准确率受限:Medusa 约 0.6、Lookahead 更低,EAGLE 约 0.8(第 2 页 §1)。P

论文的两个关键观察(本页机制的出发点)

  1. 特征级自回归更「直」:token 序列只是自然语言的离散变换,特征序列(第二层顶层)更有规律;先在特征上自回归、再用目标 LM Head 映射回 token,优于直接预测 token——加速 1.9x vs 1.5x(Vicuna 7B、MT-bench、T=0)。P(第 2 页 §1 + 第 3 页图 4)
  2. 采样随机性污染特征预测:f_I 之后下一特征取决于采样出「am」(p=0.6)还是「always」(p=0.4),仅凭 f_I 无法确定——Medusa 预测带空格 token 时也面临同类歧义。EAGLE 把 token 序列提前一步输入草稿模型:预测 f_always 用 (f_I, t_always),预测 f_am 用 (f_I, t_am)——加速进一步升到 2.8x。P(第 2 页图 3 + §1)

基线格局

逐 token 自回归(vanilla);同系列小模型投机采样(草稿长度 2–10 扫描取最优);DistillSpec(与 EAGLE 同数据蒸馏 + FKL 散度);Lookahead 与 Medusa(加速比取自其原技术报告,论文未复跑);以及各类带 relaxations 的有损/阈值方法(DistillSpec lenience、BiLD 距离阈值、Medusa 截断阈值)——EAGLE 不做任何松弛(第 1、5、8–9 页)。P

本页使用的加速口径

与全站一致:本文是batch=1 的单流解码延迟口径(墙钟加速比、τ、n-α),吞吐只在 §4.4 单独测;两套口径不可混用,跨论文横比被禁止。P I(口径整理)

核心机制

EAGLE 与其他投机采样方法共享「草稿 + 验证」骨架,差异集中在草稿阶段:对齐方式(特征 + 提前一步 token)、树状草稿、以及与之配套的多轮接受算法。以下小节除标注外均为论文事实。P

1 · 输入对齐:第二层顶层特征 + 提前一步的 token(第 4 页 §3.1 + 图 5)

预测 f₃ 用特征序列 (f₁, f₂) 与提前一个时间步的 token 序列 (t₂, t₃):p₄ = LM Head(f₃) 采样出 t₄ 后,(f₂, f₃) 与 (t₃, t₄) 拼接继续预测 f₄……训练目标写成一般式即 L_reg = SmoothL1(fᵢ₊₁, Draft_Model(T₂:ᵢ₊₁, F₁:ᵢ))。对照:Medusa 用目标模型的单个特征 f₂ 独立预测 t₄、t₅,分支间无采样信息。P

2 · 草稿模型三模块:两冻一训(第 4 页 §3.1 + 图 6)

  • Embedding 层与 LM Head:直接用目标 LLM 参数,不训练(图 6 雪花标记)。P
  • 自回归头(可训练):FC 层把拼接后的 2×hidden 降回 hidden,再接一层 decoder 预测下一特征;预测特征与采样 token 重新拼接作为下一步输入。输入形状:特征 (bs, seq, hidden) + token (bs, seq)。P
  • 整个插件即论文所称「单个 transformer decoder 层」量级,目标模型零改动。P(第 3 页 §1)

3 · 树状草稿:5 次前向长一棵树(第 4 页 §3.1 + 第 12 页附录 A.1)

用树注意力把逐层扩展组织成树:深度 m 的树经 m 次前向产生多于 m 个候选(图 6 示例:3 次前向得 10-token 树)。实际结构(附录 A.1):贪心时每节点取概率 top-k 子节点、非贪心时采样 k 个;根节点 k=4;草稿固定 5 次前向(树/链相同);树形凭直觉设计——「高概率分支更深更宽」,未做精调,全部模型与实验共用同一棵;论文同时指出最优树可能随场景变化(batch 变大时更小的树可能更好)。P 图 9 各层节点数(4/8/8/3/2)为编辑对渲染页的目测计数,论文文字只给出 k=4 与 5 次前向。I

4 · 训练目标与数据(第 4–5 页 §3.2–§3.3)

  • 损失:L = L_reg + w_cls·L_cls,w_cls = 0.1(分类项数值约大一个量级);L_cls 为「真特征过 LM Head 的分布 pᵢ₊₂」与「预测特征过 LM Head 的分布 p̂ᵢ₊₂」的交叉熵——特征回归是中间目标,分类直接对齐最终 token 目标。P
  • 抗误差累积:训练时对目标特征加 U(−0.1, 0.1) 均匀噪声(NEFTune 式增广,引 Jain et al. 2023)。P
  • 数据与超参:固定 ShareGPT 数据集 68,000 对话;lr 3e-5;AdamW β=(0.9, 0.95);梯度裁剪 0.5;目标模型全程冻结。可训练参数:0.24B(7B)/ 0.37B(13B)/ 0.56B(33B)/ 0.99B(70B)/ 0.28B(Mixtral 8x7B)。P
  • 数据不敏感:改用目标模型自生成的答案训练仅 2.88x vs 固定集 2.78x(LC7B、MT-bench、T=0,表 6)——用固定数据集压成本成立。P

5 · 验证:目标模型一次前向 + 多轮投机采样(第 5 页 §3.3 + 第 12–13 页附录 A.2/算法 1)

树注意力下,目标 LLM 一次前向得到草稿树中每个 token 的概率;随后在每个节点递归执行多轮投机采样:r < p(t)/p̂(t) 则接受该 token;否则 p ← norm(max(0, p(t) − p̂(t))) 换下一候选;全部候选被拒绝才从调整后分布直接采样。该流程与 SpecInfer 一致;被接受 token连同其目标特征被记录,作为下一轮草稿的输入——因此验证不产生额外前向开销。输出分布与目标 LLM 对齐。P

6 · 无损性与对照方法的分界(第 3、5、8–9 页)

无损性对贪心与非贪心都有理论保证;论文据此明确「评测生成质量既无必要也无意义」(第 5 页 §4)。对照:Lookahead 只覆盖贪心;Medusa 非贪心不保证分布一致;DistillSpec/BiLD/Medusa 都在接受判据上做松弛(lenience/距离阈值/截断阈值),EAGLE 不做任何松弛(第 8–9 页 §5)。P

7 · 三组消融支撑设计选择(第 5–8 页 §4.1/§4.3)

  • 树注意力:τ 提高 0.62–0.75(表 5),加速比 +0.3–0.5、不增前向次数但增每前向 token 数;不用树的链式口径仍有约 2.3x–2.7x。P
  • 输入类型(Vicuna 7B、图 8):参数受限时特征略胜 token;特征+token 合并因离散无错 token 缓解特征误差累积而再有提升;「提前一步」贡献最大且不增加复杂度。P
  • 训练数据(表 6):目标模型自生成数据仅边际更优(2.88x vs 2.78x)——低数据敏感度支撑固定数据集方案。P
事实与解释的边界:以上均为论文陈述。本页对机制叙述的分组顺序(对齐→模块→树→训练→验证→无损→消融)是编辑为可读性所作的归纳(标 I),论文原文以 §3.1–§3.3 与附录 A 的展开为准;数据路径图(见下节)为本站据论文图 3/5/6/9 与 §3–§4 重新绘制,非论文原图。I

GPU / 系统数据路径

EAGLE 数据路径图,自上而下七个阶段:1 输入与已确认上下文——查询加已确认 token 序列及其 KV 缓存,上一轮验证顺带产出的第二层顶层特征随序列保留;2 对照路径——通用投机采样由同系列更小模型起草 token 链再由目标模型一次前向验证,但 7B 目标没有合适草稿模型、7B 草稿反使 13B 慢于逐 token 解码,这是 EAGLE 的动机;3 目标 LLM 一次前向——Embedding 与 Transformer 各层产出第二层顶层特征(倒数第二层、LM Head 之前),LM Head 同时采样下一个 token,与逐 token 解码完全一致;4 EAGLE 草稿模型——把第二层顶层特征与提前一个时间步的 token embedding 拼接成两倍隐藏维,经 FC 降维后进入一层可训练 decoder(自回归头)预测下一特征,再经冻结的 LM Head 得到分布,每个节点扩展 k 个子节点(根 k=4,贪心取 top-k 或非贪心采样 k),每个分支把自己的采样结果直接作为输入,消除采样不确定性;5 树注意力草稿树——5 次前向长成一棵树,高概率分支更深更宽,图 6 示例 3 次前向得 10 token,不用树时退化为链式仍有约 2.3 至 2.7 倍加速;6 目标模型验证——树注意力掩码下一次前向得到整棵树每个 token 的目标概率,逐节点多轮投机采样:随机数小于 p 除以 p-hat 则接受,否则按 p 等于 norm(max(0,p 减 p-hat)) 调整分布换下一候选,全部拒绝才从调整后分布采样,输出分布与目标模型严格一致;7 接受的 token 连同其目标特征并回上下文,进入下一轮循环。右侧四个面板:训练形态(SmoothL1 回归加 0.1 倍交叉熵分类、对目标特征加 U(-0.1,0.1) 噪声、ShareGPT 68000 对话、可训练参数 0.24B 至 0.99B、1 至 2 天)、评测硬件口径(batch=1 延迟为主、FP16、RTX 3090 与 4 倍 A100 40G、EAGLE+gpt-fast 160.4 tokens/s)、边界风险(batch 增大加速比衰减、显存略增使最大 batch 减一、MoE 仅 1.50x、树增益不等效转化为加速比)、指标口径(墙钟加速比、τ、n-α、无损定义)。实线为数据流,虚线为控制流与训练配置;紫色为特征与上下文存储,绿色为可训练模块,雪花标记冻结的目标模型参数,琥珀色为风险与边界。
图 1 · EAGLE 端到端草稿-验证数据路径(本站据论文第 2–5 页图 3/5/6、第 4 页 §3.1–§3.2、第 5 页 §3.3、第 12–13 页附录 A/算法 1、第 6–8 页表 4–7 绘制;编号 ①–⑦ 对应下方文字序列;对照路径与训练/风险面板依据见 实验与指标证据台账)。SVG 文件:assets/diagrams/eagle-data-path.svg(含 title/desc 无障碍描述;树拓扑为编辑示意,论文文字口径为根节点 k=4 与 5 次草稿前向)。

端到端文字序列

  1. ① 上下文:查询与已确认 token 序列 T₁..ⱼ 及其 KV 缓存就绪;序列各位置的第二层顶层特征 F₁..ⱼ 随验证前向保留(第 5 页 §3.3「记录被接受 token 及其特征」)。P
  2. ② 对照路径(理解用):通用投机采样由同系列小模型起草 token 链;7B 目标无草稿可用、7B 草稿拖慢 13B——EAGLE 针对的正是这一前提缺口(第 1–2 页 §1 + 图 1 注)。P
  3. ③ 目标前向(本轮锚点):目标 LLM 一次前向产出第二层顶层特征 fⱼ 并经(冻结的)LM Head 采样 tⱼ₊₁——与逐 token 解码完全一致;下一轮起该前向由验证阶段兼任(第 3 页 §2、第 5 页 §3.3)。P
  4. ④ 草稿一层:自回归头取 (fⱼ, tⱼ₊₁):token 过(冻结的)Embedding 后与特征拼成 2×hidden,FC 降维 → 一层 decoder → f̂ⱼ₊₁ →(冻结的)LM Head → 分布,扩展 k 个子节点(根 k=4);每分支携带自己的采样 token,歧义消除(第 4 页 §3.1、第 12 页附录 A.1、第 2 页图 3)。P
  5. ⑤ 树生长:共 5 次草稿前向得到一棵树注意力草稿树;候选路径各自携带 token 序列;高概率分支更深更宽(第 4 页 §3.1 + 图 6、第 12 页附录 A.1)。P
  6. ⑥ 验证(无损):目标模型树注意力一次前向得全树概率;逐节点多轮投机采样接受/调整-重采样;输出分布与目标模型一致(第 5 页 §3.3、第 12–13 页附录 A.2/算法 1)。P
  7. ⑦ 并回与循环:被接受 token 及其目标特征并回上下文(KV 与特征序列同步追加),进入下一轮草稿-验证;退出循环即输出最终文本(第 5 页 §3.3)。该端到端闭环为本页编辑装配(各环节均为论文事实)。P I(装配)
表 B1 · 数据路径组件与职责
组件职责证据
目标 LLM(Embedding + Transformer 各层 + LM Head)计算面产出第二层顶层特征与全树验证概率;参数全程冻结,LM Head/Embedding 被草稿模型复用P 第 4 页 §3.1 + 图 6
自回归头(FC + 1 层 decoder)计算面(唯一可训练)特征+提前一步 token → 下一特征预测;0.24B–0.99B 参数/模型P 第 3–5 页 §1/§3.1/§3.3
树草稿生成器(树注意力 + 5 次前向)控制/计算交界逐层扩展草稿树,根 k=4,贪心 top-k 或非贪心采样 k;结构全部实验固定P 第 4 页 + 第 12 页附录 A.1
树注意力验证前向计算面目标模型一次前向产出整树概率;同时顺带产出被接受 token 的目标特征供下一轮P 第 5 页 §3.3
多轮投机采样器控制面逐节点递归接受/调整分布/兜底采样;与 SpecInfer 一致;保证分布不变P 第 12–13 页附录 A.2 + 算法 1
上下文/KV 与特征序列存储面已确认 token 的 KV 与第二层顶层特征同步追加;被接受内容回填供下一轮草稿P 第 5 页 §3.3 I(存储组织细节为编辑推演)

架构权衡

无损保证 ↔ 草稿自由度

EAGLE 不做任何接受松弛,换取输出分布与目标模型严格一致(贪心+非贪心);代价是草稿必须走「可被目标分布校正」的路线,不能像 Medusa 典型接受那样用阈值换速度。对内容合规敏感的线上服务,无损是硬需求时的正确取舍(第 5、8–9 页 §3.3/§4/§5)。P I(取舍解读)

单流延迟收益 ↔ batch 扩展

batch=1 时 MT-bench 贪心 2.78x–3.07x;bs=4 时 LC70B 降至 2.40x、V7B 2.76x——GPU 算力余量随 batch 下降;吞吐口径收益约 2x(1.97x/1.99x)。验证一次前向要处理更多 token,在高并发场景吸引力显著下降(第 8 页 §4.4 + 表 7)。P

显存开销 ↔ 并发容量

草稿树与自回归头需要「略多」显存:V7B 在 24G 内最大 batch 8→7,LC70B 在 160G 内 5→4(FP16)。对按并发容量计费的部署,这是直接的容量折损,容量规划必须计入(第 8 页 §4.4)。P I(容量含义)

特征正则性 ↔ 误差累积

特征级自回归更规整但误差会沿步累积——论文用三重手段对冲:训练时特征加 U(−0.1,0.1) 噪声、token 与特征合并输入(离散无错 token 缓解累积)、以及 τ 证据上 1-α 到 4-α 仅缓慢衰减显示的鲁棒性(第 5 页 §3.2、第 6 页 §4.1、第 7–8 页 §4.3.2)。P

树收益 ↔ 计算预算

树注意力把 τ 提高 0.6–0.8,但每前向处理的 token 变多,加速比只 +0.3–0.5;batch 大、算力紧张时(如 bs=7)关树反而更有利。树是「用算力换接受长度」的旋钮,不是免费午餐(第 7–8 页 §4.3.1/§4.4 + 表 5)。P

每模型草稿头 ↔ 模型演进节奏

草稿头按目标模型一对一训练(0.24B–0.99B、1–2 天、ShareGPT 68k 对话,一次训练按查询摊销);但目标模型每次升级/换底座都要重训并重评测。模型频繁迭代的团队要把「草稿头再训练流水线」当作常设能力(第 3、5 页 §1/§3.3)。P I(运维含义)

稠密模型大胜 ↔ MoE 受限

稠密 LLaMA/Vicuna 系全面 2.1x+,Mixtral 8x7B 仅 1.50x:逐 token 解码每 token 只读 2 个专家权重,而验证多个草稿 token 可能要读更多专家——MoE 服务的加速预期必须单列(第 6 页表 3 + §4.1)。P

温度敏感性 ↔ 负载类型

T=0 快于 T=1(LC13B:3.01x–3.76x vs 2.66x–2.89x);代码任务因固定模板最易起草、收益最高。对高温度采样为主的负载,收益预期要按 T=1 口径折减(第 5–6 页 §4.1 + 表 1)。P

云上部署映射

本节为部署映射:论文硬件事实标 P,云产品对应标 E(厂商中立示例、非推荐,参数与价格以云厂商文档为准,本站未联网核验),运维建议/推断标 I。边界声明:EAGLE 论文只测 standalone 解码循环(batch=1 为主),未测任何服务框架集成(无 vLLM/SGLang/TGI 数据)——服务化集成的所有表述均为编辑推断。EAGLE 是解码算法层插件,论文不涉及跨节点网络与存储架构。

表 C · 论文配置 → 云上对应(厂商中立示例,非推荐)
维度论文配置(P)云上映射(E/I,示例非推荐)说明
GPU 实例与代际 显式口径:Vicuna 7B 单卡 RTX 3090(24G)、LC7B gpt-fast 用单卡 RTX 3090、LC70B 用 4×A100 40G;FP16(第 6、8 页)P 7B 级草稿头可随单卡消费级/入门实例;70B 目标需多卡实例族;实例选择以目标模型显存 + 草稿树余量为准 E I 论文其余模型(V13B/V33B/LC13B)推理硬件未披露,不能按表 1 数字直接倒推实例规格 I
草稿头资产与版本 每个目标模型一个自回归头(0.24B–0.99B),ShareGPT 68k 对话、1–2 天训练(第 3、5 页)P 草稿头作为独立模型制品纳入模型仓库/镜像版本管理;与目标模型版本严格配对 E I 论文未提供 commit/tag;官方仓库获制品后建议自行锁定版本(见 论文/链接R I
解码循环集成 论文在 standalone 解码循环评测;自述「插件仅一个 transformer decoder 层,易于生产部署」(第 3 页 §1)P(插件轻量)I(服务化集成未测) 宿主推理框架需支持投机采样接口(草稿/验证两阶段与树注意力掩码);集成改造量在框架侧 I 论文无任何 vLLM/SGLang/TGI 集成数据;服务化收益须以本节 batch/温度条件自行 PoC I(缺口声明)
显存预算 最大 batch:V7B 24G 内 8→7、LC70B 160G 内 5→4(FP16)(第 8 页 §4.4)P 容量规划按「目标模型 + KV + 草稿树峰值」预留;以最大 batch 折损(约 −1)核算并发容量 E I 论文未给显存分解式;「略多」的具体 MB 数未披露 I(缺口)
训练任务编排 70B 头:4×A100 40G、1–2 天;≤33B 头:RTX 3090 节点、1–2 天;一次训练按查询摊销(第 3、5 页)P 作为可重跑的训练作业编排(固定 ShareGPT 数据集 + 超参),产出入模型仓库并触发评测门禁 E I 数据消融显示对训练数据不敏感(2.88x vs 2.78x,表 6)——固定数据集即成本上限可控 P I
可观测 论文度量:墙钟加速比、τ、n-α(第 5 页 §4)P(口径) 云上指标面:接受长度 τ 的在线分布、加速比、草稿头版本、温度/任务分层的收益曲线 I 论文未披露运维指标体系(缺口);τ 骤降可作为分布漂移信号(编辑建议)I
弹性与扩缩容 论文未涉及 I(缺口) 草稿头是无状态权重制品,实例扩缩容边界与宿主推理服务一致;无独立有状态组件 I 论文未涉及编排/弹性议题 I

成本 / 性能 / SLO

论文的性能口径与结果条件

表 D · 论文各实验口径(batch=1 延迟为主口径,第 5 页 §4)
实验关键条件系统配置结果来源
主评测(§4.1 + 表 1–2) batch 1;T=0 与 T=1 两档;MT-bench/HumanEval/GSM8K/Alpaca;六稠密模型 + Mixtral EAGLE vs 逐 token 解码(vs Lookahead/Medusa 数字取自其报告) T=0:2.78x–3.76x;T=1:2.13x–2.92x;Mixtral 1.50x;τ 3.2–4.5 P 第 5–6 页
树消融(§4.3.1 + 表 5) MT-bench、T=0;草稿固定 5 次前向(树/链同) EAGLE 树 vs EAGLE 链式 τ +0.62–0.75;加速 +0.3–0.5;链式仍有 ~2.3x–2.7x P 第 7 页
batch/吞吐(§4.4 + 表 7) MT-bench、T=0、FP16;V7B 单卡 3090(24G)、LC70B 4×A100 40G;bs 1–4 EAGLE vs 逐 token(各自最大 batch 取吞吐) 加速 2.90x→2.76x / 3.01x→2.40x;吞吐 1.97x / 1.99x P 第 8 页
组合加速(§4.2 + 表 4) MT-bench、T=0、LC7B、单卡 RTX 3090 EAGLE+gpt-fast vs gpt-fast vs vanilla HF FP16 100.2 / int4 160.4 tokens/s P 第 6 页

容量规划变量(SLO 达成率的自变量)

  • batch/并发:加速比随 batch 单调走低(表 7);SLO 承诺必须绑定 batch 口径。P
  • 采样温度:T=1 收益系统性低于 T=0(LC13B 2.66x–2.89x vs 3.01x–3.76x)。P
  • 任务/负载类型:代码类(固定模板)最高 3.76x;对话类 MT-bench 2.78x–3.07x(T=0)。P
  • 树规模:全部实验用同一棵树(根 k=4、5 次前向);论文明确未精调、大 batch 下应缩小——这是留给部署方的调优空间。P(存在性与默认值) I(调优空间)
  • 显存余量:最大 batch 折损 8→7 / 5→4(FP16),决定并发容量上限。P
  • 模型架构:MoE 目标按 1.5x 级别单列预期(表 3)。P

成本模型(参数化,非论文结论)

论文不含成本数据(只有加速比/τ/α 与 tokens/s)。架构师可用下式估算(I,价格项为参数):

一次性成本 ≈ p_gpu × N_GPU × T_train(1–2 天)…(公式 1);摊销后单查询增量 ≈ 公式 1 ÷ Q lifetime;每百万 token 收益 ≈ (1 − 1/S) × 原 token 成本,S 为同条件实测加速比 …(公式 2)

  • p_gpu × N_GPU:训练实例时租价(A100 40G ×4 对应 70B 头;≤33B 头可用 RTX 3090 级节点,第 3 页,P 条件、E 价格);
  • S:必须用与线上一致的 batch/温度/任务实测,不得直接引用摘要区间(2.7x–3.5x 为 LC70B 跨任务聚合,第 1 页,P);
  • 敏感项:batch↑ → S↓(表 7);温度↑ → S↓(表 1);MoE → S≈1.5x(表 3);组合量化/编译可再叠加(gpt-fast 160.4 tokens/s,表 4);树开关影响 τ 与算力余量(§4.3.1/§4.4)。

SLO 提示:无损性意味着切换 EAGLE 不改变输出分布——延迟 SLO 可以独立于质量评测推进(论文原话:质量评测「既无必要也无意义」,第 5 页);但加速比的 SLO 承诺必须按 batch×温度×任务三条件收敛后给出。P(无损) I(SLO 方法)

安全与可运维性

论文披露范围

  • 论文未涉及多租户隔离、数据驻留、权限与故障恢复议题——以下部署要点除标注论文事实外均为编辑推断。I
  • 官方仓库:论文首页印有 github.com/SafeAILab/EAGLER;2026-09-15 核验可达 HTTP 200;论文未提供 commit/tag,使用时应自行锁定版本)。
  • 训练数据:固定 ShareGPT 数据集(68k 对话)——第三方对话数据的许可与合规由使用方自行核对,论文未讨论(P 数据事实;I 合规提醒)。

部署方必须自行覆盖的项

表 E · 安全/运维清单(论文事实 + 缺口 + 编辑建议)
维度论文状态部署建议(I)
租户隔离 / 缓存残留EAGLE 不拥有 KV/上下文的归属语义;被接受 token 与特征回填宿主上下文(第 5 页 §3.3)P(机制)上下文与 KV 的清零/分域策略由宿主框架决定;草稿头为无状态权重,不引入额外租户状态;把「特征序列随上下文回填」纳入数据残留评审
输出合规(无损性)输出分布与目标模型严格一致,贪心与非贪心均有理论保证;不做接受松弛(第 3、5、8–9 页)P相对有损加速方法,合规面更小:加速层不改变内容分布;但草稿头的训练数据(ShareGPT)仍需常规合规审查
供应链官方仓库由论文首页给出;论文未给 commit/tagR仅从官方仓库构建并锁定 commit/digest;草稿头制品(权重+超参+数据版本)与目标模型版本配对入册;任何第三方「优化版 EAGLE」视为未核验供应链
RBAC / 权限论文未涉及 I(缺口)草稿头训练作业(写模型仓库)与推理服务(只读制品)分角色授权;训练数据集访问单独控权
监控告警论文度量停留实验层(加速比/τ/n-α)(第 5 页 §4)P(口径) I(缺口)建议指标:在线 τ 分布、实测加速比、按温度/任务分层收益、草稿头版本配对一致性、显存水位(最大 batch 触顶)
故障恢复 / 回退关闭 EAGLE 即回到逐 token 解码;因无损性,回退不改变输出分布(第 3、5 页)P(无损)回退路径天然安全(输出等价,仅变慢);草稿头加载失败、树注意力实现异常均应自动降级为逐 token 解码并告警
升级 / 回滚目标模型升级后草稿头需重训(每模型一头,第 3 页 §1)P(机制) I(流程含义)目标模型与草稿头版本配对发布、配对回滚;升级后先跑 τ/加速比回归基线再放量;树参数(k、深度)变更视为配置变更走评审
运维契约提醒:EAGLE 的加速是「概率性收益、确定性正确」:加速比随 batch/温度/任务波动(表 1/7),而输出分布恒等(第 5 页 §3.3)。容量与 SLO 应按波动维度分别设防——延迟 SLO 绑定 batch/温度条件,正确性无需重复评测但需保留回归抽查以防实现偏差。P(论文口径) I(运维含义)

适用 / 不适用场景

适用(触发条件 → 理由)

  1. 单流/低并发、延迟敏感的交互式服务:触发条件——chat/agent 类 bs≈1 场景,端到端延迟由解码主导。理由——MT-bench 贪心 2.78x–3.07x、非贪心 2.13x–2.68x(六模型,第 1–2 页图 1/图 2);batch=1 正是论文主口径(第 5 页 §4)。P
  2. 代码生成/固定模板占比高的负载:触发条件——HumanEval 类任务或高模板密度输出。理由——HumanEval 全表最高 3.76x(LC13B,T=0,表 1),论文归因于固定模板易起草(第 5 页 §4.1)。P
  3. 不允许输出分布漂移的产品:触发条件——内容合规/回归测试要求与基模型逐位同分布。理由——无损性对贪心与非贪心均有理论保证,且不做接受松弛(第 3、5、8–9 页)。P
  4. 想叠加量化/编译的推理栈:触发条件——已用或计划用 gpt-fast 类量化编译方案。理由——组合后 LC7B 在单卡 3090 达 160.4 tokens/s(int4,表 4),论文明确宣称可与其他加速正交组合(第 3 页 §1)。P
  5. 能承担一次性草稿头训练的团队:触发条件——目标模型相对固定、查询量足以摊销。理由——训练 1–2 天(70B:4×A100 40G;≤33B:RTX 3090 节点)、0.24B–0.99B 参数、固定 ShareGPT 数据即可(第 3、5 页;数据不敏感消融表 6)。P

不适用(触发条件 → 理由)

  1. 高并发吞吐型服务:触发条件——大 batch 持续运行(bs≥4 且算力饱和)。理由——加速比随 batch 走低(LC70B bs=4 2.40x),吞吐口径仅约 2x,且最大 batch 减一(第 8 页 §4.4 + 表 7)。P
  2. MoE 目标模型为主的部署:触发条件——Mixtral 类稀疏激活模型。理由——1.50x(τ 3.25),论文归因于验证需读更多专家权重(第 6 页表 3 + §4.1)。P
  3. 目标模型高频迭代且无训练流水线:触发条件——底座频繁升级/切换。理由——草稿头按目标模型一对一训练(1–2 天),模型换则头换(第 3 页 §1)。P I(运维判断)
  4. 显存余量极端紧张的单卡场景:触发条件——24G 内已接近最大 batch 运行。理由——EAGLE 显存略增使最大 batch 8→7(V7B/24G 口径,第 8 页 §4.4)。P
  5. 需要即刻获得收益、无法改动解码循环的服务:触发条件——宿主框架不支持投机采样接口或不允许改解码循环。理由——论文只验证 standalone 解码循环,服务框架集成未被评测;集成改造在框架侧(I),无集成面时收益无从兑现(第 5 页 §4 口径 + 缺口声明)。P I(适用判断)

实验与指标

复现实验的完整条件(论文口径)

表 F · 实验条件口径(硬件 / 模型 / 精度 / 负载 / 基线)
条件维度论文口径来源
被测对象EAGLE(草稿头按目标模型一对一训练);目标模型全程冻结P 第 5 页 §3.3
模型Vicuna 7B/13B/33B;LLaMA2-Chat 7B/13B/70B;Mixtral 8x7B Instruct-v0.1P 第 5 页 §4 + 第 6 页表 3
任务/数据集MT-bench(多轮对话)、HumanEval(代码)、GSM8K(数学)、Alpaca(指令跟随);zero-shot/few-shot 社区惯例;评测集零额外训练P 第 3、5 页
硬件显式披露:Vicuna 7B 单卡 RTX 3090(24G)、LC7B gpt-fast 单卡 RTX 3090、LC70B 4×A100 40G(160G);其余型号与各表推理硬件论文未披露P 第 6、8 页;I(缺口标注)
精度§4.4 明示其评测全部 FP16;表 4 另有 int4;其余各表未复述精度处记「论文未明确披露」P 第 6、8 页;I(披露缺口标注)
负载batch 1 为主(与 Speculative sampling/DistillSpec/BiLD 一致);batch>1 仅 §4.4;T=0 与 T=1 两档P 第 5、8 页
基线逐 token 自回归;同系列小模型投机采样(草稿长 2–10 取最优;13B 无收益、33B 1.12x、70B 1.88x);DistillSpec(同数据 + FKL);Lookahead/Medusa 数字取自其原技术报告(未复跑)P 第 1 页图 1 注 + 第 5 页 §4.1
草稿配置树注意力草稿树:根 k=4、草稿 5 次前向;全部实验同一结构;τ/α 另按链式(无树)口径测量P 第 5、12 页

关键结果(均带条件)

表 G · 评测关键数字 → 完整条件 → 定位(「论文未明确披露」为允许字段值,不留空)
结论(指标)数字完整条件(硬件 / 模型 / 精度 / 负载 / 基线)来源页码
MT-bench 逐模型加速(贪心 / 非贪心)T=0:2.78x–3.07x;T=1:2.13x–2.68x 六个稠密模型逐列见表 A;MT-bench、batch 1;硬件仅 V7B/LC7B(RTX 3090)与 LC70B(4×A100 40G)显式,其余论文未披露;精度除 §4.4(FP16)外未复述;基线逐 token 解码。图 1/图 2 柱-模型配对经渲染页目视核验 + 表 7 双点锚定(台账 C30/C31/C40) P 第 1–2 页图 1/2 + 第 8 页表 7
三任务加速 + τ(表 1 全表)T=0:2.78x–3.76x(τ 3.61–4.52);T=1:2.21x–2.92x(τ 3.29–3.79) HumanEval/GSM8K/Alpaca × 六稠密模型;batch 1;硬件/精度论文未在表 1 复述;基线逐 token 解码;代码任务最佳(§4.1) P 第 6 页表 1 + 第 5 页 §4.1
MT-bench τ 与逐级接受率(表 2 全表)T=0 τ 3.62–3.98(0-α 0.74–0.79);T=1 τ 3.17–3.46(0-α 0.71–0.73) 六稠密模型;τ 为目标前向平均接受 token 数;α 用链式草稿(无树)测量,n-α 为前 n 个特征有误时的接受率;1-α→4-α 缓慢衰减显示误差鲁棒性 P 第 6 页表 2 + §4.1
Mixtral 8x7B(MoE)1.50x;τ 3.25 Mixtral 8x7B Instruct-v0.1、MT-bench、T=0;硬件/精度论文未披露;归因:验证多 token 或需读 >2 个专家权重 P 第 6 页表 3 + §4.1
树 vs 链(τ,表 5 全表)链 3.00–3.23 → 树 3.62–3.98(+0.62–0.75);链式加速仍 ~2.3x–2.7x MT-bench、T=0、六稠密模型;草稿均 5 次前向;硬件/精度论文未披露;树增益折算加速 +0.3–0.5(每前向 token 增多) P 第 7 页 §4.3.1 + 表 5
输入类型消融(图 8 + 图 4 锚点)token ~1.5x / feature ~1.9x / feature&shifted-token ~2.8x Vicuna 7B、MT-bench、T=0(图 4)与 T=0/T=1 曲线(图 8);草稿结构除 FC 降维外完全一致;硬件/精度论文未披露 P 第 2–3 页 + 第 7–8 页
训练数据消融(表 6)固定集 2.78x/τ3.62 vs 目标生成 2.88x/τ3.75 LLaMA2-Chat 7B、MT-bench、T=0;两Recipe仅答案来源不同;硬件/精度论文未披露 P 第 7 页 §4.3.3 + 表 6
batch/吞吐(表 7 全表)V7B:2.90x/2.87x/2.65x/2.76x(吞吐 1.97x);LC70B:3.01x/2.81x/2.50x/2.40x(吞吐 1.99x) MT-bench、T=0、FP16;V7B 单卡 RTX 3090 24G(最大 bs 8→7)、LC70B 4×A100 40G/160G(最大 bs 5→4);基线逐 token(各系统按自身最大 bs 取吞吐) P 第 8 页 §4.4 + 表 7
EAGLE + gpt-fast(表 4)FP16 100.2;int4 160.4 tokens/s(vanilla HF 24.5;gpt-fast 55.1/106.9) LLaMA2-Chat 7B、单卡 RTX 3090、MT-bench、T=0;精度 FP16 与 int4 明示 P 第 6 页 §4.2 + 表 4
附录表 8(α 细化,T=0)0-α 0.70–0.85;4-α 0.60–0.75(速度/τ 与表 1 一致) 三数据集 × 六稠密模型;Hardware/精度论文未披露;链式口径逐级 α P 第 13 页表 8

公平性限制与已知差异

  • 对照数字来源不一:Lookahead/Medusa 的加速比取自其原技术报告而未复跑(图 1 注);DistillSpec 经同数据+FKL 重训后仅边际提升——跨方法数字并非同一环境实测。P(第 1、5 页) I(口径提示)
  • 结论区间与图表的出入(原文照录,不调和):结论称「MT-bench 上 2.1x–3.8x」,但 MT-bench 可复得逐模型最大值为 3.07x(贪心)/2.68x(非贪心),3.76x 出现在表 1 HumanEval;vs Lookahead/Medusa 区间在 §1/§6 与 §4.1 间有细微出入。P(引文) I(编辑标注)
  • 披露缺口:表 1/2/3/5/6/8 与图 4/8 未逐表复述硬件与精度(仅 §4.2/§4.4 明示);本页一律记「论文未明确披露」,不臆测。I
  • 服务化缺口:论文未测任何服务框架集成;跨论文(如与 FlashInfer/Medusa/KIVI 的服务化数字)比较被禁止。I
  • 图柱配对方法:图 1/图 2 的柱-模型配对依赖渲染页目视核验与表 7 双点锚定,纯文本提取不足为凭(台账 C40)。I

建议复现路径

论文给出官方仓库与完整超参;以下步骤顺序为编辑建议(I),配置项均出自论文(P):

  1. 获取官方仓库 github.com/SafeAILab/EAGLE(论文首页给出;建议锁定明确 commit/tag 后再复现);
  2. 对齐训练口径:目标模型冻结;ShareGPT 68,000 对话、lr 3e-5、AdamW(0.9, 0.95)、裁剪 0.5、特征噪声 U(−0.1, 0.1)、w_cls=0.1(第 4–5 页);
  3. 构建草稿树:根 k=4、贪心 top-k(或非贪心采样 k)、草稿 5 次前向;全部对比保持同一结构(第 12 页附录 A.1);
  4. 评测矩阵:六稠密模型(+Mixtral)× 四数据集 × T∈{0,1} × batch 1;记录墙钟加速比、τ、链式口径 n-α(第 5–6 页);
  5. 扩展复刻:树/链消融(表 5)、输入类型消融(图 8)、训练数据消融(表 6)、batch/吞吐(表 7,FP16、指定显存约束)、gpt-fast 组合(表 4);输出与论文数值的偏差先核草稿头训练随机性与树结构一致再论结论。

给架构师的决策清单

需求与兼容
PoC 与容量
SLO 与成本
安全与运维
退出策略

证据台账

分级(本论文台账 schema:sources/eagle.evidence.json):P = 论文正文/附录/图表(锚定 PDF 页码/章节);R = 论文首页给出的官方仓库(可达性本次核验,commit/tag 论文未提供);E = 论文引用的外部资源(对照方法仓库/数据集,仅作背景);I = 编辑推断。页码口径:PDF 印刷页脚编号 1–13 与 PDF 页序逐页一致。图 1/图 2 柱-模型配对经渲染页目视核验并以表 7 双点锚定。最后核验日期:2026-09-15。

表 I · 关键结论 → 级别 → 定位(PDF 页码 + 章节/图号)→ 核验状态(40 条 = P 33 · R 1 · E 2 · I 4)
编号关键结论(摘要)级别定位(PDF 页码/章节)核验状态
C1论文身份:题名/作者/机构/仓库 URL/arXiv v3 戳记/ICML 2024 元数据P第 1 页 + PDF 元数据已核验(提取 + 渲染页)
C2摘要:两观察 + 提前一步 token + LC70B 2.7x–3.5x/吞吐翻倍 + 覆盖模型与任务P第 1 页摘要 + 第 3 页 §1已核验(页码一致)
C3特征级自回归更规整:1.9x vs 1.5x(V7B、MT-bench、T=0,图 4)P第 2 页 §1 + 第 3 页图 4已核验(页码一致)
C4采样不确定性(图 3:p_am=0.6/p_always=0.4)与提前一步对策;1.9x→2.8xP第 2 页图 3 + §1已核验(页码一致)
C5草稿两难:7B 无草稿/7B 草 13B 更慢(N/A);TinyLLaMA 3,000B vs EAGLE 2–4B tokenP第 2 页 §1 + 第 1 页图 1 注已核验(页码一致)
C6草稿准确率:Medusa ~0.6、Lookahead 更低、EAGLE ~0.8P第 2 页 §1已核验(页码一致)
C7优点:通用性/无损保证(贪心+非贪心)/单层插件易部署;权重仅训于 ShareGPTP第 3 页 §1已核验(页码一致)
C8训练成本:70B 头 <1B 参数、≤70k 对话、1–2 天 @4×A100 40G;≤33B 用 RTX 3090 节点P第 3 页 §1已核验(页码一致)
C9gpt-fast 组合:LC7B 160.4 tokens/s @单卡 3090(表 4 细分)P第 3 页 §1 + 第 6 页表 4已核验(页码一致)
C10vs Lookahead/Medusa 区间:三处表述(1.7x–2.1x/1.5x–1.6x 与 1.70x–2.08x/1.47x–1.60x)P第 3、5、9 页已核验;差异照录不调和
C11记号与投机采样机制(接受 min(1,p/q)、拒绝 norm(max(0,p−q)))P第 3 页 §2已核验(页码一致)
C12草稿:f3 ← (f1,f2)+(t2,t3) 提前一步;树深度 m、m 次前向;图 6 例 10 token/3 前向P第 4 页 §3.1 + 图 5/图 6已核验(提取 + 渲染页)
C13草稿模型三模块:Embedding/LM Head 冻结 + 自回归头(FC + 1 层 decoder);形状与拼接P第 4 页 §3.1 + 图 6已核验(页码一致)
C14树结构:根 k=4、贪心 top-k/非贪心采样 k、5 次前向;直觉设计、全部实验同一棵P第 12 页附录 A.1 + 图 9已核验(渲染页目视)
C15损失:SmoothL1 + w_cls·CE,w_cls=0.1(分类项约大一个量级)P第 4–5 页 §3.2已核验(页码一致)
C16特征噪声增广 U(−0.1, 0.1)(引 NEFTune/Jain et al. 2023)P第 5 页 §3.2已核验(页码一致)
C17训练配置:ShareGPT 68k 对话、lr 3e-5、AdamW(0.9,0.95)、裁剪 0.5;可训参数 0.24/0.37/0.56/0.99B、Mixtral 0.28BP第 5 页 §3.3已核验(页码一致)
C18验证:树注意力一次前向 + 多轮投机采样(算法 1)+ 记录接受 token/特征;质量评测「既无必要也无意义」P第 5 页 §3.3/§4 + 第 12–13 页已核验(页码一致)
C19指标定义:墙钟加速比 / τ / 链式口径 α 与 n-αP第 5 页 §4已核验(页码一致)
C20评测设置:模型×任务清单、batch 1 为主、zero/few-shot、评测集零训练P第 5 页 §4 + 第 3 页已核验(页码一致)
C21基线配置:草稿长 2–10 扫描;13B 无收益/33B 1.12x/70B 1.88x;DistillSpec 同数据 FKL;Lookahead/Medusa 数字取自其报告P第 5 页 §4.1 + 第 1 页图 1 注已核验(页码一致)
C22表 1 全表:三任务 × 六模型 × 两温度 加速比 + τ;LC13B 区间 3.01x–3.76x / 2.66x–2.89x;代码最佳P第 6 页表 1 + 第 5 页 §4.1已核验(逐格核对)
C23表 2 全表:MT-bench τ 与 0-α..4-α;τ 合计 3.2–4.5;0-α≫1-α、1-α..4-α 缓变P第 6 页表 2 + §4.1已核验(逐格核对)
C24Mixtral 1.50x/τ3.25 + MoE 专家读取归因P第 6 页表 3 + §4.1已核验(页码一致)
C25表 4:EAGLE+gpt-fast FP16 100.2 / int4 160.4 tokens/s(LC7B、3090、T=0)P第 6 页 §4.2 + 表 4已核验(页码一致)
C26树消融:τ +0.62–0.75(表 5 全表);聚合 +0.6–0.8 τ / +0.3–0.5 加速;链式仍 2.3x–2.7xP第 7 页 §4.3.1 + 表 5已核验(页码一致)
C27输入消融三观察(图 8):特征>token、合并抗误差、提前一步贡献最大P第 7 页 §4.3.2 + 第 8 页图 8已核验(页码一致)
C28数据消融(表 6):固定集 2.78x/3.62 vs 目标生成 2.88x/3.75P第 7 页 §4.3.3 + 表 6已核验(页码一致)
C29batch/吞吐(表 7)+ 最大 bs 8→7、5→4 + FP16 + bs=7 关树更优 + 2x 吞吐P第 8 页 §4.4 + 表 7已核验(页码一致)
C30图 1 贪心逐模型柱值(2.90x/3.07x/2.95x/2.78x/3.03x/3.01x)+ 其余方法柱值P第 1 页图 1 + 第 8 页表 7 锚定已核验(渲染页目视 + 双点锚定)
C31图 2 非贪心逐模型柱值(2.13x/2.32x/2.40x/2.22x/2.68x/2.67x);Lookahead/Medusa 不参比P第 2 页图 2已核验(渲染页目视)
C32定位:不做接受松弛(对照 DistillSpec/BiLD/Medusa);草稿阶段分类学;可与其他加速正交组合P第 8–9 页 §5 + 第 3 页 §1已核验(页码一致)
C33口径:以延迟为主、吞吐为辅;显式硬件仅 V7B/LC7B(3090)与 LC70B(4×A100 40G)P第 5、6、8 页已核验(页码一致)
C34官方仓库 github.com/SafeAILab/EAGLE(首页印出;可达;无 commit/tag)R第 1 页已核验(网络 HTTP 200,2026-09-15)
C35对照方法外部资源(Medusa/gpt-fast 仓库、Lookahead 博客):仅文字引用不链接E第 9 页参考文献 + 第 1 页图 1 注已核验(页码一致);不作超链接
C36数据集/基准与外部模型(MT-bench/HumanEval/GSM8K/Alpaca/ShareGPT/TinyLlama/LLaMA 2):仅文字引用E第 3、5 页 + 第 9–11 页参考文献已核验(页码一致);不作超链接
C37编辑标注:结论「MT-bench 2.1x–3.8x」上界与图表不可复得(3.76x 在 HumanEval);vs 基线区间三处细微出入I第 1–2、6、9 页(编辑分析)编辑标注完成;照录不调和
C38编辑标注:各表硬件/精度未复述处一律记「论文未明确披露」;V13B/V33B/LC13B 推理硬件未披露I第 6–8、13 页(编辑分析)编辑标注完成
C39编辑标注:图 9 各层节点数(4/8/8/3/2)为目测计数、不作论文事实;论文未测服务框架集成I第 12 页图 9 + 第 5 页 §4(编辑分析)编辑标注完成
C40编辑标注:图 1/图 2 柱-模型配对方法 = 渲染页目视 + 表 7 双点锚定;纯文本提取不足为凭I第 1–2 页 + 第 8 页(编辑方法注)编辑标注完成

数据与文件说明:本页全部性能数字与机制描述均取自论文《EAGLE: Speculative Sampling Requires Rethinking Feature Uncertainty》(arXiv:2401.15077v3,ICML 2024)的提取文本与渲染页核验,并通过 sources/eagle.summary.jsonsources/eagle.evidence.json 逐条对应(claims 40 条、performance_rows 18 行,行行带硬件/模型/精度/负载/基线/定位字段,缺失字段记「论文未明确披露」)。编辑推断与部署建议已用 I 标注;本页外链仅 arXiv 与官方仓库两处(HTTPS + rel="noopener noreferrer")。数据路径图 assets/diagrams/eagle-data-path.svg(含 title/desc 无障碍描述;树拓扑为编辑示意)。台账外不捏造任何数字、出处或日期。