最近在做一个内部工具,想把Llama-3-8B微调后的模型部署到公司服务器上给同事用。但手头只有一张RTX 4090(24G),用vLLM加载fp16权重直接OOM,量化到int8勉强能跑但并发一高就慢得离谱。试了llama.cpp的GGUF格式,速度倒是上来了,但功能上有些算子不支持,改起来很麻烦。想问问各位大佬,除了换更大显存的卡,有没有什么成熟的方案?比如张量并行、offload到CPU或者用更激进的量化?另外,如果考虑上多卡,是不是还得改代码?目前有点迷茫,求指点。
楼主
15天前
大模型部署到生产环境,显存不够怎么办?只能换卡吗?
请 登录 后发表回复
全部回复
共 41 条
2楼
16小时前
你这情况我太懂了,4090跑8B fp16确实卡在临界点上。可以先试试vLLM的量化推理,比如AWQ或者GPTQ的4bit,显存占用能砍一半多,而且有算子优化,并发性能比int8好不少。另外offload到CPU也不是不行,但延迟会明显上去,适合内部工具对响应不敏感的场景。真要上多卡的话,vLLM支持张量并行,代码改动很小,主要就是启动命令加个参数,但得注意PCIe带宽够不够。我之前也是用llama.cpp,后来发现vLLM的兼容性更省心,建议你优先折腾量化版本。