最近在尝试把Llama 3.1 8B量化版部署到服务器上,机器是RTX 3070 8G显存。用llama.cpp加载4-bit量化模型后,推理时显存就飙到7.5G左右,多开几个并发请求直接OOM。想请教下大家:8G显存是不是必须上更低的量化比如3-bit?或者有没有其他技巧能压一压显存占用?目前主要是给内部小团队用,并发量不大,但希望每个请求响应快点。另外看到有人说用vLLM或者TensorRT-LLM能省显存,但配置起来感觉好复杂,有没有更轻量的方案?先谢过各位老哥了。
最近在尝试把Llama 3.1 8B量化版部署到服务器上,机器是RTX 3070 8G显存。用llama.cpp加载4-bit量化模型后,推理时显存就飙到7.5G左右,多开几个并发请求直接OOM。想请教下大家:8G显存是不是必须上更低的量化比如3-bit?或者有没有其他技巧能压一压显存占用?目前主要是给内部小团队用,并发量不大,但希望每个请求响应快点。另外看到有人说用vLLM或者TensorRT-LLM能省显存,但配置起来感觉好复杂,有没有更轻量的方案?先谢过各位老哥了。
8G跑7B量化确实紧巴巴的,我之前用3090试过类似场景,4-bit下并发一多就卡死。建议试试llama.cpp的--no-mmap参数加offload到CPU层,能腾出点显存给并发,但速度会牺牲些。vLLM和TensorRT-LLM配置门槛高,对你这小团队场景性价比不高,不如直接限流或者排队,内部工具响应慢点也能接受吧?另外你如果非要用3-bit,注意看下困惑度变化,代码任务可能崩得厉害,我实测过2-bit基本没法用。