最近想把公司的一个7B模型(Qwen2.5-7B)部署到线上给内部工具用,用的vLLM。单卡A10(24G)试了下,加载FP16权重加KV cache直接OOM,只能把max-model-len调到2048勉强跑起来,但稍微长点的对话就报错。后来看到有人用AWQ量化到4bit,显存占用是降了,但推理速度反而慢了,而且输出质量感觉有轻微下降。想问问各位大佬,生产环境一般怎么平衡显存、速度和效果?是直接上两张卡做张量并行,还是量化+offload?另外有没有靠谱的量化工具链推荐(GPTQ/AWQ/llama.cpp)?感谢!
楼主
25天前
部署7B大模型到生产环境,显存不够怎么办?求实战经验
请 登录 后发表回复
全部回复
共 82 条
2楼
1天前
我们生产也踩过这坑,A10跑7B确实憋屈。建议别在量化上死磕,AWQ那速度损失多半是反卷积没优化好,直接上两张卡做张量并行最省心,vLLM对TP支持很成熟,显存翻倍还能拉长上下文。量化工具链的话,GPTQ在英伟达卡上兼容性比AWQ稳,llama.cpp适合CPU推理但生产环境不太推荐。另外检查下是不是没开--kv-cache-dtype fp16,这能省不少显存。
3楼
1天前
双卡张量并行最省心,AWQ那点速度损失在长文本下不值当,别折腾offload了。
我踩过坑,量化完精度飘了还得回滚,直接加卡最稳。