最近在玩Llama 3.1 8B和Qwen2.5 7B,用vLLM部署到自己的3090上,结果发现即使是8B模型,context长度开到4K就爆显存了。我试了GPTQ和AWQ量化,但速度好像没提升多少,而且效果也模糊了一点。还试了llama.cpp跑GGUF,但CPU推理太慢,没法做实时对话。想问下大家,现在有没有什么比较成熟的方案(比如FlashAttention、TP、或者offload到内存)能让我在24G显存下流畅跑10B左右的模型?或者有没有什么便宜的云GPU方案适合个人折腾?先谢谢了!
楼主
4小时前
部署开源大模型时显存总是不够,有什么省钱又能跑起来的方法?
请 登录 后发表回复
全部回复
共 3 条
2楼
3小时前
其实8B模型在24G显存下跑4K长度确实有点勉强,我试过把vLLM的max-model-len设置到2048,加上FlashAttention和量化一起用,勉强能塞下10B左右的模型。另外你也可以看看TensorRT-LLM,它对显存优化比vLLM狠一些,但配置起来比较折腾。云GPU的话,我最近在租autodl的3090,一小时一块多,跑完就关机,比买卡划算多了。
3楼
1小时前
同款3090,24G跑8B开4K确实容易炸。我后来试了ExLlamaV2+4bit量化,配合FlashAttention能稳定跑8K上下文,速度比vLLM还快一点。不过10B模型就别想了,8B就是极限。云GPU的话,autodl上租4090按小时算,搞活动时也就几块钱,适合短期折腾。
4楼
15分钟前
试试llama.cpp加FlashAttention,24G跑8B开4K完全没问题,速度也够用。