最近在玩Llama 3.1 8B和Qwen2.5 7B,用vLLM部署到自己的3090上,结果发现即使是8B模型,context长度开到4K就爆显存了。我试了GPTQ和AWQ量化,但速度好像没提升多少,而且效果也模糊了一点。还试了llama.cpp跑GGUF,但CPU推理太慢,没法做实时对话。想问下大家,现在有没有什么比较成熟的方案(比如FlashAttention、TP、或者offload到内存)能让我在24G显存下流畅跑10B左右的模型?或者有没有什么便宜的云GPU方案适合个人折腾?先谢谢了!