最近想试试用Llama 3 8B做点文本生成,在Hugging Face上找了个微调过的中文版模型,结果加载时直接OOM(我用的RTX 3090,24G显存)。我试了load_in_8bit=Truetorch_dtype=torch.float16,但加载到一半还是崩了,错误提示是“CUDA out of memory”。是不是因为我没设device_map="auto"?或者需要先装bitsandbytes?另外,有没有办法像GPTQ那样4bit量化加载?我查了官方文档,但说得比较简略,直接抄代码跑不通。求有经验的大佬指点下正确姿势,或者推荐个已经量化好的模型链接也行,谢谢!