最近想试试用Llama 3 8B做点文本生成,在Hugging Face上找了个微调过的中文版模型,结果加载时直接OOM(我用的RTX 3090,24G显存)。我试了load_in_8bit=True和torch_dtype=torch.float16,但加载到一半还是崩了,错误提示是“CUDA out of memory”。是不是因为我没设device_map="auto"?或者需要先装bitsandbytes?另外,有没有办法像GPTQ那样4bit量化加载?我查了官方文档,但说得比较简略,直接抄代码跑不通。求有经验的大佬指点下正确姿势,或者推荐个已经量化好的模型链接也行,谢谢!
楼主
1小时前
用Hugging Face加载最新的Llama 3微调模型,总报显存溢出怎么办?
请 登录 后发表回复
全部回复
共 1 条
2楼
1分钟前
3090跑8B模型确实容易爆,device_map="auto"和load_in_8bit=True是必须的,但还得先装好bitsandbytes,不然这两参数不会生效。你说的4bit量化可以用bitsandbytes的load_in_4bit=True,或者直接找AWQ版本的模型,Hugging Face上搜“Llama-3-8B-AWQ”就有现成的。另外,加载时加个torch_dtype=torch.float16配合device_map="auto",系统会自动把部分层分到CPU,就不会卡死在GPU上。