最近在试着用LoRA微调Qwen2.5-7B,想让它懂一点我们公司内部的技术文档(大概5000条QA对)。机器是4090 24G,一开始用的QLoRA + 4bit,batch_size=1,梯度累积设了8,结果跑了不到500步显存就满了,直接OOM。我看网上教程说4bit + LoRA应该很省显存啊,是我哪里设置不对吗?另外,我用的transformers + peft,是不是gradient_checkpointing没开导致的?还是说7B模型本身做指令微调就需要更高的显存底线?有没有大佬分享下自己微调7B的显存配置,或者推荐更小一点的模型(比如3B/4B)来试水?感谢!