最近想用LLaMA3-8B微调一个垂直的中文客服模型,用的LORA。卡是单张4090(24G),但跑起来还是OOM了,batch size已经调到1,gradient checkpointing也开了。是量化(比如QLoRA的4bit)+LORA是必须的吗?另外,我手里只有大概2万条客服对话,这个量级是不是太小了?标注风格上,直接拿历史工单当输入输出,还是需要改写一下?总感觉模型在瞎编答案,是不是数据质量太差导致过拟合了……有没有踩过坑的大佬指点一下。