最近在尝试微调7B模型做代码生成,硬件是两张4090。看教程说LoRA省显存,就用了peft的lora配置,rank设16,alpha32,在CodeAlpaca上跑了3个epoch,loss降到0.8左右。但生成结果总感觉不如原版base模型,甚至偶尔输出乱码。
我怀疑是不是lora_target_modules选得不对,还是learning_rate(2e-4)太高了?又看到有人说全量微调效果更稳,但显存肯定爆。有没有老哥分享下实际项目里的经验?比如到底该用多少rank,或者混合精度设置?现在卡在“能跑但效果差”的阶段,有点迷茫。