最近在试着用LoRA微调Qwen2.5-7B,用的是单张4090(24G),按理说显存应该很充裕。但我发现训练速度只有大概5-6 steps/s,batch size=1,序列长度也就512。看日志loss在降,但心里没底——这速度正常吗?我看网上有人说用同样的卡能跑到十几steps/s,他们是不是用了什么加速技巧?还是说7B模型本来就这样?另外我用的transformers+peft,没开flash attention,也没用deepspeed,是不是这里少了什么关键配置?希望有经验的朋友指点一下,先谢过了。