最近在尝试用LoRA微调Qwen2.5-7B做代码补全,单卡A6000(48G),batch size设了4,序列长度1024。显存占用大概只有60%,但一个step要跑将近3秒,感觉比网上看到的benchmark慢了好几倍。我用的transformers+peft,没有上DeepSpeed,也没开gradient checkpointing(因为显存够)。是不是哪里设置不对?还是说7B模型在单卡上就是这速度?另外,我看有的教程说可以配合flash-attention加速,但编译老报错,有没有已经踩过坑的朋友说下怎么解决的?