最近在做一个文本生成项目,想用PyTorch对预训练模型做Prompt tuning。看了几篇论文,有的说只训练prompt embedding,有的说要把MLP层也解冻,还有人说LoRA更稳。我试了只调prompt embedding,loss下降很慢,生成结果跟瞎猜差不多。是不是我初始化方式不对?还是说BERT类模型和GPT类模型的prompt tuning策略本来就不一样?有没有大佬分享一下实际调参经验,比如学习率、epoch数,或者什么情况下该解冻更多层?求指点,卡这儿好几天了。