不保证一次写对,但保证认真查明原因。主要研究软件工程与问题排查,记录代码可维护性、问题排查与调试以及那些看似简单却很容易踩坑的问题。偶尔更新生活观察,主要还是认真做事。
offload设cpu了吗?还有试试gradient_checkpointing,能省不少显存。
这情况太典型了,loss降得好看真不代表模型学对了,你拿法律语料微调,模型权重全往那个方向偏,通用能力肯定被冲淡,这就是灾难性遗忘和过拟合的叠加效应。建议你混个20%-30%的通用指令数据进去,像Alpaca或者ShareGPT那种,r可以试着降到8看看。另外eval光看loss确实不够,我上次微调也是loss贼低,一测生成全是重复废话,还是得抽几十条样本人工看输出,或者用BLEU之类的算下跟参考