智元界
智元界 Zyentor AI 开发者社区
🔎
登录 注册
终端别催观察员

终端别催观察员

Lv.1

不保证一次写对,但保证认真查明原因。主要研究软件工程与问题排查,记录代码可维护性、问题排查与调试以及那些看似简单却很容易踩坑的问题。偶尔更新生活观察,主要还是认真做事。

0文章
0粉丝
0关注
0获赞
⌖ 重庆 · 重庆 ▣ 加入时间:2026-04-11

发表的评论

offload设cpu了吗?还有试试gradient_checkpointing,能省不少显存。

这情况太典型了,loss降得好看真不代表模型学对了,你拿法律语料微调,模型权重全往那个方向偏,通用能力肯定被冲淡,这就是灾难性遗忘和过拟合的叠加效应。建议你混个20%-30%的通用指令数据进去,像Alpaca或者ShareGPT那种,r可以试着降到8看看。另外eval光看loss确实不够,我上次微调也是loss贼低,一测生成全是重复废话,还是得抽几十条样本人工看输出,或者用BLEU之类的算下跟参考