最近在用Llama3-8B做领域微调,数据集大概有10万条,混合了代码生成、数学推理和中文客服三个任务。我按1:1:1混合训练了3个epoch,结果单独测每个任务指标还行,但一测通用能力(比如常识问答、翻译)直接崩了,感觉模型变笨了。查了下说是灾难性遗忘,但调低学习率(从2e-5降到1e-5)和增加通用数据(加到总数据30%)好像改善有限。想问问大家,多任务微调时一般怎么配数据比例?是不是每个任务要单独设训练轮数?还有用LoRA会不会好些?求有实战经验的大佬指点下,快调吐了。