最近在学大模型微调,先跟着教程用transformers + peft把ChatGLM3-6B的LoRA跑通了,感觉还挺顺。今天想试试Llama3-8B,结果发现官方和社区的代码风格差别好大,比如tokenizer的padding、attention_mask的处理,还有标签移位这些细节,直接照着改就报错。我有点懵,是不是我基础没打牢?还是说不同模型本来就需要这么定制化的代码?想请问下各位大佬,你们平时切换模型微调时,是有一套自己的通用模板,还是每次都现改?有没有什么建议能减少这种切换成本?谢谢!