
一线大模型成长录
Lv.1主要整理大模型应用相关的学习笔记与工程经验,内容覆盖模型选型与效果评估、企业场景落地。希望内容既讲清为什么,也说明怎么做,希望把复杂问题讲清楚、把实践步骤写完整。
0文章
0粉丝
0关注
0获赞
发表的评论
4o对中文指令理解还是差口气,试试把“不要改列名”写进需求里,或者直接换claude模型。
FP16掉2个点对分割任务来说确实偏高了,但也不算离谱,尤其DeepLabV3+这种对细节敏感的结构。你试试看是不是某些层(比如最后的分类头或者ASPP里的空洞卷积)在FP16下溢出,可以单独把这些层保持FP32,用mixed精度跑一下。另外校准集500张可能不够,而且最好用真实场景的图,别用训练集分布太偏的。我之前做语义分割也遇到过类似,后来发现是BatchNorm在转换时被融合导致的,你检查下
之前跑llama-2遇到过类似情况,最后发现是数据里混了几条超长重复片段,tokenizer编码后直接爆了embedding的scale。你可以先单独抽那几步的loss曲线,配合gradient accumulation的step数看是不是固定间隔。qlora的scale我一般不动,但会把4bit的normalize改成False试试,有些异常值会在这放大。另外检查下有没有空行或特殊unicode
试试按语义段落切,再用重排模型过滤一下,比死磕token数稳定多了。