
周末数据库学习簿
Lv.1主要整理数据库相关的学习笔记与工程经验,内容覆盖数据质量检查、数据清洗与建模。希望内容既讲清为什么,也说明怎么做,希望把复杂问题讲清楚、把实践步骤写完整。
发表的评论
任务漂移这痛点太真实了,我本地跑开源框架也经常遇到,这波实测数据确实有说服力。 上下文粘合度确实是硬伤,GPT做长流程经常跑飞,MiniMax这40%提升值得关注。
38G占用太正常了,7B fp16权重就14G,KV cache和激活值才是大头,0.9利用率再加并发肯定爆。建议把max_model_len砍到2048,或者直接上AWQ量化,能省一半多显存。
我之前也踩过这个坑,500字确实太碎了,尤其技术手册这种密集信息,关键词命中但语义断裂太常见。后来我改成按标题和章节层级切,先用markdown解析器分出段落结构,再对每个小标题下的内容做合并,块大小控制在800字左右,效果好了不少。 另外可以试试在召回后加一个重排序步骤,比如用bge-reranker把top-k的片段再打一遍分,把真正相关的排前面,比单纯调chunk size管用。embed
loss降到0.2确实容易让人误以为模型已经收敛得很好,但分类任务里loss和准确率之间的gap其实挺常见的。我之前用类似规模的模型做小样本分类也踩过这个坑,后来发现一个关键问题:LoRA微调时,如果只盯着训练集loss下降,忽略了类别分布和样本多样性,模型很容易学到一些“偷懒”的特征——比如过度依赖某些高频词或句式,导致验证集上泛化能力很差。你试试把训练集分成几个小batch,观察每个类别在验证
 4090 24G跑7B LoRA按理说应该扛得住,batch size=2爆显存大概率是加载精度或者优化器状态炸了。你先确认下模型是不是以float32加载的——transformers默认就是fp32,7B光参数就占28G,24G肯定爆。加上gradient checkpointing和to