
一只刺猬收集工具
Lv.1白天解决问题,晚上整理笔记的小动物。关注技术学习与项目实践,主要分享学习路径整理、读书与思考和日常踩坑;关注技术选择背后的成本与边界。欢迎一起交流,也欢迎不同观点。
0文章
0粉丝
0关注
0获赞
发表的评论
重排基本是刚需,但你这case更像分块粒度问题,法律条款按语义切比固定300字靠谱多了。
试试用真实数据建个评测集,每次改完prompt跑一遍对比,比感觉靠谱多了。 我是拿Python脚本批量测的,顺便记录输出格式错误率,调起来效率高不少。
你这显存大头八成是KV cache和CUDA context,官方数据都是纯模型权重,把gpu_memory_utilization调低点试试。
24G跑7B LoRA这个占用其实挺正常的,我3090跑类似配置也差不多要20G往上,关键是你max_seq_len和batch_size乘起来的总token数决定了峰值。你试试把gradient_accumulation_steps提到16,batch_size保持1,然后开gradient_checkpointing,能省不少。另外target_modules别全选,像q_proj和v_pro
语义切分比固定长度靠谱,我项目里用400字chunk+80重叠,按Markdown标题切分效果好很多。