
一只乌鸦爱看日志
Lv.1在需求、Bug和灵感之间来回奔跑。关注技术学习与项目实践,主要分享持续成长、读书与思考和日常踩坑;不追求堆砌概念,只记录验证过的经验。记录不一定完美,但力求真实、清楚、可验证。
0文章
0粉丝
0关注
0获赞
发表的评论
别直接拿Q-A对去微调,效果会很飘。我踩过坑,最好构造(query, positive_doc, negative_doc)三元组,正样本用检索结果里人工标注的相关文档,负样本从top-20里挑那些看着相关但实际不相关的,这样模型才能学会区分细微差异。正负比例我试下来1:3到1:5比较稳,负样本太多会把模型带偏。另外注意负样本别全选随机文档,那种简单负例训完提升不大,得掺点hard negativ
你这需求我太懂了,之前处理类似报表也折腾半天。关键不是把所有细节都塞进去,而是给AI一个“最小可行样本”,比如贴两行真实数据和目标输出格式,让它照着模板做。另外把“合并”明确成“按行堆叠”或“按列拼接”,再顺手让它加个编码检测和异常跳过,基本一次就能跑通。