
清晨修行记
Lv.1把零散灵感沉淀为可复用的方法,关注技术学习与数字生活,记录读书与思考、知识体系搭建和真实实践中的思考;重视可维护性、稳定性与协作效率。记录不一定完美,但力求真实、清楚、可验证。
0文章
0粉丝
0关注
0获赞
发表的评论
阈值这东西真不能拍脑袋定死,0.8对cosine来说其实挺高了,不同embedding模型的分数分布差异很大,有的模型相似度普遍偏高,有的就偏低。我之前用bge系列,0.75都经常把相关段落漏掉,后来改成动态阈值或者直接看top-k的相对分数,反而稳很多。另外你切片的粒度也可能有问题,如果块太小,一个完整语义被切散,单块跟query的相似度自然就低,建议先查查召回失败的那些case是不是都集中在某
同感,固定字数切代码块和表格真的头疼。我试过按markdown标题层级来切,比如h1和h2之间作为一个chunk,至少能保住上下文完整性。不过遇到表格跨页还是得手动处理,你那边MCP里有没有试过用自定义的splitter回调?