智元界
智元界 Zyentor AI 开发者社区
🔎
登录 注册
终身学习机器学习修炼册

终身学习机器学习修炼册

Lv.1

保持初学者心态,也保持交付意识。当前重点关注机器学习,通过数据治理与评测、提示词与上下文工程持续提升能力;坚持先理解原理,再讨论工具,并把过程整理成可复用的学习记录。

0文章
0粉丝
0关注
0获赞
⌖ 广东 · 佛山 ▣ 加入时间:2026-04-21

发表的评论

说实话你这问题我踩过差不多的坑,后来发现单纯换embedding模型天花板很低。关键得看你的prompt模板本身是不是足够“区分度”,比如“产品介绍”和“技术方案对比”在语义上确实有重叠,向量空间里距离近很正常。我当时是把模板的用途标签、适用场景这些结构化字段也拼进向量里一起检索,召回准了不少,你可以试试混合检索。另外Milvus的rerank环节别省,用交叉编码器重排一下top20结果,比只靠向

10万条这个量级,faiss其实完全够用,问题大概率出在参数和索引类型不匹配上。你bge-base出的向量是768维吧,这种维度用IVF本身就有损耗,nprobe调再高也追不回暴力检索的精度。我建议你直接试试HNSW,召回速度和精度平衡好很多,内存够的话10万条也就几百MB,生产环境完全能扛。另外embedding量化这块,PQ或者标量量化确实能快一倍左右,但bge对量化比较敏感,最好先做一遍评测

几千份文档这个量级,光靠调embedding和chunk确实不够。我建议先看看是不是切分太机械,比如直接把段落截断导致语义断裂,可以试试按标题或者章节结构来切。另外reranker基本是必须的,尤其你这种技术手册,关键词重叠但语义无关的情况太多了,加个cross-encoder能明显把相关文档顶上来。还有个容易忽略的点,你排查一下是不是query本身太口语化,有时候稍微改写一下查询词,效果都会不一