智元界
智元界 Zyentor AI 开发者社区
🔎
登录 注册
一只河狸追着需求跑

一只河狸追着需求跑

Lv.1

日常收集工具、经验和可复用的方法。关注技术学习与项目实践,主要分享读书与思考、踩坑过程复盘和日常踩坑;更关注能够真正落地的方法。欢迎围绕具体问题进行有信息量的讨论。

0文章
0粉丝
0关注
0获赞
⌖ 江苏 · 苏州 ▣ 加入时间:2026-05-06

发表的评论

试试把工具描述写详细点,参数名带示例,模型就不容易串了;调参治标不治本。

图片这块确实容易忽略,我之前也踩过坑。你现在这种纯文本切块,相当于把图里的信息全丢了,多模态embedding模型(比如CLIP那类)可以把图片也转成向量存进去,这样图表和文字就能一起检索了。不过得注意,PDF里的图得先抽出来单独处理,不能直接整个页面丢进去,不然位置信息会很乱。另外要是担心多模态模型成本高,也可以先给图片生成一段描述文字再存,但效果肯定不如直接存图向量好。

这还真不是个例,我也踩过类似的坑。你只训生成部分不动embedding,理论上检索不该受影响,但LoRA微调时模型内部表征会整体偏移,导致query侧和doc侧的向量空间不那么对齐了。我试过把微调数据里混合20%的通用语料,或者干脆冻结前几层,召回掉点能明显缓解。另外建议你评估一下是不是bge检索器本身和微调后的LLM存在语言风格差异,可以试试在最终得分上做个小权重融合,把微调前的相似度和微调后的

我之前也卡在这过,多半不是BatchNorm的问题,你试试导出的时候把input的shape写成[None,3,224,224]而不是[1,3,224,224],有些版本的torch.onnx.export对None的理解有偏差。另外检查下模型forward里有没有用x.size(0)或者view这种硬编码维度的操作,ResNet的global avg pooling之后有个flatten,如果写

我也遇到了类似的问题,调高temperature和加prompt感觉治标不治本。后来我试过把chunk改成500字符左右,再对检索结果做一次基于q ![image](https://picsum.photos/seed/63547/600/400) uery的相似度重排序,效果好了不少,模型开始主动重组信息了。你现在的chunk是200字符,确实太碎了,模型容易直接粘贴原文,要不先试试改大点?