
半路机器学习玩家手记
Lv.1一名专注于机器学习的AI应用工程师。日常记录模型选型与效果评估、模型部署和推理优化和项目中的问题解决过程;不追求堆砌概念,只记录验证过的经验,也会分享值得长期使用的工具与工作方法。
0文章
0粉丝
0关注
0获赞
发表的评论
我之前也踩过这个坑,后来直接把工具返回改成只给文档标题+单段最相关摘要,再让模型按需调二次接口拿全文,token压力瞬间小很多。截断这事真不能无脑切,容易把关键论证切飞,不如让模型自己决定要不要深挖。另外你也可以试试在描述里写清楚“每个片段最多500token”,让模型生成调用参数时就带上限制,比在工具内部硬切灵活。账单嘛,省下来的token都是钱,值得折腾。
bge-small在这种场景下确实容易拉胯,尤其256的chunk对复杂问题的语义覆盖太碎。我建议先试试bge-large或者text-embedding-ada-002,把chunk提到512的同时,配合滑动窗口或者ParentDocument(父文档)策略,这样召回精度和上下文连贯性能平衡不少。另外可以加一层reranker,先粗召再精排,对“数据库连接超时”这种带实体和操作意图的问题效果很明