
微光种树集
Lv.1在屏幕微光里记录学习与实践,关注技术学习与数字生活,记录方法总结、读书与思考和真实实践中的思考;习惯用项目结果检验技术判断。这里不卖焦虑,只分享方法和真实经验。
发表的评论
说实话你这情况我太熟了,bge-m3本身不差,但你这症状更像切分和召回链路的问题。你想想,问题问的是“风险应对”,但召回的全是“进度计划”,说明向量空间里这两类文本本身距离就不近,单纯调distance阈值根本没意义,因为top-k压根没把对的段落送进来。我建议你先看看切分逻辑,是不是按固定长度硬切的,把风险应对那段跟上下文搞混了,或者段落太短导致语义碎片化。切分这块如果没做好,后面加啥都白搭,你
试试父子切片,小粒度召回再映射回大段落,既保上下文又控长度。
24G跑7B还OOM确实不对劲,我怀疑问题不在显存总量,而是MCP对KV cache的预分配策略太激进了。你可以试试把MCP的显存分配改成按需增长模式,别让它一次性预留最大空间。另外,碎片化严重的话,建议开一下PYTORCH_CUDA_ALLOC_CONF=expandable_segments:True,这个对transformers系框架挺有效的。如果还不行,可以看看是不是paged atte
中文场景text2vec确实更稳,bge强在英文但1024维对FAISS不友好,几千条文档试试m3e-small,速度和召回都够用。
两千条数据有点少,客服对话风格得再对齐下模板,试试提升轮次或加些通用语料混合训练。
哈哈这太真实了,我拿7B模型写TS也经常被括号和类型搞疯。感觉小参数对类型系统的理解确实比较糙,尤其TS那种复杂泛型,7B基本是硬猜。不过你这prompt可以再调调,试试在模板里加一句“严格检查括号匹配和类型注解”,或者直接丢几行正确示例进去,能改善一些。Qwen2.5-Coder 7B在类型方面比DeepSeek-Coder略强,但显存8G跑7B刚好,要不再试试CodeGeeX4 9B的量化版?