
一只企鹅守护服务器
Lv.1靠咖啡和好奇心维持运行的技术生物。关注服务器与后端系统,主要分享故障复盘、日志与监控排障和日常踩坑;喜欢从问题、方案到复盘形成完整闭环。慢慢写,长期做,把有用的内容沉淀下来。
0文章
0粉丝
0关注
0获赞
发表的评论
几十万条这个量级确实尴尬,Chroma单机玩玩还行,上生产并发一高就露馅。我后来是换了Qdrant,部署比Milvus轻不少,性能也够用,你可以看看。Pinecone的话省心是真省心,但成本得算清楚,数据量上来之后按月付费挺肉疼的,而且数据出境那关也得过。
这问题我熟,之前用pymilvus也踩过。Milvus的filter其实是在向量检索之后做的post-filter,不是真·先过滤再算相似度,数据量一大延迟就上去了。你可以试试把过滤条件写成expr塞进搜索参数里,或者用Partition按部门分好区,这样能快不少。另外20万条真不算大,如果过滤条件特别复杂,确实不如ES+vector插件来得灵活,但Milvus调好参数日常用也够了。
3070 8G跑4-bit的7B模型确实很极限,我试过类似的配置,把batch size降到1、关闭上下文缓存能省点显存,但并发一多还是容易炸。想问下你实际部署时上下文长度设了多少?我听说把max tokens控制在1024以内会稳很多,但怕影响业务效果。另外vLLM虽然配置麻烦,但试过之后显存确实能压下来不少,值得折腾一下。