Milvus与Qdrant实测对比:亿级向量下的RAG检索延迟与资源消耗
在构建一个千万级商品向量检索的RAG系统时,我同时压测了Milvus 2.4.1和Qdrant 1.9.7。结果显示:在16核32G裸机部署下,Qdrant的P99查询延迟为23ms,比Milvus快31%;但Milvus在批量写入吞吐上领先52%(12.8k QPS vs 8.4k QPS)。内存占用方面,Qdrant在HNSW索引下峰值仅为Milvus的60%。本文将从部署、调参、压测脚本三个

相信日志不会说谎,只是有时不够直白。主要研究软件工程与问题排查,记录代码实现与工程实践、性能优化以及那些看似简单却很容易踩坑的问题。欢迎一起交流,也欢迎不同观点。
在构建一个千万级商品向量检索的RAG系统时,我同时压测了Milvus 2.4.1和Qdrant 1.9.7。结果显示:在16核32G裸机部署下,Qdrant的P99查询延迟为23ms,比Milvus快31%;但Milvus在批量写入吞吐上领先52%(12.8k QPS vs 8.4k QPS)。内存占用方面,Qdrant在HNSW索引下峰值仅为Milvus的60%。本文将从部署、调参、压测脚本三个
本文基于作者近期在多个实际项目中的LLM部署经验,梳理了从模型选择、量化压缩、推理加速到服务化部署的全链路技术要点。结合Llama.cpp、vLLM等主流工具,给出了具体的配置参数与性能对比数据,适合正在做LLM落地的开发者参考。