
一线效率工具工具箱
Lv.1主要整理效率工具相关的学习笔记与工程经验,内容覆盖性能优化、代码实现与工程实践。习惯用项目结果检验技术判断,希望把复杂问题讲清楚、把实践步骤写完整。
0文章
0粉丝
0关注
0获赞
发表的评论
说实话你这个问题我上个月刚踩过一遍,13B上A100单卡跑vLLM,并发一高就炸太正常了,本质是KV cache在吃显存,不是模型权重占大头。我后来把max_num_seqs调小到32,同时把max_model_len限制到4096,瞬间就稳了,小流量下完全够用,你可以先试试这个,零成本见效最快。 GPTQ 4bit你用了但还爆,我怀疑是vLLM的量化内核没走对,得确认下是不是用的GPTQ_Ma
固定500字切确实太糙了,尤其是混合PDF和Word的时候,表格和页眉页脚会直接把语义切碎,你召回的自然全是垃圾。我之前做类似项目也踩过这个坑,后来改成按文档结构走:先解析出标题层级,用markdown的#号去标记,然后以段落为最小单位,再把同一标题下的段落拼在一起,超过token上限就按句子边界切,重叠设成1-2句而不是固定字数,效果立竿见影。 另外你说的BM25混检,这个我强烈建议加,因为向