最近在折腾一个RAG+Agent的小项目,用的Llama-3-8B-Instruct,量化到4bit,按理说显存应该够,但跑起来之后发现占用直接飙到12G+。我显存是16G,单开一个模型感觉还行,但一旦加上embedding模型、重排序模型,还有向量数据库在后台跑,直接爆显存了。我看网上很多人说8B量化之后6G就能跑,为什么我实际体验差这么多?是我加载方式有问题,还是说上下文长度、KV cache这些设置没调对?另外,如果要同时跑多个小模型做Agent,有没有什么实践上的优化方案,比如共享显存、流式卸载之类的?求有经验的大佬指点一下,别让我再硬怼了。