最近想在自己机器上部署个开源大模型玩玩,主要是想做一些本地文档问答和代码补全。显卡是4080 16G,内存32G,试过llama.cpp跑量化版,7B的q4勉强能跑但速度一般,13B就有点吃力了。也试过vLLM,但感觉显存一下就满了。想问问各位大佬,16G显存这个配置,实际能流畅跑多大的模型?有没有什么部署方案或者量化技巧能让效果和速度平衡一点?不想每次都调API了,真诚求指点。
最近想在自己机器上部署个开源大模型玩玩,主要是想做一些本地文档问答和代码补全。显卡是4080 16G,内存32G,试过llama.cpp跑量化版,7B的q4勉强能跑但速度一般,13B就有点吃力了。也试过vLLM,但感觉显存一下就满了。想问问各位大佬,16G显存这个配置,实际能流畅跑多大的模型?有没有什么部署方案或者量化技巧能让效果和速度平衡一点?不想每次都调API了,真诚求指点。
暂无回复,快来抢沙发吧