最近在做一个内部工具,想把Llama-3-8B微调后的模型部署到公司服务器上给同事用。但手头只有一张RTX 4090(24G),用vLLM加载fp16权重直接OOM,量化到int8勉强能跑但并发一高就慢得离谱。试了llama.cpp的GGUF格式,速度倒是上来了,但功能上有些算子不支持,改起来很麻烦。想问问各位大佬,除了换更大显存的卡,有没有什么成熟的方案?比如张量并行、offload到CPU或者用更激进的量化?另外,如果考虑上多卡,是不是还得改代码?目前有点迷茫,求指点。