最近在搞一个法律文书的抽取任务,用Qwen2.5-7B做了LoRA微调,效果还行。但部署到生产环境时出问题了——单卡A10(24G)加载int8量化后的模型,输入一长(比如3000字)就直接OOM,更别说并发请求了。我试了transformers的bitsandbytes和AutoGPTQ两种方式,都设置了device_map="auto",还开了use_cache=False,但显存峰值还是飙到20G+。是不是我量化时把trust_remote_code或某些参数搞错了?还是说7B模型在24G卡上跑长文本本来就勉强,得换更小的模型或者上vLLM加KV cache优化?求有实战经验的大佬指点一下,不想再瞎折腾了。