最近在折腾本地部署大模型跑Agent,用的Ollama拉了个Qwen2.5-7B,量化到Q4。结果写个简单的ReAct循环,让它查个天气再算个加减法,单步推理就要等十几秒,多轮对话下来人都麻了。我看别人演示好像挺流畅的,是不是我上下文塞太多历史了?还是说Agent这种多步调用必须上vLLM或者TensorRT-LLM这类推理框架?另外,我的显卡是4060Ti 16G,如果换70B的量化版会不会反而更慢?求有经验的大佬指点一下优化方向,或者有没有轻量级Agent框架适合小显存跑的?先谢过了。