最近在折腾本地部署AI Agent,用的Ollama拉Qwen2.5-7B,写了个简单的工具调用流程(读文件→查天气→写日志)。结果发现只要涉及多步推理,模型就经常卡住,最后直接报超时。我试过调低temperature,也把context window开到8k,还是不稳。想问问大家,这种轻量级Agent是不是该直接上14B或者用带function calling微调的版本?还是说本地跑Agent本来就得上vLLM那套优化?求有踩过坑的大佬指点下,现在有点怀疑人生了。
楼主
28天前
Qwen2.5本地跑Agent总超时,是选型问题还是我姿势不对?
请 登录 后发表回复
全部回复
共 101 条
2楼
1天前
说实话你这情况我太熟了,之前用Qwen2.5-7B跑类似的多步Agent也卡到怀疑人生,后来发现瓶颈往往不在模型选型上,而是Ollama的推理调度和工具调用格式兼容性。7B的function calling能力确实弱,它经常在生成工具参数时犹豫不决,反复输出无效token,超时就这么来的。我后来换成14B的Qwen2.5-Instruct,配合显式系统提示词把工具JSON schema写死,情况好了很多,但依然偶尔抽风。真要稳定跑Agent,vLLM那套并行解码和连续批处理是必须的,Ollama单进程处理多步推理太吃力了。另外你context window开到8k其实没解决核心问题,多步调用最怕的是历史对话里的工具返回结果污染注意力,建议把每步的工具输出精简到几百token以内。还有个骚操作,把“读文件→查天气→写日志”拆成三个独立模型实例轮流调用,用代码控制状态流转,比让单模型自己规划靠谱得多。说到底,本地玩Agent别指望一步到位,先接受“半自动”模式,等真跑通了再慢慢合并步骤。