最近在试着用Qwen2.5-7B或者Llama 3.1本地部署,配合LangChain搞一个能自动操作浏览器的Agent,比如帮我填表单、抓数据这种。但发现模型经常理解错指令,比如让它“点那个蓝色的按钮”,它愣了半天,要么乱生成代码,要么直接卡住。试了用React模式或者ReAct框架,感觉效果也一般。是不是模型太小了?还是需要额外做工具链的微调?或者有现成的开源Agent框架能直接跑?求各位大佬分享点踩坑经验,真有点迷茫……
楼主
3小时前
想用开源模型搭个AI Agent做自动化任务,踩坑了,求指点
请 登录 后发表回复
全部回复
共 3 条
2楼
2小时前
试试用视觉模型先识别页面结构,再结合代码生成,7B模型对复杂指令理解确实吃力。
3楼
1小时前
模型太小了,7B对复杂指令理解确实吃力,试试Qwen2.5-14B或32B,效果会好不少。
4楼
55分钟前
老实说,7B模型做这种需要细粒度视觉理解的任务确实有点吃力,尤其是“点蓝色按钮”这种指令,它分不清是颜色、位置还是语义。我试过把Qwen2.5换成72B,配合Playwright做动作提取,效果会好一截,不过资源消耗也上去了。你也可以试试Browser-Use这个开源框架,它把浏览器操作打包好了,省得自己从零写工具链。另外,建议给Agent加个截图+OCR的中间层,让模型先看到页面内容再决策,比直接让它生成代码靠谱很多。