最近在做RAG+Agent的项目,用LangGraph接了搜索、计算器和内部API三个工具,模型是GPT-4o-mini。跑了几十轮测试,发现模型经常在用户问“某某公司去年营收”时,不走搜索而是直接调计算器,或者明明该调API却去搜网页。我试过在system prompt里写工具选择规则、给每个tool加了详细中文描述,甚至调了temperature,效果还是不稳定。想问下大家有没有遇到过类似问题?是模型本身推理能力不够,还是我的工具描述写得不对?或者有没有什么prompt技巧,比如few-shot示例之类的?求指点,卡在这好几天了。