最近在折腾用Qwen2.5-7B做本地agent,用的LangChain搭了个带搜索和代码执行的流程。跑简单任务还行,但一涉及多轮工具调用,比如让它查资料再写脚本再总结,经常第三四轮就开始胡言乱语,或者直接忽略工具返回的结果。我猜是上下文太长把模型搞懵了,但截断又怕丢关键信息。试过让LLM自己总结历史,效果不稳定。想问下各位,你们在本地部署agent时是怎么管理工具结果和历史对话的?有没有什么轻量级的压缩策略或者记忆机制推荐?还是说7B模型做多步agent本来就力不从心,得上更大的模型?