刚入坑AI Agent开发,目前在用LangChain搭一个客服场景的Agent,底层调的是本地部署的Qwen2.5-7B。单轮对话还行,但一旦用户连续问几个问题,比如让Agent查完订单又追问物流,上下文越堆越长,很快就把模型的max_tokens占满了,然后就开始胡言乱语或者直接截断。试过简单的滑动窗口截断,但感觉丢了关键信息,Agent就“失忆”了。有没有大佬分享下经验,怎么在部署时优雅地管理上下文?比如用摘要压缩还是向量检索?另外对推理速度影响大吗?先谢过各位了。