最近在尝试用Qwen2.5-7B搭一个简单的Agent,用来做客服问答。单轮对话还行,但一到多轮,尤其是用户连续追问细节时,模型就开始“失忆”了。比如用户先问“退款流程是什么”,再问“那需要等几天”,模型居然回答“您是指哪个流程”。我试过拼接历史消息到prompt,但token一长(大概超过3000)就逻辑混乱,甚至重复输出。是不是开源模型对长上下文的支持普遍不如闭源?还是我prompt结构有问题?有没有大佬分享下处理这类多轮记忆的trick,或者推荐对长上下文更友好的开源模型?感谢!