最近在做一个内部知识库问答的Agent,用LangChain + GPT-4,本地跑demo感觉还行。但一挂到服务上就发现一堆问题:比如多个用户并发的时候,对话历史串了;还有工具调用偶尔超时或者返回格式不对,直接让整个chain崩了,得手动重试。我看了下LangSmith的trace,感觉是状态管理没做好,但网上教程大多都是讲单个demo怎么跑,很少有讲怎么设计生产级的状态持久化、错误恢复和上下文隔离的。想请教下社区里真正做过落地项目的朋友,你们是用什么方案解决这些的?是自己维护conversation状态,还是直接用LangGraph或者别的框架?另外,对于工具调用失败,有没有什么好的自动降级或者重试策略?先谢谢各位了。