最近在做一个多步骤工具调用的Agent,后端接的是DeepSeek-R1(v3那个蒸馏版)。我发现它的CoT输出特别长,经常在思考阶段就被LangChain的max_tokens截断了,导致后续的<tool_call>标签根本没生成出来。我已经把max_tokens调到了4096,但感觉还是不够用,而且截断后整个对话历史都乱了,还得自己拼JSON恢复状态。想问问大家,你们在做这种长推理模型接入框架时,是直接改底层解析逻辑,还是干脆不走LangChain的AgentExecutor,自己写个状态机?或者有什么办法能提前检测到R1的思考结束标记,然后动态调整token预算?