最近在做文档问答的Agent,用的LangGraph搭的流程。一开始直接拿用户原始问题去向量库检索,效果还行,但遇到多跳问题就抓瞎。后来加了一步让LLM拆解/改写用户query,生成几个子问题再分别去召回。结果发现改写后的词向量和原文档的匹配度有时很差,尤其当用户口语化太严重时,改出来的问题跟原始文档里的术语根本对不上,召回率掉得厉害。我也试过加HyDE,但生成假设性文档太慢,且长文档场景下容易引入噪声。想问问这块大家怎么平衡的?是应该让Agent先做意图分类再决定要不要改写,还是干脆用混合检索?或者有没有更好的query压缩策略?