最近在做一个知识库问答的POC,用GPT-4做底模。我把用户问题、历史对话、检索到的top5文档片段拼成一个大prompt,结果效果时好时坏。比如问“上季度华东区营收下滑原因”,它经常答非所问,或者直接忽略检索到的报表数据,反而去猜。我试过加few-shot示例、写“请基于以下文档回答”的强约束,但一旦文档变多(超过3000字),就开始“幻觉”了。想问问有实战经验的大佬:这种多文档+多轮对话的场景,是靠优化prompt结构能解决的,还是说必须上RAG+重排+微调?我自己感觉prompt工程在简单任务上挺有效,但一上业务复杂度就有点摸不着头脑,不知道是不是我拆分指令的逻辑有问题。求指点,最好能给个你们生产环境里的prompt模板思路,谢谢。