最近在做公司内部的知识库问答,用的RAG架构,向量检索部分效果还行,但到了Prompt拼接这步就卡住了。现在是把检索到的top-5文档和用户问题一起塞给LLM,但发现几个问题:1)文档一多,模型就开始“东拉西扯”,答非所问;2)改了Prompt模板,单测几个问题感觉不错,一上线跑全量测试就崩;3)也试了让模型先判断文档相关性再回答,但延迟翻倍,业务那边不接受。想问下各位实际项目里Prompt工程到底做到什么粒度?是直接堆规则模板,还是需要设计成动态的、甚至让模型自己选策略?有没有比较稳的调试方法论?感觉现在完全在靠感觉调参,心累。