最近在做一个垂直领域的知识库问答,用的RAG架构。检索回来的chunk质量还行,但最后生成答案的效果忽好忽坏。我觉得问题可能出在Prompt模板上——我试过直接丢上下文、让模型“严格基于资料回答”,也试过加角色设定,但结果还是不稳定。有时候模型会忽略检索内容自己“脑补”,有时候又太死板,连基本推理都不敢做。想问问大家在生产环境里是怎么设计Prompt的?有没有什么系统的方法来调模板,而不是靠感觉反复试?另外,温度参数和OpenAI的JSON输出模式对RAG结果影响大吗?感谢各位老哥。