最近在调一个文档问答的RAG项目,用的是LangChain+OpenAI那个套路。现在遇到个比较纠结的问题:system prompt里到底要放多少内容?放少了感觉回答很飘,经常自己脑补知识库之外的东西;放多了又感觉模型输出太“死”,甚至有时候直接照着检索片段念,基本没有总结和组织语言的能力。我看网上教程有的说“提示词要具体到每个步骤”,有的又说“给模型留点自由发挥空间”。目前试了两种写法,一种是把回答结构、引用格式全部写死,另一种就是大概说“根据上下文回答”。效果都不太理想,前者太生硬,后者容易幻觉。想问问各位在真实项目里,一般怎么平衡这个度?有没有什么更工程化的调法,比如动态拼Prompt或者分阶段就检索结果做二次过滤再交给模型?谢谢各位佬。