最近在做一个简单的客服Agent,用LangChain + GPT-4。刚开始Prompt写得很顺,但迭代了几轮之后问题来了:每次改一个细节,比如调整语气或者加一个few-shot例子,都会影响之前调好的行为。现在项目里堆了十几个版本的Prompt,有的叫v2_final,有的叫v3_真的最终版,根本分不清哪个是能用的。