最近在做一个基于大模型的客服问答系统,用GPT-4的API。发现同一个prompt,有时候回答得很好,有时候就胡言乱语,尤其是用户问题稍微绕一点的时候。我试过加few-shot示例、调整temperature、写更详细的角色设定,但总感觉是在碰运气,改了一个case另一个又挂了。想问问大家,在实际项目里是怎么管理prompt版本的?有没有什么工具或者方法论能系统地评估prompt效果,而不是靠人肉一条条试?感觉自己快变成玄学调参工程师了……
最近在做一个基于大模型的客服问答系统,用GPT-4的API。发现同一个prompt,有时候回答得很好,有时候就胡言乱语,尤其是用户问题稍微绕一点的时候。我试过加few-shot示例、调整temperature、写更详细的角色设定,但总感觉是在碰运气,改了一个case另一个又挂了。想问问大家,在实际项目里是怎么管理prompt版本的?有没有什么工具或者方法论能系统地评估prompt效果,而不是靠人肉一条条试?感觉自己快变成玄学调参工程师了……
暂无回复,快来抢沙发吧