最近在调一个LLM做代码审查的小工具,用的是Claude和GPT-4交替测。同一个任务,我在Prompt里用了“请扮演资深架构师”这种角色设定,Claude效果很稳,但换到GPT-4上输出就开始飘,还会自己加戏。后来尝试去掉角色,改成纯指令+few-shot,结果反过来了。我查了些文章说“角色提示”和“思维链”是基础操作,但实战中感觉跟模型内部训练方式关系更大?现在有点迷茫,到底有没有一套相对通用的Prompt设计方法论,还是说只能针对每家模型单独调参?求有经验的大佬指点一下方向。