最近在做一个代码审查工具,用Prompt让大模型分析PR里的潜在bug。我发现同一个Prompt,在Claude里表现很好,能给出很具体的修改建议,但放到GPT-4o里就变得很空泛,甚至漏掉关键问题。反过来,为GPT调优后的Prompt,Claude又觉得太啰嗦。我现在只能维护两套Prompt,感觉很累。也试过用一些所谓的“结构化模板”,比如“角色+任务+约束+输出格式”,但感觉还是治标不治本。想问问大家,有没有比较通用的写法策略,或者至少能减少这种差异的实践经验?另外,是不是模型底层的指令遵循机制决定了这种差异,有没有相关的公开资料可以学习?