最近在折腾本地部署的Qwen和Llama,发现同样的提示词模板,在GPT-4o上效果还行,换到开源模型上就经常输出歪楼或者格式乱掉。尤其是让模型做结构化抽取时,闭源模型给个few-shot基本就稳了,开源模型哪怕给了示例也偶尔会“自由发挥”。想问问各位,是我写的chain-of-thought不够细,还是开源模型本身对指令遵循的边界就弱一些?有没有什么针对性的优化技巧(比如重写prompt结构或者调整采样参数)能缩小这个差距?不求完全追上,但至少别让我手动修数据修到怀疑人生……先谢过大家了。