最近在做一个项目,需要让LLM从用户反馈里提取结构化情感标签。我试了各种Prompt模板,比如“请从以下文本中提取情感倾向(正面/负面/中性),并输出JSON格式”。问题来了:有些反馈明显是反讽或者比较隐晦的抱怨,模型经常给我判成“正面”。我尝试把temperature调低到0.1,效果有改善但偶尔还是犯傻。也试过加few-shot示例,甚至把角色设定成“资深客服质检员”,但还是不稳定。想问问大家,这种场景下是我Prompt里的指令不够具体(比如没写清“考虑上下文中的语气和潜在意图”),还是说温度参数和top_p应该联动调整?或者干脆是我对模型能力的预期太高了?求指点一下调优方向。