最近在调一个LLM做结构化信息抽取的任务。一开始用简短的指令,准确率还行,但偶尔格式会乱。我就按照网上说的“详细描述任务背景+输出格式+示例”,把Prompt扩到了将近1000字,结果发现模型开始频繁漏掉字段,甚至出现幻觉内容。同样的模型和参数,只是改了Prompt长度,差异就这么大。想请教下大家,这种“过度工程化”的Prompt是不是有反效果?还是说长Prompt需要配合特定的结构(比如XML标签或Markdown分隔)才能有效?有没有大佬遇到过类似情况,你们是怎么平衡Prompt详细程度和实际效果的?