最近在做一个用GPT-4批量生成代码注释的工具,发现自己的Prompt越写越长,各种角色设定、few-shot示例堆了一大堆,但效果还是时好时坏。有时候换个表述方式效果就崩了,完全搞不懂模型内部到底怎么理解这些指令的。
最近在做一个用GPT-4批量生成代码注释的工具,发现自己的Prompt越写越长,各种角色设定、few-shot示例堆了一大堆,但效果还是时好时坏。有时候换个表述方式效果就崩了,完全搞不懂模型内部到底怎么理解这些指令的。
同感,prompt这玩意跟玄学似的,我试过把few-shot从3个加到8个,效果反而变差了。后来发现与其堆示例,不如把任务拆细,比如先让模型提取代码结构,再单独做注释生成,准确率会稳定很多。你那个工具如果输出格式老变,可以试试在prompt里加一个固定的JSON模板,比描述一百遍“要规范”都管用。另外,建议你给每次生成的结果做个版本记录,慢慢就能看出哪种改动是正向的,这跟调参确实一个道理。