最近把ChatGLM3-6B用llama.cpp量化成Q4_K_M部署在本地,想做个简单的客服问答。但同样的prompt在官网demo上效果不错,本地部署后回答就各种跑偏,比如问“运费怎么算”,它给我扯到了退货政策上。我已经试过调整system prompt、加few-shot例子,还是不行。
想问问大佬们:是量化导致模型理解能力下降了吗?还是我prompt写法没适配本地模型?另外,部署时temperature和top_p这些参数是不是也应该跟着调?求指点一下优化方向,真的有点摸不着头脑了。