最近在折腾本地部署,用的ollama跑qwen2.5:7b,量化选的q4_k_m。之前用官方API的时候,同样的prompt(带角色设定+几个few-shot示例)效果挺稳的,但本地部署后模型输出明显变差,经常跑偏,甚至无视指令格式。一开始以为是我显存不够导致上下文被截断,但检查了n_ctx设置没问题。后来试了去掉量化直接用fp16,稍微好一点但还是很飘。想问问有经验的朋友,这种差异主要是量化导致的推理能力下降,还是本地小参数量模型本身对prompt格式的敏感度跟云端不一样?有没有什么调整prompt结构的通用建议?