最近在本地用Ollama部署了Qwen2.5-7B,准备做个简单的文档摘要工具。结果发现同一个Prompt,在官网网页版和本地API返回的结果差别巨大。比如我让模型“提取三点核心结论”,本地经常只给两条,或者直接开始复述原文。已经试过调整temperature和top_p,也换过几版system提示词,但效果不稳定。是想问下各位老哥,本地部署的小参数模型是不是对Prompt写法更敏感?有没有什么针对性的模板或者技巧,能让输出更可控?还是说单纯是模型量化后能力下降,只能换更大参数?