最近在本地部署了Qwen2.5-7B和Llama3.1-8B,想给公司做一个内部知识库问答的demo。我发现网上教程都说temperature设低一点、top_p设0.9左右,但我实际测试时,同样的Prompt在Qwen上temperature=0.7效果很好,换到Llama上就胡说八道,降到0.2又显得太死板。另外,我用了LangChain的PromptTemplate,里面加了few-shot示例,但模型总是忽略我给的格式要求,输出一堆废话。想问问大家,针对不同开源模型,有没有一套相对系统的调参思路?还是说只能靠暴力试错?还有就是,对于这种结构化输出,大家是硬调prompt还是直接上JSON mode或者function calling?求指教,真的有点迷茫。