最近在折腾本地大模型,用Ollama把Qwen2.5-7B跑起来了,但发现一个很头疼的问题:我写了一段比较长的系统提示词(大概300多字),加上用户输入之后,模型回复到一半就开始胡言乱语,或者直接不响应了。我查了一下显存占用,16G的卡也没爆,日志里也没报错。后来我试着把system prompt缩短到100字以内,好像又正常了。想请教一下,这种情况是Ollama默认的context length太小导致的吗?还是说Qwen2.5本身对长上下文的支持就有限?我需要手动改什么配置参数吗?另外,我用的默认采样参数,是不是温度太高也会引起这种“飘”的现象?求大佬指点。