最近把项目里的代码补丁任务交给Qwen2.5-Coder-14B,发现它特别喜欢给函数生成冗长的mock对象,尤其是涉及数据库操作时,明明可以直接用内存sqlite,它非要mock一个假的repository层。跑测试的时候,覆盖率倒是上去了,但实际逻辑很多没测到。我试过在prompt里强调“少用mock、多写集成测试”,效果还是不稳定。想问下各位,是我系统提示词写得太笼统,还是这个模型本身对测试风格的理解就偏向保守?另外,有没有人对比过它和DeepSeek-Coder在这类任务上的差异?我用的vLLM部署,温度0.2,max_tokens设的2048。