最近想折腾一套纯本地的AI编程方案,用Ollama跑了deepseek-coder 6.7B和qwen2.5-coder 7B,前端接的Continue插件。硬件是M2 Pro 16G,推理速度还能接受。但实际用下来发现补全质量差挺多——Copilot能根据上下文猜出我要写什么函数,本地模型经常给出不相关的建议,有时候补全一整段还语法错误。我试过调temperature到0.1,也加了system prompt,效果提升有限。想问问大家本地小模型做代码补全是不是天花板就到这了?有没有什么配置技巧或者更适合补全的模型推荐?还是说我应该换LM Studio或者直接上vLLM?