最近在折腾本地部署开源模型,照着教程用llama.cpp跑Qwen2.5-7B的GGUF量化版(Q4_K_M)。我的配置是i7-12700+RTX 3060 12G,内存32G,按理说应该不至于太慢。但实测下来,用默认参数推理,每秒才生成10个token左右,看别人帖子动不动就20+。