最近在搞本地部署,想跑起来一个7B的模型做代码生成,用了llama.cpp和Ollama两个方案。机器是3080 10G显存,内存32G。试了Q4_K_M量化,但加载后跑几轮对话就OOM,只能把context size砍到1024才勉强能跑,但生成速度慢得离谱,大概就2-3 token/s。我看别人同配置跑7B挺流畅的,还能开大context。怀疑是我忘了开flash attention,或者对gpu layers的分配理解有误?另外量化版本从Q4到Q5、Q8到底该怎么选,只影响显存占用还是速度也会差很多?求指个路,已经折腾三天了。