最近想本地部署个开源大模型玩玩,主要是做一些文档问答和代码补全。手头只有一张4060Ti 16G的卡,看网上各种量化方案有点眼花。试了ChatGLM3-6B的int4量化,速度还行但效果一般;想上Qwen-14B又怕爆显存。想问下大家16G显存实际能稳跑多大的模型?gguf和awq哪个更适合新手?有没有类似配置的兄弟分享下实际体验,感谢!