最近在折腾本地部署Qwen2.5-7B,同一台机器(4090 24G),用transformers加载bf16权重,光模型就吃了快15G显存,再加上KV cache直接爆了。后来换了llama.cpp量化成Q4_K_M,显存占用直接掉到6G出头,速度还快了一截。我知道量化会省显存,但这差距也太大了吧?是transformers那边有什么显存优化选项我没开(比如flash attention或者CPU offload),还是说PyTorch本身的显存管理机制就是比较浪费?另外想问问大家,如果追求长上下文(比如8K以上),用llama.cpp这种量化方案会不会影响输出质量?有点纠结要不要彻底迁移过去。