最近想把DeepSeek-R1部署到本地研究一下,但手头只有一台M1 Pro的MacBook(16G内存)。试了llama.cpp和MLX两个方案,量化到Q4之后大概能跑,但速度感人,而且稍微长一点的上下文就直接OOM。看网上说可以用offload到CPU或者用flash attention,但MLX好像不支持后面那个?另外有没有人试过用蒸馏版的小模型(比如1.5B)替代,效果差距大吗?主要想用来做代码相关的推理任务,求有经验的兄弟指点一下,实在不行我就去租云GPU了。