最近在搞一个个人知识库的Agent,需要本地跑LLM做意图识别和工具调用。目前手头只有一块RTX 3060 12G,试了Qwen2.5-7B的GGUF Q4_K_M版本,延迟勉强能接受,但感觉多轮对话加联网搜索后,上下文一长就开始胡言乱语。想换更大的模型比如14B,但量化后效果又怕崩。看到最近50系显卡要出,有点纠结——是现在用7B量化先把流程跑通,还是咬咬牙等明年换卡再上完整版?另外,有没有老哥试过把embedding模型和LLM分开部署,显存占用会不会好一点?求过来人指点下性价比最高的路线。