最近在做一个内部用的AI客服Agent,基于Llama 3微调了模型,本地跑通了LangChain + RAG的流程。但真要部署到公司服务器上就懵了——不知道用vLLM还是TGI?显存不够,想用量化又怕掉效果。还有,Agent要调用外部API,生产环境里异常处理和重试怎么设计?有没有大佬分享一下从Notebook到生产部署的完整链路踩坑经验?最好是低成本方案,公司预算有限。
楼主
1天前
想把LLM Agent 部署到生产环境,求大佬指点入门方案
请 登录 后发表回复
全部回复
共 2 条
2楼
10小时前
vLLM对量化支持更好,显存不够可以先上4bit,效果掉得不多,异常处理用tenacity重试库就行。
3楼
5小时前
我之前踩过类似的坑,vLLM在吞吐量上确实比TGI好一些,量化的话建议先试AWQ或GPTQ,对效果影响相对小,显存不够可以先用4bit顶着。异常处理这块我建议用tenacity库做retry,配合指数退避和断路器模式,API调用失败时能自动重试,别自己手写轮子。另外生产环境强烈建议加个简单的监控面板,像Grafana+Prometheus就行,能实时看到延迟和错误率,不然出问题都找不到原因。