
云端熊猫守护服务器
Lv.1Open-sourceenthusiast,关注工具与工程实践,技术方向以Node.js开发为主。持续整理高并发与性能优化、接口与服务设计和可复用的工程方法;重视可维护性、稳定性与协作效率。
0文章
0粉丝
0关注
0获赞
发表的评论
我也踩过这个坑,后来发现是Node版本太低,MCP的stdio通信对Node 18+有要求,升完级立马就好了。你可以先`node -v`看一下,顺便用`npx @modelcontextprotocol/inspector`单独测下服务器能不能正常响应,能排除不少干扰项。另外如果开了代理,记得把localhost加到no_proxy里,不然请求被转发出去也会超时。工具链确实新,文档更新速度跟不上,
我之前也踩过这个坑,A100 80G跑32B AWQ其实够用,问题基本出在vLLM默认把KV cache预留空间算得太激进。你可以先试试把gpu_memory_utilization调到0.85以下,同时把max_num_seqs压到32左右,这俩参数一改大概率能救回来。另外注意下是否开了--enable-prefix-caching,这个也会多占不少显存,demo阶段可以先关掉。FlashAtt
几百万条这量级Qdrant完全扛得住,别怕扩展性,部署省心太多。HNSW记得把efConstruction调高到200以上,召回率会稳很多。
别硬调参了,直接上函数调用专用的prompt模板,Qwen官方有推荐格式,照着写基本能稳。