
企业级MCP开发日志
Lv.1专注于MCP与智能体工具链的工程化与业务落地。持续实践企业场景落地、AI应用的成本与稳定性,重点关注效果、成本、稳定性和可维护性,分享经过验证的方案与真实复盘。
发表的评论
背景信息放system里容易让模型“分心”,放user消息里跟任务绑定反而更听话,可以试试。
先确认下MCP server是不是真的跑起来了,unexpected EOF八成是进程没起来或者端口被占,`npx`手动启动一次看输出最快。
降维这个事我踩过坑,768降到256对中文长文本确实容易飘,尤其产品手册里术语多,语义边界本来就细。建议你保留原始维度,但用faiss的PQ或IVF压缩索引来省内存,效果比直接砍维度稳。增量更新的话,Milvus的partition和dynamic schema更省心,Weaviate也还行,但别指望faiss那套手动管理能撑住十几万条以上的持续更新。内存估算大概就是embedding维度乘4字节
few-shot确实管用,我试过塞一个带全量行内注释的样例后,稳定性明显上来了。
几千条QA对其实不算少了,关键看你这批数据跟实际检索场景的分布像不像。我之前试过用5000条领域问答微调bge-base,检索命中率大概能涨个8到10个点,但前提是这些QA对里的问题和用户真实query风格比较接近,不然微调完可能只是过拟合到你的训练集上,泛化反而变差。 关于向量空间这个坑我必须提醒你,微调后模型输出的embedding分布一定会发生变化,旧索引肯定要重建,而且最好连chunk粒
我之前也踩过这个坑,后来发现是Node版本太老导致的,官方模板对Node 18+有依赖,升完级秒连。你可以先`node -v`确认下,如果版本没问题再检查下config里有没有写绝对路径,相对路径有时候会莫名触发超时。另外Claude Code最近更新挺频繁的,说不定是它自己改了握手协议,你留意下GitHub issues,昨天还有人报类似问题。
你说得太真实了,尤其那个“demo在展台上光鲜,一落地就翻车”的体验,我做嵌入式开发的也深有感触。去年我们给一个物流分拣项目试过某家的机械臂方案,宣传里吹得天花乱坠的“自适应抓取”,结果实际跑起来,稍微换个光照角度或者物料堆叠方式就频繁误判,最后只能退回定制化夹具的老路。 关于你提的“通用性vs专用性”问题,我最近也在想:现在大家一窝蜂追通用大模型那种“one model fits all”的思
同感,8G显存跑Llama 3.1确实太极限了,我试过Q4_K_M之后也是慢到怀疑人生。不过你说ollama直接爆显存,我猜可能是ollama默认的context长度或batch size没调?ollama有个环境变量OLLAMA_NUM_PARALLEL可以限制并发,但更关键的是ollama的量化版本可能不是最激进的,它默认的4bit可能比llama.cpp的Q4_K_M精度高一点但更吃显存。你