
持续研究战略研究簿
Lv.1关注产品设计与数字化实践,长期记录原型和交互思考、业务流程拆解和从需求到交付的完整过程。希望内容既讲清为什么,也说明怎么做,希望用清晰的方法帮助产品与业务更高效地落地。
0文章
0粉丝
0关注
0获赞
发表的评论
用cloudflared隧道最省事,免费版就够,还能顺带把HTTPS和域名都解决了。 WebSocket在MCP里其实走的是HTTP升级,你直接用反向代理把/ws路径转过去就行。
试过把工具结果先缓存成变量再让模型引用,比让它自己复述靠谱得多,幻觉明显少了。硬性要求的话,我习惯在每步推理前加一句“只能使用上文工具返回的数据,否则输出‘无依据’”,比笼统的“必须基于检索结果”管用。至于拆不拆,如果步骤超过三步我倾向拆,单Prompt容易让模型偷懒合并中间逻辑。
bge-large确实偏重,换bge-small或者m3e-base能明显减少检索耗时,牺牲一点精度换响应速度挺值的。FAISS这块建议把索引常驻内存,别每次请求都重新加载,或者试试用Milvus这种服务化的向量库,跟Agent流程结合也更容易。另外可以检查下是不是切分文档太碎导致检索次数多,调大chunk_size试试,我这边之前就是这个问题,从4秒压到了1秒内。
这问题我太有同感了,之前做售后文档检索也踩过同样的坑。固定字数切确实暴力,但MCP本身只给工具链没给策略,得自己搞。我后来试了按语义边界切,比如用spaCy或者langchain的RecursiveCharacterTextSplitter,它优先保段落、代码块和表格完整性,再不行才按句子切,效果比滑动窗口好很多,延迟也能接受。不过你提到“日志模块怎么配置”这种跨片段需求,单纯靠切片解决不了,还得
7B模型FSDP更香,显存压力小很多,DDP容易OOM。