
深夜网络笔记
Lv.1主要整理网络技术相关的学习笔记与工程经验,内容覆盖项目复盘、架构设计。习惯用项目结果检验技术判断,希望把复杂问题讲清楚、把实践步骤写完整。
发表的评论
本质上确实是标准化和生态的问题,function calling各家各写各的,MCP是想让工具接入一次到处能用。
说实话你这个情况我太有同感了,之前做合同审查的RAG也这样,检索top5里明明有正确答案,prompt怎么调都像在抽奖。我个人感觉你那个“年假怎么算”和“入职两年能休几天”的差异,问题可能真不全在prompt,而是向量检索本身对“入职两年”这种隐含条件不敏感,它抓的是字面相似,不是逻辑等价。所以与其纠结模板顺序,不如先看看召回内容里到底有没有“两年对应5天”这类具体规则,如果召回里没有,那prom
MCP确实能让AI执行命令,但得配好权限和本地服务,不然连不上很正常。我试过让它跑测试,能改代码但bug还得自己盯着。 --- 别指望全自动修,MCP主要帮AI读上下文,执行命令要看工具支不支持。你这Node连不上八成是环境变量没配对。
我之前也踩过这个坑,后来发现问题多半不在embedding和chunk,而在query本身太短太泛。“怎么退款”这种问法,语义上跟“换货流程”确实有重叠,模型分不清很正常。你可以试试先做个query改写,把用户问题扩写成几个具体子问题,比如“退款条件是什么”“退款步骤有哪些”“退款多久到账”,然后再分别去检索,最后合并结果。另外rerank别一上来就上重模型,先试试用BM25和向量检索做混合召回,
这问题太真实了,我最近也踩过这个坑。后来把few-shot从3个砍到1个,再把system prompt里那些角色定义压缩成一句话,瞬间就轻松了,你可以试试给模板设个“精简版”和“完整版”双档位,按任务复杂度切换。另外MCP好像确实没有内置的token预算控制,但可以自己在注入变量时做个长度检查,超了就直接降级模板,比硬撑强。
试试把常用组件抽成snippet或者自定义指令,让它照着你的模板写,比prompt管用多了。
我之前也踩过这个坑,光调chunk_size没啥用,后来发现是标题层级被打散了。你可以试试按文档结构走,比如markdown header或者PDF的标题样式来切,再不行就搞个段落合并,把同一个小节的内容先拼一起再分。另外检索那边也可以加个rerank,不然光靠向量相似度确实容易跑偏。
说实话这情况我上周刚遇到过,加代理池确实能撑久一点,但成本和技术门槛都在那,如果目标站反爬策略升级快,不如先试试Selenium带指纹伪装,配合随机点击和滚动,比纯requests稳不少。至于代码重构,我建议你让AI先按模块拆分成独立的函数,比如请求、解析、存储分开,别急着改逻辑,等结构清晰了再逐步替换掉容易触发风控的部分,这样就算改崩了也容易定位。对了,你试过用playwright的stealt
这问题我熟,之前用Cursor写爬虫的时候也被它坑过,明明定义好的变量名,下一行补全就给我改成别的了。后来我发现一个稍微管用的土办法,就是先不急着写逻辑,把整个函数要用的变量全在开头用空值或者占位符声明一遍,而且声明的时候故意把类型写在变量名里,比如user_input_str,这样它就不太敢瞎改了。另外,你可以在Cursor的设置里找一下,有个控制补全保守程度的选项,调低一点它就不那么爱自作主张