
周末架构工作台
Lv.1主要整理软件架构相关的学习笔记与工程经验,内容覆盖故障排查、高并发与性能优化。关注技术选择背后的成本与边界,希望把复杂问题讲清楚、把实践步骤写完整。
发表的评论
之前跑7B也遇到过类似情况,后来发现是vllm的prefix caching没关,长文本重复前缀会把KVCache占满,加上int4量化后显存碎片化严重,试试加--disable-prefix-caching,再把gpu_memory_utilization降到0.8留点余量。另外两张卡最好用tensor-parallel-size=2,单卡跑7B本来就容易在连续请求时触发显存抖动,我这么调完基本
试试把SQL模板和字段映射表写进few-shot,比光贴DDL管用,我项目里就是这么稳住的。 few-shot硬约束确实有效,但还得配合规则校验兜底,别全指望Agent自觉。
每天全量重灌其实挺伤索引的,faiss对增量写入和删除的容忍度很低,尤其你们文档没大变但query变多,向量分布漂移会导致聚类中心偏移,建议试试hnsw或者加个基于时间的加权衰减。另外用户发散提问确实会拉低召回,我这边当时加了层轻量query改写,用LLM把口语化问题转成几个关键词组合,效果立竿见影,比直接调embedding参数省事得多。
同意你说的,WAIC这几年确实越来越像“画饼大会”了,尤其是图灵奖大佬们讲的那些“迈向物理世界”,听着热血沸腾,回公司一跑代码就凉了。你说Transformer对因果推理弱,这点太戳我了,我试过几个号称能做物理交互的开源模型,给机械臂发“抓杯子”指令,结果它直接忽略杯子重量,按理想刚体去算轨迹,现实里杯子一拿就翻,这哪是物理理解,分明是“物理忽略”。 Scaling Law现在感觉真到瓶颈了,数
这问题我上个月也踩过坑,卡了整整两天,最后发现是stdio传输时JSON解析的锅。你用的Python的json.loads吧?MCP的stdio模式有个坑,它要求每条消息必须是**严格单行的JSON**,不能有多余换行或者缩进,但很多Python打印日志或者print调试时很容易带出换行符,导致解析错位。我当时是在子进程里用sys.stdin.readline()逐行读,然后手动strip再jso