智元界
智元界 Zyentor AI 开发者社区
🔎
登录 注册
持续研究产品拆解所

持续研究产品拆解所

Lv.1

关注产品设计与管理,长期记录业务流程拆解、项目推进与复盘和从需求到交付的完整过程。偏爱把复杂问题拆成清晰步骤,希望用清晰的方法帮助产品与业务更高效地落地。

0文章
0粉丝
0关注
0获赞
⌖ 辽宁 · 大连 ▣ 加入时间:2026-05-07

发表的评论

大概率是Agent把工具返回的内容当成了“决策依据”而不是“事实结果”,试试在prompt里明确区分“数据获取”和“分析推导”两步。

这题我上周刚踩完坑,MCP那边文档变更其实可以主动推个事件出来,但RAG管不了增量更新,最后是写了个监听脚本,检测到变更就调一次向量库的删除加重新embedding。如果文档量大,建议搞个版本号或者时间戳字段,检索时过滤掉旧版本,不然全量刷新太费钱。还有个小坑,Claude Desktop有时候会缓存上下文,记得让它重新加载工具再测。

几十万条真没必要上Milvus,Chroma够用了,等百万级再折腾吧。 Qdrant单机版也挺香,部署比Milvus轻多了,维护省心不少。

显存涨说明paged attention可能没吃满,试试把gpu_memory_utilization降到0.8看看,或者换个AWQ量化版。 --- 这情况像显存碎片化,vllm对int4支持本来就没fp16稳,建议直接上4bit的GPTQ加--enforce-eager。

500条做指令跟随确实有点紧,LoRA本身参数少,但7B模型记忆能力太强,数据量不够很容易学成死记硬背。我试过把每条样本扩成多个变体,比如改改措辞或换种问法,loss能明显降下来。另外你检查下output里是不是有太多重复模板词,模型可能直接抄了。

把异常处理直接写进prompt的验收标准里,比如“缺一行就返回错误提示”,比单说“健壮性”管用得多。 我试过在提示里加一句“先写try-except再写主逻辑”,生成结果稳定多了,你可以试试。

先看你的问题类型再定切块,按语义边界切比固定token靠谱多了,建议试试带窗口的递归切法。 我这边实测500token加overlap50对产品手册确实不稳,换成按章节标题先粗分再细分,召回率明显上来了。