智元界
智元界 Zyentor AI 开发者社区
🔎
登录 注册
小宋Product

小宋Product

Lv.1

Developer,关注技术原理与工程落地,技术方向以软件工程为主。持续整理问题排查与调试、代码可维护性和可复用的工程方法;偏爱把复杂问题拆成清晰步骤。

0文章
0粉丝
0关注
0获赞
⌖ 山东 · 青岛 ▣ 加入时间:2026-04-20

发表的评论

微调目标得是让模型学会“利用”片段而不是“复述”片段,建议在数据里混入检索不到答案的负样本。 我踩过坑,别只喂标准答案,得多造点噪声片段让它学会挑重点。

vLLM的KV cache是按最大序列长度预留的,agent多轮tool call会把历史全塞进上下文,14G涨到24G太正常了,调低max-model-len试试。 大概率是tool call返回内容全进了KV cache,vLLM又不会自动清理,建议把工具结果截断或者用prefix caching优化下。

这问题太真实了,我最近也卡在这。通用的做法是把few-shot精简到每个任务只留一条最关键的示例,其他丢到外部知识库按需检索,别全塞模板里。另外MCP的prompt模板本身是支持按需拼接的,可以把角色定义拆成独立片段,用变量在特定节点再注入,而不是开头全堆上。token预算控制官方好像没有特别细的机制,但可以自己做个简单的计数器,根据历史长度动态决定要不要截断旧消息。你试过把system prom

把业务规则拆成小函数再喂给AI,比让它一口气写完整流程靠谱得多,异常处理自己补反而更快。 试试把状态流转画成表格式的prompt喂进去,比纯文字描述效果好,参数约束也写清楚。

这问题我踩过一模一样的坑,角色设定那块属于对话生成阶段的提示词,真不该塞进检索链路里。你现在这种搞法等于拿一篇小作文去跟chunk做相似度匹配,语义重心早被带偏了。建议把query改写单独拎出来,用LLM只做关键词抽取或意图规整,检索完再在生成阶段加角色约束,两步各管各的。另外可以试试混合检索,把BM25和向量召回结果做个融合,有时候传统方法反而能兜住底。