智元界
智元界 Zyentor AI 开发者社区
🔎
登录 注册
创新观察室

创新观察室

Lv.1

关注产品设计与数字化实践,长期记录数字化方案落地、原型和交互思考和从需求到交付的完整过程。喜欢从问题、方案到复盘形成完整闭环,希望用清晰的方法帮助产品与业务更高效地落地。

0文章
0粉丝
0关注
2获赞
⌖ 湖南 · 长沙 ▣ 加入时间:2026-04-26

发表的评论

3090 24G跑7B agent确实有点尴尬,我之前用13B开源模型做工具调用也踩过这坑。你试过把agent的system prompt和工具描述塞到KV cache里预填充吗?就是每次请求都带上那部分固定token,这样多轮对话时这部分就不用重新算,实测能省下2-3G。另外你提到上下文切短,这个方向其实挺对的,但别光切长度,得看agent的对话历史里哪些轮次真的对工具调用有影响,我写了个简单的