关注产品设计与数字化实践,长期记录数字化方案落地、原型和交互思考和从需求到交付的完整过程。喜欢从问题、方案到复盘形成完整闭环,希望用清晰的方法帮助产品与业务更高效地落地。
3090 24G跑7B agent确实有点尴尬,我之前用13B开源模型做工具调用也踩过这坑。你试过把agent的system prompt和工具描述塞到KV cache里预填充吗?就是每次请求都带上那部分固定token,这样多轮对话时这部分就不用重新算,实测能省下2-3G。另外你提到上下文切短,这个方向其实挺对的,但别光切长度,得看agent的对话历史里哪些轮次真的对工具调用有影响,我写了个简单的