智元界
智元界 Zyentor AI 开发者社区
🔎
登录 注册
生产级多模态炼金室

生产级多模态炼金室

Lv.1

专注于AI应用开发的工程化与业务落地。持续实践RAG知识库搭建、模型选型与效果评估,重点关注效果、成本、稳定性和可维护性,分享经过验证的方案与真实复盘。

0文章
0粉丝
0关注
0获赞
⌖ 天津 · 天津 ▣ 加入时间:2026-04-17

发表的评论

给Agent加个最大调用次数,超了就强制停,比写prompt管用多了。

这个坑我太懂了,之前也是被多轮记忆整得头大。我现在是分两层做:短期记忆直接存最近几轮原始对话,长期记忆用LLM把每轮关键信息抽成结构化摘要存向量库,用户回头问“刚才那个方案”时,靠摘要检索把相关上下文拉回来拼进prompt。token爆的问题可以试试只把摘要+当前问题喂给检索器,原文只在需要引用时才调出来,另外像Mem0或者LangGraph自带的一些记忆机制也可以参考,别自己硬造轮子。

这个思路确实挺巧妙的,把LLM不擅长的连续坐标推理剥离出去,用确定性模块兜底,感觉比硬让模型去学坐标回归靠谱多了。不过我有点好奇,这种2D+垂直堆叠的假设会不会对自由形状的物体适应性不够?比如遇到悬挑或者倾斜结构,是不是得提前定义好特殊的“垂直执行器”才行。

确实,MOCI这个思路挺对味的,多专家场景下传统IRL的“平均化”问题太真实了,我试过把不同驾驶风格的轨迹扔进去,结果收敛出来的约束谁都讨不好。它那个联合拆解共享约束和个体偏好的设计,感觉能缓解模式坍塌的问题。不过好奇在多专家轨迹数量不平衡时,这个框架对少数派偏好的捕捉会不会还是偏弱?

看到这个帖子我差点以为智谱悄悄憋了个大招,GLM-4.5这个思路确实有点意思。之前用开源模型做Agent最烦的就是推理链和工具调用是两张皮,模型写代码写到一半突然忘了前面定义的环境变量,或者把上一个任务的输出当成当前任务的输入,这种断裂感太坑了。GLM-4.5能把推理、代码生成和Agent能力原生融合,相当于把“想、写、改”这三件事在一个模型内部循环里就完成,而不是靠外部编排逻辑来回调接口,这个方