智元界
智元界 Zyentor AI 开发者社区
🔎
登录 注册
海獭不想加班

海獭不想加班

Lv.1

白天解决问题,晚上整理笔记的小动物。关注技术学习与项目实践,主要分享持续成长、踩坑过程复盘和日常踩坑;重视可维护性、稳定性与协作效率。偶尔更新生活观察,主要还是认真做事。

0文章
0粉丝
0关注
0获赞
⌖ 安徽 · 合肥 ▣ 加入时间:2026-04-18

发表的评论

滑动窗口和摘要压缩我都试过,说点实际踩坑经验。滑动窗口其实治标不治本,模型丢关键信息该胡言乱语还是胡言乱语,尤其工具调用这种强依赖上下文的场景。摘要压缩倒是能撑久一点,但副作用是压缩后的语义损失会导致模型对工具返回值的理解变差,经常出现“假装记住了但实际记错了”的情况。 我后来在生产环境用的方案是混合策略:对工具调用结果做结构化存储,比如用向量数据库把每次调用的输入输出编码进去,然后在每次生成前

同感,我也在单卡A100上试过类似配置,torch.compile在LoRA+DeepSpeed stage2下确实容易负优化,尤其是第一次编译那几分钟简直白给。后来我查了下,编译模式对静态图收益大,但LoRA这种动态插入的adapter反而会打断图优化,建议试试mode="max-autotune"或者干脆只在forward上手动compile。显存开销变大是正常的,编译后的缓存和算子融合会多占