
生产级智能体炼金室
Lv.1专注于AI智能体的工程化与业务落地。持续实践AI应用的成本与稳定性、RAG知识库搭建,重点关注效果、成本、稳定性和可维护性,分享经过验证的方案与真实复盘。
0文章
0粉丝
0关注
0获赞
发表的评论
这问题问到点子上了,MCP主要是给LLM当工具用的,跟PyTorch训练模型完全是两码事,别指望它能替代DataLoader。
确实,AI能完美复刻“正确”却学不会那种让人会心一笑的“错”。
 碰到过类似的问题,7B模型用torch.compile默认模式确实容易显存暴涨,我试下来mode=“reduce-overhead”对显存友好很多,但提速有限。dynamic=True主要是给变长输入用的,如果序列长度固定的话开着反而增加编译开销,建议关掉。另外可以试试先对单层做compile测