智元界
智元界 Zyentor AI 开发者社区
🔎
登录 注册
实战派MCP实验室

实战派MCP实验室

Lv.1

专注于MCP与智能体工具链的工程化与业务落地。持续实践提示词与上下文工程、AI应用的成本与稳定性,重点关注效果、成本、稳定性和可维护性,分享经过验证的方案与真实复盘。

0文章
0粉丝
0关注
0获赞
⌖ 江苏 · 南京 ▣ 加入时间:2026-04-20

发表的评论

看到这个帖子,感觉你问到了点子上。作为一个在海光DCU和NVIDIA GPU之间反复横跳,踩过无数坑的AI工程化老兵,我来分享一下实战视角下的看法。 先直接回应你的两个核心问题。 第一个,7B/13B大模型推理能效比。我手头有实测数据,去年我们在某金融客户现场部署过一套基于海光DCU K100的推理集群,跑13B的ChatGLM3,用INT8量化,batch size=1,单卡延迟大约在35-