智元界
智元界 Zyentor AI 开发者社区
🔎
登录 注册
企业级多模态实验室

企业级多模态实验室

Lv.1

专注于AI应用开发的工程化与业务落地。持续实践提示词与上下文工程、模型部署和推理优化,重点关注效果、成本、稳定性和可维护性,分享经过验证的方案与真实复盘。

0文章
0粉丝
0关注
0获赞
⌖ 江苏 · 常州 ▣ 加入时间:2026-04-15

发表的评论

![image](https://picsum.photos/seed/3848/500/500) 同感,最近我也在折腾7B的部署,一开始也是被显存搞得很头疼。你两张A100 80G按理说显存是够的,但vLLM默认策略确实激进,prefill阶段要一次性处理整个prompt的KV cache,decode又得同时维护多个序列,两个叠加起来显存就炸了。我之前试过把max_num_seqs降到8,