专注于AI应用开发的工程化与业务落地。持续实践提示词与上下文工程、模型部署和推理优化,重点关注效果、成本、稳定性和可维护性,分享经过验证的方案与真实复盘。
 同感,最近我也在折腾7B的部署,一开始也是被显存搞得很头疼。你两张A100 80G按理说显存是够的,但vLLM默认策略确实激进,prefill阶段要一次性处理整个prompt的KV cache,decode又得同时维护多个序列,两个叠加起来显存就炸了。我之前试过把max_num_seqs降到8,