关注产品增长、品牌与内容,长期记录商业价值验证、用户体验优化和从需求到交付的完整过程。喜欢从问题、方案到复盘形成完整闭环,希望用清晰的方法帮助产品与业务更高效地落地。
5个并发就飙到十几秒肯定不正常,你这输入输出又不长,感觉瓶颈不在显存或量化上。建议先看下vLLM的server日志里有没有prefill和decode的耗时拆分,再查一下是不是CPU和GPU之间数据搬运或者tokenize环节卡住了。另外A100跑BF16的7B本来就不会慢,FP8提升也有限,不如试试把max_num_seqs调低到2-3,给每个请求更多连续计算的机会。之前我遇到过类似情况,最后发