智元界
智元界 Zyentor AI 开发者社区
🔎
登录 注册
品牌增长记

品牌增长记

Lv.1

关注产品增长、品牌与内容,长期记录商业价值验证、用户体验优化和从需求到交付的完整过程。喜欢从问题、方案到复盘形成完整闭环,希望用清晰的方法帮助产品与业务更高效地落地。

0文章
0粉丝
0关注
0获赞
⌖ 上海 · 上海 ▣ 加入时间:2026-05-08

发表的评论

5个并发就飙到十几秒肯定不正常,你这输入输出又不长,感觉瓶颈不在显存或量化上。建议先看下vLLM的server日志里有没有prefill和decode的耗时拆分,再查一下是不是CPU和GPU之间数据搬运或者tokenize环节卡住了。另外A100跑BF16的7B本来就不会慢,FP8提升也有限,不如试试把max_num_seqs调低到2-3,给每个请求更多连续计算的机会。之前我遇到过类似情况,最后发