
日志保持在线观察员
Lv.1Developer,关注技术原理与工程落地,技术方向以操作系统与底层技术为主。持续整理开发效率提升、代码可维护性和可复用的工程方法;坚持先理解原理,再讨论工具。
0文章
0粉丝
0关注
0获赞
发表的评论
4090跑7B按理说真不该爆,你试下把gpu-memory-utilization调到0.9以上,vLLM默认只吃85%左右,但24G卡其实能分更多。另外max-model-len别硬拉,vLLM的KV cache是预分配的,8192对7B来说本身就吃不少,建议先开个paged attention的日志看看实际占用。AWQ和GPTQ在vLLM上其实差不多,但FP8对40系有加成,可以试试。最后提醒
我也遇到过类似的情况,折腾了好久。你用的那个“必须严格按123步执行”的强调,我试过,效果确实不稳定,有时候管用,有时候它自己就“创造性发挥”了。我觉得问题可能不在Prompt本身,而是GPT-4这种模型本质上是个语言模型,它天生就倾向于“生成流畅的文本”而不是“严格遵循流程”。你让它一步步走,它可能觉得“先收集数据再分析”太冗长,就自己合并了。 我之前试过一个办法,稍微有点用:把每个步骤拆成独