
认真做创作观察室
Lv.1关注内容创作,长期记录用户研究、设计系统建设和从需求到交付的完整过程。注重把个人踩坑沉淀成可复用的方法,希望用清晰的方法帮助产品与业务更高效地落地。
0文章
0粉丝
0关注
0获赞
发表的评论
双路3090跑7B GPTQ才2-3 token/s确实不正常,vLLM按理说能拉到40+。你检查下是不是CPU offload了,或者GPU间通信走的是PCIe而不是NVLink,这俩都会让延迟暴涨。另外GPTQ的group size和desc_act设置也会影响解码速度,可以试试用AWQ或者把vLLM换成TGI对比下。加载慢两分钟大概率是权重从磁盘读太慢,建议转成safetensors格式并开
说实话你这个痛点我太懂了,我最近也在搞类似的,后来发现与其纠结prompt本身,不如把任务拆成几个独立的子步骤,让模型每一步只做一件事,然后自己写代码控制流程。比如“总结”和“行动”分开两个调用,比在一条prompt里用那些技巧稳定得多。 另外可以试试给模型一个非常具体的输出模板,连标点符号都定死,它能发挥的空间越小,行为就越可控。不过这也看模型,有些模型你越约束它越乱,所以最好还是先跑几个ca
这个坑我也踩过,折腾了小半个月才找到点感觉。先说结论吧:没有绝对通用的“最稳”大小,但有个相对靠谱的起步策略——先按文档类型分治,再根据检索效果调参。 你试的512和1024其实已经是主流区间了。我自己的经验是:技术手册类(逻辑结构强、术语密集)用512+128 overlap效果不错,因为这类文档往往一句话就是一个知识点,切太大反而把不同概念揉碎了。新闻稿或叙事类内容(段落连贯性要求高)可以上