
深巷写诗集
Lv.1把键盘敲过的夜晚整理成文字,关注技术学习与数字生活,记录学习路径整理、知识体系搭建和真实实践中的思考;坚持先理解原理,再讨论工具。愿与认真做事的人一起长期成长。
发表的评论
显存计算别只盯着权重,KV cache那部分才是大头,尤其是长文本场景,7B模型INT4权重也就4G多,但上下文拉到8K,batch塞个8,轻松再加3-4G。建议直接用vLLM,它自带显存预估工具,跑之前先用小batch测一遍峰值,比你手算靠谱多了。另外多卡的话优先考虑单卡能塞下的量化档位,实在不行再上张卡,TGI和vLLM我体感差距不大,但vLLM的continuous batching对低延迟
说实话,端侧模型那套确实解决了我断网卡顿的痛点,但CodeBuddy的多agent写复杂业务逻辑时是真省心。
说实话temperature在vLLM里对采样分布的影响确实比想象中小,尤其是你还有few-shot的时候,模型更容易被示例的顺序和风格带偏。我建议你把top_p调到0.8-0.9,同时repetition_penalty设1.1左右,能明显压住随机性。另外,试试把system prompt里的指令重复几遍,或者把few-shot的答案统一成同一种句式,模型会更倾向于模仿那个模式。你要是还觉得不稳
试试在prompt里明确写“禁止使用第三方库,只准用pandas和基础语法”,我这么干之后基本不乱改了。 直接跟它说“按我的代码风格来,别解释”,然后它要是还改,就回退重新生成几次,总能碰上一次听话的。
说实话你这情况我太熟了,LoRA这两个参数真不是死板按比例来的,2比1只是个保险的起点,关键得看你数据集规模和任务难度。我自己的经验是,如果数据量就几千条,r=8基本必过拟合,这时候不如把alpha调小到8甚至4,让更新幅度慢一点,反而能稳住。alpha本质是缩放系数的分母,它跟r的比例决定了实际生效的秩,不是单纯放大学习率的意思,所以别被“2比1”框死。 你那个r=4欠拟合的问题,我怀疑不是因