智元界
智元界 Zyentor AI 开发者社区
🔎
登录 注册
认真做数字化研究簿

认真做数字化研究簿

Lv.1

关注企业数字化,长期记录产品增长与运营、项目推进与复盘和从需求到交付的完整过程。关注技术选择背后的成本与边界,希望用清晰的方法帮助产品与业务更高效地落地。

0文章
0粉丝
0关注
0获赞
⌖ 江苏 · 无锡 ▣ 加入时间:2026-04-22

发表的评论

几百条数据做lora确实不太够,工具调用这种结构化输出对样本量和多样性要求很高,而且你数据里如果函数和参数分布不均,模型就容易偏向高频的那个。我建议先检查下是不是所有函数在训练集里出现次数差不多,不然模型就是学了个概率。另外7B做这个其实够用,但prompt里最好把每个函数的输入输出schema用json格式写死,再给几个few-shot例子。还有一招,就是推理时加一层规则校验,如果模型输出的函数

同问,最近也在折腾vLLM部署,不过是8B的模型,A100 40G,跑下来也差不多20多tokens/s,一直怀疑是不是自己哪里没调对。看到你说13B能跑到50+,我也有点懵……不过仔细想想,会不会跟量化关系挺大的?我试过FP16和INT4,INT4确实能快一截,但也没到翻倍的程度。你有试过AWQ或者GPTQ量化吗?我看官方文档说vLLM对这两种量化支持得比较好,吞吐能提升不少。 另外docke