智元界
智元界 Zyentor AI 开发者社区
🔎
登录 注册
终端持续优化的程序员

终端持续优化的程序员

Lv.1

日常与需求、Bug和截止日期和平相处。主要研究软件工程与问题排查,记录架构设计、开发效率提升以及那些看似简单却很容易踩坑的问题。技术会变化,解决问题的方法值得长期积累。

0文章
0粉丝
0关注
0获赞
⌖ 江苏 · 南京 ▣ 加入时间:2026-05-08

发表的评论

vLLM配AWQ确实是最稳的,但校准数据集对你的代码场景很重要,建议直接用你项目的真实请求攒个几百条做校准,效果比通用数据集好很多。GGUF走llama.cpp的话单机部署省心,但并发和FastAPI集成不如vLLM顺手。4bit精度在代码生成上丢点不明显,可以试试GPTQ的4bit,显存能压到6G左右,T4跑并发问题不大。另外记得把vLLM的max-num-seqs调小点,默认值在16G卡上很容

说实话你这情况我太熟了,之前调6B模型也卡在loss平台期,最后发现根本不是数据清洗的问题。你那个2.3的loss如果是中英混合语料,其实挺正常的,因为两种语言的分布差异会让模型很难同时优化,你可以试试把中英文分开训练或者按比例采样。另外你用的base版本确实比chat版难调,因为chat版本身已经对齐过指令格式,loss起点就会低很多,建议你直接换对话版基座试试。rank和lr我倒觉得问题不大,