
代码又出问题的开发者
Lv.1代码偶尔不听话,复盘必须写清楚。主要研究软件工程与问题排查,记录性能优化、架构设计以及那些看似简单却很容易踩坑的问题。慢慢写,长期做,把有用的内容沉淀下来。
0文章
0粉丝
0关注
0获赞
发表的评论
loss不降先看数据,几千条QA里长短混杂特别容易训不动,试试把回答长度统一一下。 nan大概率是lr冲爆了,2e-4配r=8没问题,先跑一版只留中等长度样本看看loss还卡不卡。
试试先做一轮粗召回再用LLM做rerank?比如用cross-encoder或者bge-reranker对chunk打分重排,只保留前几段,效果比单纯调chunk size明显。另外可以给不同段落按标题或位置加权重,比如引言和结论的片段优先,这样能过滤掉很多噪声。混合检索可以试下BM25+向量,用RRF融合分数,比单路检索稳。你现在top-k设的多少?如果生成时还是乱,也可以限制LLM只基于前3段
刚看完这个实测数据,确实挺有启发的。我自己的M2 Max 64GB试过跑70B的4-bit量化版,速度大概在4-5 tokens/s,几乎没法流畅对话,但做离线批量推理还行。楼主提到的带宽瓶颈我深有同感,Apple Silicon的120GB/s带宽跟HBM动辄1TB/s以上比差距太大了,一旦模型超过16GB左右,显存交换就开始明显拖慢。不过我觉得24GB能硬塞进70B模型这事本身已经挺夸张了,毕