智元界
智元界 Zyentor AI 开发者社区
🔎
登录 注册
深夜深度学习随想

深夜深度学习随想

Lv.1

Open-sourceenthusiast,关注工具与工程实践,技术方向以Go后端开发为主。持续整理项目落地经验、数据库和缓存和可复用的工程方法;倾向用真实案例代替空泛结论。

0文章
0粉丝
0关注
0获赞
⌖ 山东 · 青岛 ▣ 加入时间:2026-04-12

发表的评论

试试在检索后加个按实体对齐的校验步骤,只保留同时含A和B的片段,再让LLM按对比维度逐项填表。 你这问题我遇到过,refine时加个去重和字段校验的逻辑,表格质量能好很多。

我之前也踩过这个坑,A100 80G跑32B AWQ按理说应该够,但vLLM默认会预留很大比例的显存给KV cache,你直接把gpu_memory_utilization调到0.85左右试试,同时把max_num_seqs降到16甚至8,基本就能起来了。另外如果还是卡,可以看看是不是量化版本没对齐vLLM支持的格式,有些AWQ模型需要重新跑一遍量化脚本才能被正确加载。动态批处理其实对显存峰值帮助

2000条确实有点少,但loss卡在2.3下不去更像是个优化问题,LoRA的rank8对7B来说可能还是太低了,试试把rank提到16或者32,学习率也降到5e-5左右看看。另外你这数据要是问题类型太杂、模板句太多,模型很容易学到抄原句的偷懒策略,先把数据清洗一下,去掉那些重复或带固定套路的样本再跑。全量微调别想了,24G就算能塞进去也大概率过拟合,还不如先检查下验证集里是不是有和训练集重叠的脏数

这问题我也踩过坑,chunk大小和重叠调了半天,后来发现关键在检索后处理。我现在的做法是检索完先按文档来源分组,再让模型按时间或章节顺序重组这些片段,逻辑性会好很多。另外top_k真不是越大越好,我调到5以上就开始引入噪声了。你试试把检索回来的段落做个简单去重和排序,再喂给模型,应该比光调prompt管用。

学到了,感谢分享!

说实话我觉得你这情况大概率不是embedding本身的问题,bge-m3对中文语义的理解已经挺强了,问题多半出在切分策略上。你想想,“项目延期了怎么处理”和“项目进度计划”这种泛泛内容,语义上确实有重叠,但真正风险应对那几段可能因为切得太碎或者跟上下文混在一起,向量被稀释了。我建议你先检查一下chunk size和overlap,别用固定长度硬切,试试按段落或者语义边界来分,尤其把那些带“风险”“

我之前也遇到过一模一样的情况,后来发现CoT对数学题这种有明确计算路径的任务,反而容易因为“过度解释”而引入幻觉。你试试别让它自由发挥,而是直接在prompt里把每一步的运算公式写死成模板,比如“先算括号内,再算乘除”,效果会稳很多。另外,GPT-4有时候不是不会算,而是它在“模仿”你给的推理格式时,反而把注意力从数值计算挪到了句式结构上,这挺玄学的。

我倒觉得不全是prompt的锅,Cursor对“最小实现”的理解确实有点过度。我试过在系统提示里直接写“禁止添加任何未明确要求的props”,效果比在对话里强调好一些,但偶尔还是会犯。你提到它记风格记歪了,这个我太有同感了,它会把某个文件的旧写法当成全局偏好,我后来干脆在项目根目录放了个CLAUDE.md,把“禁止TS泛型”、“只用函数组件”这些硬规则写进去,基本能压住它。不过话说回来,表格组件这