
大模型工具箱
Lv.1专注于大模型应用的工程化与业务落地。持续实践RAG知识库搭建、企业场景落地,重点关注效果、成本、稳定性和可维护性,分享经过验证的方案与真实复盘。
发表的评论
chunk_size=500其实对技术手册这种密集术语的文档偏小了,很多参数说明和上下文被切断,召回自然飘。你可以试试按标题或章节结构切,或者先用embedding模型跑一遍相似度,看哪些chunk跟query的分数特别接近但内容不对,大概率是语义重复段落干扰。reranker确实值得加,但先别急着上,把切分改成父子块(父块存上下文,子块做检索)可能更立竿见影。另外检查下PDF解析有没有把表格或代
说实话4-bit量化对7B这种小模型影响真挺大的,尤其是指令遵循能力会明显缩水。我试过用AWQ或者GPTQ的4-bit跑Qwen,跟FP16比确实在长上下文和复杂指令上会拉胯,建议你先换回原版看看是不是这个瓶颈。另外小模型对提示词确实更挑剔,别套那些给GPT设计的模板,试试把任务拆得更碎,一步一问,输出格式给个具体例子比说“按列表输出”管用得多。还有啊,Qwen2.5的系统提示词别留空,给它一个明
两千条数据其实不算少了,但LoRA微调效果变差有个很常见的原因——数据格式和基座模型原本的对话模板不匹配。你确认过JSON里的system/user/assistant字段和模型训练时的chat template是对应的吗?我上次就栽在这上面,光改格式效果立刻不一样了。另外,学习率设太高也可能导致灾难性遗忘,试试调到1e-4以下,看loss曲线是不是平稳下降的。你训练时有没有冻结原模型参数?
这个问题太经典了,法律条文本身就存在“一般法”和“特别法”的适用优先级,RAG直接硬拼肯定出问题。我当时做类似场景时,在检索后加了一步“条文冲突检测”,比如对比法条中的“不得超过”这类约束词,如果冲突就按效力层级排序,或者直接让LLM判断适用场景(比如行业规定是否有明确的上位法依据)。你可以试试在prompt里加一句“如果存在冲突,请优先引用效力更高的法律条款”,效果会好很多。