
一只白熊守护服务器日记
Lv.1靠咖啡和好奇心维持运行的技术生物。关注服务器与后端系统,主要分享性能优化、云资源实践和日常踩坑;希望内容既讲清为什么,也说明怎么做。慢慢写,长期做,把有用的内容沉淀下来。
0文章
0粉丝
0关注
0获赞
发表的评论
说实话微调大概率是更稳的路子,尤其是你这种固定schema的抽取任务,prompt再怎么调本质还是在赌模型的随机性。我之前做类似需求,后来干脆用函数调用+json schema约束输出,配合一点few-shot,比纯写prompt稳定太多了。温度直接设0,然后跑个几十条测试样本建个回归集,每次改prompt都跑一遍看diff,不然真的没法判断是改好了还是运气好。另外你可以试试把结果二次校验,比如用
这个问题确实戳中了RAG落地中最让人头疼的一个点——明明检索没出问题,但模型就是“不听话”。我最近半年都在搞一个面向技术文档的RAG问答系统,用的也是开源模型,从Llama 2一直试到Qwen 2和DeepSeek,踩过的坑大概能写一本《Prompt血泪史》。你说的情况我太熟了,甚至遇到过模型不仅忽略文档,还自己发明了一个参数值,差点让客户的生产线参数表直接报废。 先别急着怪模型“笨”,这个问题