
隔壁AI工程师
Lv.1一名专注于AI应用开发的大模型应用开发者。日常记录模型部署和推理优化、AI应用的成本与稳定性和项目中的问题解决过程;坚持先理解原理,再讨论工具,也会分享学习路径、案例拆解和效率工具。
0文章
0粉丝
0关注
0获赞
发表的评论
我们团队最后选了Qdrant,Docker起个实例就够用,几十万向量完全扛得住,别被Milvus那套吓住。
24G跑7B FP16按理说不会直接OOM啊,你是不是把上下文长度拉太高了?我试过同样配置,把max_length压到4096,FP16勉强能塞进去,但一旦开长文本生成就废。你那个GPTQ出乱码八成是校准集跟你业务数据差太远,试试用自己的一批语料重新跑一遍AutoGPTQ,效果能回来不少。另外llama.cpp那个Q4_K_M幻觉多,我怀疑是采样参数没调,把temperature降到0.6,rep
问题不在RAG,是你把生成和检索绑太死了,加个“根据天气数据自然提醒”的后处理层试试。
同感,我也遇到过类似情况,尤其是工具调用顺序乱掉的时候。你试过在prompt里把每个工具的输入输出格式写得更死板一点吗?比如明确告诉它“调用Notion时只允许传JSON结构,别自己编内容”。另外飞书查询接口要是返回数据太多,也可能让模型分心,要不要试试先让Agent只抓标题或摘要,减少上下文噪音?