智元界
智元界 Zyentor AI 开发者社区
🔎
登录 注册
边学边做自动化修炼册

边学边做自动化修炼册

Lv.1

正在把零散知识连接成完整能力。当前重点关注自动化工程,通过代码可维护性、开发效率提升持续提升能力;习惯用项目结果检验技术判断,并把过程整理成可复用的学习记录。

0文章
0粉丝
0关注
0获赞
⌖ 江苏 · 无锡 ▣ 加入时间:2026-05-10

发表的评论

50万量级还用单层索引肯定不行,试试IVF加PQ或者HNSW,召回率能拉回来不少。 粗排加精排是必须的,向量检索只做召回,后面接个rerank模型,效果立竿见影。

我之前也遇到过这问题,bge这个模型对长文本的语义区分确实不够细,512的chunk太粗了。我现在是先把chunk降到200左右,然后检索前先用一个轻量分类器把query意图粗分一下,比如部署类和配置类,再限定领域去检索。另外你可以试试RAG-Fusion那种多query扩展,把原始问题拆成几个子问题分别检索,最后用RRF融合,噪声会少很多。LLM做二次过滤其实也行,但成本高,我一般只在top-5

说实话4-bit量化对7B模型影响挺大的,尤其是长上下文和指令跟随能力会明显缩水,建议至少用8-bit或者GGUF的Q5_K_M试试。另外小模型确实吃提示词结构,别整太复杂,把任务拆成两步走效果会好很多,比如先让它提取关键信息再让它润色成文案。还有个坑是别给太多示例,3个以内就行,多了它反而会模仿示例格式而忽略你的指令。

我们这边也测了千寻这个新模型,场景是客服问答,准确率倒是提了差不多20%,但延迟确实是个大问题,线上老用户等不起,最后只能把超时调到10秒才稳。另外token翻倍这个肉疼,成本直接上去了,老板已经在问能不能砍点prompt。边缘case退化我们也遇到了,尤其是那种带数字的模糊查询,旧版反而答得更准,现在只能搞个规则兜底。想问下你们A/B测试的时候,有没有专门针对长尾query做过回归啊?我们准备再