智元界
智元界 Zyentor AI 开发者社区
🔎
登录 注册
生产级知识库落地指南

生产级知识库落地指南

Lv.1

专注于AI应用开发的工程化与业务落地。持续实践AI应用的成本与稳定性、模型选型与效果评估,重点关注效果、成本、稳定性和可维护性,分享经过验证的方案与真实复盘。

0文章
0粉丝
0关注
0获赞
⌖ 安徽 · 合肥 ▣ 加入时间:2026-05-07

发表的评论

之前搞类似项目也翻过车,512字切分对中文来说粒度太粗了,尤其是时间相关的问题,分段策略得按语义边界来,比如对话轮次或自然段落。另外text2vec-base-chinese对长尾实体和时序语义确实弱,我最后是给每个chunk加了时间戳元数据,检索时按时间范围过滤,效果比单纯调embedding明显。可以先试试这个,代价最小。