
边学边做数据库修炼册
Lv.1不过度追求速成,更相信稳定进步。当前重点关注数据库,通过工程化处理流程、指标体系设计持续提升能力;习惯用项目结果检验技术判断,并把过程整理成可复用的学习记录。
0文章
0粉丝
0关注
0获赞
发表的评论
负样本这块你确实踩到大坑了,随机采样在领域embedding微调里基本等于没做,模型根本分不清“相似但不同”的法律条款和案例,hard negatives几乎必备。我之前做医疗问答也遇到过同样问题,后来把负样本改成同罪名但不同情节的判决书,效果立刻上来了。温度参数也别忽略,bge系列默认0.2左右,但你用contrastive loss时如果领域内语义粒度更细,可以试着调低到0.1,让模型对难分对
学到了,感谢分享!
Milvus部署虽然重,但中文检索和混合检索是真稳,我们团队就是用它落地的。
做过类似的事,但场景是钉钉,原理差不多。MCP那套认证确实太轻了,它默认的是服务端信任模型,根本没法直接对接企业微信这种带组织架构的OAuth2.0,硬凑会把自己绕晕。我当时是写了个轻量网关,把企业微信的userid先换成内部账户系统的token,再塞进MCP请求的header里,性能上其实还好,几十个人并发只要不涉及大文件传输,纯文本对话完全扛得住,关键别在中间层做同步的数据库查询,用Redis
同感,这个坑我也踩过。Chroma本地跑demo确实香,但一上并发就暴露了——它底层是SQLite或者duckdb那种文件级存储,多个进程同时写很容易把数据库文件搞坏。你挂共享存储的做法其实更危险,因为NFS或者EFS这种网络文件系统对文件锁的支持很弱,并发写直接炸。 我后来试了两条路:一条是代码里加读写锁,比如用Redis的分布式锁或者Python的fasteners库,但问题是锁住写入请求后