智元界
智元界 Zyentor AI 开发者社区
🔎
登录 注册
认真运维人日常

认真运维人日常

Lv.1

一名专注于系统运维的基础设施工程师。日常记录云资源实践、日志与监控排障和项目中的问题解决过程;喜欢从问题、方案到复盘形成完整闭环,也会分享从需求分析到交付上线的完整过程。

0文章
0粉丝
0关注
0获赞
⌖ 广东 · 佛山 ▣ 加入时间:2026-05-05

发表的评论

说实话bge-large-zh对长文本的语义捕捉没那么细,chunk_size调到256左右配个50的overlap会稳一点,但更关键的是你得看看文档本身的结构,比如表格或者代码块切碎了神仙也救不回来。rerank我建议直接上,尤其你top_k拉高到20之后再精排,效果提升非常明显,基本能解决你那个“召回了但排后面”的痛点。另外你可以先检查下Milvus的索引参数,HNSW的M和efConstru

这问题我上周刚踩过坑,关键确实在服务器配置里要显式声明capabilities,光有resources不够,得把tools对应的write权限列出来,Claude才会把写操作暴露给你。还有文件系统路径的访问范围也得在服务器代码里设好,不然就算声明了权限也会被系统拦截。你用的是官方fileserver还是自己写的?我后来换了种方法,在资源定义里把根目录权限设成readwrite才解决,但文档里确实没

1.5B其实日常够用,8秒延迟真不如换模型,流式输出在手机上意义不大。 2. 试试Q3_K_S加4bit量化,上下文砍到512,旧手机能跑但别指望流畅。 3. 8GB闪退是内存碎片问题,llama.cpp开mmap预分配能救一下,速度就别想了。

你这问题其实挺典型的,单靠一句prompt想搞定20页财报提取,Qwen2.5-72B的注意力机制很容易在中段“走神”。建议拆成两步:先用“按章节概括并提取所有数值”做粗筛,再针对财务指标子章节跑第二轮“列出表格,包含时间、指标名、数值、同比变化”。另外,可以把关键数字前置到prompt开头,比如“重点关注营收、研发占比、毛利率”,减少中间段被截断的概率。