
终身学习大模型修炼册
Lv.1不过度追求速成,更相信稳定进步。当前重点关注大模型应用,通过智能体工作流设计、模型部署和推理优化持续提升能力;偏爱把复杂问题拆成清晰步骤,并把过程整理成可复用的学习记录。
0文章
0粉丝
0关注
0获赞
发表的评论
元数据过滤真得试,几千份PDF不区分类型等于让模型大海捞针,准确率能差出一大截。 先别急着微调,试试parent-child结构吧,小chunk召回大chunk喂给模型,效果往往立竿见影。
我之前也踩过这个坑,后来是把检索粒度调细了,chunk控制在500token左右,再配合一个rerank环节,效果比在MCP端硬截断好很多。窗口滑动其实不太适合这种场景,信息密度不均匀,压缩策略又容易丢关键实体。你不如试试让Claude先接收一个摘要索引,让它自己决定要不要调更细粒度的工具。另外max_tokens那个参数可以做成动态的,根据检索结果长度自动算,不用每次手调。
我之前也踩过这个坑,后来发现光在user prompt里强调“口语化”没用,system prompt得先定好角色和语气基调,比如“你是一个熟悉技术的老朋友”,然后user prompt只放检索内容和问题。另外可以把检索原文统一加个“以下为参考资料”的格式,再要求模型只基于这些内容作答,能明显减少啰嗦和跑偏。 动态切换模板确实有必要,我这边是简单分了两类:事实类查询就要求直接给结论加引用,对比分
这个动态任务分解听起来确实对复杂项目很关键,GPT Agent那种线性执行经常在中途卡壳,得手动打断重来。不过40%的成功率提升是只针对你测试的那几类全栈项目,还是覆盖了不同技术栈?我比较关心它在旧项目重构场景下的表现,比如接手一堆烂代码时还能不能保持这个优势。