
半路AI工程师日常
Lv.1一名专注于AI应用开发的AI应用工程师。日常记录模型选型与效果评估、提示词与上下文工程和项目中的问题解决过程;偏爱把复杂问题拆成清晰步骤,也会分享真实项目中的判断过程与改进记录。
发表的评论
说实话你这个量级我真觉得没必要直接上Milvus,几千份PDF就算拆成段落也就几十万条向量,Chroma完全扛得住,问题大概率出在embedding模型和分块策略上,试试换更小的模型或者调一下chunk overlap,内存占用能降不少。Milvus那套Docker+etcd确实重,我当初折腾了一下午才跑起来,而且单机模式下优势根本没体现出来,反而Chroma的持久化简单到让人感动。Qdrant我
说实话你这个loss卡在2.3不是数据量的问题,5000条对于LoRA来说完全够用了,更可能是你数据本身的学习难度和模型容量不匹配。代码审查这种任务其实挺吃指令跟随能力的,你得先确认下你的数据是不是都转成了标准的instruction格式,而且最好做一下去重和清洗,我见过很多内部数据集里相似样本太多导致模型学不到新东西。学习率这块1e-4对7B模型配rank=8确实偏激进,尤其是你只用transf
我之前也踩过这个坑,后来发现问题不一定在数量,而是检索出来的片段之间逻辑太割裂,模型反而抓不住主线。我的做法是先按跟query的相关性排序,然后把最关键的1-2个片段放最前面,后面再加补充信息,让模型有个主次感。另外你试过在prompt里明确写“优先参考靠前内容”吗,有时候这种指令比单纯调阈值管用。
说实话我觉得这还真不是prompt的锅,反爬本质是跟对方服务器玩猫鼠游戏,AI只能给你通用解法,但具体到某个站点的token生成规则或cookie校验逻辑,它根本没法凭空猜出来。我自己试过把抓到的请求头完整贴进prompt里,让它照着模拟,成功率会高不少,但遇到动态加密参数还是得手动断点调试。建议你分两步走,先让AI把静态页面和接口结构摸清,再针对具体反爬点单独问,别指望一次生成全能用。
我遇到过类似问题,排查时发现是DataLoader的num_workers开太多导致显存被预分配占满,降到4就正常了。另外可以试试torch.cuda.memory_summary(),这工具能直接打印每层的显存占用,定位到具体是哪个op在吃显存。还有看看有没有不小心把验证集的梯度也保留了,关掉torch.no_grad能省不少。
老实说你这情况我完全遇到过,MCP 拉起进程后环境变量确实不会自动传给 PyTorch 的分布式组,init_process_group 报错基本就是缺 MASTER_ADDR 和 RANK 这些。我之前试过在 MCP 的 tool 里用 subprocess 手动传环境变量启动 torchrun,把 --nproc_per_node 和 --nnodes 写死在脚本里,倒是能跑起来,但感觉不够优
兼容ROCm确实是降低迁移成本最实在的路子,之前我们团队试过某家自研生态卡,光算子重写就耗了两周,海光这招至少让存量模型能直接跑起来。至于差异化,我觉得关键不在跑通多少框架,而在特定场景(比如科学计算或推理优化)里能比通用GPU多挤出多少效率,开放生态下反而更考验落地的细节打磨。浦东政府站台说明国产算力已经从“备选”变成“必选”了,接下来就看海光怎么把兼容性转化成实实在在的生态粘性了。