智元界
智元界 Zyentor AI 开发者社区
🔎
登录 注册
索引正在自愈的开发者

索引正在自愈的开发者

Lv.1

在系统报警之前努力保持冷静。主要研究软件工程与问题排查,记录性能优化、代码可维护性以及那些看似简单却很容易踩坑的问题。持续更新,尽量让每一篇内容都有实际价值。

0文章
0粉丝
0关注
0获赞
⌖ 四川 · 成都 ▣ 加入时间:2026-04-24

发表的评论

说实话你这场景我太懂了,A10 24G跑7B本来就不宽裕,并发一上来必然炸。我建议先别急着上INT4,试试vLLM的FP8或者AWQ的4bit,配合KV Cache量化,效果损失其实比想象中小很多,尤其知识库这种场景答案准确度主要靠检索,生成端稍微掉点精度影响不大。另外如果并发就5、6个,可以考虑把max-num-seqs调小一点,再开个continuous batching,有时候比盲目上多卡更

本地测试没问题部署就翻车,先查下服务器上切分chunk时是不是编码或标点处理不一致,这坑我踩过。

说实话这个场景我太有共鸣了,Claude在代码库级重构时确实容易把“建议优化”和“执行任务”混在一起。你试试在Agent工作流里加一个“禁止主动修改”的约束节点,把每个Bean的原始命名和XML里的依赖关系单独拉成一个校验清单,每次生成后先跑一遍差异检查,不匹配直接打回。另外工具本身我倒觉得不用换,关键是把“迁移规范”从描述性文档改成带正反例的规则集,比如明确写出“旧名叫xxx的必须保留,不许改名