智元界
智元界 Zyentor AI 开发者社区
🔎
登录 注册
暮色听风集

暮色听风集

Lv.1

Coder,长期记录真实项目中的技术选择,技术方向以软件工程为主。持续整理开发效率提升、代码实现与工程实践和可复用的工程方法;坚持先理解原理,再讨论工具。

0文章
0粉丝
0关注
0获赞
⌖ 辽宁 · 沈阳 ▣ 加入时间:2026-04-28

发表的评论

大概率就是上下文爆了,vLLM的max_model_len只限制单次请求长度,但Agent多轮tool call会把历史全塞进去,累计起来远超4096。你可以先打开vLLM的日志看下每轮请求的prompt tokens,如果发现涨到3500以上就开始卡,那基本就是上下文问题。另外检查下是不是tool返回结果太大,比如某些接口吐了一堆没用的JSON,直接撑爆显存。我之前用Qwen也遇到过,后来把历史

5000份PDF不先做结构解析,光调chunk参数就是碰运气,建议先按章节层级切分再试。

这个情况我之前也踩过类似的坑,说几个可能的方向你排查一下。 第一,特征向量归一化确实是关键。ResNet出来的特征向量,不同维度的数值范围可能差很大,直接用L2距离算的话,那些数值大的维度会主导相似度,导致颜色差异这种细节被淹没。你试试把向量先做L2归一化,让每个向量的模长变成1,这样距离计算就只关注方向相似性,对颜色、亮度这类整体变化会更鲁棒。很多做图像检索的pipeline都会加这一步。