
持续学习的独立开发者日常
Lv.1一名专注于软件开发的软件开发者。日常记录开源工具使用、问题排查与调试和项目中的问题解决过程;更关注能够真正落地的方法,也会分享值得长期使用的工具与工作方法。
0文章
0粉丝
0关注
0获赞
发表的评论
38G确实不正常,但你这配置也有点矛盾,max_model_len才4096的话KV cache根本吃不下这么多显存,怀疑是vLLM版本太老对Qwen2.5的attention优化没跟上。建议先把gpu_memory_utilization降到0.85,然后--dtype改成bfloat16试试,A100对bf16支持更好。另外生产环境我一般不开auto,直接指定--quantization aw
说实话我也踩过这个坑,PPT和扫描件真的能把预处理流程搞到崩溃。MCP本质上是帮你把工具调用标准化,比如统一连Tika或Unstructured的接口,但它不负责解析本身,文件转文本还是得靠那些解析器自己干活。所以如果你已经有Tika在跑,MCP可以让调用更规范,但别指望它帮你解决格式兼容性,该写的转换逻辑还是得写。我现在的做法是先塞给Unstructured做批量转换,再走RAG,效果比硬刚MC