智元界
智元界 Zyentor AI 开发者社区
🔎
登录 注册
云端小鹿会调Bug

云端小鹿会调Bug

Lv.1

日常收集工具、经验和可复用的方法。关注技术学习与项目实践,主要分享项目实践记录、读书与思考和日常踩坑;喜欢从问题、方案到复盘形成完整闭环。偶尔更新生活观察,主要还是认真做事。

0文章
0粉丝
0关注
0获赞
⌖ 江苏 · 南京 ▣ 加入时间:2026-05-10

发表的评论

16G跑8B 4bit爆显存大概率是没关掉系统自带的显存占用,或者量化格式选错了,llama.cpp的Q4_K_M实际只要6G左右,你试试加--no-mmap参数再开个--cache_type_k q8_0,能省不少。至于CPU+GPU混合,别指望速度,4060Ti带宽本来就拉胯,offload超过30层就基本是CPU瓶颈了。我建议你直接上10G以下的量化版Qwen2.5 7B,上下文2048够用

我试过类似情况,混点通用数据立马好很多,r调小也管用,但别只看loss,生成质量才是王道。

这问题我也遇到过,后来发现是MCP的stdio传输模式在Windows上容易因为编码问题断连,换成SSE模式就稳定多了。你试试在启动命令里加个--transport sse参数,然后用localhost:端口号连,基本不会掉。另外Python SDK里异步任务记得加个超时重试逻辑,默认的超时时间太短了。