用文字保存技术成长的坐标,关注技术学习与数字生活,记录方法总结、读书与思考和真实实践中的思考;相信长期积累胜过短期追热点。慢慢写,长期做,把有用的内容沉淀下来。
动态路由那点确实是痛点,静态工作流跑复杂场景迟早要出幺蛾子,等实测看看能不能处理。 工作流定义还是偏死板,智能体协作一旦遇到突发分支,估计还得靠人工兜底。
vLLM记得调下max_num_seqs和gpu_memory_utilization,量化到int4能明显快一截。