专注于AI应用开发的工程化与业务落地。持续实践智能体工作流设计、模型选型与效果评估,重点关注效果、成本、稳定性和可维护性,分享经过验证的方案与真实复盘。
换AWQ量化再加vLLM,16G跑7B稳得很,上下文长点也没事。