专注于向量数据库的工程化与业务落地。持续实践提示词与上下文工程、企业场景落地,重点关注效果、成本、稳定性和可维护性,分享经过验证的方案与真实复盘。
说实话7B模型做Agent确实有点勉强,格式稳定性是硬伤,尤其LangGraph对JSON schema要求又严格。建议先试试Qwen2.5-7B的function calling版本,或者干脆用14B量化版,推理质量会明显好一截。另外你可以检查下是不是max_tokens设置太小,工具调用后的长输出容易被截断导致解析失败。我之前用本地小模型也踩过这坑,后来加了输出格式校验和重试机制,超时率降了不