GPT-5.6、Claude Opus 5、Gemini 3.7 Flash:我不会按总榜选模型
过去两个月,模型选型越来越像一件“看起来容易、实际上很容易选错”的事。
OpenAI 有 GPT-5.6 Sol / Terra / Luna,Anthropic 在 7 月 24 日发布了 Claude Opus 5,Google 8 月 13 日又把 Gemini 3.7 Flash 推到了 Coding 和 Agent 场景。
如果只看厂商发布页,你会得到三套都很漂亮的 benchmark。
问题是,你真正要上线的业务不叫 SWE-Bench,也不叫 AutomationBench。
所以这篇我不做“谁是第一”的排名。我只回答一个更实际的问题:如果今天要给企业系统选模型,我会按什么工作负载拆。
先把价格摆在桌面上
按当前官方公开价:
| 模型 | 输入 / 1M Token | 输出 / 1M Token | 我会给它的定位 |
|---|---|---|---|
| GPT-5.6 Sol | $5 | $30 | 高复杂知识工作、Agent、复杂 Coding |
| GPT-5.6 Terra | $2.5 | $15 | 日常生产主力、成本与能力折中 |
| GPT-5.6 Luna | $1 | $6 | 大规模高频任务 |
| Claude Opus 5 | $5 | $25 | 长任务、复杂 Coding、分析与判断 |
| Gemini 3.7 Flash | $0.75 | $3.75* | 大规模 Coding / Agent 工作马 |
* Gemini 3.7 Flash 这一价格是 2026 年底前的 introductory price;2027 年起变为 $1.50 / $7.50。
先提醒一句:
Token 单价不是成本。任务成功一次要花多少钱,才是成本。
一个模型价格便宜一半,但平均要多两次重试,并不一定更便宜。
场景一:大规模企业 RAG,我优先看 Terra、Luna 和 Flash
RAG 的核心不是让模型做世界上最难的推理,而是:
看懂问题
读懂检索证据
不要乱补
按格式回答
如果检索层本身做得好,我一般不会默认使用最高价旗舰。
更合理的是先让:
GPT-5.6 Terra / Luna
Gemini 3.7 Flash
跑公司自己的问题集。
真正要测的是:
- 引用支持率;
- 数字保真;
- “不知道”是否正确;
- 长文档噪声;
- 中文专业术语;
- 一次成功率;
- 每成功任务成本。
如果一个 5 万次/天的知识助手,模型单价只差几美元/百万 Token,月底就是一笔非常现实的成本。
这里我的倾向是:先把便宜模型推到业务阈值,再把少数失败请求升级。
场景二:长周期 Coding,我会重点测 GPT-5.6 Sol 和 Opus 5
Coding Benchmark 当然有用,但我会更看重长任务中的“稳定性”。
Anthropic 在 Opus 5 的发布材料里强调长运行 Agent 和复杂软件工程任务,并公开了一批客户测试数据。例如有客户报告,某些金融建模任务中,Opus 5 相比 Opus 4.8 平均高 9 个百分点,同时减少约三分之一轮次与工具调用,并节省约 60% 时间。
这里要注意:这是厂商发布页里的客户反馈,不等于第三方统一 benchmark。
OpenAI 则在 GPT-5.6 页面公布了较强的 Coding Agent、BrowseComp、OSWorld 等数据,并特别强调更少 Token 完成长任务。
如果是我的代码仓库,我不会先问:
谁 SWE-Bench 高?
我会给两家同样的真实任务:
修一个真实 Bug
改 4—8 个文件
必须通过现有测试
增加回归测试
不能改公共接口
限制最大工具调用数
然后比较:
第一次能不能跑过
改了多少无关文件
测试覆盖是否真实
人工 Review 用时
总 Token
总工具调用
最终成本
这比总榜更接近开发团队的真实痛点。
场景三:大量 Agent Workflow,Gemini 3.7 Flash 值得单独测
Google 这次很明确地把 3.7 Flash 往 Agent 和 Workflow 方向推。
公开数据里,AutomationBench 从 3.6 Flash 的 17.0% 提到 30.4%。
30.4% 本身说明一件事:复杂 Workflow 仍然很难。
但考虑到当前 $0.75 / $3.75 的价格,它非常适合被放在:
默认 Agent 工作马
而不是只做 Router。
我会把它拿来测试:
- 邮件整理;
- 文档归档;
- CRM 查询;
- 状态更新;
- 代码辅助;
- 多工具信息收集;
- 轻量 Supervisor。
失败或高风险时,再升级到更强模型。
场景四:复杂分析和“判断”,Opus 5 与 Sol 都要跑公司自己的题
法律、财务、策略、研究这类任务,最麻烦的是没有唯一答案。
这时 benchmark 很难直接告诉你“谁更好”。
我会构建一个内部评测集:
20 条真实研究问题
20 条复杂表格分析
20 条文档冲突判断
20 条开放式决策建议
20 条必须指出不确定性的任务
评测不要只让另一个 LLM 打分。
至少加入:
事实错误数
遗漏关键条件数
引用错误数
人工修改分钟数
Reviewer是否采纳
最后一个指标很重要:
模型的价值不是“写了多少”,而是人最终愿不愿意用。
场景五:大规模低风险处理,我不会碰旗舰模型
分类、抽取、改写、标签、标题、简单总结、格式转换,这类请求如果全部上 Sol 或 Opus 5,我会认为架构有问题。
除非你的量非常小,不值得做路由。
大规模系统应该至少分两层:
低成本模型
↓失败/风险/低置信
高能力模型
进一步可以三层:
Luna / Flash
↓
Terra
↓
Sol / Opus 5
这种路由真正省钱的前提是:升级条件必须由程序和评测驱动,而不是让模型自己决定。
一个我现在会直接放进架构里的字段
每次模型调用都记录:
{
"task_type": "invoice_analysis",
"model": "...",
"input_tokens": 42102,
"output_tokens": 3890,
"latency_ms": 8210,
"tool_calls": 3,
"retry_count": 0,
"task_success": true,
"human_edit_minutes": 2.0,
"escalated": false
}
一两周后,不需要争论哪个模型“感觉更聪明”。
你可以直接看:
每种任务
哪个模型成功率最高?
哪个模型每成功任务成本最低?
哪个模型人工修改最少?
这才是真正的模型选型。
厂商 benchmark 要看,但要知道它回答的是什么
OpenAI 在 GPT-5.6 官方页给了大量 benchmark,Anthropic 对 Opus 5 也展示了 Frontier-Bench、AutomationBench 和客户任务数据,Google 给了 FrontierCode、DeepSWE、GDP.pdf、AutomationBench。
这些数据可以帮你缩小候选范围。
但它们不能回答:
你的 Prompt
你的知识库
你的 Tool
你的权限
你的失败模式
你的用户
所以我的选型原则一直很简单:
官方榜单用来决定“谁值得进候选池”,公司自己的任务用来决定“谁能上线”。
如果最终让我给一个最简建议:
高复杂 Coding / 长任务:重点测 Sol、Opus 5
大规模 Agent:重点测 3.7 Flash、Terra
高频低风险:优先 Luna / Flash
开放权重和私有部署:另外开一条 Kimi K3 等模型评测线
不要找“一个模型解决全部问题”。2026 年真正成熟的系统,正在从模型选型走向模型调度。
更多企业级 AI 应用、Agent、RAG 与模型工程化内容,我会继续整理在 智元界:
https://www.zyentor.com/