OpenAI于2026年9月29日发布GPT-6.1 Sol,定位为GPT-6 Sol的升级版,在Agentic编程、计算机使用和专业工作三大场景接近GPT-6 Astra的智能水平,但标准API输入输出价格仅为Astra的五分之一。对开发者而言,这不是一次简单的版本迭代,而是模型选型与成本结构重新计算的信号。
定价结构:缓存输入是真正的杠杆
GPT-6.1 Sol标准API定价为:输入$2/百万token,缓存输入$0.10/百万token,输出$10/百万token。缓存输入比标准输入便宜95%,比GPT-6 Sol的缓存输入价格低50%。
这个定价对Agent类工作流影响最大。Agent通常需要跨请求复用系统提示、工具定义、历史上下文和文档片段。缓存命中率越高,单次任务的实际成本越接近输出token成本。官方明确提到,这“给开发者更多空间构建和运行可复用上下文的Agent”。工程上,这意味着应优先设计稳定的前缀结构:把系统指令、工具schema、固定知识库放在请求前部,把动态用户输入放在后部,以最大化缓存命中。
能力基准:接近Astra,但并非全面替代
官方在多个基准上给出了对比数据,需要区分“接近”和“超越”。
编程场景:在DeepSWE v1.1上,GPT-6.1 Sol在约五分之一成本下匹配GPT-6 Astra,同时以更低推理努力和成本超过GPT-6 Sol最佳分数6.4个百分点。
专业工作:在GDP.pdf上,GPT-6.1 Sol得分高于带fallback的Opus 5.5,每任务成本不到后者一半;在约五分之一成本下接近Astra。在AutomationBench上,中等推理努力下比Opus 5.5高2.2个百分点,成本约为三分之一;比同设置GPT-6 Sol高4.8个百分点。
计算机使用:在OSWorld 2.0离线集上,最大推理努力下比GPT-6 Sol高7个百分点,成本不到一半;距Astra仅2.1个百分点,每任务成本约为七分之一。
科学研究:在Terminal-Bench Science 0.1上,最大推理努力下得分是GPT-6 Sol两倍以上,每任务平均$5.47,而Opus 5.5为$23.21,Astra为$23.80。但Astra仍以68.1%保持最高分,官方明确建议最困难的科研任务仍应使用Astra。
事实性:低推理努力下,含事实错误的响应比例从GPT-6 Sol的11.4%降至7.7%,降低约32%。
选型建议:按场景分层
基于官方数据,可以给出以下工程选型思路:
-
日常编程与代码调试:GPT-6.1 Sol在DeepSWE v1.1上以更低推理努力超过GPT-6 Sol,适合作为默认编码模型。Codex中已可用,且即将提供Ultrafast模式,token生成速度最高提升8倍。
-
多步业务工作流Agent:AutomationBench数据显示中等推理努力下性价比突出。建议将GPT-6.1 Sol作为Agent主模型,把Astra保留给失败重试或高价值任务。
-
计算机使用与长周期任务:OSWorld 2.0上距Astra仅2.1个百分点但成本约七分之一,适合大规模部署。对精度要求极高的子任务可路由到Astra。
-
专业文档理解:GDP.pdf上优于Opus 5.5且成本更低,适合金融、医疗、法律等PDF密集型场景。
-
科学研究:Terminal-Bench Science上成本优势明显,但Astra仍保持最高分。建议用Sol做探索和批量实验,用Astra做最终验证。
迁移注意事项
GPT-6.1 Sol已通过API以gpt-6.1-sol提供,ChatGPT Work和Codex中面向Plus、Pro、Business、Enterprise和Edu用户开放,但暂未在Chat中提供。
迁移时需注意:
- 缓存输入定价是核心成本变量,迁移前应评估现有请求的缓存命中率。如果前缀不稳定,实际成本可能高于预期。
- 推理努力设置直接影响成本与得分。官方数据显示低推理努力下事实性提升最明显,中等努力在AutomationBench上性价比突出,最大努力在计算机使用和科研场景才需要。
- 安全评估显示GPT-6.1 Sol在透明度、尊重用户限制和避免未授权结果方面优于GPT-6 Sol,未观察到绕过自动安全审查的尝试。但官方强调这些评估刻意测试困难场景,不代表典型使用失败率。
- 对最困难科研任务,Astra仍是官方推荐选择,不应仅因成本优势全面替换。
总体而言,GPT-6.1 Sol的发布把“接近Astra”的能力拉到了五分之一价格区间,缓存输入进一步压低了Agent类应用的边际成本。开发者的选型逻辑应从“用最强模型”转向“按任务分层路由”,把Astra留给真正需要最高精度的场景,用Sol覆盖大多数日常和专业工作负载。