OpenAI在2026年9月22日发布GPT-6 Sol与GPT-6 Luna。官方定位很明确:GPT-6 Astra仍是“最好、无需妥协”的模型;Sol与Luna用类似方法训练,把Astra在专业工作、事实性、编码、computer use和对齐上的进展,带到更快、更便宜的档位。核心变化是价格:Sol输入从$4降到$2、输出从$20降到$10;Luna输入从$0.20降到$0.10、输出从$1.20降到$0.50,均为每百万tokens,较GPT-5.6促销价下降50%。
先看能力与成本权衡的官方数据。专业工作方面,AutomationBench 1.0.6测试47个工具、覆盖销售、营销、运营、支持、财务和HR的端到端工作流。Sol在xhigh effort下得分33.2%,每任务成本$0.27;Opus 5 max得26.9%,成本是Sol的11.1倍;Astra low得30.3%,成本是Sol的3.9倍;Fable 5.1加Opus 5 fallback得31.4%,成本超过Sol的8.9倍,且官方注明fallback成本未报告,约40%任务发生Opus 5 fallback,因此该数据点低估了实际成本。Sol甚至超过低effort的Astra。Luna在high effort下比前代提升5.4个百分点,每任务成本低58%。Agents’ Last Exam上,Sol max得分56.4%,高于Claude Opus 5在该评测中的最高分,每任务成本低60%。
事实性与编码是开发者最关心的部分。官方内部事实性评测基于去标识真实对话,用户此前标记了模型错误;Sol的错误约为前代一半,接近Astra级可靠性,但成本低得多。Luna在更高effort下可匹配GPT-5.6 Sol,成本约为其百分之一。编码方面,OpenAI内部编码代理使用量增长很快,按API价格计,中位数研究者每日token使用超过$600,90分位超过$7,000。FrontierCode上,Sol明显优于GPT-5.6 Sol,并能以更低成本匹配Fable 5.1 xhigh。DeepSWE v1.1上,Sol max得分68.8%,距Fable 5的xhigh最高分69.9%仅差1.1个百分点,每任务成本约低80%;Luna max得分66.6%,与Opus 5和Fable 5的medium effort相当,成本比Opus 5低93%、比Fable 5低96%。
Computer use上,Astra仍是官方认为的世界最佳,但Sol和Luna比前代更划算。OSWorld 2.0 offline中,Sol xhigh得60.5%,Opus 5 medium得60.3%,Sol每任务成本约低80%;Luna max超过GPT-5.6 Sol medium,成本仅为其十分之一。风格和对齐也有更新:Sol与Luna继承Astra改进后的沟通风格,技术对话中更清晰、少术语、少低价值细节,答案略短但不丢实质。对齐评测中,两者相比GPT-5.6对应版本均有改进,包括更少对其编码工作做出误导性声明。官方强调这些评测故意设置挑战场景,不代表典型使用中的失败率,完整结果见system card。
成本优化不止来自token降价。Prompt caching针对GPT-6做了改进,默认带来更高缓存命中率,缓存输入读取折扣90%。开发者可用Prompt Caching Dashboard查看输入缓存量及变化,用diagnostics工具解释错失的缓存机会和修复方向。调整reasoning effort、启用或禁用工具,现在都会保留早期上下文用于缓存复用;显式breakpoints则让开发者选择缓存前缀的结束位置。GitHub报告称,过去数月这些改进让数十亿次请求中需要新鲜处理的prompt token份额减少超过50%,帮助Copilot更快响应。
可用性方面,Sol和Luna即日起在ChatGPT Work和Codex中向Plus、Pro、Business、Enterprise和Edu用户提供;Free和Go用户可在桌面应用中访问GPT-6 Luna。Chat中暂不可用。API模型名为gpt-6-sol和gpt-6-luna,ChatGPT端会全天逐步推送。官方还提示,评测在研究环境或API完成,因系统提示、工具可用性不同,生产ChatGPT输出可能略有差异。
对开发者的选型建议如下,属于工程分析而非官方承诺。第一,按任务价值分层:不可妥协的最高质量任务用Astra;复杂Agent、编码和computer use且成本敏感时优先评估Sol;高吞吐、日常问答、分类摘要、轻量编码或预算极紧时用Luna。第二,迁移时先替换API模型名,价格已降50%,可把节省的预算用于提高effort或增加迭代次数;但需回归测试输出风格、工具调用、事实性和长上下文行为,官方未提供自动迁移工具或兼容性承诺。第三,缓存策略要围绕长系统提示、工具schema和few-shot示例设计,尽量保持前缀稳定,用显式断点控制缓存边界,并用Dashboard和diagnostics持续监控。多轮Agent中动态调整effort和工具开关,比破坏缓存后重建前缀更划算。第四,在AutomationBench上Sol已超过低effort Astra,因此低effort Astra的某些场景值得评估迁移到Sol,但应限定在官方数据覆盖的任务类型。
边界同样重要。发布页未披露底层架构、参数规模、训练数据、上下文窗口、速率限制、完整缓存TTL或最小缓存token、区域可用性,以及中国区接入与合规差异。任何选型都应等待系统卡和API文档补充后再定论。总体看,Sol与Luna不是替代Astra,而是把GPT-6能力沿成本曲线分发;对开发者的直接利好是50%降价,更长期的价值在缓存、effort和工具控制共同带来的Agent成本下降。