今天,人类正式进入AGI时代!


就在刚刚,OpenAI重磅官宣下一代旗舰模型GPT-6 Astra。


刚刚,全球最强GPT-6 Astra来了!人类进入AGI时代


官方将其定义为,「世界上最智能、对齐程度最高」的模型。


它在计算机使用、浏览、软件工程、网络安全、科学和专业工作领域,全部刷新SOTA。


发布会上,总裁Greg Brockman更是毫不掩饰地宣布——


OpenAI已经实现了AGI!Welcome to the AGI era(欢迎来到AGI时代)!


他更是直言,「在我看来,世界正式步入AGI时代,也就是AI的综合智力彻底碾压人类了」


全人类苦等已久的AGI时刻,终于在今天彻底降临!


从5到6,GPT-6 Astra不仅是版本号的一次跨越,更是OpenAI史上最具里程碑意义的跃迁。


刚刚,全球最强GPT-6 Astra来了!人类进入AGI时代


直接划重点,GPT-6 Astra终极杀手锏全在这儿了——


  • 各项天花板级基准彻底被「打爆」FrontierMath Tier 4得分97.6%(逼近98%饱和线),ARC-AGI-3飙出惊人的99.9%,ExploitBench漏洞利用拿下100%满分;


  • 「计算机使用」代际飞跃Astra可以完成你在电脑上能做的任何事,速度飞快;


  • 训练史上最大算力GPT-6 Astra爆出动用了OpenAI迄今为止最大算力,超10万块GPU;


  • AI亲自训练AI这是OpenAI首款在「训练监督」中由先前AI模型发挥重要作用的模型;


  • 价格输入10美元每百万Token,输出50美元每百万Token。


刚刚,全球最强GPT-6 Astra来了!人类进入AGI时代


来源:@rickawsb整理


一点小遗憾,GPT-6 Astra还得再等等。


刚刚,全球最强GPT-6 Astra来了!人类进入AGI时代


GPT-6 Astra震撼登场


AGI时代来了


在各项基准测试中,OpenAI官博中多次重用了一个词——「饱和」(saturate)。


这足以证明,GPT-6 Astra在多个领域的「绝对统治力」,榜单已测不出它的上限了。


刚刚,全球最强GPT-6 Astra来了!人类进入AGI时代


总榜上,刚刚上线的Claude Fable 5.1,已经没有什么优势可言了。


GPT-6 Astra直接把Claude 5.1死死踩在了脚下,全方位、无死角。


刚刚,全球最强GPT-6 Astra来了!人类进入AGI时代


先来看ARC-AGI-3,Astra直接拿下99.9%,暴击Claude Opus 5(30.2%)。


这个测试考的是,Agent在陌生的互动式任务里边玩边学的能力,人类测试者平均只有48%。


OpenAI估算,在同样的responses API评测框架下,Sol只有30%左右,Astra直线刷爆。


刚刚,全球最强GPT-6 Astra来了!人类进入AGI时代


刚刚,全球最强GPT-6 Astra来了!人类进入AGI时代


数学上,Astra在FrontierMath Tier 4 v2达到97.6%(接近98%饱和分)。


这是当前最难的数学测试集,被公认为人类顶尖数学家的难题高地。


在测试生物、化学和物理领域的研究生级科学推理GPQA Diamond,Astra同样刷新历史新高。


即便在较低算力成本设置下,亦能跑出94.9%,远超 GPT-5.6 Sol(94.6%),且API预估成本下降约37%。


刚刚,全球最强GPT-6 Astra来了!人类进入AGI时代


刚刚,全球最强GPT-6 Astra来了!人类进入AGI时代


编程第一,Fable 5.1惨败


编程,依然是Astra的主战场。


OpenAI自称,GPT‑6 Astra是迄今为止最适合软件工程的模型。


Terminal-Bench 4.0上,Astra拿到57.7%,GPT-5.6 Sol为37.3%,Claude Fable 5.1为55.8%。


DeepSWE v1.1上,Astra达到74.1%;内部数据库迁移任务达到63.9%,相比Sol的42.7%提升明显。


刚刚,全球最强GPT-6 Astra来了!人类进入AGI时代


刚刚,全球最强GPT-6 Astra来了!人类进入AGI时代


比跑分更关键的升级,藏在Codex的上下文管理里。


过去,长任务一旦塞满上下文窗口,模型会把历史压缩成摘要。每压缩一次,都可能丢掉一些细节:某次修复为何失败、一个模块有什么特殊行为、用户最初设下了哪些限制。


这一次,Astra新增了跨上下文窗口的笔记与检索机制。


它会保存一路积累的关键信息,早期窗口也保持可搜索。即使某条测试结果没有被写进摘要,模型仍能从过去的消息和工具输出中把它找回来。


OpenAI开始给长时间运行的智能体补上一套外部记忆:重点内容主动记,完整历史需要时再搜。


对持续数小时、跨越大量文件的重构任务,这种能力可能比单次代码生成得分更重要。


刚刚,全球最强GPT-6 Astra来了!人类进入AGI时代


全球最强「计算机使用」模型


但真正让Astra与上一代模型拉开距离的,是「计算机使用」的能力。


OpenAI把Astra称为,世界上最好的计算机使用模型。


刚刚,全球最强GPT-6 Astra来了!人类进入AGI时代


奥特曼之前反复强调,下一代最让他兴奋的,就是这一功能。他直言:Astra计算机使用能力,已达人类水平。


如今,GPT-6 Astra已彻底进化为一个坐在电脑前、手握键鼠的「超级专家」。


OpenAI放了一段15秒的浓缩视频:Astra在KiCad里做PCB布局。


Astra打开KiCad,从电路原理图开始摆放元器件、规划走线,最终完成一块可制造的PCB。


电路板布局长期依赖工程师手工调整,一个位置、一根铜线出错,都可能把问题带进后续打样。


现在,这类工作第一次被放进了通用模型的任务范围。


刚刚,全球最强GPT-6 Astra来了!人类进入AGI时代


它还填了一份美国1040报税表,给法律文件排了版,在Power BI里做报表,给一个网站跑了前端QA。


刚刚,全球最强GPT-6 Astra来了!人类进入AGI时代


刚刚,全球最强GPT-6 Astra来了!人类进入AGI时代


刚刚,全球最强GPT-6 Astra来了!人类进入AGI时代


Agents' Last Exam,测真实软件里的专业任务,从财务建模到工程制图。Astra得分59.3%,赶超Claude Opus 5(55.5%)和GPT-5.6 Sol(53.6%)。在最高分设置下,它使用的输出Token还比Opus 5少约65%。


OSWorld 2.0,模拟真人操作电脑。上一代GPT-5.6 Sol一个任务平均要75分钟,Astra仅40分钟,分数还从65.7%涨到72.6%。性能更高,单项任务耗时缩短约47%。


配合新版Codex harness,在Mind2Web上,网页任务比Sol快1.9倍。


刚刚,全球最强GPT-6 Astra来了!人类进入AGI时代


刚刚,全球最强GPT-6 Astra来了!人类进入AGI时代


画CAD、建网站,一次交付


在知识型工作上,GPT-6 Astra又是一次重大变革。


Astra接受过针对办公与专业环境的训练,可以执行多步骤工作流,并直接生成文档、表格和演示文稿。


AutomationBench上,它从GPT-5.6 Sol的18.1%跃升至41.4%,也超过Claude Fable 5.1的31.4%。


BenchCAD中,模型需要根据多个视角的渲染图,用代码重建3D物体。


Astra配合工具拿到95.9%的几何重合度,GPT-5.6 Sol为83.3%,Claude Fable 5.1为84.3%。按照OpenAI给出的测试配置,Astra的估算API成本比Sol低约43%,比Fable 5.1低约86%。


刚刚,全球最强GPT-6 Astra来了!人类进入AGI时代


Astra对企业模板的理解也更强了。


给它几页公司的既有PPT,Astra可以延续版式、语气和叙事结构,把后面的整套演示文稿补出来。


文档和表格也一样:它会抓取真正相关的上下文,尽量删掉无关复述,让结果贴近企业原有的写作与视觉规范。


刚刚,全球最强GPT-6 Astra来了!人类进入AGI时代


GPT‑6 Astra还为其构建的网站、游戏、应用程序和渲染图带来了更强的视觉判断力。


Astra先在Blender里搭出一栋房子,再把它送进Unreal Engine 5,变成可以自由行走的场景。


通过ChatGPT中的Sites⁠功能,Astra可以直接根据提示词创建、托管和分享网站、网页应用及游戏。


刚刚,全球最强GPT-6 Astra来了!人类进入AGI时代


这里还有一个很容易被忽略的变化:Astra更会判断什么时候该问人。


指令里只缺少常规细节,它会结合上下文补齐;某个选择足以改变结果,它会提出一个聚焦的问题。


在Codex中,它可以异步询问,同时继续完成不依赖答案的部分。用户暂时没回复,它会在低风险环节采用合理假设;碰到关键决策,则停下来等人确认。