刚刚,OpenAI 正式发布了 GPT-6。
代号 Astra。

总裁 Greg Brockman 在记者会上说了句非常重磅的话:
“ 如果几年后回望「AGI 到底是什么时候被造出来的」,我觉得就是现在,可能就是这个模型。

并在介绍推文中写道:
“ Welcome to the AGI era。
OpenAI 给 Astra 的定位也很 AGI:
“ Anything you can do on a computer, Astra can do for you. Fast.(你在电脑上能做的任何事情,Astra 都能替你做。而且很快。)

OpenAI Developers 则介绍说,GPT-6 Astra 是 OpenAI 目前在 computer use、软件工程和视觉理解三个方向上最强的模型。
并同样表示:
“ 携手迈入 AGI 时代,与 GPT-6 Astra 同行。

这次发布里面最核心的内容,则是 OpenAI 同步放出来的一段 2 分 43 秒的演示视频:
在视频里,一个人坐在房间里,面前是一面巨大的投影屏幕。他全程用语音和 Astra 对话,而 Astra 则在电脑上接住他不断抛过来的任务。
关键词是,同时。

一开始,他让 Astra 画了一个黄色的圆。
然后他说,把这个变成火箭飞船的窗户吧,于是Astra 画了个简笔画火箭出来。
他又说,能不能再精细一些,于是 Astra 给出了一个细节丰富得多的版本。
紧接着他来了一句:好了,现在把它变成 Blender 里的 3D 模型。
Astra 便打开了 Blender,开始进行 3D 建模。
而与此同时呢,他也没闲着,继续上强度了:
“ 帮我做一个下一季雨衣的零售演示文稿,要高端感,要彩色,要好玩。
去 eBay 帮我把这张桌子挂上去卖,我几年前在跳蚤市场买的,一张很野的橙色桌子。
我要一个 3D 小游戏,用方向键躲小行星,空格键加速。
我有点饿了,帮我从上周点过的那家店再来一份牛肉饭。
我律所需要一份授权协议模板,帮我起草一版给律师们过目。
下午想打网球,帮我找个球场订一下。
于是这样的七件事,便全部并行在由 Astra 处理着。

而且在这个过程中,用户还在持续地给各个任务追加和修改需求:
把 eBay 商品描述里加上「有轻微磕碰」,把授权协议里的责任限制条款调整得对许可方更有利一些,把演示文稿的背景色换成和雨衣颜色搭配的。
Astra 全部都稳稳地接住了,其他线的任务也都在继续推进着。
在网球场那边,Astra 找到了一个下午 5 点的空位,问要不要帮他预订。

订!
至于那个大火箭呢,Astra 不仅在 Blender 里完成了 3D 建模:

还直接生成了 STL 文件,可以发到 3D 打印机。

而在视频结尾的画面里,桌上也真的就摆着一个打印出来的实体火箭模型。
从一个黄色小圆开始,到一个可以拿在手里的实物,中间还穿插着六件完全不同领域的任务,全部由 Astra 并行完成。
OpenAI Developers 放出的另一段 53 秒的视频里,则展示了 Astra 在解谜方面的能力。

一位开发者讲述了自己带着 Astra 去参加 DEF CON 黑客大会的经历:
DEF CON 上有一系列高难度的解谜挑战赛,其中有一道题是 12 个魔方按 3×4 的方式排列在一起,参赛者需要从这些魔方的状态中推导出隐藏的信息。
Astra 解出来了。
而更离谱的是另一组谜题。Astra 在其中解出了三道人类团队没能解出来的题目。
以及还有一道,全世界此前没有任何人解出来过的题目。
同样,Astra 是第一个解出来的。
同这段视频里,还有另一位开发者则展示了用 Astra 构建的一个历史伦敦的 3D 体素(voxel)场景。

需要注意的是,这是真正的实时着色器(shader),应用在已有图像之上,可以交互、可以调整参数。
演示看完后,我们来看可量化的 bench 得分。到这里,事情就开始变得有儿意思了。
还记得 GPT-5 发布时的图吗?

这次的 GPT-6 也很有点异曲同工之妙。
官方在博客正文中写的是 FrontierMath Tier 4 拿到了 98%,ARC-AGI-3 是 99.9%,ExploitBench 直接 100%。
三项基准全部「饱和」,非常的 AGI。

但如果再仔细看一眼官方发布稿附表,就会发现 ARC-AGI-3 那格写的其实是:98.6%。
而且还有个不起眼却又很明显的矛盾细节是,全表几十个分数里,只有这一格的右上角带了一个小小的上标:[1]。

那么……这个 [1] 是什么呢?
官方脚注的原文是:
“ 在 ARC-AGI-3 上,Astra 用的是我们的 Responses API harness,它改了两个设置以更贴近真实世界表现。这些改动并非专门针对 ARC-AGI-3。
我来翻译一下,跑出 99.9% 的那个成绩,用的不是标准测试环境,而是 OpenAI 自己的 agent 系统。
那标准 harness 下呢?
ARC Prize 官方在榜单给出的数字是:62.7%。

同一个模型在同一天,换了个 harness 后,就从 62.7% 飞升到了 99.9%……

ARC-AGI 的作者 Chollet 本人在看到 Astra 的推理链之后,给出了一段很有意思的评价:
“ Astra 在对每个陌生的测试环境做即时的符号化世界建模,把游戏机制表示成逻辑规则,甚至自创了一套速记 DSL 来表示游戏状态。
最后他总结说:
“ Astra 展现出的符号建模行为,我们以前只在复杂 harness 里见过。harness 的能力正在越来越多地转移进模型本身。
但,是否拿到了 99.9% 就意味着实现了 AGI 呢?

Chollet 说其并没有提出这样的主张,并表示目前对 GPT-6 的了解仅限于其基准测试成绩而已。
同时也表示,在发布 ARC 3 时,以及在每次关于该产品的介绍中,团队都反复强调了一件事:解决问题并非证明成功的方法。
但,OpenAI 似乎并不这样理解?
另一份榜单里,则给出了不太一样的故事。

Artificial Analysis 综合智能指数上,GPT-6 Astra 得分 61.2,排在 Claude Fable 5.1(65.7)和 Claude Opus 5(63.1)之后,是第三名。
而且竟然只比自家上一代 GPT-5.6 Sol(60.9)高了 0.3 分。
也就是说,宣布进入 AGI 时代的那个模型,在第三方综合智能评测里排第三,且与自家上代基本持平。

而在我们许多人关心的编程方向上,也并没那么碾压。

DeepSWE v1.1 上 Astra 拿到 74.1%,比 Gemini 3.8 Flash 的 73.8% 高了 0.3 个点。
网友 KickLassChewGum:
“ 恭喜 OpenAI……追平了 Gemini 3.8 Flash
在另一张七项成绩卡里,Astra 和 Sol、Fable 5.1 的对比是:

在 FrontierCode 上,GPT-6 的两档分数都输给了 Claude Fable 5,Coding Agent Index 也输给了 Opus 5。

而在 AutomationBench 上,Astra 则准确度最高且 API 成本最低。
有点意思的跑分看完后,我们再来看些实际的成果。
十多年来,「存在无穷多对相邻素数间距不超过多少」这个问题的最好结果一直卡在 246。

最近刚有数学家把它推进到了 240,而这次的 Astra 则进一步证明了:存在无穷多对相邻素数间距不超过 186。
OpenAI 在 GitHub 上公开了完整的 Lean 形式化证明。
另外,Astra 还改进了素数之间异常大间隔的一个界,而这个界,80 多年来都没有人动过。

有个非常有含金量的是 FrontierMath Tier 4,它一共 50 道题,每道都是由数学教授或博士后花了数周的研究项目才最终提交的。
而当初设计的时候,出题方的预期是「可能几十年内都不会被 AI 解开」。但现在,GPT-6 把它给打满了。

EpochAI 的 Greg Burnham 在官方博客里点评:
“ 一个时代结束了,另一个时代开始了。
网络安全方面,Astra 在漏洞发现 bench ExploitBench 上稳定地拿下了 100% 的成绩,即使在测试过的最低推理强度下,也是满分。

为了排除「刷历史漏洞」的污染质疑,OpenAI 自建了一套只含 2026 年 6-8 月新漏洞的评测集。Astra 在里面拿到 39.0%,GPT-5.6 Sol 是 5.5%。
评测过程中,Astra 甚至自己发现并利用了两个此前未知的零日漏洞,OpenAI 已向相关方进行了披露。
这是 OpenAI 第一个被认定触及「关键网络安全能力阈值」的模型。

而在对齐方面呢,官方也给出了一组数据:在一个专门测试模型会不会越权行事的蜜罐评估中,GPT-5.6 Sol(无生产护栏)的越权率是 48.2%,而 Astra 是 0%。
不过系统卡里还有另一句话:GPT-6 Astra 的可监控性相对 GPT-5.6 Sol 下降了。

具体来说,Astra 比上一代更能控制自己的思维链,更不容易在 CoT 里留下「定罪性」信息。
在对抗性测试中(明确要求它规避监控时),CoT 监控器的召回率从 GPT-5.6 Sol 的 99.8% 骤降到了 Astra 的 10.9%。
这个……也很 AGI。

英国 AI 安全研究所(AISI)在评估时发现:
Astra 在不使用思维链的情况下,单次前向传播能解出的数学题难度(no-CoT 时间视野)从 GPT-5.6 Sol 的 3.6 分钟跳到了 30.9 分钟,涨了约 8.6 倍。
AISI 最后的结论是:Astra 具备可以让它规避监控的能力。
而 AISI 在一项供应链攻击模拟测试中还发现,Astra 在未被明确告知不能访问外部网络的情况下,有 12% 的概率主动向范围外的开源代码库提交恶意代码、伪造身份欺骗开发者。
在把范围改成明确禁止上网后,概率降到了 0.4%。
Gary Marcus 说可监控性的下降,是个「至关重要的技术问题」。
那些拿到早期权限的人,都用来做了些什么呢?
开发者 Dimillian 发布了目前最完整的一手体验,他只是指定了房间数量和风格,Astra 就从设计图到 3D 建模到 Blender 加工,再到自己写导出管线转进 Unreal Engine 5,最终交付了一个能在本机 60 FPS 实时漫游的独立应用。

他分享了两个诀窍:
灯光提示词写「黄金时刻的电影感镜头」,Astra 能准确理解;Astra 习惯用 Blender headless/CLI,靠写 Python 代码来生成 3D 模型。
他判断:
“ Astra 非常擅长理解什么样的电影化内容和 3D 模型才够「惊艳」。
独立开发者 theo 用了数周后的评价是:有史以来最聪明的模型。
能做此前认为 LLM 做不到的事,虽有毛病和粗糙之处,但「有时感觉是 AGI 的一瞥」。

来自 Astra 团队成员的 yanndubs 在 X 上坦承:Astra 确实明显更聪明、评测基准接近饱和、对齐与可信度更好。
但他同时也坦言:代码 slop 变多了,确认请求过于频繁。
API 价格上,输入 $10/M tokens,输出 $50/M tokens,是 GPT-5.6 Sol 的 2.5 倍,和 Claude Fable 5.1 相同。

同样支持 Fast 模式,最高 2.5 倍速度、2 倍价格。
模型 ID 是 gpt-6-astra,并同时也上线了 Amazon Bedrock。
Plus、Pro、Business 和 Enterprise 用户将在未来几天陆续开放,而 Pro 订阅及以上还将获得 GPT-6 Astra Pro(值得期待一)。
企业管理员需手动开启,发布时默认关闭。
说回这次发布的过程本身,则的确称得上是一场灾难。
官方博客链接上线后先返回 404,然后是 500 错误,中间还短暂消失过一次。
Axios 的预写稿件被提前发了出去,正文里什么实质内容都还没有。
我刚打开两篇博客,然后一刷新就又 404 了:

还有前面说的各种数字的不一致……原计划一点的发布往后推了约两小时。
但上面的也都不重要,最重要的是,模型还没有全面开放,我们要在「未来几天」才能用上。
而综合来看,如果把演示、跑分能力、安全和上线过程放在一起来看的话,GPT-6 Astra 的发布确实是个很割裂和混乱的画面。
演示惊人能力很强,但同时也是一个博客会挂、跑分会打架、思维链学会了隐藏心事的 AGI 时代。
怎么说呢,欢迎来到 AGI。
唯一的遗憾是,我还没能拥有 AGI:
◇ ◆ ◇
https://openai.com/index/gpt-6-astra/
https://x.com/OpenAI/status/2095595741528125780
https://x.com/ChatGPT/status/2095597502368284748
https://x.com/OpenAIDevs/status/2095596020638036311