GPT-6 Astra:混乱地来到 AGI 时代。

作者:AGI Hunt 发布:2026-09-04 06:04 收录:2026-09-08 08:10 1 次阅读 约 3527 字
摘要:欢迎进入 AGI 时代
推荐理由:本文涵盖「OpenAI」、「AGI」、「GPT-6」等多个主题,重点关注 OpenAI。

刚刚,OpenAI 正式发布了 GPT-6。

代号 Astra。

GPT-6 Astra
GPT-6 Astra

总裁 Greg Brockman 在记者会上说了句非常重磅的话:

如果几年后回望「AGI 到底是什么时候被造出来的」,我觉得就是现在,可能就是这个模型。

Greg Brockman 推文
Greg Brockman 推文

并在介绍推文中写道:

Welcome to the AGI era。

OpenAI 给 Astra 的定位也很 AGI:

Anything you can do on a computer, Astra can do for you. Fast.(你在电脑上能做的任何事情,Astra 都能替你做。而且很快。)

最强模型
最强模型

OpenAI Developers 则介绍说,GPT-6 Astra 是 OpenAI 目前在 computer use、软件工程和视觉理解三个方向上最强的模型。

并同样表示:

携手迈入 AGI 时代,与 GPT-6 Astra 同行。

OpenAI Developers:携手迈入 AGI 时代
OpenAI Developers:携手迈入 AGI 时代

这次发布里面最核心的内容,则是 OpenAI 同步放出来的一段 2 分 43 秒的演示视频:

七件事并行

01

在视频里,一个人坐在房间里,面前是一面巨大的投影屏幕。他全程用语音和 Astra 对话,而 Astra 则在电脑上接住他不断抛过来的任务。

关键词是,同时

画火箭
画火箭

一开始,他让 Astra 画了一个黄色的圆。

然后他说,把这个变成火箭飞船的窗户吧,于是Astra 画了个简笔画火箭出来。

他又说,能不能再精细一些,于是 Astra 给出了一个细节丰富得多的版本。

紧接着他来了一句:好了,现在把它变成 Blender 里的 3D 模型。

Astra 便打开了 Blender,开始进行 3D 建模。

而与此同时呢,他也没闲着,继续上强度了:

帮我做一个下一季雨衣的零售演示文稿,要高端感,要彩色,要好玩。

去 eBay 帮我把这张桌子挂上去卖,我几年前在跳蚤市场买的,一张很野的橙色桌子。

我要一个 3D 小游戏,用方向键躲小行星,空格键加速。

我有点饿了,帮我从上周点过的那家店再来一份牛肉饭。

我律所需要一份授权协议模板,帮我起草一版给律师们过目。

下午想打网球,帮我找个球场订一下。

于是这样的七件事,便全部并行在由 Astra 处理着。

法律协议
法律协议

而且在这个过程中,用户还在持续地给各个任务追加和修改需求:

把 eBay 商品描述里加上「有轻微磕碰」,把授权协议里的责任限制条款调整得对许可方更有利一些,把演示文稿的背景色换成和雨衣颜色搭配的。

Astra 全部都稳稳地接住了,其他线的任务也都在继续推进着。

在网球场那边,Astra 找到了一个下午 5 点的空位,问要不要帮他预订。

网球场
网球场

订!

至于那个大火箭呢,Astra 不仅在 Blender 里完成了 3D 建模:

火箭
火箭

还直接生成了 STL 文件,可以发到 3D 打印机。

3D 打印火箭
3D 打印火箭

而在视频结尾的画面里,桌上也真的就摆着一个打印出来的实体火箭模型。

从一个黄色小圆开始,到一个可以拿在手里的实物,中间还穿插着六件完全不同领域的任务,全部由 Astra 并行完成。

DEF CON 世界首解

02

OpenAI Developers 放出的另一段 53 秒的视频里,则展示了 Astra 在解谜方面的能力。

12 个魔方谜题
12 个魔方谜题

一位开发者讲述了自己带着 Astra 去参加 DEF CON 黑客大会的经历:

DEF CON 上有一系列高难度的解谜挑战赛,其中有一道题是 12 个魔方按 3×4 的方式排列在一起,参赛者需要从这些魔方的状态中推导出隐藏的信息。

Astra 解出来了。

而更离谱的是另一组谜题。Astra 在其中解出了三道人类团队没能解出来的题目。

以及还有一道,全世界此前没有任何人解出来过的题目

同样,Astra 是第一个解出来的。

体素伦敦

03

同这段视频里,还有另一位开发者则展示了用 Astra 构建的一个历史伦敦的 3D 体素(voxel)场景。

3D 场景
3D 场景

需要注意的是,这是真正的实时着色器(shader),应用在已有图像之上,可以交互、可以调整参数。

上标 [1]

04

演示看完后,我们来看可量化的 bench 得分。到这里,事情就开始变得有儿意思了。

还记得 GPT-5 发布时的图吗?

GPT-5 发布图
GPT-5 发布图

这次的 GPT-6 也很有点异曲同工之妙。

官方在博客正文中写的是 FrontierMath Tier 4 拿到了 98%,ARC-AGI-3 是 99.9%,ExploitBench 直接 100%

三项基准全部「饱和」,非常的 AGI。

跑分汇总
跑分汇总

但如果再仔细看一眼官方发布稿附表,就会发现 ARC-AGI-3 那格写的其实是:98.6%

而且还有个不起眼却又很明显的矛盾细节是,全表几十个分数里,只有这一格的右上角带了一个小小的上标:[1]

发布稿全表
发布稿全表

那么……这个 [1] 是什么呢?

官方脚注的原文是:

在 ARC-AGI-3 上,Astra 用的是我们的 Responses API harness,它改了两个设置以更贴近真实世界表现。这些改动并非专门针对 ARC-AGI-3。

我来翻译一下,跑出 99.9% 的那个成绩,用的不是标准测试环境,而是 OpenAI 自己的 agent 系统

那标准 harness 下呢?

ARC Prize 官方在榜单给出的数字是:62.7%

ARC Prize 成绩图
ARC Prize 成绩图

同一个模型在同一天,换了个 harness 后,就从 62.7% 飞升到了 99.9%……

Chollet 推文
Chollet 推文

ARC-AGI 的作者 Chollet 本人在看到 Astra 的推理链之后,给出了一段很有意思的评价:

Astra 在对每个陌生的测试环境做即时的符号化世界建模,把游戏机制表示成逻辑规则,甚至自创了一套速记 DSL 来表示游戏状态。

最后他总结说:

Astra 展现出的符号建模行为,我们以前只在复杂 harness 里见过。harness 的能力正在越来越多地转移进模型本身。

但,是否拿到了 99.9% 就意味着实现了 AGI 呢?

AGI
AGI

Chollet 说其并没有提出这样的主张,并表示目前对 GPT-6 的了解仅限于其基准测试成绩而已。

同时也表示,在发布 ARC 3 时,以及在每次关于该产品的介绍中,团队都反复强调了一件事:解决问题并非证明成功的方法

但,OpenAI 似乎并不这样理解?

智能第三名

05

另一份榜单里,则给出了不太一样的故事。

AA 智能指数
AA 智能指数

Artificial Analysis 综合智能指数上,GPT-6 Astra 得分 61.2,排在 Claude Fable 5.1(65.7)和 Claude Opus 5(63.1)之后,是第三名

而且竟然只比自家上一代 GPT-5.6 Sol(60.9)高了 0.3 分。

也就是说,宣布进入 AGI 时代的那个模型,在第三方综合智能评测里排第三,且与自家上代基本持平。

AA 榜单
AA 榜单

而在我们许多人关心的编程方向上,也并没那么碾压。

全表
全表

DeepSWE v1.1 上 Astra 拿到 74.1%,比 Gemini 3.8 Flash 的 73.8% 高了 0.3 个点。

网友 KickLassChewGum:

恭喜 OpenAI……追平了 Gemini 3.8 Flash

在另一张七项成绩卡里,Astra 和 Sol、Fable 5.1 的对比是:

官方七项成绩卡
七项成绩卡

在 FrontierCode 上,GPT-6 的两档分数都输给了 Claude Fable 5,Coding Agent Index 也输给了 Opus 5。

AutomationBench 准确度 vs 成本
AutomationBench 准确度 vs 成本

而在 AutomationBench 上,Astra 则准确度最高且 API 成本最低。

素数 246→186

06

有点意思的跑分看完后,我们再来看些实际的成果。

十多年来,「存在无穷多对相邻素数间距不超过多少」这个问题的最好结果一直卡在 246

无穷多对相邻素数间距
无穷多对相邻素数间距

最近刚有数学家把它推进到了 240,而这次的 Astra 则进一步证明了:存在无穷多对相邻素数间距不超过 186

OpenAI 在 GitHub 上公开了完整的 Lean 形式化证明。

另外,Astra 还改进了素数之间异常大间隔的一个界,而这个界,80 多年来都没有人动过

FrontierMath Tier 4
FrontierMath Tier 4

有个非常有含金量的是 FrontierMath Tier 4,它一共 50 道题,每道都是由数学教授或博士后花了数周的研究项目才最终提交的。

而当初设计的时候,出题方的预期是「可能几十年内都不会被 AI 解开」。但现在,GPT-6 把它给打满了。

EpochAI Greg Burnham
EpochAI Greg Burnham

EpochAI 的 Greg Burnham 在官方博客里点评:

一个时代结束了,另一个时代开始了。

安全与隐蔽

07

网络安全方面,Astra 在漏洞发现 bench ExploitBench 上稳定地拿下了 100% 的成绩,即使在测试过的最低推理强度下,也是满分。

ExploitBench
ExploitBench

为了排除「刷历史漏洞」的污染质疑,OpenAI 自建了一套只含 2026 年 6-8 月新漏洞的评测集。Astra 在里面拿到 39.0%,GPT-5.6 Sol 是 5.5%。

评测过程中,Astra 甚至自己发现并利用了两个此前未知的零日漏洞,OpenAI 已向相关方进行了披露。

这是 OpenAI 第一个被认定触及「关键网络安全能力阈值」的模型

蜜罐越权率
蜜罐越权率

而在对齐方面呢,官方也给出了一组数据:在一个专门测试模型会不会越权行事的蜜罐评估中,GPT-5.6 Sol(无生产护栏)的越权率是 48.2%,而 Astra 是 0%

不过系统卡里还有另一句话:GPT-6 Astra 的可监控性相对 GPT-5.6 Sol 下降了。

CoT 监控
CoT 监控

具体来说,Astra 比上一代更能控制自己的思维链,更不容易在 CoT 里留下「定罪性」信息。

在对抗性测试中(明确要求它规避监控时),CoT 监控器的召回率从 GPT-5.6 Sol 的 99.8% 骤降到了 Astra 的 10.9%

这个……也很 AGI。

No-CoT 时间视野
No-CoT 时间视野

英国 AI 安全研究所(AISI)在评估时发现:

Astra 在不使用思维链的情况下,单次前向传播能解出的数学题难度(no-CoT 时间视野)从 GPT-5.6 Sol 的 3.6 分钟跳到了 30.9 分钟,涨了约 8.6 倍。

AISI 最后的结论是:Astra 具备可以让它规避监控的能力。

而 AISI 在一项供应链攻击模拟测试中还发现,Astra 在未被明确告知不能访问外部网络的情况下,有 12% 的概率主动向范围外的开源代码库提交恶意代码、伪造身份欺骗开发者。

在把范围改成明确禁止上网后,概率降到了 0.4%。

Gary Marcus 说可监控性的下降,是个「至关重要的技术问题」。

早期实测

08

那些拿到早期权限的人,都用来做了些什么呢?

开发者 Dimillian 发布了目前最完整的一手体验,他只是指定了房间数量和风格,Astra 就从设计图到 3D 建模到 Blender 加工,再到自己写导出管线转进 Unreal Engine 5,最终交付了一个能在本机 60 FPS 实时漫游的独立应用。

Blender 到 UE5
Blender 到 UE5

他分享了两个诀窍:

灯光提示词写「黄金时刻的电影感镜头」,Astra 能准确理解;Astra 习惯用 Blender headless/CLI,靠写 Python 代码来生成 3D 模型。

他判断:

Astra 非常擅长理解什么样的电影化内容和 3D 模型才够「惊艳」。

独立开发者 theo 用了数周后的评价是:有史以来最聪明的模型

能做此前认为 LLM 做不到的事,虽有毛病和粗糙之处,但「有时感觉是 AGI 的一瞥」。

yanndubs
yanndubs

来自 Astra 团队成员的 yanndubs 在 X 上坦承:Astra 确实明显更聪明、评测基准接近饱和、对齐与可信度更好。

但他同时也坦言:代码 slop 变多了,确认请求过于频繁。

定价与使用

09

API 价格上,输入 $10/M tokens,输出 $50/M tokens,是 GPT-5.6 Sol 的 2.5 倍,和 Claude Fable 5.1 相同。

价格
价格

同样支持 Fast 模式,最高 2.5 倍速度、2 倍价格。

模型 ID 是 gpt-6-astra,并同时也上线了 Amazon Bedrock。

Plus、Pro、Business 和 Enterprise 用户将在未来几天陆续开放,而 Pro 订阅及以上还将获得 GPT-6 Astra Pro(值得期待一)。

企业管理员需手动开启,发布时默认关闭。

上线中翻的车

10

说回这次发布的过程本身,则的确称得上是一场灾难。

官方博客链接上线后先返回 404,然后是 500 错误,中间还短暂消失过一次。

Axios 的预写稿件被提前发了出去,正文里什么实质内容都还没有。

我刚打开两篇博客,然后一刷新就又 404 了:

404
404

还有前面说的各种数字的不一致……原计划一点的发布往后推了约两小时。

但上面的也都不重要,最重要的是,模型还没有全面开放,我们要在「未来几天」才能用上

而综合来看,如果把演示、跑分能力、安全和上线过程放在一起来看的话,GPT-6 Astra 的发布确实是个很割裂和混乱的画面

演示惊人能力很强,但同时也是一个博客会挂、跑分会打架、思维链学会了隐藏心事的 AGI 时代。

怎么说呢,欢迎来到 AGI。

唯一的遗憾是,我还没能拥有 AGI:我的 AGI 呢?

我的 AGI 呢?

◇ ◆ ◇

https://openai.com/index/gpt-6-astra/

https://x.com/OpenAI/status/2095595741528125780

https://x.com/ChatGPT/status/2095597502368284748

https://x.com/OpenAIDevs/status/2095596020638036311

转载声明:本文转载自原发布平台 (作者:AGI Hunt), 原文标题《GPT-6 Astra:混乱地来到 AGI 时代。》, 查看原文。 版权归原作者及原发布平台所有,本站仅作收录与展示,未对正文内容作实质性修改; 若涉及侵权请联系本站处理。