梦晨 发自 凹非寺
量子位 | 公众号 QbitAI
啊这,OpenAI的服务器被Claude帮着黑了!
一个只有3人的安全研究小组,用不到72小时,从OpenAI社区论坛一路打进了内部代码仓库。

当初Astra还没发布就到处黑别人,又黑Hugging Face又黑德语Wiki的,这一波是什么天道好轮回吗。

而且这也暴露出一个另问题,Claude说好的安全对齐呢?

一张图片引发的“血案”
整个攻击的起点,是OpenAI的开发者社区论坛,这个论坛基于开源软件Discourse搭建,支持用户上传图片。
实施攻击的HacktronAI团队由Harsh Jaiswal领队,成员包括Mohan Pedhapati和Rahul Maini,三人此前曾与Perplexity、Vercel等公司合作过安全研究。
7月23日,他们开始审查Discourse的图片上传流程,发现了一条特殊路径:
当用户上传HEIC或HEIF格式的图片时,Discourse的常规图片检测工具FastImage无法处理,会将文件转交给ImageMagick,而ImageMagick底层依赖的图片解析库叫libheif。
问题就出在这里,libheif此前有一个堆缓冲区溢出漏洞,上游代码早在一年前就做了修复,但这次修复没有被标记为安全相关,也没有分配CVE编号。
结果就是Discourse所用的Docker镜像基于Debian 12,安装的libheif版本仍然存在这个漏洞,甚至Debian 13当时也没有及时收到安全补丁。
三人利用这个漏洞构造了恶意的HEIF文件,上传到论坛后触发了ImageMagick的解析流程,最终在OpenAI的论坛服务器上实现了远程代码执行。
但这只是第一步。

真正让事态升级的是第二个漏洞:OpenAI的SSO单点登录存在一个身份验证缺陷。
OpenAI的论坛支持「用OpenAI账号登录」,通过auth.openai.com进行身份认证。攻击者利用论坛服务器上的代码执行权限,结合这个SSO缺陷,直接接管了曾经登录过论坛的用户的ChatGPT和Codex账号,其中包括OpenAI自己的员工。
这些账号中,有的已经关联了Outlook、Gmail、Google Drive、Slack、GitHub等外部服务。攻击面远远超出了ChatGPT本身。
为了证明攻击的真实性同时不接触任何敏感信息,团队选择了一个已连接OpenAI GitHub组织的员工账号,通过其Codex向OpenAI内部monorepo提交了一个无害的PR。整个过程中他们没有阅读任何内部代码。

HacktronAI团队特别强调,这个SSO漏洞并非Discourse特有的问题。任何使用OpenAI SSO的第一方或第三方服务一旦被攻破,都会导致同样的账号接管结果,Discourse只是碰巧成了证明这条路径的入口。

Claude帮着黑了OpenAI
整个攻击过程中最值得关注的细节之一,是AI在其中扮演的角色。
7月23日团队启动研究后,首先用Anthropic的Claude Opus 4.8对Discourse的Docker镜像进行安全审查。
Opus 4.8成功发现了libheif中未被回移的安全修复,并构建了一个部分可用的漏洞利用程序,但在面对开启了ASLR地址空间随机化的真实Discourse环境时,经过多轮尝试始终无法生成稳定的exploit。
转折点出现在7月24日,Anthropic发布了Claude Opus 5。

团队立即改用新版本,Opus 5在3小时内先产出了一个ARM64架构下的可用exploit,随后被要求移植到Discourse使用的x86-64环境和jemalloc内存分配器配置上。
到7月25日凌晨6点,团队已经在本地确认了通过图片上传实现的远程代码执行。
之后,团队将Claude置于自主循环模式,让它对自己的Discourse Cloud测试实例发起攻击,为了绕过Opus拒绝攻击真实远程服务器的限制,他们通过代理将目标伪装成了一个CTF竞赛靶机。
等到上午10点再去检查时,AI已经在Discourse Cloud上拿到了代码执行权限,并通过读取/etc/hosts文件验证了访问。
从发现漏洞到完成整条攻击链,AI承担了大量原本需要稀缺专业知识的工作。
团队后来在更大范围的HEIF Heist研究项目中进一步验证了这一点:整个项目历时两个月,覆盖了Slack、Meta、GitHub Enterprise等多个目标,总计消耗的token成本不到3000美元,三个研究人员完成了全部工作,将exploit适配到每个新目标通常只需要一两天。
团队还观察到,每一代新模型的能力提升都是可感知的。
Opus 4.8在ASLR环境下反复失败的任务,Opus 5在几小时内就解决了。而在后续需要在完全未知的目标环境中盲打exploit时,GPT-5.6 Sol又展现出了比Opus 5更强的适应能力。
一个漏洞修复了,但……
漏洞报告提交后,各方的响应速度都不慢。
OpenAI在收到报告约14小时后修复了SSO问题。
Discourse那边,报告提交于周六,周日回复,周一就准备好了补丁,同时开始对ImageMagick进行沙箱隔离。7月28日,Discourse发布了安全公告GHSA-vhm9-85gw-x335。
9月1日,OpenAI正式给团队结算了6500美元的赏金,并注明这笔奖励针对的是OpenAI侧的SSO发现,因为针对Discourse论坛的测试本身并不在OpenAI漏洞赏金计划的范围内。
这下可算让好久不见的老朋友Gary Macus逮到机会嘲讽了。

而libheif这个问题的影响范围远不止OpenAI一家。
HacktronAI将这项研究扩展成了名为「HEIF Heist」的系统性调查,发现同一个图片解析库的漏洞影响了Slack、Meta、GitHub Enterprise、Ruby on Rails,以及Next.js、Astro、Gatsby等多个Node.js框架。
任何接受用户上传的HEIC、HEIF或AVIF图片并进行服务端处理的应用,都可能存在风险。在整个研究过程中,除了Shopify之外,没有任何一家公司检测到了攻击活动,即使攻击者发送了数千张图片并多次导致图片处理进程崩溃。
三个人,不到3000美元的AI算力成本,72小时攻破OpenAI服务器。
软件行业长期依赖的「复杂性即安全」正在失效。
已知的内存损坏漏洞过去之所以对大多数公司构不成实际威胁,是因为将漏洞转化为可靠exploit所需的专业知识、时间和对目标环境的了解,门槛极高。
AI正在把这些稀缺的专业能力转化为可购买的算力,曾经需要一个资深团队花几个月才能完成的工作,现在压缩到了几天。
参考链接:
[1]https://www.hacktron.ai/blog/hacking-openai
[2]https://x.com/S1r1u5_/status/2100777801335095383
一键三连「点赞」「转发」「小心心」
欢迎在评论区留下你的想法!
— 完 —
🌟 点亮星标 🌟