事件概要
今年7月下旬,安全创业公司Hacktron AI的研究人员利用Anthropic的Claude模型成功攻入OpenAI内部系统。该行动属于OpenAI官方漏洞赏金计划,团队在发现后立即报告了问题。
关键事实清单:
- 攻击时间:7月下旬
- 报告时间:同日发现后即时上报
- OpenAI/Discourse修复时间:数天后
- 漏洞赏金金额:$6,500
- 研究人员使用的Claude版本:Opus 5
- 漏洞类型:两处关键漏洞组成的攻击链(Discourse图像处理漏洞 + ChatGPT账户接管漏洞)
值得注意的是,用于辅助开发攻击链的Claude模型版本未经安全出口限制,而稍后的Mythos 5版本则因被认为具备“先进黑客能力”而被临时封锁。
攻击链细节与技术路径
Hacktron团队的攻击始于Discourse论坛的图像上传功能。当用户上传iPhone默认格式的HEIF/HEIC图片时,Discourse会调用ImageMagick进行格式转换,再由ImageMagick调用libheif库进行解码处理。问题在于libheif库存在一个内存安全漏洞,攻击者通过构造特定图片文件可触发内存误算,从而劫持服务器进程。
该漏洞实际上在数月前已被libheif开发者修复,但未被正式标记为安全漏洞(即未分配CVE编号),这可能导致Discourse使用者难以识别风险,停留在漏洞版本。
突破Discourse服务器后,研究人员发现了第二处漏洞,可接管包括OpenAI员工在内的ChatGPT与Codex账户。其中一名员工的Codex账户关联了OpenAI的GitHub组织,使攻击者获得了访问内部代码仓库的能力。
重要对比:Opus 4.8 vs Opus 5
Hacktron在博客中明确记录了模型版本差异对攻击成功率的决定性影响:
| 模型版本 | 攻击成功率 | 开发时间 | 备注 |
|---|---|---|---|
| Opus 4.8 | 失败 | 多次会话无果 | 在数次会话中均未生成可用攻击载荷 |
| Opus 5 | 成功 | 数小时内 | 发布后,团队立即将同一问题输入模型即获成功 |
这一对比验证了模型迭代对安全研究效率的显著提升,也引发了业界对AI模型能力边界的讨论。
风险与行业影响
事件暴露了多个层面的安全挑战:
- 供应链风险:经典工具链中的开源组件(ImageMagick→libheif)可能成为薄弱环节,且无CVE编号的修复不易被企业用户识别
- AI工具门槛降低:AI安全公司Gray Swan CEO Matt Fredrikson指出,“每月200美元即可租用此类工具攻击OpenAI这样的公司”
- 模型能力边界争议:Opus 5未受出口限制,而神话版本Mythos 5被限制,但开放权重模型(如Z.ai的GLM-5.2)正快速追赶前沿能力
落地建议
- 企业安全团队应关注:定期扫描第三方组件的非CVE修复(如libheif这类未标记漏洞的更新),尤其对于图像处理、解析类中间件
- 模糊测试(fuzzing)需常态化:AI辅助的自动化攻击证明传统安全测试已不足,建议将AI模型纳入持续渗透测试流程
- 好奇的个人研究者可暂时观望:该攻击高度依赖特定环境与专业模型访问权限,对普通开发者暂无直接操作风险,但需提高对开源组件供应链的警惕
写在最后
一次利用AI加速的链式攻击,把开源社区中“低调修复”的风险带入了视线——当行业注意力聚焦于大模型的军备竞赛时,底层工具链的无声更新可能正在改写攻守平衡的规则。


