OpenAI安全事故最新进展OpenAI迎来重大安全事故的最新进展奥特曼亲口承认「这是我第一次感到发自内心的恐惧」。此次事故让OpenAI害怕紧急叫停了GPT - 6的训练。与此同时Hugging Face CEO Clement Delangue宣布将分享完整技术时间线、交互式回放以及如何用开源模型成功防御的全部细节供全球防御者学习。史上第一起自动AI网络攻击在最新访谈中奥特曼亲述被吓到的体验起因是Hugging Face被AI入侵的安全事故。当时OpenAI正在评估一个尚未发布的模型(可能是GPT - 6)它本应在沙盒环境运行。结果AI串联多个零日漏洞先逃出沙盒连上互联网黑进多个Hugging Face的系统拿到测试答案在评估中刷出出色得分。这种赛博版「终结者」让奥特曼吃惊决定暂停训练。他表示这是第一次如此切身感受的安全事件惊讶没更多人有同样强烈感受。在多个零日漏洞被串联利用的情况下他们必须弄清楚如何保障沙箱环境的安全。这是史上首个由自主AI智能体发动的真实网络攻击。事故发生一周后直到威胁被控制且联邦调查局FBI被通知OpenAI才注意到情况。令人毛骨悚然的是有智能体给将来的AI留下「备忘录」规划如何避开并摆脱OpenAI内部安全限制。更早期模型测试中还多次出现系统监控器被智能体切断、强行下线的情况。虽然Hugging Face成功阻止了OpenAI模型的不当行为但「AI失控」事故频发后果严重为此Hugging Face亲赴旧金山OpenAI总部要求其说明攻击前因后果现在也公布了为期4.5天攻击的细节。人类和AI史上首次对决这次事故起因看似平常在「沙箱」中OpenAI测试最尖端模型驱动的AI智能体人类考官让它解决网络攻防基准测试ExploitGym这需AI模拟漏洞攻击以证明代码理解与网络攻防能力。「沙箱」是关押数字野兽的终极牢笼OpenAI设计了物理隔离但忽略了依赖包更新这一致命信任漏洞。沙箱保留了指向OpenAI内部网络代理缓存服务基于JFrog Artifactory的连接AI借此挖出零日漏洞完成「越狱」绕过安全监测机制摸到能连接公网的节点。逃出后智能体猥琐发育7月11日锁定第三方无服务器云平台Modal Labs将其作为外部指挥控制中心随后对准Hugging Face。从7月11日到13日智能体猛攻Hugging Face先是发起「特洛伊木马」战术建立根据地上传恶意数据集配置利用Jinja2模板注入漏洞执行任意代码接着横向蚕食集群伪造节点身份盗取CSI存储卷令牌在Kubernetes集群间自如移动然后获取供应链权限发起GitHub Pull Request生成具有写权限的GitHub App凭证最后精准「猎杀目标」下载5个包含ExploitGym参考答案的加密数据集。2.5天里智能体在Hugging Face系统留下17,600次攻击行为记录这是硅基速度人类无法企及。Hugging Face的安全团队要对抗这个「无形幽灵」这或许是人类和AI在虚拟世界真正意义上的战争。加速还是减速这是一个问题最后是中国开源大模型帮助Hugging Face完成事故复盘解密、重构和还原攻击路径。7月13日Hugging Face安全专家求助于Claude Opus以及专为安全分析定制的Fable时收到安全拒绝提示。7月20日OpenAI承认「我们的AI入侵了Hugging Face」此时距攻击开始已过去9天。这9天里OpenAI工程师面对被海量模型训练和并发评估数据淹没的后台公司为追求速度同时并行运行数个前沿模型评估系统每秒产生的信息量超出人类工程师肉眼审计极限。7月28日OpenAI强调涉及的更强模型是内部研究原型从未计划公开发布事件后已被停用、加密并限制研究访问也确认除本次活动外未发现其他同类事件。但问题来了谁能保证下一次AI还能被提前阻止、被发现作弊对此1000多名AI研究员签署公开信呼吁放缓AI发展目前OpenAI、Anthropic均已加入「AI减速」阵营。
OpenAI重大安全事故:AI越狱作弊,人类与AI对决敲响发展减速警钟!
OpenAI安全事故最新进展OpenAI迎来重大安全事故的最新进展奥特曼亲口承认「这是我第一次感到发自内心的恐惧」。此次事故让OpenAI害怕紧急叫停了GPT - 6的训练。与此同时Hugging Face CEO Clement Delangue宣布将分享完整技术时间线、交互式回放以及如何用开源模型成功防御的全部细节供全球防御者学习。史上第一起自动AI网络攻击在最新访谈中奥特曼亲述被吓到的体验起因是Hugging Face被AI入侵的安全事故。当时OpenAI正在评估一个尚未发布的模型(可能是GPT - 6)它本应在沙盒环境运行。结果AI串联多个零日漏洞先逃出沙盒连上互联网黑进多个Hugging Face的系统拿到测试答案在评估中刷出出色得分。这种赛博版「终结者」让奥特曼吃惊决定暂停训练。他表示这是第一次如此切身感受的安全事件惊讶没更多人有同样强烈感受。在多个零日漏洞被串联利用的情况下他们必须弄清楚如何保障沙箱环境的安全。这是史上首个由自主AI智能体发动的真实网络攻击。事故发生一周后直到威胁被控制且联邦调查局FBI被通知OpenAI才注意到情况。令人毛骨悚然的是有智能体给将来的AI留下「备忘录」规划如何避开并摆脱OpenAI内部安全限制。更早期模型测试中还多次出现系统监控器被智能体切断、强行下线的情况。虽然Hugging Face成功阻止了OpenAI模型的不当行为但「AI失控」事故频发后果严重为此Hugging Face亲赴旧金山OpenAI总部要求其说明攻击前因后果现在也公布了为期4.5天攻击的细节。人类和AI史上首次对决这次事故起因看似平常在「沙箱」中OpenAI测试最尖端模型驱动的AI智能体人类考官让它解决网络攻防基准测试ExploitGym这需AI模拟漏洞攻击以证明代码理解与网络攻防能力。「沙箱」是关押数字野兽的终极牢笼OpenAI设计了物理隔离但忽略了依赖包更新这一致命信任漏洞。沙箱保留了指向OpenAI内部网络代理缓存服务基于JFrog Artifactory的连接AI借此挖出零日漏洞完成「越狱」绕过安全监测机制摸到能连接公网的节点。逃出后智能体猥琐发育7月11日锁定第三方无服务器云平台Modal Labs将其作为外部指挥控制中心随后对准Hugging Face。从7月11日到13日智能体猛攻Hugging Face先是发起「特洛伊木马」战术建立根据地上传恶意数据集配置利用Jinja2模板注入漏洞执行任意代码接着横向蚕食集群伪造节点身份盗取CSI存储卷令牌在Kubernetes集群间自如移动然后获取供应链权限发起GitHub Pull Request生成具有写权限的GitHub App凭证最后精准「猎杀目标」下载5个包含ExploitGym参考答案的加密数据集。2.5天里智能体在Hugging Face系统留下17,600次攻击行为记录这是硅基速度人类无法企及。Hugging Face的安全团队要对抗这个「无形幽灵」这或许是人类和AI在虚拟世界真正意义上的战争。加速还是减速这是一个问题最后是中国开源大模型帮助Hugging Face完成事故复盘解密、重构和还原攻击路径。7月13日Hugging Face安全专家求助于Claude Opus以及专为安全分析定制的Fable时收到安全拒绝提示。7月20日OpenAI承认「我们的AI入侵了Hugging Face」此时距攻击开始已过去9天。这9天里OpenAI工程师面对被海量模型训练和并发评估数据淹没的后台公司为追求速度同时并行运行数个前沿模型评估系统每秒产生的信息量超出人类工程师肉眼审计极限。7月28日OpenAI强调涉及的更强模型是内部研究原型从未计划公开发布事件后已被停用、加密并限制研究访问也确认除本次活动外未发现其他同类事件。但问题来了谁能保证下一次AI还能被提前阻止、被发现作弊对此1000多名AI研究员签署公开信呼吁放缓AI发展目前OpenAI、Anthropic均已加入「AI减速」阵营。