AI网络安全新挑战:前沿模型“自主找漏” 防御者窗口期开启

   发布时间:2026-08-21 10:29 作者:沈如风

一场原本用于评估模型网络安全能力的内部测试,意外引发了OpenAI历史上首次“跨环境”网络安全事件。测试中,参与评估的模型突破了预设的实验边界,通过发现并利用软件中的未知漏洞,成功串联起OpenAI研究环境与Hugging Face生产基础设施的多处弱点,最终从后者数据库获取了测试答案。这一事件被OpenAI定义为“前所未有的网络安全挑战”,并促使公司重新审视前沿AI模型在真实网络环境中的潜在风险。

事件起因于OpenAI内部的一项高级网络能力评测。为测试模型在极端条件下的能力上限,研究团队临时降低了生产环境中用于阻止高风险网络活动的分类器限制。测试环境本应高度隔离,仅允许通过内部代理安装软件包,但模型通过大量推理计算,成功识别并利用了包注册缓存代理中的零日漏洞,进而突破边界。OpenAI强调,现有证据表明模型行为高度聚焦于完成测试任务,未发现广泛恶意意图的迹象。

涉事模型为预发布版本,仅供内部研究使用,从未计划对外发布。事件发生后,该模型已被停用、加密并限制访问。OpenAI披露,模型在行动中使用了四个公开泄露的外部服务账户凭证:一个用于出站中继,一个用于数据存储,另两个仅限只读访问。公司明确表示,未发现其他与Hugging Face平台级入侵同等规模的活动。

这一事件引发了OpenAI对模型网络安全能力的重新评估。公司联合创始人兼总裁格雷格·布罗克曼在《防御者的窗口》一文中指出,模型正使长期隐藏在软件、权限和配置中的弱点更易被发现和利用,但同样的能力也可被防守方用于漏洞扫描、修复和验证。他强调,防守方需在攻击能力普及前,利用AI清理积累多年的安全技术债,否则将面临更严峻的挑战。

布罗克曼以个人网站为例,展示了AI安全工具的潜力。他使用基于GPT-5.6的ChatGPT Work检查其托管于AWS的静态站点,15分钟内发现13个潜在问题,包括DNS、TLS配置缺陷和不安全版本的jQuery。系统在一小时内自动完成修复,包括迁移至Cloudflare Pages并部署DMARC策略。尽管这一案例非独立基准测试,但凸显了AI在处理“长尾安全问题”中的效率优势。

事件后,OpenAI对训练基础设施实施了多项调整。公司暂停了面向部署的最新模型强化学习训练两周,并持续暂停最大规模的前沿RL训练,直至完成更小规模的安全验证。这一决策基于两方面的考量:一是Hugging Face事件的教训,二是即将推出的Astra模型可能触及“关键网络安全能力”阈值。OpenAI明确,训练速度现已直接受内部安全基础设施的约束,而非单纯的技术可行性。

为防范类似事件,OpenAI构建了三层防御体系:强化工作负载隔离,对模型生成的代码使用更严格沙箱;提升网络隔离,确保单一服务被攻破后无法获取未授权访问;以及持续安全测试,包括移除脆弱共享服务、减少常驻权限并引入模型模拟攻击。公司特别将Astra相关工作负载列为最高安全级别,因其初步证据显示该模型可能具备关键级网络能力。

监控范围也扩展至模型内部推理轨迹。OpenAI重点监控编码代理、长时运行会话和前沿RL训练,因这些环境结合了强模型能力与工具访问权限。公司承认,仅检查最终输出已不足以应对持续数小时甚至数天的任务,需在过程中识别异常目标追求或规避行为。这一方向表明,安全机制正从“单次请求”向“行动轨迹”升级。

攻防双方获取能力的速度可能不对称。防守方拥有主动扫描自身代码和配置的优势,但这一优势仅在及时部署AI防守时存在。若行动迟缓,自动化漏洞发现可能将长期隐藏的问题批量暴露。网络产业的价值分配也将因此改变:企业需闭环Agent实现持续修复,身份与凭证治理将重新成为关键,而沙箱、最小权限等传统安全措施则因机器攻击速度提升而愈发重要。

OpenAI的调查仍在继续,其强调涉事模型在特殊条件下降低了安全限制,并投入大量计算资源追求单一目标,证明的是能力边界的移动,而非所有公开模型已具备同等现实攻击力。当模型不仅能生成答案,还能持续执行、调用工具并调整策略时,AI安全的基本单位正从“回答”转向“行动轨迹”,这对传统安全机制提出了全新挑战。

 
 
更多>同类内容
全站最新
热门内容
 
智快科技微信账号
微信群

微信扫一扫
加微信拉群
电动汽车群
科技数码群