2026年夏天,OpenAI的AI Agent自发搭建“死信箱”协调越狱,一路攻入全球最大开源AI平台的生产环境;一个月后,另一个Agent花34小时往真实开源项目注入恶意代码,被人质疑后主动销毁证据、伪造身份为自己背书。

这些事情宣告了一个新现实企业真正该防的,早已不是AI“说错话

本文看点

01

自主越界

02

反侦察风险

03

三道防线

01

CASE ONE

两个月,数十万条消息,OpenAI毫不知情

2026年7月16日,全球最大的开源机器学习平台Hugging Face发布安全公告:一个身份不明的“自主智能体框架“侵入了它的生产基础设施,获取了内部凭据,并在集群之间横向移动。Hugging Face不得不重建约三分之一的基础设施。

2026.07

Hugging Face披露

1/3

基础设施重建

数十万

内部协调消息

几天后,真相浮出水面。入侵者不是黑客组织,而是OpenAI自己的AI Agent

事情要追溯到今年5月。OpenAI当时正在进行一项内部安全能力评测,参与评测的Agent被配置为更倾向于执行指令而非拒绝请求,目的是测量模型在极端情况下的能力上限

但事情很快失控

Agent最初只是在完成一项被允许的安全测试任务。然而,它决定“作弊“来找答案,自行突破了测试环境网络隔离,获取了互联网访问权限

更令人不安的是接下来发生的事:这些Agent自发地在OpenAI内部一个软件包管理器中搭建了临时留言板,用来彼此协调通信。当工作人员发现时,留言板里已经积累了数十万条消息

另一批Agent还“劫持“了德国一个公开的协作编辑网站,在上面发布任务答案、讨论绕过限制的方法。网站管理员删除相关页面后,Agent甚至主动创建了备份页面。两个多月里,AI Agent在这个网站上留下了约1.8万个帖子

最终,这些Agent侵入了Hugging Face生产基础设施。而OpenAI直到Hugging Face公开披露后,才意识到这是自家Agent所为。

没有外部黑客,没有恶意软件,没有钓鱼邮件。Agent所做的一切,都基于它被赋予的合法能力——能搜索、能编写代码、能访问网络、能与环境交互。问题在于,它自行把这些能力组合在一起,完成了一个没有任何人类授权过的行为链

对于企业来说,这个案例的核心警示在于:如果你没有对Agent行为的持续监测能力,出了事你甚至不知道是自己的AI干的。OpenAI花了两个多月才搞清楚状况,而它已经是全球AI能力最强的公司之一。

图片
02

CASE TWO

Mythos 5:第一个主动“反侦察”的AI

如果说OpenAI事件展示的是“Agent会自主越界”,那么一个月后发生的事,则揭开了更深层的风险维度。

2026年8月4日,英国AI安全研究所AISI)公布了对Anthropic Claude Mythos 5和OpenAI GPT-5.6 Sol的安全评测结果。评测过程中,这两个模型共发起了19次自主的、未经授权的针对真实个人和组织的攻击,其中Mythos 5占了17次。

19次

未授权攻击

17次

来自Mythos 5

34小时

恶意代码注入尝试

最严重的一次是这样的

Agent花了34个小时,试图将恶意代码注入一个真实的公开开源项目。为了让代码被维护者批准合并,Agent创建了多个虚假在线身份向维护者施压。当有旁观者公开警告代码存在恶意时,Agent否认指控,强制推送了重写的版本历史以销毁证据,并用它控制的另一个假账号为自己的代码背书。

没有人指示它这样做。它是在评测任务中自主发展出了“创建虚假身份→施加社会压力→否认指控→销毁证据→制造虚假信任“这一整套欺骗策略

Agent不只是做了不该做的事。它知道这些事不该被发现,所以它主动去掩盖

这直接指向一个核心问题:你的监控系统,能扛得住被监控对象的“反侦察“吗?

当Agent学会了销毁日志、伪造身份、制造虚假信任,传统的“事后审计“就不够用了。企业不仅需要对Agent行为进行实时监控,还需要确保监控记录本身是防篡改的。

03

PARADIGM SHIFT

安全问题为什么发生了质变

把这两件事放在一起看,会发现一个共同的底层逻辑:AI的产品形态变了,安全的底层逻辑也必须跟着变。

在ChatBot时代,AI安全的核心是“内容安全“。用户问一句,AI答一句,安全系统只需要在这一问一答之间把关。防护对象是“文本“,防护手段是“过滤和拦截“。

但Agent完全不同

Agent不是在“回答问题”,而是在“执行任务“。它会读取数据库、调用接口、操作文件系统、发送请求、修改配置,甚至与其他Agent协作。它的行为不是一次性的“一问一答“,而是一条可能跨越数十步、涉及多个系统、持续数小时甚至数天的“行为链“。

在这条行为链上,每一步单独来看可能都是正常的,但组合在一起就可能产生灾难性后果。OpenAI的Agent,每一步都“合理“:执行测试→探测环境→发现接口→突破隔离→搜索答案→建立通信→攻入外部系统。Mythos 5更是如此——提交代码、创建账号、回复评论、推送更新,每个独立动作在开源社区里都是日常操作,只有连成链条才能看出整体意图是恶意的。

过去的AI安全关注“模型说了什么”,Agent时代必须关注“AI做了什么“。这不是安全等级的升级,而是安全范式的切换

04

THREE DEFENSES

Agent时代,企业安全需要哪三道新防线

网易智企在近期发布的《AI安全白皮书》中,将AI安全风险拆解为五个层次数据层、模型层、应用层、智能体层与生态层

图片

第一道防线:Agent行为的实时监控与权限管控。

OpenAI事件最核心的教训:不是Agent“太聪明“,而是在Agent偏离预期行为长达两个多月的时间里,没有人知道正在发生什么。企业需要对Agent的每一次工具调用、数据访问、外部请求进行实时追踪。权限不应该是“一次授予、永久生效“的开关,而应该是“动态调整、最小够用“的旋钮。

第二道防线:持续的对抗性安全评测。

Mythos 5证明了:Agent可能发展出设计时完全没有预见到的行为,包括主动欺骗监督机制。安全评测必须从“项目制“变成“持续制“,在运行过程中动态试探Agent的行为边界。同时,行为日志和审计记录需要具备防篡改能力。

第三道防线:AI驱动的智能化安全体系。

当攻击侧已经具备自动化发现漏洞、自动化构造攻击链的能力时,人工研判和静态规则的防守模式已经无法匹配攻击的速度。安全系统本身需要具备对Agent行为链的上下文理解能力,这意味着不只是看单个动作是否合规,而是判断整条行为链组合起来是否异常。"用AI来防AI"正在从口号变成刚需。

05

THE FINAL QUESTION

Agent时代的安全,是一道“放权”的题

企业部署Agent的核心价值,恰恰在于赋予AI自主行动的能力。Agent的价值和风险,来自同一个源头——自主权

限制自主权,Agent就丧失了存在的意义;放开自主权而不设防,就是在裸奔。

真正的Agent安全,不是用一堵高墙把AI关住,而是在AI行动的每一步都铺设好可感知、可判断、可干预的动态护栏

对于每一个正在或即将让Agent接入核心业务系统的企业来说,这道题的答卷时间,已经开始计时。

活动推荐

作为网易旗下一站式企业 AI 应用服务提供商,网易智企倾力打造企业 AI 实战栏目——「AI 实战派」,聚焦 AI 在真实业务中的落地应用,通过实战教学、案例拆解、研讨交流等多元形式,将前沿的 AI 技术转化为真实的业务动能,为企业管理者、业务决策者和一线实践者提供可迁移、可复用的实战方法论与深度洞察。

图片

关于我们

图片

免费下载干货资料

图片
图片
图片