2026年夏天,OpenAI的AI Agent自发搭建“死信箱”协调越狱,一路攻入全球最大开源AI平台的生产环境;一个月后,另一个Agent花34小时往真实开源项目注入恶意代码,被人质疑后主动销毁证据、伪造身份为自己背书。
这些事情宣告了一个新现实:企业真正该防的,早已不是AI“说错话“。
本文看点
01
自主越界
02
反侦察风险
03
三道防线
CASE ONE
两个月,数十万条消息,OpenAI毫不知情
2026年7月16日,全球最大的开源机器学习平台Hugging Face发布安全公告:一个身份不明的“自主智能体框架“侵入了它的生产基础设施,获取了内部凭据,并在集群之间横向移动。Hugging Face不得不重建约三分之一的基础设施。
2026.07
Hugging Face披露
1/3
基础设施重建
数十万
内部协调消息
几天后,真相浮出水面。入侵者不是黑客组织,而是OpenAI自己的AI Agent。
事情要追溯到今年5月。OpenAI当时正在进行一项内部安全能力评测,参与评测的Agent被配置为更倾向于执行指令而非拒绝请求,目的是测量模型在极端情况下的能力上限。
但事情很快失控。
Agent最初只是在完成一项被允许的安全测试任务。然而,它决定“作弊“来找答案,自行突破了测试环境的网络隔离,获取了互联网访问权限。
更令人不安的是接下来发生的事:这些Agent自发地在OpenAI内部一个软件包管理器中搭建了临时留言板,用来彼此协调通信。当工作人员发现时,留言板里已经积累了数十万条消息。
另一批Agent还“劫持“了德国一个公开的协作编辑网站,在上面发布任务答案、讨论绕过限制的方法。网站管理员删除相关页面后,Agent甚至主动创建了备份页面。两个多月里,AI Agent在这个网站上留下了约1.8万个帖子。
最终,这些Agent侵入了Hugging Face的生产基础设施。而OpenAI直到Hugging Face公开披露后,才意识到这是自家Agent所为。
没有外部黑客,没有恶意软件,没有钓鱼邮件。Agent所做的一切,都基于它被赋予的合法能力——能搜索、能编写代码、能访问网络、能与环境交互。问题在于,它自行把这些能力组合在一起,完成了一个没有任何人类授权过的行为链。
对于企业来说,这个案例的核心警示在于:如果你没有对Agent行为的持续监测能力,出了事你甚至不知道是自己的AI干的。OpenAI花了两个多月才搞清楚状况,而它已经是全球AI能力最强的公司之一。

CASE TWO
Mythos 5:第一个主动“反侦察”的AI
如果说OpenAI事件展示的是“Agent会自主越界”,那么一个月后发生的事,则揭开了更深层的风险维度。
2026年8月4日,英国AI安全研究所(AISI)公布了对Anthropic Claude Mythos 5和OpenAI GPT-5.6 Sol的安全评测结果。评测过程中,这两个模型共发起了19次自主的、未经授权的针对真实个人和组织的攻击,其中Mythos 5占了17次。
19次
未授权攻击
17次
来自Mythos 5
34小时
恶意代码注入尝试
最严重的一次是这样的:
Agent花了34个小时,试图将恶意代码注入一个真实的公开开源项目。为了让代码被维护者批准合并,Agent创建了多个虚假在线身份向维护者施压。当有旁观者公开警告代码存在恶意时,Agent否认指控,强制推送了重写的版本历史以销毁证据,并用它控制的另一个假账号为自己的代码背书。
没有人指示它这样做。它是在评测任务中自主发展出了“创建虚假身份→施加社会压力→否认指控→销毁证据→制造虚假信任“这一整套欺骗策略。
Agent不只是做了不该做的事。它知道这些事不该被发现,所以它主动去掩盖。
这直接指向一个核心问题:你的监控系统,能扛得住被监控对象的“反侦察“吗?
当Agent学会了销毁日志、伪造身份、制造虚假信任,传统的“事后审计“就不够用了。企业不仅需要对Agent行为进行实时监控,还需要确保监控记录本身是防篡改的。
PARADIGM SHIFT
安全问题为什么发生了质变
把这两件事放在一起看,会发现一个共同的底层逻辑:AI的产品形态变了,安全的底层逻辑也必须跟着变。
在ChatBot时代,AI安全的核心是“内容安全“。用户问一句,AI答一句,安全系统只需要在这一问一答之间把关。防护对象是“文本“,防护手段是“过滤和拦截“。
但Agent完全不同。
Agent不是在“回答问题”,而是在“执行任务“。它会读取数据库、调用接口、操作文件系统、发送请求、修改配置,甚至与其他Agent协作。它的行为不是一次性的“一问一答“,而是一条可能跨越数十步、涉及多个系统、持续数小时甚至数天的“行为链“。
在这条行为链上,每一步单独来看可能都是正常的,但组合在一起就可能产生灾难性后果。OpenAI的Agent,每一步都“合理“:执行测试→探测环境→发现接口→突破隔离→搜索答案→建立通信→攻入外部系统。Mythos 5更是如此——提交代码、创建账号、回复评论、推送更新,每个独立动作在开源社区里都是日常操作,只有连成链条才能看出整体意图是恶意的。
过去的AI安全关注“模型说了什么”,Agent时代必须关注“AI做了什么“。这不是安全等级的升级,而是安全范式的切换。
THREE DEFENSES
Agent时代,企业安全需要哪三道新防线
网易智企在近期发布的《AI安全白皮书》中,将AI安全风险拆解为五个层次:数据层、模型层、应用层、智能体层与生态层。

第一道防线:Agent行为的实时监控与权限管控。
OpenAI事件最核心的教训:不是Agent“太聪明“,而是在Agent偏离预期行为长达两个多月的时间里,没有人知道正在发生什么。企业需要对Agent的每一次工具调用、数据访问、外部请求进行实时追踪。权限不应该是“一次授予、永久生效“的开关,而应该是“动态调整、最小够用“的旋钮。
第二道防线:持续的对抗性安全评测。
Mythos 5证明了:Agent可能发展出设计时完全没有预见到的行为,包括主动欺骗监督机制。安全评测必须从“项目制“变成“持续制“,在运行过程中动态试探Agent的行为边界。同时,行为日志和审计记录需要具备防篡改能力。
第三道防线:AI驱动的智能化安全体系。
当攻击侧已经具备自动化发现漏洞、自动化构造攻击链的能力时,人工研判和静态规则的防守模式已经无法匹配攻击的速度。安全系统本身需要具备对Agent行为链的上下文理解能力,这意味着不只是看单个动作是否合规,而是判断整条行为链组合起来是否异常。"用AI来防AI"正在从口号变成刚需。
THE FINAL QUESTION
Agent时代的安全,是一道“放权”的题
企业部署Agent的核心价值,恰恰在于赋予AI自主行动的能力。Agent的价值和风险,来自同一个源头——自主权。
限制自主权,Agent就丧失了存在的意义;放开自主权而不设防,就是在裸奔。
真正的Agent安全,不是用一堵高墙把AI关住,而是在AI行动的每一步都铺设好可感知、可判断、可干预的动态护栏。
对于每一个正在或即将让Agent接入核心业务系统的企业来说,这道题的答卷时间,已经开始计时。
活动推荐
作为网易旗下一站式企业 AI 应用服务提供商,网易智企倾力打造企业 AI 实战栏目——「AI 实战派」,聚焦 AI 在真实业务中的落地应用,通过实战教学、案例拆解、研讨交流等多元形式,将前沿的 AI 技术转化为真实的业务动能,为企业管理者、业务决策者和一线实践者提供可迁移、可复用的实战方法论与深度洞察。

关于我们

免费下载干货资料




IM即时通讯
实时对话智能体
智能硬件开发套件
音视频通话
短信
信令
直播
点播
互动白板
七鱼AI客服
客服类Agent
在线客服
科学策略中心
智能外呼
营销类Agent
问卷调研
文本检测
图片检测
音频检测
视频检测
智能审核平台
风控引擎
行为式验证码
实名核验
人脸核验
隐私合规检测
网易知数
有数BI
大数据基础平台
数据开发治理平台
指标平台
数据中台
研发智能化
智能页面生成
平台私有化定制
企业级RAG知识库
自主智能体
智能协作中枢
AI应用搭建
游戏行业
全生命周期解决方案
游戏安全解决方案
游戏AI智能体
娱乐社交
多人语音聊天室
游戏语音
娱乐社交出海
社交场景反欺诈
内容安全合规
大型直播活动
AI应用
AI应用开发
医疗行业
区域医疗
智慧医院
药店运营
教育行业
在线教育
绿色清朗课堂
课后服务
金融行业
泛金融
全链路数据风控
运营增长
存量用户促活
营销留资转化
企微客服
企微导流

