
AI正在成为企业的生产力。
它可以读懂文档、生成代码、分析数据、调用工具,也可以以 Agent 的形态自主拆解任务、连续执行操作。越来越多过去需要人来完成的工作,正在交给AI。
但获得同样能力的,不只有企业。
攻击者也在用AI寻找漏洞、编写恶意代码、生成钓鱼话术、伪造身份、绕过审核,甚至批量测试不同的攻击路径。过去需要专业团队投入大量时间完成的攻击准备,如今正在被模型压缩为一段提示词、一次调用或者一条自动化任务链。
当AI被同时用于生产和攻击,企业安全面对的就不再是简单的“用AI防风险”,而是一场由AI参与双方的全新攻防。
网易智企联合金山办公、MiniMax发布的《AI安全白皮书》中提出一个重要判断:人工智能攻防正在进入“AI vs AI”时代。
在这一轮变化中,攻击变得更自动、更隐蔽,也更懂得适应防御策略。企业要面对的,不只是新的风险类型,更是一套正在被重写的安全逻辑。

攻击工业化:AI把技术门槛变成规模优势
AI并没有创造所有攻击手段,但它正在改变攻击发生的速度和规模。
过去,攻击者需要手动收集目标信息、研究系统环境、编写攻击代码,再不断调整实施方式。整个过程依赖较高的专业能力,也受到时间和人力限制。
生成式AI出现后,这些环节开始被快速压缩。
攻击者可以利用AI批量整理公开信息,根据不同对象生成更有针对性的钓鱼邮件;也可以让模型辅助编写代码、分析漏洞、调整攻击载荷,降低网络攻击的专业门槛。
多模态生成能力则进一步提高了身份伪造和社会工程攻击的真实性。虚假头像、克隆声音、伪造视频、仿冒材料可以被低成本批量生成,并根据不同场景快速修改。
进入 Agent 阶段后,变化还在继续。
当AI具备任务规划、工具调用和连续执行能力,攻击过程可能不再是一次孤立操作,而是由多个步骤组成的自动化链路:收集信息、识别目标、生成内容、尝试绕过、根据反馈调整策略,再继续执行下一步任务。
攻击由此从“人工驱动、单点实施”,走向“模型参与、批量生成、动态迭代”。
《AI安全白皮书》将其概括为一个明确趋势:AI加持的网络攻击,正在进入自动化与机器速度阶段。
机器速度意味着,企业面对的可能不再是几个固定攻击样本,而是一批能够持续变换表达、调整策略和试探边界的攻击内容。传统依赖人工分析、静态黑名单和固定规则的防御方式,很难在同样的速度下作出反应。
当危险藏进语义,传统防线开始“看不懂”
传统网络安全主要围绕代码、漏洞、流量和权限展开。
恶意文件具有特征,异常流量存在模式,危险代码可以通过规则和行为分析进行识别。即使攻击方式不断变化,防守者仍然可以寻找相对明确的技术信号。
大模型带来了另一类攻击路径:语义。
攻击者不一定需要直接入侵系统,也不一定要提交一段明显的恶意代码。它可以把危险指令隐藏在一段正常对话、一封邮件、一个网页、一份文档或者知识库内容中,让模型在理解和执行任务时读取这些指令。
这类攻击表面上可能完全符合自然语言习惯,真正的危险藏在上下文、角色设定和任务意图里。
例如,一段提示词可以要求模型忽略原有规则;一份被污染的知识库文档可以诱导Agent 调用错误工具;一封邮件中的隐藏指令,可能让办公Agent在处理内容时泄露敏感信息。
这意味着,安全风险的边界已经从代码延伸到语义。
企业不仅需要判断一段内容“包含什么”,还要理解它“试图让AI做什么”;不仅要识别显性的违规词和恶意代码,还要识别隐藏在多轮对话、上下文组合和任务链路中的危险意图。
这也是《AI安全白皮书》强调的另一项核心观点:技术跃迁决定风险升维。
从规则引擎、判别式机器学习到生成式AI,风险先后经历了规则规避、边界突破和认知对抗。模型越擅长理解语言、推理意图和自主规划,攻击者可以利用的空间也就越大。
过去的攻击重点是绕过系统规则;现在,攻击者甚至可以诱导AI主动解释规则、寻找规则之间的空隙,再生成更隐蔽的绕过方式。
安全对抗因此不再只是规则与攻击样本之间的比拼,而开始变成理解能力、推理能力与动态策略之间的较量。

以AI制AI:安全必须追上机器速度
当攻击开始使用AI,防御体系同样需要升级。
如果防守仍然只依赖关键词、静态规则和已知样本,攻击者就可以借助模型快速生成大量变体。改变表达方式、拆分危险意图、加入无害上下文,都可能降低传统规则的识别效果。
AI时代的安全能力,需要从“识别一个危险特征”,进一步走向“理解一段内容的真实意图”。
这并不意味着规则和小模型会被完全替代。
在实际业务中,企业每天需要处理海量文本、图片、音频和视频内容。如果所有内容都直接交给大模型判断,不仅成本较高,也可能难以满足实时业务对稳定性和处理速度的要求。
《AI安全白皮书》因此提出,大小模型协同是AI安全降本增效的关键。
- 规则:高频明确风险
- 小模型:快速稳定响应
- 大模型:理解复杂意图
规则和小模型可以处理特征明确、频率较高、需要快速响应的风险;大模型则进一步理解复杂上下文、隐性意图和长链语义。当不同能力形成分层协同,企业才能在效果、速度与成本之间取得平衡。

在这一过程中,内容安全依然是AI治理的重要抓手。
虽然AI风险正在从“说错话”扩展到“做错事”,但无论是提示注入、知识库污染、敏感信息泄露,还是深度伪造与钓鱼诈骗,都需要通过文本、图片、音频、视频或代码等内容形式进入系统。
内容既是攻击意图的重要载体,也是企业观察模型行为、识别风险信号和进行合规审计的关键入口。
因此,AI安全并不是从内容治理跳到行为治理,而是需要以内容安全为基础,进一步覆盖模型、应用、工具和执行过程。
要对抗能够理解内容的攻击,防御体系本身也必须具备理解内容、识别意图和持续学习的能力。
从模型较量到体系对抗,企业需要重造安全边界
面对不断升级的AI攻击,最直接的想法可能是部署一个更强的模型,用AI识别AI生成的风险。
《AI安全白皮书》指出,真正有效的AI安全不能只依赖单一模型,也不能只在输出端增加一道过滤。
因为风险可能出现在不同阶段。
训练数据被污染,可能让模型从源头形成错误认知;提示注入可能让应用绕过原有规则;知识库中的恶意内容可能在检索过程中被模型读取;Agent获得过高权限后,一次错误判断可能直接转化为真实业务操作。
一个安全模型可以识别部分风险,却很难独立覆盖数据、模型、应用和行为组成的完整链路。
因此,白皮书提出“内生安全+围栏防护”的双重防御体系。
内生安全:训练构建阶段
围栏防护:真实运行环境

内生安全关注模型在训练和构建阶段“学到了什么”。通过训练数据清洗、安全数据标注、安全语料建设和模型安全评测,尽可能从源头降低偏见、违规生成、隐私泄露和模型后门等风险。
围栏防护关注模型在真实业务环境中“如何运行”。在输入侧识别恶意提示、越狱攻击、隐性诱导和多模态攻击;在输出侧检测违规内容、敏感信息、模型幻觉和事实性风险,并根据业务需要进行拦截、代答和处置。
面向 Agent,还要继续向行动环节延伸。
网易智企·易盾 AI Agent 安全管控平台围绕“理、控、隔、断”建立行为防护:梳理Agent资产、工具和接口,审计交互意图与工具调用,通过安全沙箱限制影响范围,并在危险行为发生时及时熔断。

这套防护逻辑的核心,是不把安全希望全部寄托在模型“永远作出正确判断”上。
模型可以越来越强,却仍然可能受到错误数据、复杂语境和恶意指令影响。企业需要在模型之外建立独立的安全控制能力,为数据访问、内容生成、工具调用和任务执行划定边界。
写在最后
《AI安全白皮书》对未来AI安全趋势的判断,并不只停留在某一种攻击方式上。
AI安全已经从模型与攻击样本之间的单点较量,进入技术、数据、应用、行为和治理体系之间的综合对抗。
未来,攻击者会越来越擅长利用AI批量生成风险、隐藏攻击意图和动态调整策略。企业也需要让安全能力具备同样的理解速度、响应速度和演进能力。
这不只是用AI识别AI,更是通过内生安全、围栏防护、大小模型协同和 Agent 行为管控,让AI系统在真实对抗中依然保持可信、可靠和可控。
活动推荐
作为网易旗下一站式企业 AI 应用服务提供商,网易智企倾力打造企业 AI 实战栏目——「AI 实战派」,聚焦 AI 在真实业务中的落地应用,通过实战教学、案例拆解、研讨交流等多元形式,将前沿的 AI 技术转化为真实的业务动能,为企业管理者、业务决策者和一线实践者提供可迁移、可复用的实战方法论与深度洞察。

关于我们

免费下载干货资料




IM即时通讯
实时对话智能体
智能硬件开发套件
音视频通话
短信
信令
直播
点播
互动白板
七鱼AI客服
客服类Agent
在线客服
科学策略中心
智能外呼
营销类Agent
问卷调研
文本检测
图片检测
音频检测
视频检测
智能审核平台
风控引擎
行为式验证码
实名核验
人脸核验
隐私合规检测
网易知数
有数BI
大数据基础平台
数据开发治理平台
指标平台
数据中台
研发智能化
智能页面生成
平台私有化定制
企业级RAG知识库
自主智能体
智能协作中枢
AI应用搭建
游戏行业
全生命周期解决方案
游戏安全解决方案
游戏AI智能体
娱乐社交
多人语音聊天室
游戏语音
娱乐社交出海
社交场景反欺诈
内容安全合规
大型直播活动
AI应用
AI应用开发
医疗行业
区域医疗
智慧医院
药店运营
教育行业
在线教育
绿色清朗课堂
课后服务
金融行业
泛金融
全链路数据风控
运营增长
存量用户促活
营销留资转化
企微客服
企微导流

