图片

AI正在成为企业的生产力。

它可以读懂文档、生成代码、分析数据、调用工具,也可以以 Agent 的形态自主拆解任务、连续执行操作。越来越多过去需要人来完成的工作,正在交给AI。

但获得同样能力的,不只有企业。

攻击者也在用AI寻找漏洞、编写恶意代码、生成钓鱼话术、伪造身份、绕过审核,甚至批量测试不同的攻击路径。过去需要专业团队投入大量时间完成的攻击准备,如今正在被模型压缩为一段提示词、一次调用或者一条自动化任务链。

当AI被同时用于生产和攻击,企业安全面对的就不再是简单的“用AI防风险”,而是一场由AI参与双方的全新攻防。

网易智企联合金山办公、MiniMax发布的《AI安全白皮书》中提出一个重要判断:人工智能攻防正在进入“AI vs AI”时代。

在这一轮变化中,攻击变得更自动、更隐蔽,也更懂得适应防御策略。企业要面对的,不只是新的风险类型,更是一套正在被重写的安全逻辑。

图片

 

攻击工业化:AI把技术门槛变成规模优势

AI并没有创造所有攻击手段,但它正在改变攻击发生的速度和规模。

过去,攻击者需要手动收集目标信息、研究系统环境、编写攻击代码,再不断调整实施方式。整个过程依赖较高的专业能力,也受到时间和人力限制。

生成式AI出现后,这些环节开始被快速压缩。

攻击者可以利用AI批量整理公开信息,根据不同对象生成更有针对性的钓鱼邮件;也可以让模型辅助编写代码、分析漏洞、调整攻击载荷,降低网络攻击的专业门槛。

多模态生成能力则进一步提高了身份伪造和社会工程攻击的真实性。虚假头像、克隆声音、伪造视频、仿冒材料可以被低成本批量生成,并根据不同场景快速修改。

进入 Agent 阶段后,变化还在继续。

当AI具备任务规划、工具调用和连续执行能力,攻击过程可能不再是一次孤立操作,而是由多个步骤组成的自动化链路:收集信息、识别目标、生成内容、尝试绕过、根据反馈调整策略,再继续执行下一步任务。

攻击由此从“人工驱动、单点实施”,走向“模型参与、批量生成、动态迭代”。

《AI安全白皮书》将其概括为一个明确趋势:AI加持的网络攻击,正在进入自动化与机器速度阶段

机器速度意味着,企业面对的可能不再是几个固定攻击样本,而是一批能够持续变换表达、调整策略和试探边界的攻击内容。传统依赖人工分析、静态黑名单和固定规则的防御方式,很难在同样的速度下作出反应。

当危险藏进语义,传统防线开始“看不懂”

传统网络安全主要围绕代码、漏洞、流量和权限展开。

恶意文件具有特征,异常流量存在模式,危险代码可以通过规则和行为分析进行识别。即使攻击方式不断变化,防守者仍然可以寻找相对明确的技术信号

大模型带来了另一类攻击路径语义

攻击者不一定需要直接入侵系统,也不一定要提交一段明显的恶意代码。它可以把危险指令隐藏在一段正常对话、一封邮件、一个网页、一份文档或者知识库内容中,让模型在理解和执行任务时读取这些指令。

这类攻击表面上可能完全符合自然语言习惯,真正的危险藏在上下文、角色设定和任务意图里。

例如,一段提示词可以要求模型忽略原有规则;一份被污染的知识库文档可以诱导Agent 调用错误工具;一封邮件中的隐藏指令,可能让办公Agent在处理内容时泄露敏感信息。

这意味着,安全风险的边界已经从代码延伸到语义。

企业不仅需要判断一段内容“包含什么”,还要理解它“试图让AI做什么”;不仅要识别显性的违规词和恶意代码,还要识别隐藏在多轮对话、上下文组合和任务链路中的危险意图。

这也是《AI安全白皮书》强调的另一项核心观点:技术跃迁决定风险升维

从规则引擎、判别式机器学习到生成式AI,风险先后经历了规则规避、边界突破和认知对抗。模型越擅长理解语言、推理意图和自主规划,攻击者可以利用的空间也就越大。

过去的攻击重点是绕过系统规则;现在,攻击者甚至可以诱导AI主动解释规则、寻找规则之间的空隙,再生成更隐蔽的绕过方式。

安全对抗因此不再只是规则与攻击样本之间的比拼,而开始变成理解能力、推理能力与动态策略之间的较量。

图片

以AI制AI:安全必须追上机器速度

当攻击开始使用AI,防御体系同样需要升级。

如果防守仍然只依赖关键词、静态规则和已知样本,攻击者就可以借助模型快速生成大量变体。改变表达方式、拆分危险意图、加入无害上下文,都可能降低传统规则的识别效果。

AI时代的安全能力,需要从“识别一个危险特征”,进一步走向“理解一段内容的真实意图”。

这并不意味着规则和小模型会被完全替代。

在实际业务中,企业每天需要处理海量文本、图片、音频和视频内容。如果所有内容都直接交给大模型判断,不仅成本较高,也可能难以满足实时业务对稳定性和处理速度的要求。

《AI安全白皮书》因此提出,大小模型协同是AI安全降本增效的关键

  1. 规则:高频明确风险
  2. 小模型:快速稳定响应
  3. 大模型:理解复杂意图

规则和小模型可以处理特征明确、频率较高、需要快速响应的风险;大模型则进一步理解复杂上下文、隐性意图和长链语义。当不同能力形成分层协同,企业才能在效果、速度与成本之间取得平衡。

图片

在这一过程中,内容安全依然是AI治理的重要抓手

虽然AI风险正在从“说错话”扩展到“做错事”,但无论是提示注入、知识库污染、敏感信息泄露,还是深度伪造与钓鱼诈骗,都需要通过文本、图片、音频、视频或代码等内容形式进入系统。

内容既是攻击意图的重要载体,也是企业观察模型行为、识别风险信号和进行合规审计的关键入口。

因此,AI安全并不是从内容治理跳到行为治理,而是需要以内容安全为基础,进一步覆盖模型、应用、工具和执行过程。

要对抗能够理解内容的攻击,防御体系本身也必须具备理解内容、识别意图和持续学习的能力。

从模型较量到体系对抗,企业需要重造安全边界

面对不断升级的AI攻击,最直接的想法可能是部署一个更强的模型,用AI识别AI生成的风险。

《AI安全白皮书》指出,真正有效的AI安全不能只依赖单一模型,也不能只在输出端增加一道过滤

因为风险可能出现在不同阶段。

训练数据被污染,可能让模型从源头形成错误认知;提示注入可能让应用绕过原有规则;知识库中的恶意内容可能在检索过程中被模型读取;Agent获得过高权限后,一次错误判断可能直接转化为真实业务操作。

一个安全模型可以识别部分风险,却很难独立覆盖数据、模型、应用和行为组成的完整链路。

因此,白皮书提出“内生安全+围栏防护”的双重防御体系

内生安全:训练构建阶段

围栏防护:真实运行环境

图片

内生安全关注模型在训练和构建阶段“学到了什么”。通过训练数据清洗、安全数据标注、安全语料建设和模型安全评测,尽可能从源头降低偏见、违规生成、隐私泄露和模型后门等风险。

围栏防护关注模型在真实业务环境中“如何运行”。在输入侧识别恶意提示、越狱攻击、隐性诱导和多模态攻击;在输出侧检测违规内容、敏感信息、模型幻觉和事实性风险,并根据业务需要进行拦截、代答和处置。

面向 Agent,还要继续向行动环节延伸。

网易智企·易盾 AI Agent 安全管控平台围绕“理、控、隔、断”建立行为防护:梳理Agent资产、工具和接口,审计交互意图与工具调用,通过安全沙箱限制影响范围,并在危险行为发生时及时熔断。

图片

这套防护逻辑的核心,是不把安全希望全部寄托在模型“永远作出正确判断”上。

模型可以越来越强,却仍然可能受到错误数据、复杂语境和恶意指令影响。企业需要在模型之外建立独立的安全控制能力,为数据访问、内容生成、工具调用和任务执行划定边界

写在最后

《AI安全白皮书》对未来AI安全趋势的判断,并不只停留在某一种攻击方式上。

AI安全已经从模型与攻击样本之间的单点较量,进入技术、数据、应用、行为和治理体系之间的综合对抗。

未来,攻击者会越来越擅长利用AI批量生成风险、隐藏攻击意图和动态调整策略。企业也需要让安全能力具备同样的理解速度响应速度演进能力

这不只是用AI识别AI,更是通过内生安全围栏防护大小模型协同和 Agent 行为管控,让AI系统在真实对抗中依然保持可信、可靠和可控。

 

活动推荐

作为网易旗下一站式企业 AI 应用服务提供商,网易智企倾力打造企业 AI 实战栏目——「AI 实战派」,聚焦 AI 在真实业务中的落地应用,通过实战教学、案例拆解、研讨交流等多元形式,将前沿的 AI 技术转化为真实的业务动能,为企业管理者、业务决策者和一线实践者提供可迁移、可复用的实战方法论与深度洞察。

图片

关于我们

图片

 

免费下载干货资料

 

图片
图片
图片
图片