图片

企业正在批量“招聘”一特殊员工

它们没有工位,不需要休息,可以同时处理数十项任务;它们能阅读内部文档、调用API、操作业务系统,也能代替人发送邮件、修改数据、完成交易。

它们就是正在加速进入企业的AI Agent

随着Agent与MCP等工具连接方式快速普及,AI不再只是隔着屏幕给出答案,而是开始接触真实数据、调用真实工具、执行真实任务,越来越深地参与企业业务流程。

能力边界的扩张,也在重新定义AI的风险边界

当大模型只负责生成内容时,企业主要担心的是它会不会“说错话”:生成违规内容、输出虚假信息或泄露敏感数据。当Agent获得工具和系统权限后,风险进一步变成它会不会“做错事”:发错邮件、误删文件、越权读取数据、错误调用接口,甚至在攻击者诱导下执行高风险操作。

因此,Agent时代真正稀缺的,不只是更强的模型能力,还有一套与之匹配、能够让智能始终运行在明确边界内的安全控制能力。

📌 本文看点

01

数字员工视角

02

安全控制面

03

AI 对抗 AI

01

EMPLOYEE

把Agent当作“数字员工”,而不是传统软件

理解Agent安全,首先要换一个视角。

传统软件按照相对确定的规则运行,配置权限、写好流程后,通常可以预期其执行结果。但大模型由概率驱动,拥有自主规划和推理能力,其行为具有天然的不确定性。它能够理解模糊指令,也可能误解指令;可以自己寻找解决方案,也可能在长链任务中偏离最初目标。

因此,企业不能继用管理传统软件方式管理Agent。

面对复杂智能系统,更现实的安全前提不是“假设它绝对安全”,而是“假设它可能犯错”。企业需要把对真实员工的管理逻辑迁移到AI员工上:有明确的规章制度,有最小化的权限范围,有过程监督和审计,也有异常发生后的隔离与处置机制。

智能客服为例。当它只负责回答问题时,风险主要停留在内容层面;当客服Agent获得修改账号、处理密码、发放权益等权限后,攻击者就可能通过身份冒充、多轮诱导或提示词注入,驱使它执行本不该执行的操作。

此时,企业需要判断的不只是“回答是否合规”,还包括身份是否可信、任务意图是否一致、权限是否过大、动作是否应该发生。

这些问题,无法仅靠模型自身的安全对齐一次性解决。

02

CONTROL

越强的智能,越需要模型之外的安全控制面

模型原生安全当然重要。通过训练数据治理、安全语料构建、对齐训练和安全评测,可以让大模型建立基本的规则意识,从源头减少危险知识、违规内容和错误价值倾向带来的影响。

但良好的基础教育,并不意味着进入企业后可以不受制度约束。

模型漏洞和攻击手段持续变化,企业的业务规则、监管要求和风险偏好也各不相同。若每出现一种新风险,都依靠重新收集数据和训练模型来修复,不仅成本高、周期长,也很难跟上实战攻防的速度。

因此,企业AI既要提高模型自身的安全能力,也要在模型之外建立独立、可审计、可更新、可管控的安全控制面

如果把大模型比作负责语言、推理和任务规划的“大脑皮层”,外部安全控制面就像处理生存级反应的“脑干”:不必等待模型完成复杂思考,而是在输入、输出、工具调用和权限执行等关键节点快速识别、决策和阻断。

输入进入模型前,安全控制面可以识别提示词注入、越狱攻击、恶意请求和敏感信息提交;内容生成后,可以完成流式检测、风险分类、事实性检测、策略处置和审计留痕;Agent准备调用工具时,还能进一步核验任务意图、权限范围、调用参数和执行结果。

的价值不只是增加一层过滤,而是把大模型的概率性和不确定性,重新收敛到企业可定义、可验证的规则中。当新的攻击样本、监管要求或业务风险出现时,企业可以快速更新风险标签、检测规则和处置策略,而不必更换底层模型。

第三方安全能力还能提供更加客观的审计依据。业务方不能既当“运动员”,又当“裁判员”。当封禁、拦截或权限处置引发争议时,可追溯的检测过程和相对独立的安全证据,能够帮助企业说明决策依据,让安全判断更容易被外部验证。

03

DEFENSE

AI对抗AI,安全防御也要持续进化

Agent带来的风险变化,并不只发生在防守一侧。

生成式AI正在降低黑灰产的技术门槛。过去需要人工修改的图片、话术和脚本,现在可以被自动批量生成;一套攻击素材被识别后,AI可以迅速生成大量细微变体,并根据防御反馈持续调整策略。

游戏安全领域,攻击者还可以借助AI分析客户端资源和通信协议,模拟服务端行为,制作私服或作弊工具。原本需要多人协作、较长周期才能完成的攻击,现在可能被更小的团队快速实施。

当攻击方已经使用AI实现自动化,防守方如果仍然主要依靠人工分析、人工编排和逐条上线策略,响应速度就会被迅速拉开。

AI对抗AI,不再是一句趋势判断,而是正在发生的攻防现实。

早在2024年,易盾便提出“以模制模”,用安全大模型的识别能力对抗AI生成的风险内容。如今,这一能力正在进一步升级:安全模型不只负责识别,也在学习安全专家的处置经验和工具使用方式。

面对复杂风险图片,安全模型可以根据特征自动调用OCR、图像识别、文本语义理解等工具,并结合历史样本选择检测链路;面对快速变化的攻击,则可以辅助完成策略生成、数据验证和防御编排,将过去可能需要数小时的响应过程压缩到分钟级。

这并非让AI不经验证地自行发布策略,而是把安全专家沉淀多年的攻防经验转化为可调用、可编排、可量化验证的模型能力。

AI加快分析和执行,人负责设定边界并把控关键决策。

04. “内生安全+围栏防护”,守住大模型应用全链路

围绕企业大模型应用,易盾构建了“内生安全+围栏防护”的安全体系

内生安全面向模型训练和对齐阶段,覆盖多模态训练数据清洗、安全数据标注、合规安全语料库和大模型安全评测等环节。

大模型从海量数据中学习知识,也可能吸收危险知识、攻击方法、违规内容和错误价值倾向。企业使用业务数据训练或微调专属模型时,数据中还可能混入个人信息、商业秘密和不安全指令。若这些问题没有在训练前得到治理,就可能被模型记忆,并在实际应用中转化为不当输出或数据泄露风险。

围栏防护则面向模型上线后的输入、输出与运行过程。在输入侧,它不仅识别敏感关键词和已知越狱模板,还通过语义理解发现隐藏在角色扮演、多轮诱导、编码隐喻和图文混合内容中的真实意图。

在输出侧,围栏通过流式实时检测、多模态分析、幻觉与事实性检测、安全智能代答等能力,帮助模型回应保持边界。尤其在政务、金融、教育、客服等严肃场景中,安全目标不仅是“不违规”,还包括不虚构政策、不提供错误高风险建议、不作出越权承诺、不泄露敏感信息。

内生安全提高模型自身的安全基线,围栏防护应对持续变化的外部风险,两者共同覆盖从训练到应用的完整链路。

05. Agent Guard:让智能体可见、可审、可控、可断

如果说大模型安全围栏关注的是输入与输出,那么面向Agent,还需要进一步管住它的工具、权限和行为。

网易智企AI Agent安全管控平台Agent Guard,围绕“理、控、隔、断”建立一站式安全方案。

“理”,是梳理企业内部Agent及其关联的工具、服务与接口,让智能体资产可发现、可盘点,避免出现影子Agent和未知调用链。

“控”,是对用户输入、Agent多轮思考、任务意图和工具调用进行持续分析,并通过白名单限定其能够访问的数据、使用的工具和执行的命令。

“隔”,是通过沙箱等方式划定运行边界。即使Agent拥有较强能力,也只能在被授权的环境和数据范围内活动。

“断”,是在发现提示词诱导、意图偏移、越权访问或异常执行时及时隔离风险,必要时阻断任务继续运行。

针对运行在员工终端上的个人Agent,安全能力可以在本地关注文件删除、邮件发送和敏感数据访问等动作;对于部署在服务端的客服或业务Agent,则可以统一配置权限范围、工具白名单、意图核验和隔离机制。

无论Agent运行在哪里,核心原则始终一致:不能只检查用户最初说了什么,还要检查Agent经过多轮推理后准备执行什么,并判断输入意图与最终动作是否一致。

只有做到资产可见、意图可审、权限可控、行为可断,数字员工才真正具备进入核心业务系统的安全基础。

安全不是限制AI,而是让AI真正进入生产环境

AI发展的速度不会因为风险而停下来。

行业关注点已经从“AI能不能用”转向“AI怎样用好、怎样管好”。当大模型从对话工具走向业务系统,当Agent成为企业的数字员工,安全也必须从内容审核升级为贯穿数据、模型、权限、工具和行为的系统工程。

企业需要让模型“内外兼修”:在训练和对齐阶段提高内生安全,在应用阶段部署独立安全围栏;既管住AI说什么,也管住它能做什么;既依靠AI提升攻防效率,也以明确规则、数据验证和人工监督约束AI。

越强的智能,越需要独立于模型之外的安全约束。

这道约束不是AI创新的绊脚