
企业正在批量“招聘”一类特殊员工。
它们没有工位,不需要休息,可以同时处理数十项任务;它们能阅读内部文档、调用API、操作业务系统,也能代替人发送邮件、修改数据、完成交易。
它们就是正在加速进入企业的AI Agent。
随着Agent与MCP等工具连接方式快速普及,AI不再只是隔着屏幕给出答案,而是开始接触真实数据、调用真实工具、执行真实任务,越来越深地参与企业业务流程。
能力边界的扩张,也在重新定义AI的风险边界。
当大模型只负责生成内容时,企业主要担心的是它会不会“说错话”:生成违规内容、输出虚假信息或泄露敏感数据。当Agent获得工具和系统权限后,风险进一步变成它会不会“做错事”:发错邮件、误删文件、越权读取数据、错误调用接口,甚至在攻击者诱导下执行高风险操作。
因此,Agent时代真正稀缺的,不只是更强的模型能力,还有一套与之匹配、能够让智能始终运行在明确边界内的安全控制能力。
📌 本文看点
01
数字员工视角
02
安全控制面
03
AI 对抗 AI
EMPLOYEE
把Agent当作“数字员工”,而不是传统软件
理解Agent安全,首先要换一个视角。
传统软件按照相对确定的规则运行,配置权限、写好流程后,通常可以预期其执行结果。但大模型由概率驱动,拥有自主规划和推理能力,其行为具有天然的不确定性。它能够理解模糊指令,也可能误解指令;可以自己寻找解决方案,也可能在长链任务中偏离最初目标。
因此,企业不能继续用管理传统软件的方式管理Agent。
面对复杂智能系统,更现实的安全前提不是“假设它绝对安全”,而是“假设它可能犯错”。企业需要把对真实员工的管理逻辑迁移到AI员工上:有明确的规章制度,有最小化的权限范围,有过程监督和审计,也有异常发生后的隔离与处置机制。
以智能客服为例。当它只负责回答问题时,风险主要停留在内容层面;当客服Agent获得修改账号、处理密码、发放权益等权限后,攻击者就可能通过身份冒充、多轮诱导或提示词注入,驱使它执行本不该执行的操作。
此时,企业需要判断的不只是“回答是否合规”,还包括身份是否可信、任务意图是否一致、权限是否过大、动作是否应该发生。
这些问题,无法仅靠模型自身的安全对齐一次性解决。
CONTROL
越强的智能,越需要模型之外的安全控制面
模型原生安全当然重要。通过训练数据治理、安全语料构建、对齐训练和安全评测,可以让大模型建立基本的规则意识,从源头减少危险知识、违规内容和错误价值倾向带来的影响。
但良好的基础教育,并不意味着进入企业后可以不受制度约束。
模型漏洞和攻击手段持续变化,企业的业务规则、监管要求和风险偏好也各不相同。若每出现一种新风险,都依靠重新收集数据和训练模型来修复,不仅成本高、周期长,也很难跟上实战攻防的速度。
因此,企业AI既要提高模型自身的安全能力,也要在模型之外建立独立、可审计、可更新、可管控的安全控制面。
如果把大模型比作负责语言、推理和任务规划的“大脑皮层”,外部安全控制面就像处理生存级反应的“脑干”:不必等待模型完成复杂思考,而是在输入、输出、工具调用和权限执行等关键节点快速识别、决策和阻断。
输入进入模型前,安全控制面可以识别提示词注入、越狱攻击、恶意请求和敏感信息提交;内容生成后,可以完成流式检测、风险分类、事实性检测、策略处置和审计留痕;Agent准备调用工具时,还能进一步核验任务意图、权限范围、调用参数和执行结果。
它的价值不只是增加一层过滤,而是把大模型的概率性和不确定性,重新收敛到企业可定义、可验证的规则中。当新的攻击样本、监管要求或业务风险出现时,企业可以快速更新风险标签、检测规则和处置策略,而不必更换底层模型。
第三方安全能力还能提供更加客观的审计依据。业务方不能既当“运动员”,又当“裁判员”。当封禁、拦截或权限处置引发争议时,可追溯的检测过程和相对独立的安全证据,能够帮助企业说明决策依据,让安全判断更容易被外部验证。
DEFENSE
AI对抗AI,安全防御也要持续进化
Agent带来的风险变化,并不只发生在防守一侧。
生成式AI正在降低黑灰产的技术门槛。过去需要人工修改的图片、话术和脚本,现在可以被自动批量生成;一套攻击素材被识别后,AI可以迅速生成大量细微变体,并根据防御反馈持续调整策略。
在游戏安全领域,攻击者还可以借助AI分析客户端资源和通信协议,模拟服务端行为,制作私服或作弊工具。原本需要多人协作、较长周期才能完成的攻击,现在可能被更小的团队快速实施。
当攻击方已经使用AI实现自动化,防守方如果仍然主要依靠人工分析、人工编排和逐条上线策略,响应速度就会被迅速拉开。
AI对抗AI,不再是一句趋势判断,而是正在发生的攻防现实。
早在2024年,易盾便提出“以模制模”,用安全大模型的识别能力对抗AI生成的风险内容。如今,这一能力正在进一步升级:安全模型不只负责识别,也在学习安全专家的处置经验和工具使用方式。
面对复杂风险图片,安全模型可以根据特征自动调用OCR、图像识别、文本语义理解等工具,并结合历史样本选择检测链路;面对快速变化的攻击,则可以辅助完成策略生成、数据验证和防御编排,将过去可能需要数小时的响应过程压缩到分钟级。
这并非让AI不经验证地自行发布策略,而是把安全专家沉淀多年的攻防经验转化为可调用、可编排、可量化验证的模型能力。
AI加快分析和执行,人负责设定边界并把控关键决策。
围绕企业大模型应用,易盾构建了“内生安全+围栏防护”的安全体系。

内生安全面向模型训练和对齐阶段,覆盖多模态训练数据清洗、安全数据标注、合规安全语料库和大模型安全评测等环节。
大模型从海量数据中学习知识,也可能吸收危险知识、攻击方法、违规内容和错误价值倾向。企业使用业务数据训练或微调专属模型时,数据中还可能混入个人信息、商业秘密和不安全指令。若这些问题没有在训练前得到治理,就可能被模型记忆,并在实际应用中转化为不当输出或数据泄露风险。
围栏防护则面向模型上线后的输入、输出与运行过程。在输入侧,它不仅识别敏感关键词和已知越狱模板,还通过语义理解发现隐藏在角色扮演、多轮诱导、编码隐喻和图文混合内容中的真实意图。
在输出侧,围栏通过流式实时检测、多模态分析、幻觉与事实性检测、安全智能代答等能力,帮助模型回应保持边界。尤其在政务、金融、教育、客服等严肃场景中,安全目标不仅是“不违规”,还包括不虚构政策、不提供错误高风险建议、不作出越权承诺、不泄露敏感信息。
内生安全提高模型自身的安全基线,围栏防护应对持续变化的外部风险,两者共同覆盖从训练到应用的完整链路。
如果说大模型安全围栏关注的是输入与输出,那么面向Agent,还需要进一步管住它的工具、权限和行为。
网易智企AI Agent安全管控平台Agent Guard,围绕“理、控、隔、断”建立一站式安全方案。

“理”,是梳理企业内部Agent及其关联的工具、服务与接口,让智能体资产可发现、可盘点,避免出现影子Agent和未知调用链。
“控”,是对用户输入、Agent多轮思考、任务意图和工具调用进行持续分析,并通过白名单限定其能够访问的数据、使用的工具和执行的命令。
“隔”,是通过沙箱等方式划定运行边界。即使Agent拥有较强能力,也只能在被授权的环境和数据范围内活动。
“断”,是在发现提示词诱导、意图偏移、越权访问或异常执行时及时隔离风险,必要时阻断任务继续运行。
针对运行在员工终端上的个人Agent,安全能力可以在本地关注文件删除、邮件发送和敏感数据访问等动作;对于部署在服务端的客服或业务Agent,则可以统一配置权限范围、工具白名单、意图核验和隔离机制。
无论Agent运行在哪里,核心原则始终一致:不能只检查用户最初说了什么,还要检查Agent经过多轮推理后准备执行什么,并判断输入意图与最终动作是否一致。
只有做到资产可见、意图可审、权限可控、行为可断,数字员工才真正具备进入核心业务系统的安全基础。
AI发展的速度不会因为风险而停下来。
行业关注点已经从“AI能不能用”转向“AI怎样用好、怎样管好”。当大模型从对话工具走向业务系统,当Agent成为企业的数字员工,安全也必须从内容审核升级为贯穿数据、模型、权限、工具和行为的系统工程。
企业需要让模型“内外兼修”:在训练和对齐阶段提高内生安全,在应用阶段部署独立安全围栏;既管住AI说什么,也管住它能做什么;既依靠AI提升攻防效率,也以明确规则、数据验证和人工监督约束AI。
越强的智能,越需要独立于模型之外的安全约束。
这道约束不是AI创新的绊脚
IM即时通讯
实时对话智能体
智能硬件开发套件
音视频通话
短信
信令
直播
点播
互动白板
七鱼AI客服
客服类Agent
在线客服
科学策略中心
智能外呼
营销类Agent
问卷调研
文本检测
图片检测
音频检测
视频检测
智能审核平台
风控引擎
行为式验证码
实名核验
人脸核验
隐私合规检测
网易知数
有数BI
大数据基础平台
数据开发治理平台
指标平台
数据中台
研发智能化
智能页面生成
平台私有化定制
企业级RAG知识库
自主智能体
智能协作中枢
AI应用搭建
游戏行业
全生命周期解决方案
游戏安全解决方案
游戏AI智能体
娱乐社交
多人语音聊天室
游戏语音
娱乐社交出海
社交场景反欺诈
内容安全合规
大型直播活动
AI应用
AI应用开发
医疗行业
区域医疗
智慧医院
药店运营
教育行业
在线教育
绿色清朗课堂
课后服务
金融行业
泛金融
全链路数据风控
运营增长
存量用户促活
营销留资转化
企微客服
企微导流


