
当大模型从“会生成内容”走向“能执行任务”,安全治理也正在从内容识别走向全链路防护。
近日,由中国人工智能产业发展联盟(AIIA)安全治理委员会主办的"智守安全·内容求真"2026AIIA安全治理专题会在北京召开,围绕生成式人工智能、AI生成内容、深度合成与智能体应用带来的安全治理挑战展开交流。
网易智企·易盾受邀出席大会,围绕大模型安全围栏发表主题演讲,并获中国信通院大模型安全围栏能力检验"优秀级"评定,同时作为共建方参与可信AI"众鉴平台"发布仪式,以技术实力与产业担当深度参与AI安全治理进程。

受邀分享,解构大模型安全围栏
防护体系
网易智企·易盾内容安全负责人饶晓艳受邀出席会议,并围绕《多模态大模型安全围栏防护体系建设》进行内容分享,系统介绍了易盾如何通过独立、实时、可运营的外置安全护栏,覆盖大模型输入输出、多模态关联检测、敏感数据保护和智能体行为管控等环节,为企业AI应用构建安全控制面。

伴随人工智能技术持续演进,企业需要保护的对象已经发生明显变化。
过去,安全治理主要聚焦文本、图片、音频、视频等内容风险;进入大模型时代后,提示词攻击、算力消耗、大模型输入输出风险、敏感信息泄露以及智能体行为失控等问题不断出现,安全防护需要覆盖更加复杂的模型和应用链路。
从实际业务场景来看,当前大模型应用主要面临三类典型挑战:
一是模型本身具有一定不可控性,输出结果可能存在不稳定和不可预测的问题;
二是部分数据和中间状态不可见,例如RAG知识库、联网检索结果及相关URL中可能隐藏风险内容;
三是智能体能够调用MCP、Skill等外部工具,其权限、行为和任务执行链路更加复杂,风险也可能由内容层进一步传导至业务系统。
尤其在智能体场景中,模型已经不再只是生成一段文字或回答一个问题,而是能够获取外部信息、调用工具并执行具体任务。一旦遭遇恶意提示词、间接提示词注入或权限滥用,风险可能沿着工具调用链路持续扩散。因此,企业AI安全治理需要从单一的内容检测,升级为覆盖算法、数据、内容、智能体和实际应用的系统性防护。
基于长期安全实践,网易智企·易盾认为,企业需要在模型之外建立一套相对独立、能够实时运行并持续运营的外置安全护栏。它与模型内置安全能力相互协同,同时不依赖模型自身版本更新,可以根据实际业务风险实时热更新规则和策略,并对防护效果进行评测,对检测结果进行追溯。
围绕大模型应用全生命周期,易盾已将安全能力覆盖至训练语料安全治理、模型安全评测、上线前检测以及上线后的输入防护、输出防护、安全代答、多模态关联检测和智能体安全等环节,在不同节点配置相应的防护方案。

在输入侧,易盾可识别提示词中的有害指令、恶意指令和算力攻击。例如,要求模型循环输出大量内容、生成超长文本等指令,可能对模型服务造成资源消耗。同时,对于隐藏在MCP、Skill及其他外部信息源中的间接提示词注入,系统也可结合智能体调用链路进行检测。
在数据安全方面,易盾可提供50余种个人敏感信息标签检测,对模型输入和输出中的敏感信息进行识别与阻断,降低多类信息组合后定位到具体个人所带来的隐私泄露风险。
对于风险内容,外置安全护栏并非简单拦截,而是结合风险等级、用户身份、业务场景和内容呈现位置进行综合判断。系统可根据实际风险采取放行、降权、正向引导、安全代答、人工接管或直接阻断等差异化措施,让安全治理更加精细、灵活。
在技术路径上,易盾采用小模型、小参数大模型与多模态大模型协同的方式,根据不同任务进行路由和组合判断。以隐晦图片检测为例,系统可以先通过小模型完成OCR识别,再分别对图片和文字信息进行分析,最终由大模型完成图文关联和整体观点理解,在兼顾检测效果的同时提升处理效率。

针对来源日益多样的Skill,易盾已建立覆盖14个大类、100余个细分检测项的安全检测能力。安装前,可对代码、功能描述和权限声明进行扫描;运行过程中,则进一步校验Skill实际调用的权限和行为是否与原始说明一致,及时发现越权调用及异常执行风险。
获评"优秀级",大模型安全围栏能力
获权威认可
会上,网易智企·易盾凭借在大模型安全围栏领域的技术能力与产品实践,通过中国信通院与中国泰尔实验室联合开展的大模型安全围栏能力检验,并获评"优秀级",体现了权威机构对其产品技术能力与落地实践的高度认可。

此前,艾瑞咨询报告显示,网易智企·易盾位居中国第三方大模型内容风控服务商市场首位,也从市场维度印证了其规模化服务能力。此次"优秀级"评定,进一步从标准化评测角度验证了易盾在大模型安全围栏领域的技术领先性。
参与共建,可信AI"众鉴平台"
正式发布
大会期间,由中国信通院牵头、联合产业机构共建的可信AI——"众鉴平台"正式发布。该平台面向全行业开放,汇聚多方鉴伪技术、数据和能力资源,提供统一、权威、可复用的多模态生成合成内容检测服务,旨在构建产业协同的AI内容可信治理基础设施。

网易智企·易盾作为参与共建的产业机构,受邀出席发布仪式,将把自身在多模态内容检测领域的技术积累和实战经验注入平台,与产业各方共同推动AI生成内容的可识别、可追溯与可治理,为构建更加透明、可信的AI内容生态贡献力量。
IM即时通讯
实时对话智能体
智能硬件开发套件
音视频通话
短信
信令
直播
点播
互动白板
七鱼AI客服
客服类Agent
在线客服
科学策略中心
智能外呼
营销类Agent
问卷调研
文本检测
图片检测
音频检测
视频检测
智能审核平台
风控引擎
行为式验证码
实名核验
人脸核验
隐私合规检测
网易知数
有数BI
大数据基础平台
数据开发治理平台
指标平台
数据中台
研发智能化
智能页面生成
平台私有化定制
企业级RAG知识库
自主智能体
智能协作中枢
AI应用搭建
游戏行业
全生命周期解决方案
游戏安全解决方案
游戏AI智能体
娱乐社交
多人语音聊天室
游戏语音
娱乐社交出海
社交场景反欺诈
内容安全合规
大型直播活动
AI应用
AI应用开发
医疗行业
区域医疗
智慧医院
药店运营
教育行业
在线教育
绿色清朗课堂
课后服务
金融行业
泛金融
全链路数据风控
运营增长
存量用户促活
营销留资转化
企微客服
企微导流

