在一个社交平台的客户测试中,用户每天都会发布大量类似朋友圈的图文和视频。
这些内容经过安全审核后,可以确认没有明显违规。但平台的工作并没有结束。
它还要继续判断,内容讲的是交友、旅游、学习,还是生活随笔。内容质量属于高、中、低哪个等级。图文是否符合平台的运营标准,视频是否达到可用要求。
这类判断过去主要靠人。
而且,在部分客户场景中,负责内容标注的人力投入甚至高于安全审核。
原因并不复杂。
安全审核守住的是平台底线,内容质量标注处理的,则是平台每天如何理解和管理内容。
审核通过,只解决了第一道问题
一条内容能不能发布,和一条内容质量如何,是两套不同的判断。
安全审核关注涉政、色情、违禁、广告等风险,最终需要给出通过、不通过或进入人工复核的结果。
内容质量标注要回答的问题更多。
这条内容属于什么类别,表达是否完整,图片和文字是否匹配,视频质量处于哪个等级,是否符合平台制定的业务标准。
这些结果通常不会直接决定内容放行,也不等于平台的推荐决策。它们更像一层结构化的内容信息,为后续的内容管理、运营处理和业务系统提供依据。
很多平台已经拥有自己的标签体系。
有的标签只有十几个,有的可能达到几十个。标签的名称、含义和判断标准,也会随着平台业务变化不断调整。
麻烦就在这里。
平台可以写清楚哪些内容违规,却很难用几条固定规则解释什么是高质量内容。即使同一套标准交给不同的人,判断结果也可能存在差异。
所以,内容质量标注长期依赖人工经验。
审核团队在处理风险,标注团队则要一条条看内容、理解语义、选择类别,再给出质量等级。
内容量一上来,这项工作就会迅速变重。
大模型开始读懂那些难以写死的标准
大模型适合处理的一类任务,恰好就是这种带有语义理解和主观判断的工作。
在CMA的一个客户测试场景中,客户提供了自己的内容标签,要求模型把用户发布的图文和视频归入对应类别,并补充高、中、低质量等级。
标签里包括交友、旅游、学习、生活随笔等内容方向。
客户不需要重新训练一套固定分类模型,而是可以通过自然语言说明每个标签的含义、判断规则和边界。
CMA读取内容后,再按照这套标准输出分类与质量结果。
根据产品负责人的反馈,在该场景的测试中,模型对高质量和低质量内容的判断,与人工结果具有较高一致性。具体效果仍需根据客户标准和真实样本验证,但客户能够很直观地看到模型是否理解了自己的要求。
这和传统的小模型分类有一个明显区别。
传统模型擅长处理边界清晰、长期稳定的类别。一旦标签发生变化,往往需要重新准备样本和训练。
内容平台的规则却经常变化。
今天希望把旅游内容拆成攻略和随笔,明天可能又要增加低质搬运、营销感过强或表达不完整等标准。
大模型可以直接理解自然语言描述,也能结合文本、图片和视频进行判断。客户调整标准后,可以重新验证效果,不必每次都从模型训练开始。
这也是内容质量标注开始出现新解法的原因。
CMA做的,是把业务标准转化成标签
CMA原本是Content Moderation Agent,也就是内容安全审核智能体。
但审核和标注之间,有一部分能力可以复用。
它们都需要先理解内容,再读取一套业务标准,完成判断并输出结构化结果。区别在于,安全审核主要输出风险类别和处置建议,内容质量标注输出的是内容类别、质量等级、属性标签或达标结果。
在现有的CMA产品体系中,客户可以配置自己的Prompt和判断标准,通过批量样本验证结果,再根据误判数据继续调整。
面对更复杂的任务,还可以配置不同内容进入不同的处理流程,让CMA与人工共同完成标注。模型处理标准清晰、结果稳定的内容,人工抽检模型结果,并负责边界样本和规则修正。
知识库也可以保存平台已有的标准文档,帮助模型在判断时调用相关规则。标注标准发生变化后,这些规则还可以继续更新和沉淀。
整个过程更接近一支可以不断校准的内容理解团队。
给它一套标准,它开始工作。
发现某类内容判断不准,就回到样本和规则中修正。稳定的部分逐步交给CMA,复杂和模糊的部分继续保留人工判断。
人工依然重要,只是工作重点开始发生变化。
内容质量标注,也有清晰的能力边界
CMA更适合处理依赖语义理解、能够输出文本标签的任务。
例如图文内容分类、视频质量分级、文本与图片联合达标判断、商品属性识别,以及客户自定义标签体系下的内容归类。
自动驾驶中的框选和描点、医疗影像的像素级分割、工业缺陷的精细定位,则需要专门的工具、数据和视觉算法。这些并不是CMA当前重点解决的问题。
CMA可以提供分类、等级和属性等结构化结果,客户如何使用这些标签,仍由自己的内容管理、运营及业务系统决定。
因为内容质量标注真正值得关注的地方,并不在于给大模型套上一个更大的概念。它解决的是一个已经存在很久的问题。
平台每天面对大量文本、图片和视频,安全审核只能回答其中一部分。剩下那些属于什么、质量如何、是否达到业务标准的判断,仍然消耗着大量人工。
过去,这些标准太主观、太零散,也变化得太快,很难交给传统模型。
现在,大模型开始具备理解这些标准的能力。
CMA也因此有机会从内容安全审核,延展到更广泛的内容理解和质量标注场景。
当然,这个方向仍需要更多真实客户验证。不同平台的标准差异很大,模型能承担多少工作,也要经过样本测试、人工抽检和持续调优才能确认。
但至少,平台可以用一种更轻的方式开始。
拿出一套真实的标签标准,再选取一批文本、图片或视频,看看CMA能否理解这些内容,也理解平台自己的判断方式。
审核之外,那些长期依赖人工完成的内容判断,正在拥有新的处理方式。
IM即时通讯
实时对话智能体
智能硬件开发套件
音视频通话
短信
信令
直播
点播
互动白板
七鱼AI客服
客服类Agent
在线客服
科学策略中心
智能外呼
营销类Agent
问卷调研
文本检测
图片检测
音频检测
视频检测
智能审核平台
风控引擎
行为式验证码
实名核验
人脸核验
隐私合规检测
网易知数
有数BI
大数据基础平台
数据开发治理平台
指标平台
数据中台
研发智能化
智能页面生成
平台私有化定制
企业级RAG知识库
自主智能体
智能协作中枢
AI应用搭建
游戏行业
全生命周期解决方案
游戏安全解决方案
游戏AI智能体
娱乐社交
多人语音聊天室
游戏语音
娱乐社交出海
社交场景反欺诈
内容安全合规
大型直播活动
AI应用
AI应用开发
医疗行业
区域医疗
智慧医院
药店运营
教育行业
在线教育
绿色清朗课堂
课后服务
金融行业
泛金融
全链路数据风控
运营增长
存量用户促活
营销留资转化
企微客服
企微导流

