图片

 

在一个社交平台的客户测试中,用户每天都会发布大量类似朋友圈的图文和视频。

 

这些内容经过安全审核后,可以确认没有明显违规。但平台的工作并没有结束。

 

它还要继续判断,内容讲的是交友、旅游、学习,还是生活随笔。内容质量属于高、中、低哪个等级。图文是否符合平台的运营标准,视频是否达到可用要求。

 

这类判断过去主要靠人。

 

而且,在部分客户场景中,负责内容标注的人力投入甚至高于安全审核。

 

原因并不复杂。

 

安全审核守住的是平台底线,内容质量标注处理的,则是平台每天如何理解和管理内容。

 

 

审核通过,只解决了第一道问题

 

一条内容能不能发布,和一条内容质量如何,是两套不同的判断。

 

安全审核关注涉政、色情、违禁、广告等风险,最终需要给出通过、不通过或进入人工复核的结果。

 

内容质量标注要回答的问题更多。

 

这条内容属于什么类别,表达是否完整,图片和文字是否匹配,视频质量处于哪个等级,是否符合平台制定的业务标准。

 

这些结果通常不会直接决定内容放行,也不等于平台的推荐决策。它们更像一层结构化的内容信息,为后续的内容管理、运营处理和业务系统提供依据。

 

很多平台已经拥有自己的标签体系。

 

有的标签只有十几个,有的可能达到几十个。标签的名称、含义和判断标准,也会随着平台业务变化不断调整。

 

麻烦就在这里。

 

平台可以写清楚哪些内容违规,却很难用几条固定规则解释什么是高质量内容。即使同一套标准交给不同的人,判断结果也可能存在差异。

 

所以,内容质量标注长期依赖人工经验。

 

审核团队在处理风险,标注团队则要一条条看内容、理解语义、选择类别,再给出质量等级。

 

内容量一上来,这项工作就会迅速变重。

 

 

 

大模型开始读懂那些难以写死的标准

 

大模型适合处理的一类任务,恰好就是这种带有语义理解和主观判断的工作。

 

在CMA的一个客户测试场景中,客户提供了自己的内容标签,要求模型把用户发布的图文和视频归入对应类别,并补充高、中、低质量等级。

 

标签里包括交友、旅游、学习、生活随笔等内容方向。

 

客户不需要重新训练一套固定分类模型,而是可以通过自然语言说明每个标签的含义、判断规则和边界。

 

CMA读取内容后,再按照这套标准输出分类与质量结果。

 

根据产品负责人的反馈,在该场景的测试中,模型对高质量和低质量内容的判断,与人工结果具有较高一致性。具体效果仍需根据客户标准和真实样本验证,但客户能够很直观地看到模型是否理解了自己的要求。

 

这和传统的小模型分类有一个明显区别。

 

传统模型擅长处理边界清晰、长期稳定的类别。一旦标签发生变化,往往需要重新准备样本和训练。

 

内容平台的规则却经常变化。

 

今天希望把旅游内容拆成攻略和随笔,明天可能又要增加低质搬运、营销感过强或表达不完整等标准。

 

大模型可以直接理解自然语言描述,也能结合文本、图片和视频进行判断。客户调整标准后,可以重新验证效果,不必每次都从模型训练开始。

 

这也是内容质量标注开始出现新解法的原因。

 

 

CMA做的,是把业务标准转化成标签

 

CMA原本是Content Moderation Agent,也就是内容安全审核智能体。

 

但审核和标注之间,有一部分能力可以复用。

 

它们都需要先理解内容,再读取一套业务标准,完成判断并输出结构化结果。区别在于,安全审核主要输出风险类别和处置建议,内容质量标注输出的是内容类别、质量等级、属性标签或达标结果。

 

在现有的CMA产品体系中,客户可以配置自己的Prompt和判断标准,通过批量样本验证结果,再根据误判数据继续调整。

 

面对更复杂的任务,还可以配置不同内容进入不同的处理流程,让CMA与人工共同完成标注。模型处理标准清晰、结果稳定的内容,人工抽检模型结果,并负责边界样本和规则修正。

 

知识库也可以保存平台已有的标准文档,帮助模型在判断时调用相关规则。标注标准发生变化后,这些规则还可以继续更新和沉淀。

 

整个过程更接近一支可以不断校准的内容理解团队。

 

给它一套标准,它开始工作。

 

发现某类内容判断不准,就回到样本和规则中修正。稳定的部分逐步交给CMA,复杂和模糊的部分继续保留人工判断。

 

人工依然重要,只是工作重点开始发生变化。

 

内容质量标注,也有清晰的能力边界

 

CMA更适合处理依赖语义理解、能够输出文本标签的任务

 

例如图文内容分类、视频质量分级、文本与图片联合达标判断、商品属性识别,以及客户自定义标签体系下的内容归类。

自动驾驶中的框选和描点、医疗影像的像素级分割、工业缺陷的精细定位,则需要专门的工具、数据和视觉算法。这些并不是CMA当前重点解决的问题。

CMA可以提供分类、等级和属性等结构化结果,客户如何使用这些标签,仍由自己的内容管理、运营及业务系统决定。

因为内容质量标注真正值得关注的地方,并不在于给大模型套上一个更大的概念。它解决的是一个已经存在很久的问题。

平台每天面对大量文本、图片和视频,安全审核只能回答其中一部分。剩下那些属于什么、质量如何、是否达到业务标准的判断,仍然消耗着大量人工。

过去,这些标准太主观、太零散,也变化得太快,很难交给传统模型。

现在,大模型开始具备理解这些标准的能力。

CMA也因此有机会从内容安全审核,延展到更广泛的内容理解和质量标注场景。

当然,这个方向仍需要更多真实客户验证。不同平台的标准差异很大,模型能承担多少工作,也要经过样本测试、人工抽检和持续调优才能确认。

但至少,平台可以用一种更轻的方式开始。

拿出一套真实的标签标准,再选取一批文本、图片或视频,看看CMA能否理解这些内容,也理解平台自己的判断方式。

审核之外,那些长期依赖人工完成的内容判断,正在拥有新的处理方式。