标注员只标了一小半数据,半监督学习怎么把剩下的用起来

📋 核心摘要

半监督学习要解决的是起重机AI落地中最贵的那道坎:标注。缺陷检测模型需要海量标注样本,但逐张框选钢丝绳断丝、焊缝气孔这类缺陷,人力成本极高。半监督学习只用一小半标注数据,再搭配大量无标注数据,让模型从无标注样本里自己提炼结构规律,从而降低对人工标注的依赖。本文梳理自训练、一致性正则与FixMatch三类主流方法,拆解伪标签噪声、分布假设等落地前提,并说明这一方向在起重机行业仍处早期验证阶段,精度上限以实际工况为准。

某起重机整机厂上马缺陷检测项目,标注团队对着屏幕逐张画框,一周下来只标出几千张,而一个能在现场稳定工作的检测模型,通常需要数万到数十万张标注样本。站内此前公开的缺陷标注数据集规模已达50万张——这个数字背后,是标注员连续数月的重复劳动。

更现实的情况是:起重机每天运行产生的图像、振动、电流数据源源不断,其中绝大多数是”裸数据”,没有任何标签。如果只能用那几千张标注数据训练,模型学不到足够多的工况变化;如果等人工把几十万张全部标完,项目早已错过交付窗口。半监督学习要做的,就是把这一批”标不起”的数据用起来。

起重机AI半监督学习三类方法与落地前提卡片图

半监督学习要解决的到底是什么:标注是起重机AI最贵的一道工序

在计算机视觉任务里,模型的能力上限由两个变量决定:数据的数量与标签的质量。全监督学习的逻辑很直白,有多少标注样本,模型就学到多少监督信号,标注一旦停下来,模型也跟着停下。这对起重机缺陷检测是个现实难题。

以钢丝绳断丝识别为例,站内此前披露的模型在特定数据集上达到97.3%的识别准确率,其前提是背后有一批逐根钢丝、逐处断口标注出来的训练样本。而缺陷标注数据集达到50万张规模,意味着标注环节投入的人力远超模型训练本身。

半监督学习改变的是这个前提。它的输入包括两部分:一小批有标签的样本,以及一大批无标签的样本。模型先在小批标注上建立初步判断能力,再把这个能力迁移到无标签数据上,从无标签数据的分布结构里补充监督信号。严格说,它不是”不标注”,而是把标注的边际成本摊薄了。

这里面有一条工程边界必须说清楚:无标签数据只有满足一定分布假设时才有价值,否则它带来的不是信号而是噪声。GB/T 28264《起重机械安全监控管理系统》对监控数据的采集、传输与存储提出了规范性要求,这恰恰是半监督学习数据底座的基础。克鲁德重工在数据治理上的经验是:先保证采集口径一致,再谈模型能不能从无标注数据里获益。

自训练、一致性正则与FixMatch三种方法的原理差异

半监督学习的方法家族不小,但工程上最常被讨论的是三类:自训练、一致性正则化,以及把两者结合起来的混合增强方法。

自训练的思路最朴素。先用标注样本训练一个初始模型,再让这个模型对无标注样本做预测,把置信度足够高的预测结果当作”伪标签”,连同原始标注一起重新训练模型,如此循环。它的优点是实现简单,几乎不挑模型结构。缺点是模型早期的错误会通过伪标签被放大,形成错误累积。

一致性正则化的代表是Mean Teacher。系统维护两个结构相同的模型,一个叫学生、一个叫教师。教师模型的权重由学生模型的历史权重做指数滑动平均得到。训练时给同一张无标注样本施加两次不同的扰动,要求两个模型给出相近的输出。这种扰动不变性约束,让模型在没有标签的地方也能学到平滑的决策边界。

FixMatch则是把伪标签和强弱增强组合起来:先对无标注样本做弱增强,用模型预测得到伪标签,再对同一样本做强增强,要求强增强版本也匹配这个伪标签。伪标签只在置信度超过阈值时才被采用。这套组合拳在图像分类基准上效果显著,但对缺陷检测这种目标更小的任务,增强强度的选取要谨慎。

起重机领域的AI故障诊断属于新兴方向,ISO 24621:2022《起重机AI故障诊断》这类标准的出现,说明行业正在尝试把AI能力纳入规范框架。半监督方法如何与这类标准要求的数据可追溯、结论可复核相结合,是落地时必须面对的问题。

三类方法的参数矩阵一览

方法 核心机制 无标注数据用法 伪标签噪声敏感度 训练稳定性 适用工况
自训练 Self-training 伪标签迭代回灌 模型预测当伪标签 高(错误会累积) 中(需阈值控制) 标注极少且类别明确
一致性正则 Mean Teacher 教师学生EMA 扰动输出应一致 低(扰动平滑) 较高(EMA稳定) 图像时序且现场噪声大
混合增强 FixMatch 弱增强定标签加强增强学特征 强弱增强双支路 低(置信度门槛) 较高 图像任务且增强手段成熟
图半监督 Graph-based 样本相似图传播 相似关系扩散标签 中(依赖构图质量) 结构化数据且关系明确
生成式半监督 生成模型补充样本 生成伪样本扩充 样本极度稀缺的工况

伪标签噪声、分布假设与三种方法各自的适用工况

三种方法没有绝对优劣,选型的核心变量有两个:无标注数据的分布是否与标注数据一致,以及任务对伪标签错误的容忍度。

如果无标注数据来自同一批设备、同一类工况,分布漂移小,自训练配合严格的置信度阈值就能跑出效果。如果现场数据噪声大、工况杂,一致性正则的抗噪声特性更有价值。如果是图像类任务且增强手段成熟,FixMatch这类混合方法的收益通常更明显。

反过来看,分布假设一旦被破坏,半监督可能比不用更糟。典型场景是:无标注数据里混入了不同吨位、不同机构甚至不同厂商设备的工况,而标注数据只覆盖其中一小类。此时模型从无标注数据”学”到的结构规律,其实是跨设备的干扰。

克鲁德重工在多个项目里给出的建议是一致的:先验证分布一致性,再谈方法选型。下面这份清单,是半监督落地前建议逐项核对的八个点。

📋

标注基线

先跑通全监督基线,确认标注质量底线

🔍

分布假设

核实无标注数据与标注数据同分布

📊

伪标签阈值

设定置信度门槛,防止错误累积

🧪

数据增强

强弱增强策略与缺陷特征匹配

🛡

噪声监控

伪标签污染率持续监控

🔄

增量回流

新工况样本定期回炉重训

📏

评估闭环

用独立标注测试集对比全监督

👥

人工兜底

低置信样本交人工复核

半监督省下的标注成本到底值不值:算一笔真实的账

判断半监督值不值,最直接的办法是把三件事摆在同一张表上:标注数据量、标注成本、以及精度天花板。全监督的精度上限最高,但它要求把标注做满。半监督用一部分标注换接近的精度,代价是引入了分布假设和伪标签噪声这两项额外风险。

值得强调的是:半监督省下的主要是”重复性标注”的钱,而不是”全部标注”的钱。初始那批高质量标注仍然是地基,它决定了伪标签质量的上限。这也解释了为什么半监督在起重机行业目前仍处在早期验证阶段,数据底座还没铺平的地方,方法再先进也落不了地。克鲁德重工在为客户规划AI路线时,始终把数据治理排在半监督方法选型之前。

克鲁德重工售后数据表明,真正制约项目推进的往往不是模型精度差几个点,而是标注、清洗与回流的工程闭环没跑通。把这笔账算清,比纠结选哪个半监督框架更重要。

不同训练方案的标注成本对照

训练方案 标注数据量 相对标注成本 精度天花板参考
全监督(全量标注) 数万至数十万张 100%(基准) 上限最高,受标注质量制约
半监督(约三成标注) 少量标注加大量无标注 显著下降 接近全监督,以工况为准
自监督(零标注) 仅无标注数据 最低 表征阶段有效,下游仍需少量标注
主动学习加半监督 按需增量标注 中等 同等预算下更稳,需人工在环

📖 相关阅读:起重机缺陷数据标注:50万张样本是怎么标出来的 | 起重机AI视觉检测全景解读

常见问题

问:半监督学习和全监督学习相比,精度到底差多少?

答:差距没有固定数值,取决于标注数据规模、无标注数据质量和分布一致性。标注充足且质量高时,全监督仍是最稳的基线。标注不足时,半监督在相同标注预算下通常明显优于只用少量标注的全监督。起重机缺陷检测这类任务目前仍以全监督为工程主流,半监督多处于验证阶段,精度上限以实际工况为准。克鲁德重工在评估时也会用独立测试集做同口径对比,不直接套用论文数字。

问:起重机缺陷检测项目要不要上马半监督,怎么判断?

答:先看两个条件:无标注数据是否与标注数据同分布,标注成本是否占项目大头。若现场积累了大量同工况的原始图像、振动或电流数据,而标注团队只能覆盖其中一小部分,半监督就有尝试价值。反之,若数据量本身有限、分布漂移明显,先把数据采集和清洗做扎实比硬上半监督更划算。

问:半监督模型出现伪标签错误累积,怎么判断和处理?

答:典型表现是验证集精度先升后降,或对某几类样本稳定误判。处理上先收紧伪标签置信度阈值,只保留高置信样本回灌,再检查强弱增强是否破坏了缺陷的关键特征,必要时把误判样本抽出来人工复核后重新加入标注集。伪标签的污染率要持续监控,而不是训练完就放手。

相关信息

contact

contact us

phone:
+86 13903802779

mail:3915269@qq.com

Working hours: Monday to Friday

Wechat
Wechat
SHARE
TOP