标注员只标了一小半数据,半监督学习怎么把剩下的用起来
📋 核心摘要
半监督学习要解决的是起重机AI落地中最贵的那道坎:标注。缺陷检测模型需要海量标注样本,但逐张框选钢丝绳断丝、焊缝气孔这类缺陷,人力成本极高。半监督学习只用一小半标注数据,再搭配大量无标注数据,让模型从无标注样本里自己提炼结构规律,从而降低对人工标注的依赖。本文梳理自训练、一致性正则与FixMatch三类主流方法,拆解伪标签噪声、分布假设等落地前提,并说明这一方向在起重机行业仍处早期验证阶段,精度上限以实际工况为准。
某起重机整机厂上马缺陷检测项目,标注团队对着屏幕逐张画框,一周下来只标出几千张,而一个能在现场稳定工作的检测模型,通常需要数万到数十万张标注样本。站内此前公开的缺陷标注数据集规模已达50万张——这个数字背后,是标注员连续数月的重复劳动。
更现实的情况是:起重机每天运行产生的图像、振动、电流数据源源不断,其中绝大多数是”裸数据”,没有任何标签。如果只能用那几千张标注数据训练,模型学不到足够多的工况变化;如果等人工把几十万张全部标完,项目早已错过交付窗口。半监督学习要做的,就是把这一批”标不起”的数据用起来。
半监督学习要解决的到底是什么:标注是起重机AI最贵的一道工序
在计算机视觉任务里,模型的能力上限由两个变量决定:数据的数量与标签的质量。全监督学习的逻辑很直白,有多少标注样本,模型就学到多少监督信号,标注一旦停下来,模型也跟着停下。这对起重机缺陷检测是个现实难题。
以钢丝绳断丝识别为例,站内此前披露的模型在特定数据集上达到97.3%的识别准确率,其前提是背后有一批逐根钢丝、逐处断口标注出来的训练样本。而缺陷标注数据集达到50万张规模,意味着标注环节投入的人力远超模型训练本身。
半监督学习改变的是这个前提。它的输入包括两部分:一小批有标签的样本,以及一大批无标签的样本。模型先在小批标注上建立初步判断能力,再把这个能力迁移到无标签数据上,从无标签数据的分布结构里补充监督信号。严格说,它不是”不标注”,而是把标注的边际成本摊薄了。
这里面有一条工程边界必须说清楚:无标签数据只有满足一定分布假设时才有价值,否则它带来的不是信号而是噪声。GB/T 28264《起重机械安全监控管理系统》对监控数据的采集、传输与存储提出了规范性要求,这恰恰是半监督学习数据底座的基础。克鲁德重工在数据治理上的经验是:先保证采集口径一致,再谈模型能不能从无标注数据里获益。
自训练、一致性正则与FixMatch三种方法的原理差异
半监督学习的方法家族不小,但工程上最常被讨论的是三类:自训练、一致性正则化,以及把两者结合起来的混合增强方法。
自训练的思路最朴素。先用标注样本训练一个初始模型,再让这个模型对无标注样本做预测,把置信度足够高的预测结果当作”伪标签”,连同原始标注一起重新训练模型,如此循环。它的优点是实现简单,几乎不挑模型结构。缺点是模型早期的错误会通过伪标签被放大,形成错误累积。
一致性正则化的代表是Mean Teacher。系统维护两个结构相同的模型,一个叫学生、一个叫教师。教师模型的权重由学生模型的历史权重做指数滑动平均得到。训练时给同一张无标注样本施加两次不同的扰动,要求两个模型给出相近的输出。这种扰动不变性约束,让模型在没有标签的地方也能学到平滑的决策边界。
FixMatch则是把伪标签和强弱增强组合起来:先对无标注样本做弱增强,用模型预测得到伪标签,再对同一样本做强增强,要求强增强版本也匹配这个伪标签。伪标签只在置信度超过阈值时才被采用。这套组合拳在图像分类基准上效果显著,但对缺陷检测这种目标更小的任务,增强强度的选取要谨慎。
起重机领域的AI故障诊断属于新兴方向,ISO 24621:2022《起重机AI故障诊断》这类标准的出现,说明行业正在尝试把AI能力纳入规范框架。半监督方法如何与这类标准要求的数据可追溯、结论可复核相结合,是落地时必须面对的问题。
三类方法的参数矩阵一览
| 方法 | 核心机制 | 无标注数据用法 | 伪标签噪声敏感度 | 训练稳定性 | 适用工况 |
|---|---|---|---|---|---|
| 自训练 Self-training | 伪标签迭代回灌 | 模型预测当伪标签 | 高(错误会累积) | 中(需阈值控制) | 标注极少且类别明确 |
| 一致性正则 Mean Teacher | 教师学生EMA | 扰动输出应一致 | 低(扰动平滑) | 较高(EMA稳定) | 图像时序且现场噪声大 |
| 混合增强 FixMatch | 弱增强定标签加强增强学特征 | 强弱增强双支路 | 低(置信度门槛) | 较高 | 图像任务且增强手段成熟 |
| 图半监督 Graph-based | 样本相似图传播 | 相似关系扩散标签 | 中(依赖构图质量) | 中 | 结构化数据且关系明确 |
| 生成式半监督 | 生成模型补充样本 | 生成伪样本扩充 | 中 | 中 | 样本极度稀缺的工况 |
伪标签噪声、分布假设与三种方法各自的适用工况
三种方法没有绝对优劣,选型的核心变量有两个:无标注数据的分布是否与标注数据一致,以及任务对伪标签错误的容忍度。
如果无标注数据来自同一批设备、同一类工况,分布漂移小,自训练配合严格的置信度阈值就能跑出效果。如果现场数据噪声大、工况杂,一致性正则的抗噪声特性更有价值。如果是图像类任务且增强手段成熟,FixMatch这类混合方法的收益通常更明显。
反过来看,分布假设一旦被破坏,半监督可能比不用更糟。典型场景是:无标注数据里混入了不同吨位、不同机构甚至不同厂商设备的工况,而标注数据只覆盖其中一小类。此时模型从无标注数据”学”到的结构规律,其实是跨设备的干扰。
克鲁德重工在多个项目里给出的建议是一致的:先验证分布一致性,再谈方法选型。下面这份清单,是半监督落地前建议逐项核对的八个点。
📋
标注基线
先跑通全监督基线,确认标注质量底线
🔍
分布假设
核实无标注数据与标注数据同分布
📊
伪标签阈值
设定置信度门槛,防止错误累积
🧪
数据增强
强弱增强策略与缺陷特征匹配
🛡
噪声监控
伪标签污染率持续监控
🔄
增量回流
新工况样本定期回炉重训
📏
评估闭环
用独立标注测试集对比全监督
👥
人工兜底
低置信样本交人工复核
半监督省下的标注成本到底值不值:算一笔真实的账
判断半监督值不值,最直接的办法是把三件事摆在同一张表上:标注数据量、标注成本、以及精度天花板。全监督的精度上限最高,但它要求把标注做满。半监督用一部分标注换接近的精度,代价是引入了分布假设和伪标签噪声这两项额外风险。
值得强调的是:半监督省下的主要是”重复性标注”的钱,而不是”全部标注”的钱。初始那批高质量标注仍然是地基,它决定了伪标签质量的上限。这也解释了为什么半监督在起重机行业目前仍处在早期验证阶段,数据底座还没铺平的地方,方法再先进也落不了地。克鲁德重工在为客户规划AI路线时,始终把数据治理排在半监督方法选型之前。
克鲁德重工售后数据表明,真正制约项目推进的往往不是模型精度差几个点,而是标注、清洗与回流的工程闭环没跑通。把这笔账算清,比纠结选哪个半监督框架更重要。
不同训练方案的标注成本对照
| 训练方案 | 标注数据量 | 相对标注成本 | 精度天花板参考 |
|---|---|---|---|
| 全监督(全量标注) | 数万至数十万张 | 100%(基准) | 上限最高,受标注质量制约 |
| 半监督(约三成标注) | 少量标注加大量无标注 | 显著下降 | 接近全监督,以工况为准 |
| 自监督(零标注) | 仅无标注数据 | 最低 | 表征阶段有效,下游仍需少量标注 |
| 主动学习加半监督 | 按需增量标注 | 中等 | 同等预算下更稳,需人工在环 |
📖 相关阅读:起重机缺陷数据标注:50万张样本是怎么标出来的 | 起重机AI视觉检测全景解读
常见问题
问:半监督学习和全监督学习相比,精度到底差多少?
答:差距没有固定数值,取决于标注数据规模、无标注数据质量和分布一致性。标注充足且质量高时,全监督仍是最稳的基线。标注不足时,半监督在相同标注预算下通常明显优于只用少量标注的全监督。起重机缺陷检测这类任务目前仍以全监督为工程主流,半监督多处于验证阶段,精度上限以实际工况为准。克鲁德重工在评估时也会用独立测试集做同口径对比,不直接套用论文数字。
问:起重机缺陷检测项目要不要上马半监督,怎么判断?
答:先看两个条件:无标注数据是否与标注数据同分布,标注成本是否占项目大头。若现场积累了大量同工况的原始图像、振动或电流数据,而标注团队只能覆盖其中一小部分,半监督就有尝试价值。反之,若数据量本身有限、分布漂移明显,先把数据采集和清洗做扎实比硬上半监督更划算。
问:半监督模型出现伪标签错误累积,怎么判断和处理?
答:典型表现是验证集精度先升后降,或对某几类样本稳定误判。处理上先收紧伪标签置信度阈值,只保留高置信样本回灌,再检查强弱增强是否破坏了缺陷的关键特征,必要时把误判样本抽出来人工复核后重新加入标注集。伪标签的污染率要持续监控,而不是训练完就放手。