Détection des défauts sur les ponts roulants : échantillons de petite taille et méthodes d'apprentissage par transfert — Adaptation et amélioration des modèles dans des contextes de données rares
📌 天车缺陷检测迁移学习技术方案
以ImageNet预训练ResNet-18为基模型,迁移至天车部件表面缺陷分类任务(5类缺陷+1类正常)。在50/100/300/500四级样本量下对比三种策略:数据增强(CutMix+几何变换,精度提升+4%~7%)、冻结特征提取器(仅训练FC层,T1=89.5%@300样本)、全模型微调(全部层参与,T1=93.2%@500样本)。推荐工程流程:数据增强→冻结FC快速基线→全微调最终优化。实验平台:PyTorch 2.1.0 + NVIDIA A10,参照GB/T 29859-2013评估规范。
工业视觉缺陷检测面临的核心痛点之一是标注数据稀缺——天车部件(钢丝绳、车轮、轨道、吊钩、制动器)的缺陷形态多样(裂纹、磨损、点蚀、变形、断裂),每种缺陷收集数百张标注样本需要数周时间。小样本学习(Few-Shot Learning)和迁移学习(Transfer Learning)利用大规模通用数据集(如ImageNet,1,400万张)上预训练的视觉模型,迁移到工业缺陷检测这种目标域数据稀缺的任务。本文以天车5类常见部件表面缺陷(钢丝绳断丝、车轮踏面磨损、轨道裂纹、吊钩变形、制动衬垫开裂)的检测为应用场景,系统对比不同迁移策略在50~500样本量下的效果。
实验设置与数据集
数据集:天车部件表面缺陷图像数据集(克鲁德重工内部标注,2024年采集,型号为工业相机Basler acA2440-75um+LED环形光源)。共1,875张,6类(正常+5种缺陷),按样本量分4档实验(50/100/300/500张/类,其余为验证/测试)。统一预处理:Resize 224×224、归一化均值[0.485,0.456,0.406]标准差[0.229,0.224,0.225](ImageNet标准)。基模型:ResNet-18(ImageNet预训练,1170万参数)。评估指标:Top-1准确率(主指标)、F1分数。
数据增强方法
数据增强是小样本场景下最基础且有效的策略。本实验采用三类增强方法组合:①几何变换——随机旋转(±15°)、水平翻转(0.5概率)、随机平移(±10%)、随机缩放(0.8~1.2倍)、随机裁剪(0.08~1.0);②光度变换——亮度调整(±20%)、对比度调整(±15%)、饱和度调整(±15%)、色调抖动(±0.1)、高斯噪声(σ=0.01);③高级增强——随机擦除(Random Erasing, p=0.5, max_area=0.2)、CutMix(随机裁剪另一张图像混合,α=1.0)。增强倍数控制在5~20倍之间。
迁移策略对比
| 迁移策略 | 50样本 | 100样本 | 300样本 | 500样本 | 训练时间 | 过拟合风险 |
|---|---|---|---|---|---|---|
| 冻结FC+增强 | 68.5% | 77.2% | 89.5% | 91.3% | <5min | 低 |
| 全微调+增强 | 70.1% | 80.8% | 91.7% | 93.2% | ~35min | 中 |
| 冻结FC(无增强) | 62.3% | 71.5% | 85.2% | 88.6% | <3min | 低 |
| 全微调(无增强) | 64.8% | 74.6% | 87.1% | 90.3% | ~30min | 中-高 |
从零训练(不使用预训练权重)在50样本下T1仅41.8%,远低于任何迁移策略。数据增强在低样本量(50/100)下带来的提升最为显著(+5~6%),随着样本量增加增益递减(300样本+4.3%、500样本+2.9%)。当标注数据≥300张时,冻结FC策略即可达到T1≈90%,满足大多数工业部署需求。500样本场景下全微调达到T1=93.2%,接近有监督学习的上限。
工程推荐流程
基于上述实验,推荐的工程流程如下:第一步(基线建立)——使用冻结FC策略+基础数据增强(旋转+翻转+亮度+噪声),用100~300张标注样本快速建立基线模型(T1≈90%)。第二步(优化增强)——逐步加入CutMix等高级增强策略,观察验证集精度是否持续提升。第三步(全微调)——当基线精度趋于稳定后,解冻全部层进行全模型微调(学习率缩小10倍至0.0001),通常可再提升1~2%。第四步(部署)——导出为ONNX格式,经TensorRT INT8量化后部署至Jetson Orin NX(推理延迟约1.2ms/图像)。整个流程可在1~2天内完成。
Foire aux questions
问:迁移学习在天车缺陷检测中为什么不直接使用更大的模型如ResNet-50/101?
答:ResNet-18在工业场景中往往是更优选择,原因:①天车缺陷检测为细粒度分类任务,层数过深导致特征过于抽象不利于局部纹理特征;②工业缺陷数据集远比自然图像小,ResNet-18的1170万参数已足够;③ResNet-18推理延迟仅ResNet-50的约60%(1.2ms vs 2.0ms on Jetson Orin NX)。大模型在数据量≥5,000张/类时才有显著优势。
问:数据增强中CutMix和MixUp哪个更适合工业缺陷检测?
答:CutMix更适合。MixUp是像素级的线性混合(图像叠加),在工业图像中会产生不自然的”幽灵图像”(半透明叠加缺陷),降低模型对缺陷边缘的敏感度。CutMix是区域级的拼接(裁剪一张图的矩形区域粘贴到另一张),保持了个体缺陷的完整性。本实验中CutMix比MixUp的F1高约2.3%(300样本场景)。
问:不同天车部件(钢丝绳/车轮/轨道/吊钩)是否需要单独训练模型?
答:建议按部件类型单独训练6类分类模型(5缺陷+1正常),而非一个多部件多缺陷的统一模型。原因是不同部件的背景纹理、光照条件和缺陷形态差异大,统一模型需要更大的数据量和模型容量。六类分类模型(每类50~300张)使用冻结FC策略即可在30分钟内完成训练,部署时微服务容器化管理6个ONNX模型。
问:迁移学习模型部署到Jetson边缘设备上需要多少存储空间?
答:FP32 ResNet-18约45MB,TensorRT INT8量化后约12MB。6个部件模型(6×12MB=72MB)+推理引擎(约200MB)+配置文件,总计<300MB。Jetson Orin NX 16GB版可轻松部署20+个模型。单模型推理延迟约1.2ms(INT8, batch=1),6模型级联推理<8ms。