Дефекты мостового крана: малая выборка и трансферное обучение
Техническое решение по обнаружению дефектов мостового крана на основе трансферного обучения
В качестве базовой модели используется ResNet-18, предобученная на ImageNet, с переносом на задачу классификации поверхностных дефектов компонентов мостового крана (5 классов дефектов + 1 класс нормы). При четырёх уровнях объёма выборки (50/100/300/500) сравниваются три стратегии: аугментация данных (CutMix + геометрические преобразования, повышение точности на +4%~+7%), заморозка экстрактора признаков (обучение только полносвязного слоя, T1=89,5% при 300 образцах), полная тонкая настройка модели (обучение всех слоёв, T1=93,2% при 500 образцах). Рекомендуемый производственный процесс: аугментация данных → заморозка полносвязного слоя → быстрый базовый уровень → полная тонкая настройка → финальная оптимизация. Платформа эксперимента: PyTorch 2.1.0 + NVIDIA A10, оценка по спецификации GB/T 29859-2013.
Одной из ключевых проблем промышленного визуального контроля дефектов является дефицит размеченных данных — дефекты компонентов мостового крана (канат стальной, колёса, рельсы, крюк, тормоз) отличаются многообразием форм (трещины, износ, точечная коррозия, деформация, разрушение), и сбор сотен размеченных образцов для каждого типа дефекта занимает несколько недель. Обучение с малым количеством примеров (Few-Shot Learning) и трансферное обучение (Transfer Learning) используют визуальные модели, предобученные на крупномасштабных универсальных наборах данных (например, ImageNet, 14 миллионов изображений), и переносят их на задачи промышленного контроля дефектов с дефицитом данных в целевой области. В данной статье в качестве прикладного сценария рассматривается обнаружение пяти распространённых типов поверхностных дефектов компонентов мостового крана (обрыв проволок каната, износ поверхности катания колеса, трещины на рельсе, деформация крюка, растрескивание тормозной накладки), и систематически сравнивается эффективность различных стратегий трансферного обучения при объёме выборки от 50 до 500 образцов.
Конфигурация эксперимента и набор данных
Набор данных: набор изображений поверхностных дефектов компонентов мостового крана (внутренняя разметка Келуде Тяжёлая Промышленность, сбор в 2024 году, промышленная камера Basler acA2440-75um + кольцевой LED-осветитель). Всего 1 875 изображений, 6 классов (норма + 5 типов дефектов), эксперимент проводится в 4 этапа по объёму выборки (50/100/300/500 изображений на класс, остальные — для валидации/тестирования). Единая предобработка: изменение размера до 224×224, нормализация со средним [0,485, 0,456, 0,406] и стандартным отклонением [0,229, 0,224, 0,225] (стандарт ImageNet). Базовая модель: ResNet-18 (предобучена на ImageNet, 11,7 млн параметров). Показатели оценки: точность Top-1 (основной показатель), F1-мера.
Методы аугментации данных
Аугментация данных — наиболее базовая и эффективная стратегия в сценариях с малым количеством образцов. В данном эксперименте используется комбинация трёх типов аугментации: ① геометрические преобразования — случайное вращение (±15°), горизонтальное отражение (вероятность 0,5), случайный сдвиг (±10%), случайное масштабирование (0,8~1,2), случайное кадрирование (0,08~1,0); ② фотометрические преобразования — регулировка яркости (±20%), регулировка контрастности (±15%), регулировка насыщенности (±15%), дрожание цветового тона (±0,1), гауссов шум (σ=0,01); ③ продвинутая аугментация — случайное стирание (Random Erasing, p=0,5, max_area=0,2), CutMix (случайное кадрирование другого изображения и смешивание, α=1,0). Коэффициент аугментации контролируется в диапазоне от 5 до 20 раз.
Сравнение стратегий переноса обучения
| Стратегия переноса | 50Выборка | 100Выборка | 300Выборка | 500Выборка | Время обучения | Риск переобучения |
|---|---|---|---|---|---|---|
| ЗамораживаниеFC+Аугментация | 68.5% | 77.2% | 89.5% | 91.3% | <5min | Низкий |
| Полная тонкая настройка+Аугментация | 70.1% | 80.8% | 91.7% | 93.2% | ~35min | Средний |
| ЗамораживаниеFC(Без аугментации) | 62.3% | 71.5% | 85.2% | 88.6% | <3min | Низкий |
| Полная тонкая настройка(Без аугментации) | 64.8% | 74.6% | 87.1% | 90.3% | ~30min | Средний-Высокий |
Обучение с нуля (без использования предобученных весов) на 50 образцах даёт T1 всего 41,8%, что значительно ниже любой стратегии переноса обучения. Наибольший прирост от аугментации данных наблюдается при малом объёме выборки (50/100) — до +5–6%, однако с увеличением количества образцов эффект снижается (300 образцов — +4,3%, 500 образцов — +2,9%). При наличии ≥300 размеченных изображений стратегия заморозки полносвязного слоя (FC) уже достигает T1≈90%, что достаточно для большинства задач промышленного развёртывания. В сценарии с 500 образцами полное дообучение даёт T1=93,2%, приближаясь к верхней границе обучения с учителем.
Рекомендуемый процесс внедрения для промышленного контроля
На основе проведённых экспериментов рекомендуемый инженерный процесс выглядит следующим образом. Шаг 1 (создание базовой модели) — использование стратегии заморозки FC с базовой аугментацией (поворот, отражение, изменение яркости, добавление шума) на 100–300 размеченных изображениях для быстрого получения базовой модели (T1≈90%). Шаг 2 (оптимизация аугментации) — постепенное добавление продвинутых стратегий, таких как CutMix, с контролем точности на валидационном наборе. Шаг 3 (полное дообучение) — после стабилизации базовой точности выполняется разморозка всех слоёв и полное дообучение модели (скорость обучения уменьшается в 10 раз до 0,0001), что обычно даёт дополнительный прирост в 1–2%. Шаг 4 (развёртывание) — экспорт в формат ONNX, квантование TensorRT INT8 и развёртывание на Jetson Orin NX (задержка вывода около 1,2 мс на изображение). Весь процесс занимает 1–2 дня.
Часто задаваемые вопросы
В: Почему для переноса обучения в задаче обнаружения дефектов мостового крана не используются более крупные модели, такие как ResNet-50/101?
О: ResNet-18 часто является более предпочтительным выбором в промышленных сценариях по следующим причинам: ① обнаружение дефектов мостового крана — это задача тонкой классификации, и чрезмерная глубина сети приводит к излишней абстракции признаков, что затрудняет выделение локальных текстурных характеристик; ② промышленные наборы данных о дефектах значительно меньше наборов естественных изображений, и 11,7 млн параметров ResNet-18 вполне достаточно; ③ задержка вывода ResNet-18 составляет лишь около 60% от ResNet-50 (1,2 мс против 2,0 мс на Jetson Orin NX). Крупные модели дают существенное преимущество только при объёме данных ≥5 000 изображений на класс.
В: Какая стратегия аугментации — CutMix или MixUp — лучше подходит для промышленного обнаружения дефектов?
О: CutMix более предпочтителен. MixUp выполняет линейное смешивание на уровне пикселей (наложение изображений), что в промышленных изображениях создаёт неестественные «призрачные изображения» (полупрозрачное наложение дефектов) и снижает чувствительность модели к границам дефектов. CutMix выполняет объединение на уровне областей (вырезание прямоугольной области одного изображения и вставка её в другое), сохраняя целостность отдельных дефектов. В данном эксперименте CutMix показал F1 примерно на 2,3% выше, чем MixUp (при 300 образцах).
В: Требуется ли отдельное обучение моделей для разных компонентов мостового крана (канат стальной, колёса, рельс, крюк)?
О: Рекомендуется обучать отдельные модели классификации для каждого типа компонента (5 классов дефектов + 1 класс нормы), а не единую модель для всех компонентов и дефектов. Это связано с тем, что текстурный фон, условия освещения и морфология дефектов существенно различаются между компонентами, и единая модель потребовала бы значительно большего объёма данных и ёмкости модели. Модель с шестью классами (50–300 изображений на класс) со стратегией заморозки FC обучается менее чем за 30 минут, а при развёртывании шесть ONNX-моделей управляются как микросервисы в контейнерах.
В: Какой объём памяти требуется для развёртывания моделей переноса обучения на периферийном устройстве Jetson?
О: Модель ResNet-18 в формате FP32 занимает около 45 МБ, после квантования TensorRT INT8 — около 12 МБ. Шесть моделей для компонентов (6×12 МБ = 72 МБ) + механизм вывода (около 200 МБ) + конфигурационные файлы — в сумме менее 300 МБ. На Jetson Orin NX 16 ГБ можно без труда развернуть 20+ моделей. Задержка вывода одной модели составляет около 1,2 мс (INT8, batch=1), каскадный вывод шести моделей — менее 8 мс.