Дефекты мостового крана: малая выборка и трансферное обучение

Техническое решение по обнаружению дефектов мостового крана на основе трансферного обучения

В качестве базовой модели используется ResNet-18, предобученная на ImageNet, с переносом на задачу классификации поверхностных дефектов компонентов мостового крана (5 классов дефектов + 1 класс нормы). При четырёх уровнях объёма выборки (50/100/300/500) сравниваются три стратегии: аугментация данных (CutMix + геометрические преобразования, повышение точности на +4%~+7%), заморозка экстрактора признаков (обучение только полносвязного слоя, T1=89,5% при 300 образцах), полная тонкая настройка модели (обучение всех слоёв, T1=93,2% при 500 образцах). Рекомендуемый производственный процесс: аугментация данных → заморозка полносвязного слоя → быстрый базовый уровень → полная тонкая настройка → финальная оптимизация. Платформа эксперимента: PyTorch 2.1.0 + NVIDIA A10, оценка по спецификации GB/T 29859-2013.

Одной из ключевых проблем промышленного визуального контроля дефектов является дефицит размеченных данных — дефекты компонентов мостового крана (канат стальной, колёса, рельсы, крюк, тормоз) отличаются многообразием форм (трещины, износ, точечная коррозия, деформация, разрушение), и сбор сотен размеченных образцов для каждого типа дефекта занимает несколько недель. Обучение с малым количеством примеров (Few-Shot Learning) и трансферное обучение (Transfer Learning) используют визуальные модели, предобученные на крупномасштабных универсальных наборах данных (например, ImageNet, 14 миллионов изображений), и переносят их на задачи промышленного контроля дефектов с дефицитом данных в целевой области. В данной статье в качестве прикладного сценария рассматривается обнаружение пяти распространённых типов поверхностных дефектов компонентов мостового крана (обрыв проволок каната, износ поверхности катания колеса, трещины на рельсе, деформация крюка, растрескивание тормозной накладки), и систематически сравнивается эффективность различных стратегий трансферного обучения при объёме выборки от 50 до 500 образцов.

Применение обучения с малым количеством примеров и трансферного обучения в обнаружении дефектов мостового крана

Конфигурация эксперимента и набор данных

Набор данных: набор изображений поверхностных дефектов компонентов мостового крана (внутренняя разметка Келуде Тяжёлая Промышленность, сбор в 2024 году, промышленная камера Basler acA2440-75um + кольцевой LED-осветитель). Всего 1 875 изображений, 6 классов (норма + 5 типов дефектов), эксперимент проводится в 4 этапа по объёму выборки (50/100/300/500 изображений на класс, остальные — для валидации/тестирования). Единая предобработка: изменение размера до 224×224, нормализация со средним [0,485, 0,456, 0,406] и стандартным отклонением [0,229, 0,224, 0,225] (стандарт ImageNet). Базовая модель: ResNet-18 (предобучена на ImageNet, 11,7 млн параметров). Показатели оценки: точность Top-1 (основной показатель), F1-мера.

Типы дефектов
Обрыв проволок каната · Износ поверхности катания колеса · Трещина на рельсе · Деформация крюка · Растрескивание тормозной накладки · Норма
Распределение данных
Всего 1 875 изображений · 6 классов сбалансированы (312 изображений/класс) · 224×224 RGB · Промышленная камера Basler
Эксперимент с объёмом выборки
4 уровня: 50/100/300/500 изображений/класс · Остальные — валидационный/тестовый наборы · 5 повторов на каждом уровне с усреднением
Базовая модель
ResNet-18 · Предобучена на ImageNet · 11,7 млн параметров · PyTorch 2.1.0 · GPU A10

Методы аугментации данных

Аугментация данных — наиболее базовая и эффективная стратегия в сценариях с малым количеством образцов. В данном эксперименте используется комбинация трёх типов аугментации: ① геометрические преобразования — случайное вращение (±15°), горизонтальное отражение (вероятность 0,5), случайный сдвиг (±10%), случайное масштабирование (0,8~1,2), случайное кадрирование (0,08~1,0); ② фотометрические преобразования — регулировка яркости (±20%), регулировка контрастности (±15%), регулировка насыщенности (±15%), дрожание цветового тона (±0,1), гауссов шум (σ=0,01); ③ продвинутая аугментация — случайное стирание (Random Erasing, p=0,5, max_area=0,2), CutMix (случайное кадрирование другого изображения и смешивание, α=1,0). Коэффициент аугментации контролируется в диапазоне от 5 до 20 раз.

Геометрические преобразования
Вращение ±15° · Горизонтальное отражение · Сдвиг ±10% · Масштабирование 0,8~1,2 · Случайное кадрирование 0,08~1,0
Фотометрические преобразования
Яркость ±20% · Контраст ±15% · Насыщенность ±15% · Цветовой тон ±0.1 · Гауссов шум σ=0.01
Расширенная аугментация
Random Erasing p=0.5 · CutMix α=1.0 · Коэффициент аугментации 5–20x
Повышение точности
50 образцов + аугментация: T1 с 62.3% до 68.5% (+6.2%) · 300 образцов: с 85.2% до 89.5% (+4.3%)

Сравнение стратегий переноса обучения

Стратегия переноса50Выборка100Выборка300Выборка500ВыборкаВремя обученияРиск переобучения
ЗамораживаниеFC+Аугментация68.5%77.2%89.5%91.3%<5minНизкий
Полная тонкая настройка+Аугментация70.1%80.8%91.7%93.2%~35minСредний
ЗамораживаниеFC(Без аугментации)62.3%71.5%85.2%88.6%<3minНизкий
Полная тонкая настройка(Без аугментации)64.8%74.6%87.1%90.3%~30minСредний-Высокий

Обучение с нуля (без использования предобученных весов) на 50 образцах даёт T1 всего 41,8%, что значительно ниже любой стратегии переноса обучения. Наибольший прирост от аугментации данных наблюдается при малом объёме выборки (50/100) — до +5–6%, однако с увеличением количества образцов эффект снижается (300 образцов — +4,3%, 500 образцов — +2,9%). При наличии ≥300 размеченных изображений стратегия заморозки полносвязного слоя (FC) уже достигает T1≈90%, что достаточно для большинства задач промышленного развёртывания. В сценарии с 500 образцами полное дообучение даёт T1=93,2%, приближаясь к верхней границе обучения с учителем.


Рекомендуемый процесс внедрения для промышленного контроля

На основе проведённых экспериментов рекомендуемый инженерный процесс выглядит следующим образом. Шаг 1 (создание базовой модели) — использование стратегии заморозки FC с базовой аугментацией (поворот, отражение, изменение яркости, добавление шума) на 100–300 размеченных изображениях для быстрого получения базовой модели (T1≈90%). Шаг 2 (оптимизация аугментации) — постепенное добавление продвинутых стратегий, таких как CutMix, с контролем точности на валидационном наборе. Шаг 3 (полное дообучение) — после стабилизации базовой точности выполняется разморозка всех слоёв и полное дообучение модели (скорость обучения уменьшается в 10 раз до 0,0001), что обычно даёт дополнительный прирост в 1–2%. Шаг 4 (развёртывание) — экспорт в формат ONNX, квантование TensorRT INT8 и развёртывание на Jetson Orin NX (задержка вывода около 1,2 мс на изображение). Весь процесс занимает 1–2 дня.


Часто задаваемые вопросы

В: Почему для переноса обучения в задаче обнаружения дефектов мостового крана не используются более крупные модели, такие как ResNet-50/101?

О: ResNet-18 часто является более предпочтительным выбором в промышленных сценариях по следующим причинам: ① обнаружение дефектов мостового крана — это задача тонкой классификации, и чрезмерная глубина сети приводит к излишней абстракции признаков, что затрудняет выделение локальных текстурных характеристик; ② промышленные наборы данных о дефектах значительно меньше наборов естественных изображений, и 11,7 млн параметров ResNet-18 вполне достаточно; ③ задержка вывода ResNet-18 составляет лишь около 60% от ResNet-50 (1,2 мс против 2,0 мс на Jetson Orin NX). Крупные модели дают существенное преимущество только при объёме данных ≥5 000 изображений на класс.

В: Какая стратегия аугментации — CutMix или MixUp — лучше подходит для промышленного обнаружения дефектов?

О: CutMix более предпочтителен. MixUp выполняет линейное смешивание на уровне пикселей (наложение изображений), что в промышленных изображениях создаёт неестественные «призрачные изображения» (полупрозрачное наложение дефектов) и снижает чувствительность модели к границам дефектов. CutMix выполняет объединение на уровне областей (вырезание прямоугольной области одного изображения и вставка её в другое), сохраняя целостность отдельных дефектов. В данном эксперименте CutMix показал F1 примерно на 2,3% выше, чем MixUp (при 300 образцах).

В: Требуется ли отдельное обучение моделей для разных компонентов мостового крана (канат стальной, колёса, рельс, крюк)?

О: Рекомендуется обучать отдельные модели классификации для каждого типа компонента (5 классов дефектов + 1 класс нормы), а не единую модель для всех компонентов и дефектов. Это связано с тем, что текстурный фон, условия освещения и морфология дефектов существенно различаются между компонентами, и единая модель потребовала бы значительно большего объёма данных и ёмкости модели. Модель с шестью классами (50–300 изображений на класс) со стратегией заморозки FC обучается менее чем за 30 минут, а при развёртывании шесть ONNX-моделей управляются как микросервисы в контейнерах.

В: Какой объём памяти требуется для развёртывания моделей переноса обучения на периферийном устройстве Jetson?

О: Модель ResNet-18 в формате FP32 занимает около 45 МБ, после квантования TensorRT INT8 — около 12 МБ. Шесть моделей для компонентов (6×12 МБ = 72 МБ) + механизм вывода (около 200 МБ) + конфигурационные файлы — в сумме менее 300 МБ. На Jetson Orin NX 16 ГБ можно без труда развернуть 20+ моделей. Задержка вывода одной модели составляет около 1,2 мс (INT8, batch=1), каскадный вывод шести моделей — менее 8 мс.

Похожие статьи

contact

contact us

phone:
+86 13903802779

mail:3915269@qq.com

Working hours: Monday to Friday

Wechat
Wechat
SHARE
TOP