Сегментация изображений в диагностике кранов: от контура до пикселя

📋 Основное резюме

Обнаружение объектов даёт крану лишь ограничивающую рамку, сообщая «здесь есть объект»; семантическая сегментация идёт дальше — она относит каждый пиксель изображения к конкретному классу, показывая, «какие пиксели занимает груз и в какую зону зашёл человек». Для систем технического зрения крана, ориентированных на контроль безопасности, такое попиксельное восприятие превращает «обводку объекта» в «точное определение границ», что напрямую служит задачам обнаружения вторжения в опасную зону и контроля пересечения границ. В этой статье, отталкиваясь от контролируемых параметров, установленных стандартами безопасности, разъясняется, что даёт семантическая сегментация, какие показатели точности следует оценивать и каким выводам не стоит доверять.

Прежде чем обсуждать семантическую сегментацию, вернёмся к источнику требований мониторинга. Возможности визуального контроля крана в конечном счёте должны соответствовать контролируемым параметрам, установленным стандартами системы мониторинга и управления безопасностью: масса груза и ограничение перегрузки, ограничитель высоты подъема, концевой выключатель передвижения, защита от столкновений нескольких кранов на одном рельсе, а также — что наиболее важно — обнаружение вторжения персонала в рабочую зону и нахождения людей под поднимаемым грузом. Для всех контролируемых параметров, связанных с «зонами», «границами» и «нахождением человека в опасной зоне», одной лишь прямоугольной ограничивающей рамки часто недостаточно — именно здесь попиксельное распознавание закрывает этот пробел.

Это напрямую отражено в контролируемых параметрах, установленных стандартом GB/T 28264 «Система мониторинга и управления безопасностью грузоподъёмных машин»: стандарт требует контролировать «состояние», «положение» и «выход за пределы», а не «наличие рамки в кадре». Аналогично, ISO 24621:2022 «Диагностика неисправностей кранов с помощью ИИ» при рассмотрении распознавания состояния на основе изображений также рассматривает «интерпретируемость результата распознавания и его привязку к конкретной области» как требование для практического внедрения, а не просто выдачу изолированной метки класса.

Сравнение семантической сегментации и обнаружения объектов — схема из шести карточек

Какие контролируемые параметры безопасности требуют «распознавания пикселей», а не «обводки объектов»

Результатом обнаружения объектов является прямоугольная рамка с меткой класса, отвечающая на вопросы «что это и где примерно находится». Результатом семантической сегментации является карта классов той же размерности, что и исходное изображение, где каждый пиксель имеет определённую принадлежность к классу, отвечающая на вопрос «какому объекту принадлежит каждый фрагмент изображения». Первый подход даёт положение и класс, второй — геометрические границы.

Это различие значительно усиливается в сценариях контроля безопасности. Возьмём пример «нахождения человека под поднимаемым грузом»: обнаружение объектов может показать, что в кадре одновременно присутствуют рамка груза и рамка человека, но крайне сложно определить, попадают ли пиксели человека точно под проекцию груза. Семантическая сегментация позволяет попиксельно выделить область проекции груза и область человека, а затем выполнить проверку перекрытия на уровне областей.

Компания Келуде Тяжёлая Промышленность при модернизации систем технического зрения мостовых кранов наблюдала, что при использовании одной и той же камеры и одного и того же оборудования сбора данных частота ложных срабатываний при обнаружении вторжения персонала в опасную зону с помощью обнаружения объектов значительно выше, чем при использовании сегментационных масок для определения областей. Причина в том, что пустое пространство вокруг рамки может «включить» человека, стоящего вне опасной зоны, в неё, тогда как маска учитывает только пиксели, фактически попавшие в зону.

Оценка точности не ограничивается mAP рамок: mIoU и точность границ — ключевые показатели сегментации

В обнаружении объектов принято оценивать качество по mAP, тогда как семантическая сегментация опирается в основном на два показателя: пиксельную точность и средний коэффициент пересечения по объединению (mIoU). Пиксельная точность отражает «долю правильно классифицированных пикселей от общего числа пикселей» — это глобальный показатель; средний коэффициент пересечения по объединению для каждого класса вычисляет «пересечение прогнозируемой и истинной областей, делённое на их объединение», а затем усредняется — этот показатель ориентирован на классы и более чувствителен к малым объектам и границам.

Для сценариев кранов точность границ часто важнее общей пиксельной точности. В таких задачах, как обнаружение вторжения в опасную зону и контроль пересечения границ, ошибки возникают именно в нескольких рядах пикселей вблизи границ. Модель сегментации с высокой пиксельной точностью, но размытыми границами, может оказаться ненадёжной при определении «пересёк ли человек линию».

← Прокрутите таблицу влево/вправо →
Параметр сравнения обнаружение объектов(Выделение объекта рамкой) семантическая сегментация(Распознавание каждого пикселя)
Форма выводаПрямоугольная ограничивающая рамка + Метка классаПопиксельная маска класса
Точность ПозиционированияУровень рамки,С полями по периметруПопиксельный уровень,Точное соответствие реальностиконтур
Перекрытие и загораживаниеПри перекрытии рамок сложно определить принадлежностьЧёткое попиксельное разделение принадлежности
Малые и вытянутые объектыПодвержены пропуску обнаруженияБолее устойчив к вытянутым стропам
Вычислительные затратыОтносительно низкие,Просторазвертывание на периферииОтносительно высокие,Попиксельноинференс
Типовое применениеОбнаружение、Подсчёт、Быстрая сигнализацияЗона、Граница、Безопасность траектории

Таким образом, вывод не в том, что «семантическая сегментация совершеннее, значит, её и нужно применять», а в том, на каком именно этапе возникает задача. Если речь лишь о том, «есть ли груз в кадре и нужно ли подавать сигнал тревоги», то рамки обнаружения объектов достаточно быстры и экономичны; как только задача переходит на уровень «взаимосвязи между проекцией зоны груза, защитным ограждением и местоположением персонала», ответ нужно искать на уровне пикселей.

От контролируемых параметров к основанию для оценки: как проводить инспекцию подсистемы машинного зрения

Прежде чем подсистема обнаружения изображений выйдет на объект, инспекция не должна ограничиваться проверкой «появления рамки» или «появления маски». Более практичный подход — разбить контролируемые параметры на перечень конкретных сценариев, поддающихся однозначной оценке, и проверять каждый по отдельности. Взяв за основу контролируемые параметры, установленные стандартом контроля безопасности, и сопоставив каждый из них с возможностями семантической сегментации, можно использовать приведённую ниже таблицу в качестве эталонной базы при приёмке.

← Прокрутите таблицу влево/вправо →
МониторингПункт требования стандарта的МониторингСодержание семантическая сегментацияСоответствующая функциональность Ключевые аспекты инженерной оценки
перегрузкаиГрузоподъемностьпревышаетНоминальная грузоподъёмностьсигнализация прине соответствует напрямую,При перекрытии рамок сложно определить принадлежностьДатчик нагрузкина основеданные датчиковпринимается за основу,изображение как дополнительное подтверждение
ограничитель высоты подъемаСпредер (грузозахватное приспособление)достижение крайнегоконечный выключательсигнализация при положенииИдентификацияКрюкприближение к грузуконечный выключательзонакасание края маскиконечный выключательзона — немедленное срабатывание
концевой выключатель передвиженияМост кранаТележкавыход за пределыходсигнализация присегментацияРельсграница и корпус кранаконтурвыход пикселей корпуса за границу — фиксация нарушения
несколько кранов на одном путизащита от столкновенийнесколько единицкрандистанцияраннее предупреждениесегментация каждого устройстваконтуррасчёт дистанцииконтурминимальная дистанция нижепороговая сигнализация
вторжение персонала в рабочую зонувход персоналаопасная зонасигнализация призона человека иопасная зонаопределение перекрытиядоля перекрывающихся пикселей превышаетпороговая сигнализация
нахождение человека под грузомсигнализация при нахождении человека под проекцией грузаперекрытие зоны проекции груза и зоны персоналасрабатывание при перекрытии,лучше ложное срабатывание, чем пропуск
хранение изображений и данныхсохранение изображения-доказательства при сигнализацииархивирование снимка с наложением маски на исходное изображениеснимокпрослеживаемыйвозможность проверки
интеграция сигнализации иложная тревогаточность сигнализации и управлениеложная тревогазональное определение снижает уровень рамкиложная тревогапо фактическимрежим работыоценка по видеозаписичастота ложных срабатываний

В реальных проектах «Келуде Тяжёлая Промышленность» этот перечень превращается в чек-лист приёмки, где по каждому пункту требуется сохранить визуальное подтверждение — снимок с наложенной маской на исходное изображение служит прослеживаемым основанием для оценки. Критерий приёмки — фактическое достижение контролируемого показателя, а не факт успешного прогона модели.

Три распространённых заблуждения: сегментация — это не всегда точнее и не панацея

Первое заблуждение: «попиксельная сегментация всегда точнее, чем рамки». Сегментация даёт более детальное геометрическое описание, но не повышает точность распознавания как таковую. При низком качестве аннотаций и размытых границах классов модель может «запутать» пиксели каната, крюка и груза, что сделает результат менее практичным, чем чёткая рамка.

Второе заблуждение: «если есть сегментация, калибровка и развёртывание не нужны». Эффективность попиксельного распознавания сильно зависит от угла установки камеры, освещения и коррекции дисторсии объектива — при смене ракурса модель может деградировать. Сегментация уточняет границы, но не отменяет этап развёртывания.

Третье заблуждение: «попиксельная обработка означает работу в реальном времени без потерь». Вычислительные затраты на инференс сегментации на периферийных устройствах обычно выше, чем у обнаружения объектов: высокое разрешение и попиксельное предсказание требуют серьёзных ресурсов — как вычислительной мощности, так и времени задержки. Выбор в пользу сегментации должен определяться необходимостью контроля на уровне зон, а не тем, что «сегментация звучит более продвинуто».

Вывод очевиден: ценность семантической сегментации — не в замене обнаружения объектов, а в его дополнении. В решениях «Келуде Тяжёлая Промышленность» часто применяется двухуровневый подход: обнаружение объектов отвечает за быстрое выявление и подсчёт, а семантическая сегментация выполняет проверку границ в пределах выделенных областей. Это разделение функций, а не выбор одного из двух.

📖 Похожие материалы: Система визуального распознавания и точного позиционирования груза мостового крана | Обзор системы ИИ-зрения и обнаружения для мостовых кранов

Часто задаваемые вопросы

В: В чём принципиальная разница между семантической сегментацией и обнаружением объектов, и что выбрать?

О: Обнаружение объектов выдаёт прямоугольную рамку с меткой класса и отвечает на вопрос «что это и где примерно находится». Семантическая сегментация формирует маску классов, совпадающую по размеру с исходным изображением, и отвечает на вопрос «какому объекту принадлежит каждый пиксель». Если задача сводится к обнаружению и подсчёту — обнаружение объектов быстрее и экономичнее. Когда речь идёт о контроле вторжения в опасную зону, пересечении границ или нахождении людей под грузом — необходима попиксельная сегментация границ. Это не взаимоисключающие подходы: в решениях «Келуде Тяжёлая Промышленность» обнаружение объектов выполняет быстрый поиск, а сегментация — проверку границ.

В: Требуют ли стандарты контроля безопасности обязательного применения распознавания изображений?

О: Стандарты определяют контролируемые показатели и требования к контролю, а не предписывают конкретный алгоритм. Согласно стандартам контроля безопасности, такие показатели, как вторжение персонала в рабочую зону, нахождение людей под грузом и концевой выключатель передвижения, требуют точной оценки состояния и сохранения доказательств. Распознавание изображений — одно из средств выполнения этих требований. Применение попиксельной сегментации оправдано, когда контролируемый показатель требует оценки на уровне зон. Стандарты оценивают достижимость результата, а не привязываются к конкретному техническому подходу.

В: Как примерно оценить стоимость внедрения системы технического зрения с семантической сегментацией на кран?

О: Стоимость складывается из трёх основных составляющих: аппаратное обеспечение (промышленные камеры и вычислительный модуль), инженерные работы по обучению модели и её развёртыванию, а также последующее техническое обслуживание — аннотация данных и переобучение. Требования сегментации к вычислительной мощности периферийных устройств обычно выше, чем у обнаружения объектов: попиксельный инференс при высоком разрешении повышает требования к выбору аппаратуры. Точная котировка формируется по результатам обследования на месте с учётом режима работы, количества точек установки камер и требований к точности — универсальной цены не существует. «Келуде Тяжёлая Промышленность» сначала проводит обследование на месте, затем формирует перечень работ.

В: Как определить, нужно ли модернизировать существующую систему обнаружения до попиксельного уровня?

О: Сначала проанализируйте, по каким контролируемым показателям текущая система даёт наибольшее количество ложных или пропущенных тревог. Если проблемы сосредоточены в оценке пространственных отношений — «действительно ли человек вошёл в опасную зону», «есть ли люди под проекцией груза» — значит, вывода в виде рамок уже недостаточно, и сегментация оправдана. Если же задачи носят характер подсчёта и обнаружения, а точность стабильна, модернизация ради самой модернизации не нужна. Критерий — требует ли контролируемый показатель точного определения границ, а не то, насколько «современно» звучит сегментация.

Переход от «выделения объекта рамкой» к «распознаванию каждого пикселя» — это не замена одного алгоритма другим, а смена уровня детализации восприятия для крановой диагностики. Решение о модернизации и её глубине всегда должно исходить из конкретных контролируемых показателей. При разработке систем технического зрения «Келуде Тяжёлая Промышленность» сначала определяет, что требуется от каждого контролируемого показателя — «обнаружить» или «определить границы», — и только затем решает, как сочетать обнаружение и сегментацию, направляя вычислительные ресурсы туда, где они действительно необходимы.

Похожие статьи

contact

contact us

phone:
+86 13903802779

mail:3915269@qq.com

Working hours: Monday to Friday

Wechat
Wechat
SHARE
TOP