Сегментация изображений в диагностике кранов: от контура до пикселя
📋 Основное резюме
Обнаружение объектов даёт крану лишь ограничивающую рамку, сообщая «здесь есть объект»; семантическая сегментация идёт дальше — она относит каждый пиксель изображения к конкретному классу, показывая, «какие пиксели занимает груз и в какую зону зашёл человек». Для систем технического зрения крана, ориентированных на контроль безопасности, такое попиксельное восприятие превращает «обводку объекта» в «точное определение границ», что напрямую служит задачам обнаружения вторжения в опасную зону и контроля пересечения границ. В этой статье, отталкиваясь от контролируемых параметров, установленных стандартами безопасности, разъясняется, что даёт семантическая сегментация, какие показатели точности следует оценивать и каким выводам не стоит доверять.
Прежде чем обсуждать семантическую сегментацию, вернёмся к источнику требований мониторинга. Возможности визуального контроля крана в конечном счёте должны соответствовать контролируемым параметрам, установленным стандартами системы мониторинга и управления безопасностью: масса груза и ограничение перегрузки, ограничитель высоты подъема, концевой выключатель передвижения, защита от столкновений нескольких кранов на одном рельсе, а также — что наиболее важно — обнаружение вторжения персонала в рабочую зону и нахождения людей под поднимаемым грузом. Для всех контролируемых параметров, связанных с «зонами», «границами» и «нахождением человека в опасной зоне», одной лишь прямоугольной ограничивающей рамки часто недостаточно — именно здесь попиксельное распознавание закрывает этот пробел.
Это напрямую отражено в контролируемых параметрах, установленных стандартом GB/T 28264 «Система мониторинга и управления безопасностью грузоподъёмных машин»: стандарт требует контролировать «состояние», «положение» и «выход за пределы», а не «наличие рамки в кадре». Аналогично, ISO 24621:2022 «Диагностика неисправностей кранов с помощью ИИ» при рассмотрении распознавания состояния на основе изображений также рассматривает «интерпретируемость результата распознавания и его привязку к конкретной области» как требование для практического внедрения, а не просто выдачу изолированной метки класса.
Какие контролируемые параметры безопасности требуют «распознавания пикселей», а не «обводки объектов»
Результатом обнаружения объектов является прямоугольная рамка с меткой класса, отвечающая на вопросы «что это и где примерно находится». Результатом семантической сегментации является карта классов той же размерности, что и исходное изображение, где каждый пиксель имеет определённую принадлежность к классу, отвечающая на вопрос «какому объекту принадлежит каждый фрагмент изображения». Первый подход даёт положение и класс, второй — геометрические границы.
Это различие значительно усиливается в сценариях контроля безопасности. Возьмём пример «нахождения человека под поднимаемым грузом»: обнаружение объектов может показать, что в кадре одновременно присутствуют рамка груза и рамка человека, но крайне сложно определить, попадают ли пиксели человека точно под проекцию груза. Семантическая сегментация позволяет попиксельно выделить область проекции груза и область человека, а затем выполнить проверку перекрытия на уровне областей.
Компания Келуде Тяжёлая Промышленность при модернизации систем технического зрения мостовых кранов наблюдала, что при использовании одной и той же камеры и одного и того же оборудования сбора данных частота ложных срабатываний при обнаружении вторжения персонала в опасную зону с помощью обнаружения объектов значительно выше, чем при использовании сегментационных масок для определения областей. Причина в том, что пустое пространство вокруг рамки может «включить» человека, стоящего вне опасной зоны, в неё, тогда как маска учитывает только пиксели, фактически попавшие в зону.
Оценка точности не ограничивается mAP рамок: mIoU и точность границ — ключевые показатели сегментации
В обнаружении объектов принято оценивать качество по mAP, тогда как семантическая сегментация опирается в основном на два показателя: пиксельную точность и средний коэффициент пересечения по объединению (mIoU). Пиксельная точность отражает «долю правильно классифицированных пикселей от общего числа пикселей» — это глобальный показатель; средний коэффициент пересечения по объединению для каждого класса вычисляет «пересечение прогнозируемой и истинной областей, делённое на их объединение», а затем усредняется — этот показатель ориентирован на классы и более чувствителен к малым объектам и границам.
Для сценариев кранов точность границ часто важнее общей пиксельной точности. В таких задачах, как обнаружение вторжения в опасную зону и контроль пересечения границ, ошибки возникают именно в нескольких рядах пикселей вблизи границ. Модель сегментации с высокой пиксельной точностью, но размытыми границами, может оказаться ненадёжной при определении «пересёк ли человек линию».
| Параметр сравнения | обнаружение объектов(Выделение объекта рамкой) | семантическая сегментация(Распознавание каждого пикселя) |
|---|---|---|
| Форма вывода | Прямоугольная ограничивающая рамка + Метка класса | Попиксельная маска класса |
| Точность Позиционирования | Уровень рамки,С полями по периметру | Попиксельный уровень,Точное соответствие реальностиконтур |
| Перекрытие и загораживание | При перекрытии рамок сложно определить принадлежность | Чёткое попиксельное разделение принадлежности |
| Малые и вытянутые объекты | Подвержены пропуску обнаружения | Более устойчив к вытянутым стропам |
| Вычислительные затраты | Относительно низкие,Просторазвертывание на периферии | Относительно высокие,Попиксельноинференс |
| Типовое применение | Обнаружение、Подсчёт、Быстрая сигнализация | Зона、Граница、Безопасность траектории |
Таким образом, вывод не в том, что «семантическая сегментация совершеннее, значит, её и нужно применять», а в том, на каком именно этапе возникает задача. Если речь лишь о том, «есть ли груз в кадре и нужно ли подавать сигнал тревоги», то рамки обнаружения объектов достаточно быстры и экономичны; как только задача переходит на уровень «взаимосвязи между проекцией зоны груза, защитным ограждением и местоположением персонала», ответ нужно искать на уровне пикселей.
От контролируемых параметров к основанию для оценки: как проводить инспекцию подсистемы машинного зрения
Прежде чем подсистема обнаружения изображений выйдет на объект, инспекция не должна ограничиваться проверкой «появления рамки» или «появления маски». Более практичный подход — разбить контролируемые параметры на перечень конкретных сценариев, поддающихся однозначной оценке, и проверять каждый по отдельности. Взяв за основу контролируемые параметры, установленные стандартом контроля безопасности, и сопоставив каждый из них с возможностями семантической сегментации, можно использовать приведённую ниже таблицу в качестве эталонной базы при приёмке.
| МониторингПункт | требования стандарта的МониторингСодержание | семантическая сегментацияСоответствующая функциональность | Ключевые аспекты инженерной оценки |
|---|---|---|---|
| перегрузкаиГрузоподъемность | превышаетНоминальная грузоподъёмностьсигнализация при | не соответствует напрямую,При перекрытии рамок сложно определить принадлежностьДатчик нагрузки | на основеданные датчиковпринимается за основу,изображение как дополнительное подтверждение |
| ограничитель высоты подъема | Спредер (грузозахватное приспособление)достижение крайнегоконечный выключательсигнализация при положении | ИдентификацияКрюкприближение к грузуконечный выключательзона | касание края маскиконечный выключательзона — немедленное срабатывание |
| концевой выключатель передвижения | Мост кранаТележкавыход за пределыходсигнализация при | сегментацияРельсграница и корпус кранаконтур | выход пикселей корпуса за границу — фиксация нарушения |
| несколько кранов на одном путизащита от столкновений | несколько единицкрандистанцияраннее предупреждение | сегментация каждого устройстваконтуррасчёт дистанции | контурминимальная дистанция нижепороговая сигнализация |
| вторжение персонала в рабочую зону | вход персоналаопасная зонасигнализация при | зона человека иопасная зонаопределение перекрытия | доля перекрывающихся пикселей превышаетпороговая сигнализация |
| нахождение человека под грузом | сигнализация при нахождении человека под проекцией груза | перекрытие зоны проекции груза и зоны персонала | срабатывание при перекрытии,лучше ложное срабатывание, чем пропуск |
| хранение изображений и данных | сохранение изображения-доказательства при сигнализации | архивирование снимка с наложением маски на исходное изображение | снимокпрослеживаемыйвозможность проверки |
| интеграция сигнализации иложная тревога | точность сигнализации и управлениеложная тревога | зональное определение снижает уровень рамкиложная тревога | по фактическимрежим работыоценка по видеозаписичастота ложных срабатываний |
В реальных проектах «Келуде Тяжёлая Промышленность» этот перечень превращается в чек-лист приёмки, где по каждому пункту требуется сохранить визуальное подтверждение — снимок с наложенной маской на исходное изображение служит прослеживаемым основанием для оценки. Критерий приёмки — фактическое достижение контролируемого показателя, а не факт успешного прогона модели.
Три распространённых заблуждения: сегментация — это не всегда точнее и не панацея
Первое заблуждение: «попиксельная сегментация всегда точнее, чем рамки». Сегментация даёт более детальное геометрическое описание, но не повышает точность распознавания как таковую. При низком качестве аннотаций и размытых границах классов модель может «запутать» пиксели каната, крюка и груза, что сделает результат менее практичным, чем чёткая рамка.
Второе заблуждение: «если есть сегментация, калибровка и развёртывание не нужны». Эффективность попиксельного распознавания сильно зависит от угла установки камеры, освещения и коррекции дисторсии объектива — при смене ракурса модель может деградировать. Сегментация уточняет границы, но не отменяет этап развёртывания.
Третье заблуждение: «попиксельная обработка означает работу в реальном времени без потерь». Вычислительные затраты на инференс сегментации на периферийных устройствах обычно выше, чем у обнаружения объектов: высокое разрешение и попиксельное предсказание требуют серьёзных ресурсов — как вычислительной мощности, так и времени задержки. Выбор в пользу сегментации должен определяться необходимостью контроля на уровне зон, а не тем, что «сегментация звучит более продвинуто».
Вывод очевиден: ценность семантической сегментации — не в замене обнаружения объектов, а в его дополнении. В решениях «Келуде Тяжёлая Промышленность» часто применяется двухуровневый подход: обнаружение объектов отвечает за быстрое выявление и подсчёт, а семантическая сегментация выполняет проверку границ в пределах выделенных областей. Это разделение функций, а не выбор одного из двух.
📖 Похожие материалы: Система визуального распознавания и точного позиционирования груза мостового крана | Обзор системы ИИ-зрения и обнаружения для мостовых кранов
Часто задаваемые вопросы
В: В чём принципиальная разница между семантической сегментацией и обнаружением объектов, и что выбрать?
О: Обнаружение объектов выдаёт прямоугольную рамку с меткой класса и отвечает на вопрос «что это и где примерно находится». Семантическая сегментация формирует маску классов, совпадающую по размеру с исходным изображением, и отвечает на вопрос «какому объекту принадлежит каждый пиксель». Если задача сводится к обнаружению и подсчёту — обнаружение объектов быстрее и экономичнее. Когда речь идёт о контроле вторжения в опасную зону, пересечении границ или нахождении людей под грузом — необходима попиксельная сегментация границ. Это не взаимоисключающие подходы: в решениях «Келуде Тяжёлая Промышленность» обнаружение объектов выполняет быстрый поиск, а сегментация — проверку границ.
В: Требуют ли стандарты контроля безопасности обязательного применения распознавания изображений?
О: Стандарты определяют контролируемые показатели и требования к контролю, а не предписывают конкретный алгоритм. Согласно стандартам контроля безопасности, такие показатели, как вторжение персонала в рабочую зону, нахождение людей под грузом и концевой выключатель передвижения, требуют точной оценки состояния и сохранения доказательств. Распознавание изображений — одно из средств выполнения этих требований. Применение попиксельной сегментации оправдано, когда контролируемый показатель требует оценки на уровне зон. Стандарты оценивают достижимость результата, а не привязываются к конкретному техническому подходу.
В: Как примерно оценить стоимость внедрения системы технического зрения с семантической сегментацией на кран?
О: Стоимость складывается из трёх основных составляющих: аппаратное обеспечение (промышленные камеры и вычислительный модуль), инженерные работы по обучению модели и её развёртыванию, а также последующее техническое обслуживание — аннотация данных и переобучение. Требования сегментации к вычислительной мощности периферийных устройств обычно выше, чем у обнаружения объектов: попиксельный инференс при высоком разрешении повышает требования к выбору аппаратуры. Точная котировка формируется по результатам обследования на месте с учётом режима работы, количества точек установки камер и требований к точности — универсальной цены не существует. «Келуде Тяжёлая Промышленность» сначала проводит обследование на месте, затем формирует перечень работ.
В: Как определить, нужно ли модернизировать существующую систему обнаружения до попиксельного уровня?
О: Сначала проанализируйте, по каким контролируемым показателям текущая система даёт наибольшее количество ложных или пропущенных тревог. Если проблемы сосредоточены в оценке пространственных отношений — «действительно ли человек вошёл в опасную зону», «есть ли люди под проекцией груза» — значит, вывода в виде рамок уже недостаточно, и сегментация оправдана. Если же задачи носят характер подсчёта и обнаружения, а точность стабильна, модернизация ради самой модернизации не нужна. Критерий — требует ли контролируемый показатель точного определения границ, а не то, насколько «современно» звучит сегментация.
Переход от «выделения объекта рамкой» к «распознаванию каждого пикселя» — это не замена одного алгоритма другим, а смена уровня детализации восприятия для крановой диагностики. Решение о модернизации и её глубине всегда должно исходить из конкретных контролируемых показателей. При разработке систем технического зрения «Келуде Тяжёлая Промышленность» сначала определяет, что требуется от каждого контролируемого показателя — «обнаружить» или «определить границы», — и только затем решает, как сочетать обнаружение и сегментацию, направляя вычислительные ресурсы туда, где они действительно необходимы.