Платформа обучения и тестирования алгоритмов ИИ-зрения для кранов
Создана платформа для обучения и тестирования алгоритмов ИИ-зрения для кранов: накоплено более 500 000 размеченных изображений промышленных дефектов. Компания «Келуде Тяжёлая Промышленность» завершила создание специализированной платформы для обучения и тестирования алгоритмов ИИ-зрения для кранов. Накопленная база размеченных изображений промышленных дефектов превышает 500 000 снимков, что формирует надёжную основу данных для непрерывного совершенствования системы визуального мониторинга безопасности кранов.
Компания «Келуде Тяжёлая Промышленность» ввела в эксплуатацию платформу для обучения и тестирования алгоритмов ИИ-зрения, предназначенных для кранового оборудования. Объём накопленных размеченных данных о промышленных дефектах превысил 500 000 изображений, что обеспечивает прочную базу для последовательного развития системы визуального мониторинга безопасности кранов. Платформа объединяет сбор данных, управление разметкой, обучение моделей, оценку производительности и тестирование с аппаратным обеспечением в контуре (HIL) и представляет собой первую в отрасли специализированную инфраструктуру для разработки и верификации алгоритмов ИИ-зрения применительно к кранам.
Назначение платформы и предпосылки создания
Эффективность алгоритмов ИИ-зрения напрямую зависит от качества и объёма обучающих данных. Руководство «Келуде Тяжёлая Промышленность» осознало эту зависимость ещё на начальном этапе разработки ИИ-решений для кранов в 2023 году: отсутствие отраслевых размеченных наборов данных являлось ключевым барьером для практического внедрения технологий ИИ-зрения в краностроении. Универсальные наборы данных, такие как COCO и ImageNet, демонстрируют ограниченную переносимость на промышленные сценарии: запылённость, перепады освещения, затенение и вибрация в условиях реального цеха приводят к существенному снижению точности обнаружения при развёртывании универсальных моделей. В связи с этим предприятие инвестировало более 3 000 000 рублей в создание специализированной платформы для обучения и тестирования алгоритмов ИИ-зрения. Систематический сбор данных на производственных объектах и ручная разметка начались в сентябре 2023 года; за 22 месяца была завершена разработка платформы и накоплено 500 000 размеченных изображений.
Система сбора данных
Сбор данных охватывает четыре типа условий освещения — дневное, ночное, утреннее и вечернее (сумеречное), а также четыре типа погодных условий: ясно, облачно, дождь и туман. Оборудование для сбора включает восемь промышленных камер разрешением 5 Мп, закреплённых на нижней части главной балки крана, и одну мобильную камеру мониторинга, установленную сбоку от зоны подъёма и транспортировки грузов. Камеры оснащены датчиками с глобальным затвором, частотой кадров 25 кадров/с и поддержкой расширенного динамического диапазона (HDR). Платформа разметки поддерживает четыре типа аннотаций: прямоугольные рамки, полигоны, ключевые точки и семантическую сегментацию, что обеспечивает потребности трёх классов задач: обнаружение (детекция объектов), сегментация (сегментация дефектов) и локализация (определение ключевых точек). Процесс управления разметкой включает трёхуровневый контроль качества: первичная разметка исполнителем, проверка руководителем группы и выборочный контроль со стороны инженеров по алгоритмам. Объём выборки при проверке составляет не менее 20%, требуемая точность разметки — не ниже 97%.
Структура набора данных
500 000 размеченных изображений распределены по пяти основным категориям в соответствии с задачами обнаружения. Набор данных для обнаружения вторжения персонала насчитывает 250 000 изображений и включает четыре подкласса: работники в касках, работники без касок, лица без средств индивидуальной защиты и лица, приближающиеся к рабочей зоне снаружи. Охвачены четыре позы — ходьба, приседание, наклон и выполнение операции, а также три дистанционные зоны: дальняя (высота объекта менее 50 пикселей), средняя (50–150 пикселей) и ближняя (более 150 пикселей). Набор данных для обнаружения поднимаемых грузов содержит 120 000 изображений и включает такие категории, как стальные рулоны (в горизонтальном и вертикальном положении), стальные листы (горизонтально и под углом), компоненты оборудования (корпуса и рамы) и сыпучие материалы (навалом и в нерегулярной форме). Набор охватывает визуальные характеристики грузов при различных типах грузозахватных приспособлений (стальной канат, грузовой строп, грузоподъёмный электромагнит) и различных формах нагрузки. Набор данных для обнаружения дефектов сварных швов включает 80 000 изображений и содержит пять категорий дефектов: трещины, непровар, пористость, шлаковые включения и подрезы. Источники данных — стандартные образцы, снятые в лабораторных условиях, и фотографии сварных швов, выполненные непосредственно в цехах предприятий; каждое изображение прошло металлографическую верификацию для подтверждения достоверности дефекта. Набор данных для дефектоскопии каната насчитывает 30 000 изображений и включает пять типов аномалий: обрыв проволоки, износ, коррозия, деформация и уменьшение диаметра каната. Набор данных для обнаружения аномалий рельсового пути содержит 20 000 изображений и охватывает три категории: смещение рельса, трещины рельса и посторонние предметы на рельсовом пути.
Обучение моделей и итеративная разработка
Платформа обучения включает две независимые вычислительные среды. Среда онлайн-обучения базируется на четырёх графических процессорах NVIDIA RTX 4090, поддерживает фреймворки PyTorch и TensorFlow и обеспечивает быстрое развёртывание задач и изоляцию ресурсов за счёт контейнеризации на базе Docker. Среда офлайн-обучения оснащена двумя графическими процессорами NVIDIA A100 80GB и предназначена для ускорения обучения крупных моделей и обработки масштабных наборов данных. Платформа включает автоматизированный конвейер обучения, поддерживающий полный процесс: управление версиями данных, поиск гиперпараметров, обучение модели, сравнительную оценку и регистрацию модели. Обучение моделей выполняется на архитектуре YOLOv8 с применением аугментации данных Mosaic, адаптивного расчёта якорей и функции потерь CIoU. В результате многократных итерационных циклов обучения на 500 000 изображениях показатель mAP для обнаружения вторжения персонала вырос с исходных 67,3% до 92,3%; для обнаружения поднимаемых грузов mAP достиг 89,1%; для обнаружения дефектов сварных швов — 91,5%.
Испытательный полигон и верификация
Помимо функций обучения, платформа оснащена испытательным комплексом с аппаратным обеспечением в контуре (HIL). Испытательный стенд состоит из экспериментального мостового крана грузоподъёмностью 5 т, программируемой системы моделирования окружающей среды и системы сбора и анализа данных. Экспериментальный кран установлен в закрытом испытательном цехе; пролёт составляет 12 метров, высота подъёма — 6 метров; предусмотрены ручной и автоматический режимы работы. Программируемая система моделирования окружающей среды обеспечивает управляемое воспроизведение параметров: освещённость (регулируется в диапазоне 0–50 000 лк), температура (от −10 °C до 50 °C), влажность (20–90% относительной влажности) и запылённость (0–10 мг/м³). Система сбора и анализа данных синхронно регистрирует выходные данные ИИ-зрения, показания энкодеров и параметры окружающей среды, формируя комплексный отчёт об оценке для каждого кадра. Испытания с аппаратным обеспечением в контуре позволяют верифицировать работу алгоритмов ИИ-зрения в контролируемых лабораторных условиях при различных экстремальных условиях эксплуатации, обеспечивая достоверную экспериментальную основу для оценки устойчивости алгоритмов перед вводом оборудования в промышленную эксплуатацию.
Безопасность данных и конфиденциальность
Промышленные наборы визуальных данных могут содержать информацию о компоновке производственных линий и конфигурации оборудования заказчиков, поэтому защита данных являлась одним из ключевых требований при проектировании платформы. Все исходные данные хранятся в локальном хранилище NAS предприятия общей ёмкостью 200 ТБ с резервированием RAID6. Доступ к данным регламентирован трехуровневой системой разграничения прав: уровень исходных данных, уровень размеченных данных и уровень данных моделей; все операции доступа фиксируются в журнале аудита. При взаимодействии с внешними подрядчиками по разметке применяются стратегии деидентификации данных и фрагментированной разметки: каждый фрагмент содержит только один сценарный эпизод и не включает идентифицирующих признаков предприятия. После завершения разметки внутренние специалисты компании выполняют объединение фрагментов и контроль качества. Обмен данными с совместной лабораторией Чжэнчжоуского университета осуществляется в соответствии с подписанным соглашением об использовании данных и ограничен исключительно академическими исследовательскими целями; использование данных в коммерческих проектах за пределами лаборатории запрещено.
План развития
«Келуде Тяжёлая Промышленность» планирует расширить объём размеченных данных до 1 000 000 изображений к 2027 году, уделяя приоритетное внимание пополнению набора краевыми сценариями в условиях неблагоприятной погоды и низкой освещённости для решения проблемы длинного хвоста распределения данных в экстремальных условиях эксплуатации. Параллельно будет начато формирование наборов данных временных рядов для обучения моделей распознавания видеопоследовательностей и прогнозирования траекторий; каждая размеченная последовательность будет содержать не менее 300 кадров непрерывной детекции. Платформа также предусматривает открытие части деидентифицированных наборов данных для академического сотрудничества с целью содействия формированию отраслевых стандартов бенчмаркинга в области ИИ-зрения для кранового оборудования.
Часто задаваемые вопросы (FAQ)
В: Чем платформа ИИ-зрения «Келуде Тяжёлая Промышленность» отличается от универсальных платформ обучения ИИ?
О: Универсальные платформы обучения ИИ ориентированы преимущественно на такие зрелые области, как автономное вождение и видеонаблюдение, и используют наборы данных, основанные на открытых уличных и общих сценах. Платформа «Келуде Тяжёлая Промышленность» является первой в отрасли специализированной платформой обучения ИИ-зрения для кранов: все наборы данных сформированы на основе реальных условий эксплуатации собственного оборудования предприятия на объектах заказчиков и отражают специфические условия цехов подъёма и транспортировки. Категории разметки и конфигурация задач обнаружения полностью адаптированы к требованиям мониторинга безопасности и дефектоскопии кранов и включают пять специализированных наборов данных: обнаружение вторжения персонала, идентификация поднимаемых грузов, дефектоскопия каната, контроль сварных швов и контроль рельсового пути. Алгоритмы обучения оптимизированы для промышленных сценариев вывода: количество параметров модели при развёртывании не превышает 5 МБ, что обеспечивает возможность вывода в реальном времени на устройствах граничных вычислений Jetson Orin NX.
В: Каковы сроки и стоимость получения 500 000 размеченных изображений?
О: Работы велись с сентября 2023 г. по июль 2025 г., итого 22 месяца. На сбор данных затрачено около 280 000 руб. — приобретение 8 промышленных камер и их монтаж. На разметку привлечено до 15 специалистов в пиковые периоды и 8 в штатном режиме; суммарные затраты на ручную разметку составили около 1 800 000 руб. Инвестиции в аппаратное обеспечение платформы (GPU-серверы, NAS-хранилище, испытательные стенды) — примерно 950 000 руб. Средняя производительность разметки на одного специалиста — от 120 изображений в день (простые сцены) до 40 (сложные); средневзвешенная стоимость разметки одного изображения — около 3,6 руб.
В: Поддерживает ли платформа инкрементальное обновление данных?
О: Да. Модуль управления данными платформы построен на DVC (Data Version Control) и обеспечивает управление версиями наборов данных с поддержкой инкрементальных обновлений. Новые данные после прохождения контроля качества автоматически объединяются в следующую версию соответствующего набора; каждое обновление не влияет на результатырассуждение уже развернутых моделей. Инженеры по обучению могут выбирать конкретную версию данных для тренировки модели в зависимости от итераций алгоритма, а также выполнять сравнительную оценку и откат модели между различными версиями данных. Текущая версия набора данных платформы — V2.8, выполнено 18 инкрементальных обновлений.
В: Какова обобщающая способность набора данных и адаптация к различным сценариям?
О: При формировании набора данных была специально заложена кросс-фабричная вариативность: источники данных охватывают 18 производственных площадок в четырех отраслях — автомобилестроение, черная металлургия, складская логистика и механическая обработка. В пределах одной площадки собирались изображения из различных рабочих зон (например, зона сырья, зона готовой продукции, зона ремонта), в разное время суток и в разные сезоны. Кросс-сценарное тестирование показало: при развертывании на неучаствовавших в обучении площадках снижение mAP для обнаружения вторжения персонала не превышает 5 процентных пунктов, а для обнаружения подвешенных грузов — 8 процентных пунктов. На следующем этапе планируется дальнейшее расширение набора данных за счет дополнительных отраслей и предприятий для повышения обобщающей способности модели.