Распознавание груза на YOLOv8 и Jetson
Ключевая технология ИИ-зрения: идентификация груза на базе YOLOv8 и граничное развёртывание на Jetson. В современных интеллектуальных системах мостового крана промышленное зрение — это ключевая технология, позволяющая крану «понимать» рабочую обстановку.
В современных интеллектуальных системах мостового крана промышленное зрение — это ключевая технология, позволяющая крану «понимать» рабочую обстановку. Компания Келуде Тяжёлая Промышленность на базе алгоритма обнаружения объектов YOLOv8 и платформы граничных вычислений Jetson Orin построила полный технологический стек промышленного зрения — от выбора камеры и обучения модели до граничного развёртывания, — обеспечивающий идентификацию груза, точное позиционирование и безопасный мониторинг в безлюдном режиме. В данной статье с инженерной точки зрения системно разбирается полный цикл ключевых технологий промышленного зрения для мостовых кранов.
Четыре ключевых сценария применения промышленного зрения для мостового крана
Различные сценарии применения промышленного зрения для мостового крана предъявляют дифференцированные требования к точности и скорости обработки. На основе многолетней практики компания Келуде Тяжёлая Промышленность сформировала систему технических решений, охватывающую четыре типовых сценария:
| Область применения | Функциональные возможности | Точность | Работа в реальном времени | Рекомендуемое решение |
|---|---|---|---|---|
| Идентификация груза | Идентификациястальной рулон/Стальная заготовка/Контейнер/Изделие | ±50mm | 100ms | YOLOv10n + Jetson Orin NX |
| Точный захват/Укладка | Позиционирование захвата/приспособления с помощью системы технического зрения | ±5mm | 50ms | YOLOv8s + PnPОценка положения и ориентации |
| Опасная зонаМониторинг | Обнаружение людей в опасной зоне | ±200mm | 200ms | YOLOv8n + ByteTrackСлежение |
| Металлургический заводВысокотемпературная Среда | Идентификация высокотемпературного материала с помощью тепловизионного контроля | ±2℃ | 30fps | Optris PI 640Тепловизионный контроль |
Выбор промышленной камеры и расчёт параметров объектива
Выбор камеры — базовый этап построения системы технического зрения для мостового крана. «Келуде Тяжёлая Промышленность» разработала системный подход к подбору камер с учётом специфики различных режимов работы крана. Для типовых задач распознавания груза рекомендуется промышленная камера на 1,3 Мп в сочетании с датчиком глубины. Для операций точного позиционирования при захвате требуется цветная камера на 5 Мп в связке с 3D-камерой структурной подсветки.
Ключевой этап подбора — расчёт фокусного расстояния объектива по формуле: f = (sensor_width × working_distance) / FOV. Для типовой схемы съёмки сверху при ширине целевой зоны 1,5 м и рабочей дистанции 8 м с сенсором IMX265 (ширина сенсора 7,1 мм) расчётное фокусное расстояние составляет около 38 мм; на практике применяют объективы 35 мм или 50 мм. Рекомендуемые фокусные расстояния зависят от места установки: для съёмки сверху (рабочая дистанция 8–15 м) — 25–50 мм, для боковой съёмки — 12–25 мм, для захвата на близкой дистанции — 6–12 мм.
Для работы в условиях высокотемпературной среды металлургического производства необходима тепловизионная камера в специальном защитном кожухе с системой охлаждения. В техническом решении «Келуде Тяжёлая Промышленность» применяется тепловизор с разрешением 640×480, обеспечивающий стабильную работу при температуре свыше 95℃ — для распознавания стальных слябов и мониторинга зоны непрерывной разливки.
Обучение модели YOLOv8 и стратегия аугментации данных
Обучение модели YOLOv8 для крановых сценариев требует специальной инженерной методологии. При сборе данных рекомендуется не менее 500 образцов на каждый класс, охватывающих различные ракурсы (80% съёмка сверху + 20% боковая), условия освещения (дневной свет, ночь, контровой свет, яркий свет) и режимы работы (без груза, с полной нагрузкой, разные типы груза). Для разметки рекомендуется LabelImg в формате PascalVOC либо CVAT для командной онлайн-разметки.
Стратегия аугментации данных должна быть адаптирована к особенностям съёмки сверху. В отличие от сценариев автономного вождения, здесь не требуется аугментация с большими углами поворота — приоритет отдаётся Mosaic-аугментации (имитация хаотичного складирования) и регулировке яркости (компенсация резких перепадов освещения в цехе). Стандартная конфигурация обучения «Келуде Тяжёлая Промышленность» использует предобученную модель YOLOv8n, 200 эпох, размер входного изображения 640×640, начальную скорость обучения 0,001 и оптимизированные параметры HSV-аугментации.
crane_dataset/ ├── train/images/ # Обучающие изображения (*.jpg) ├── train/labels/ # YOLOРазметка формата (*.txt) ├── val/images/ # Валидационные изображения ├── val/labels/ └── crane_dataset.yaml
Конфигурация набора данных определяет 6 целевых классов: steel_coil (стальной рулон), steel_slab (стальной сляб), container (контейнер), workpiece (изделие), crane_hook (крюк), spreader (захватное приспособление) — покрывая наиболее распространённые объекты при крановых операциях.
Оптимизация TensorRT и развёртывание на Jetson
Развёртывание на граничных вычислениях — ключевой этап перехода кранового ИИ-зрения из лаборатории в реальную эксплуатацию. «Келуде Тяжёлая Промышленность» использует NVIDIA Jetson Orin в качестве основной платформы граничных вычислений; оптимальным решением для большинства крановых сценариев является Jetson Orin NX с производительностью 70–100 TOPS и энергопотреблением 10–25 Вт, обеспечивающий вывод в реальном времени.
Процесс развёртывания модели включает три этапа: сначала обученная модель PyTorch экспортируется в формат TensorRT через model.export(format="engine"), где за счёт слияния слоёв, калибровки квантования и оптимизации памяти значительно повышается скорость вывода; затем на платформе Jetson разворачивается движок TensorRT с настройкой DeepStream или пользовательского конвейера вывода; наконец, результаты передаются по протоколу MQTT в верхнюю систему диспетчеризации, замыкая полный цикл «обнаружение — решение — управление».
Производительность вывода на Jetson Orin NX существенно различается между версиями YOLO: YOLOv8n обеспечивает вывод за ~8 мс при размере модели всего 6,3 МБ; новейшая YOLOv10n достигает 7 мс и 5,5 МБ, сохраняя точность, близкую к YOLOv8s, при более высокой скорости — это рекомендуемая модель для граничного развёртывания.
Преобразование координат и принципы визуального позиционирования
Конечная цель визуального распознавания — преобразование в точные команды для механизмов, что требует полной цепочки преобразования от пиксельных координат к мировым. Система ИИ-зрения «Келуде Тяжёлая Промышленность» использует алгоритм оценки позы PnP (Perspective-n-Point) с учётом результатов калибровки внутренних и внешних параметров камеры, преобразуя 2D-ограничивающие рамки, обнаруженные YOLOv8, в 6-DOF позу (сдвиг X/Y/Z и вращение по крену/тангажу/рысканию).
В реальных условиях после точной калибровки положения камеры результаты обнаружения через матрицу преобразования координат передаются в команды управления по трём физическим осям: перемещение моста крана (ось X), перемещение тележки (ось Y), подъём (ось Z). Сквозная задержка всего контура визуального управления не превышает 150 мс, что удовлетворяет требованиям управления безлюдным мостовым краном уровня L4.