Модернизация мостового крана с YOLOv8n и TensorRT
Ключевые параметры
Для граничных вычислений рекомендуется NVIDIA Jetson Orin NX (100 TOPS, 16GB, 15W) с развертыванием модели обнаружения YOLOv8n (квантование TensorRT INT8, задержка вывода 5–12 мс) и трекера множественных объектов ByteTrack (2–3 мс), частота обработки кадров — 30 fps. Один граничный модуль обслуживает одновременно 2–4 AI-камеры. Более 50 комплектов внедрено на сталелитейных, цементных и автомобильных заводах, точность предупреждения о столкновениях — ≥97%.
Такие функции, как AI-визуальная защита от столкновений мостового крана, отслеживание траектории крюка и обнаружение обрывов проволок каната, требуют выполнения логических выводов в реальном времени непосредственно на граничном модуле. В отличие от облачной обработки видео, граничные вычисления выполняют вывод локально на кране, снижая задержку с 500 мс до 5–12 мс и устраняя колебания сети и узкие места пропускной способности. В данной статье рассматривается полный инженерный цикл реализации граничного модуля для мостового крана — от выбора аппаратного обеспечения, развертывания моделей и оптимизации квантования до взаимодействия с PLC.
Сравнение аппаратных платформ для граничных вычислений
Ключевые требования к граничному модулю для AI-зрения мостового крана: производительность AI ≥40 TOPS (INT8), поддержка многоканального ввода с камер (≥2 каналов MIPI CSI или USB3.0), промышленный температурный диапазон (−25°C...70°C), поддержка промышленных протоколов Profinet/EtherNet/IP. Ниже представлено комплексное сравнение трех популярных граничных модулей в применении к мостовому крану —
| Параметр | Jetson Orin NX 16GB | Jetson Orin Nano 8GB | RK3588 16GB |
|---|---|---|---|
| AIвычислительная мощность(INT8) | 100 TOPS | 40 TOPS | 6 TOPS |
| GPUархитектура | Ampere 1024ядро@918MHz | Ampere 512ядро@765MHz | Mali-G610 MP4 |
| память/пропускная способность | 16GB LPDDR5 68GB/s | 8GB LPDDR5 34GB/s | 16GB LPDDR4X 17GB/s |
| декодирование видео | 2×4K@30 + 4×1080@30 | 1×4K@30 + 2×1080@30 | 8K@30 + 4K@120 |
| энергопотребление | 15W/25Wпереключаемый | 7W/15Wпереключаемый | 8~15W |
| промышленный протокол | Profinet/Modbus TCP/EIP | Profinet/Modbus TCP/EIP | Modbus TCP |
| YOLOv8nзадержка вывода | 5~8ms (INT8) | 12~18ms (INT8) | 80~150ms (FP16) |
| ориентировочная цена | ¥6,500~7,500 | ¥2,500~3,500 | ¥800~1,200 |
| мостовой кранстепень рекомендации |
Обучение модели YOLOv8n и INT8-квантизация TensorRT
YOLOv8n (nano-версия, 3,2 млн параметров) — оптимальная модель детекции для задач AI-зрения мостовых кранов по соотношению точность-скорость. По сравнению с YOLOv8s (11,2 млн параметров), скорость инференса выше в 2,5 раза, при этом mAP снижается всего на 1,2%. Обучение выполнено на размеченном наборе данных, накопленном компанией Келуде Тяжёлая Промышленность (120 000 изображений, включающих пять классов объектов: крюк мостового крана, стальной канат, персонал, AGV, препятствия; покрытие 12 сценариев освещения: день, ночь, облачность, контровой свет и др.).
Процесс квантизации и развертывания: FP32-обучение → калибровочный набор (500 изображений типовых сцен) → PTQ INT8-квантизация TensorRT → сериализация инференс-движка (файл .plan). Ключевые параметры: разрешение входа 640×640, порог уверенности 0,5, порог NMS IoU 0,45. После квантизации размер модели снижен с 12,5 МБ (FP32) до 4,2 МБ (INT8), что дает сжатие на 66%; задержка инференса снижена с 8–12 мс (FP16) до 5–8 мс (INT8). Файлы развертывания передаются по OTA на блок граничных вычислений (инкрементальный пакет обновления ~5 МБ за раз).
Конвейер инференса (обработка каждого кадра): ① Захват кадра с камеры (30 fps, 1920×1080 → resize до 640×640) ② Инференс TensorRT (YOLOv8n INT8, 5–8 мс) ③ Постобработка NMS (1–2 мс) ④ Трекинг объектов ByteTrack (2–3 мс, на основе фильтра Калмана + венгерского алгоритма) ⑤ Расчет дистанции до столкновения (1 мс) ⑥ Запись результата в разделяемую память для чтения ПЛК. Суммарная задержка на кадр — 10–14 мс, что удовлетворяет требованию реального времени 30 fps (интервал кадра 33 мс, остаток 19–23 мс — на логику верхнего уровня).
Мультиобъектный трекинг ByteTrack и расчет дистанции до столкновения
YOLOv8n обеспечивает только детекцию объектов на отдельном кадре (ограничивающая рамка + класс + уверенность) и не отслеживает непрерывную траекторию движения. Алгоритм ByteTrack на основе результатов детекции прогнозирует положение каждого объекта в следующем кадре с помощью фильтра Калмана, после чего выполняется сопоставление детекций с существующими траекториями венгерским алгоритмом. Преимущество ByteTrack перед DeepSORT: отсутствие необходимости в извлечении ReID-признаков (экономия вычислительных затрат на дополнительный CNN-инференс), что делает его пригодным для развертывания на периферийных устройствах с ограниченной вычислительной мощностью.
Расчет дистанции до столкновения: после получения по данным трекинга актуальных позиций и векторов скорости каждого объекта (крюк мостового крана, AGV, персонал) вычисляются кратчайшая дистанция сближения (DCPA, Closest Point of Approach) и время до ближайшей точки сближения (TCPA) для каждой пары. Формула: DCPA = |d × (v_rel)| / |v_rel|, где d — вектор разности позиций двух объектов, v_rel — вектор относительной скорости. Предупреждение срабатывает при DCPA < порога безопасности (кран-кран 1,5 м; кран-человек 2,0 м) или TCPA < 2 с. Расчет столкновений выполняется для каждого кадра; результат записывается в блок разделяемой памяти между граничным блоком и ПЛК (64 байта: ID объекта, дистанция, скорость, класс риска).
Настройка протокола связи граничного блока и ПЛК
Блок граничных вычислений обменивается данными с ПЛК крана (S7-1200/1500) по Profinet или Modbus TCP. Рекомендуемое решение: граничный блок (Jetson Orin NX) запускает стек протокола Profinet-ведомого (Siemens PROFINET Stack for Linux + настройка сетевого адаптера на RT Class 1, период цикла 4 мс); на стороне ПЛК граничный блок добавляется в аппаратную конфигурацию как Profinet IO Device. Блок обмена данными (Input/Output по 64 байта): Input (граничный блок → ПЛК) содержит класс риска столкновения (0–3), дистанцию до объекта (мм), рекомендуемую скорость (% от номинальной), статус системы; Output (ПЛК → граничный блок) — текущие координаты крана, скорость, режим работы. Резервирование связи: при обрыве соединения Profinet более чем на 3 цикла (12 мс) ПЛК автоматически переключается в базовый режим блокировки без AI-ассистента; отказ граничного блока не влияет на основные операции крана.
Верификация развертывания и показатели производительности
Компания Келуде Тяжёлая Промышленность выполнила развертывание блоков граничных вычислений на 12 мостовых кранах в отделении непрерывной разливки сталелитейного завода. До развертывания предупреждение о столкновении полагалось на визуальный контроль оператора с задержкой реакции 3–5 секунд. После развертывания ключевые показатели: mAP@0.5 детекции = 0,953 (среднее по пяти классам), средняя задержка инференса на кадр 6,8 мс (INT8), сквозная задержка предупреждения о столкновении ≤50 мс (от захвата кадра камерой до срабатывания предупреждения на ПЛК), наработка на отказ MTBF ≥10 000 часов (~14 месяцев). По статистике за 6 месяцев после развертывания, количество событий риска столкновения снизилось с 23 до 0,4 в день (оставшиеся — экстренное уклонение при внезапном появлении человека), оценка удовлетворенности операторов выросла с 62 до 91 балла. Келуде Тяжёлая Промышленность предоставляет полный цикл услуг — от подбора оборудования и обучения модели до развертывания на объекте; модернизация одного мостового крана под граничные вычисления составляет около 1,5–2,5 тыс. юаней (включая граничный блок + камеру + монтаж и пусконаладку).
Сравнение производительности AI-инференса: FP16 против INT8-квантизации
FP32 исходныйТочность 12.5MB задержка вывода 18~25ms mAP 0.953(максимальный) мостовой кранне рекомендуется для сценария | FP16 полу-Точность 6.3MB задержка вывода 8~12ms mAP 0.951(-0.2%) Nanoрекомендуемая версия | INT8 квантование 4.2MB задержка вывода 5~8ms mAP 0.948(-0.5%) NXрекомендуемая версия |
Часто задаваемые вопросы (FAQ)
В: Производительности RK3588 недостаточно — почему нельзя использовать его для AI-зрения?
О: Производительность NPU в RK3588 составляет всего 6 TOPS. При запуске YOLOv8n в режиме FP16 задержка вывода составляет 80–150 мс, что не позволяет обеспечить детекцию в реальном времени с частотой 30 кадров/с (интервал между кадрами — 33 мс). Если снизить частоту до 10 кадров/с (задержка 100 мс становится приемлемой), то при такой частоте интервал между кадрами для быстро движущихся объектов (например, AGV на скорости 1 м/с перемещается на 100 мм за кадр) становится слишком большим, и точность предупреждения о столкновении резко падает. Поэтому RK3588 подходит только в качестве шлюза сбора данных и не рекомендуется для реального времени AI-инференса. Минимальная рекомендуемая платформа от Келуде — Jetson Orin Nano (40 TOPS), оптимальная по соотношению цена/производительность.
В: Какие настройки требуются для связи Profinet между Edge-боксом и ПЛК?
О: Необходимо выполнить три шага: ① установить стек протокола Profinet в Linux-системе Edge-бокса (рекомендуется Siemens PROFINET IO-Device SDK или открытый pnio_stack), настроить имя устройства и IP-адрес; ② в TIA Portal в разделе «Устройства и сети» добавить Edge-бокс как IO-Device Profinet и назначить адреса ввода/вывода (по 64 байта на Input и Output); ③ реализовать в приложении Edge-бокса функции чтения/записи данных IO: записывать результаты AI-инференса в область Input и считывать статус ПЛК из области Output. Первичная настройка занимает около 1 дня. Келуде предоставляет предварительно настроенный образ Profinet-коммуникации, что позволяет пропустить этап конфигурации при развертывании.
В: Сколько данных нужно для обучения модели? Какой точности можно достичь?
О: Келуде рекомендует для первого цикла обучения не менее 20 000 размеченных изображений (не менее 4 000 на класс), охватывающих типовые условия: день/ночь, солнце/облачность, контровой свет. Метрика mAP@0.5 достигает 0.93–0.96. Разметка данных выполняется в инструменте LabelImg (прямоугольные рамки, ~30 секунд на изображение). У Келуде уже есть базовая размеченная выборка из 120 000 изображений мостовых кранов. Новые клиенты могут выполнить тонкую настройку (Fine-tune) базовой модели на собственных 500–1 000 изображениях — адаптация занимает 2–3 дня, mAP стабильно держится выше 0.90.
В: Будет ли Edge-бокс стабильно работать в условиях высокой температуры и запыленности на металлургическом или цементном заводе?
О: Промышленная версия Jetson Orin NX (Jetson Orin NX Industrial) поддерживает расширенный диапазон температур от -40°C до +85°C и оснащена радиатором и активным вентилятором охлаждения. На металлургическом заводе в зоне непрерывной разливки (температура окружающей среды 45–55°C, запыленность ~5 мг/м³) развернуто более 50 устройств, которые работают непрерывно 12 месяцев без тепловых сбоев. Edge-бокс устанавливается в защитный шкаф IP54 (с вентилятором охлаждения и пылезащитным фильтром); замеренная температура GPU стабильно держится в диапазоне 65–72°C. Келуде предлагает опциональный пылезащитный термостойкий шкаф (с принудительным воздушным охлаждением и мониторингом температуры) по цене 800 ₽/шт.