Detección de cargas con YOLOv8 en Jetson

Tecnología central de visión artificial: identificación de cargas suspendidas con YOLOv8 y despliegue en el borde con Jetson. En los sistemas inteligentes de puente grúa modernos, la visión artificial es la tecnología clave que permite a la grúa "comprender" el entorno de trabajo.

En los sistemas inteligentes de puente grúa actuales, la visión artificial constituye la tecnología esencial que capacita a la grúa para interpretar visualmente su entorno operativo. Kelude Industrias Pesadas ha desarrollado una solución técnica integral de visión artificial —desde la selección de cámaras hasta el entrenamiento de modelos y el despliegue en el borde— basada en el algoritmo de detección de objetos YOLOv8 y la plataforma de computación en el borde Jetson Orin. Esta arquitectura permite capacidades operativas no tripuladas en múltiples escenarios, incluyendo la identificación de cargas suspendidas, el posicionamiento de precisión y el monitoreo de seguridad. Este artículo analiza sistemáticamente la cadena tecnológica completa de la visión artificial aplicada a puentes grúa desde una perspectiva de ingeniería práctica.

Diagrama de la arquitectura tecnológica completa del sistema de visión artificial para puente grúa

Cuatro aplicaciones clave de la visión artificial en puentes grúa

Los distintos escenarios de aplicación de la visión artificial en puentes grúa presentan requisitos diferenciados en cuanto a precisión y tiempo real. A lo largo de años de experiencia en proyectos, Kelude Industrias Pesadas ha consolidado una solución técnica que abarca cuatro tipologías de aplicación representativas:

← Deslice la tabla para verla completa →
Escenarios de aplicaciónFuncionesPrecisiónTiempo realSolución recomendada
Carga suspendida IdentificaciónIdentificaciónbobina de acero/Palanquilla/Contenedor/Pieza de trabajo±50mm100msYOLOv10n + Jetson Orin NX
Agarre de precisión/ColocaciónGuía por visión Elevación/Fijación Alineación±5mm50msYOLOv8s + Pn PEstimación de pose
Zona de seguridad MonitoreoDetección Intrusión de personal Zona peligrosa±200mm200msYOLOv8n + Byte Track Seguimiento
Planta siderúrgica Entorno de Alta TemperaturaTermografía Identificación Material de alta temperatura±2℃30fpsOptris PI 640Termografía

Selección de cámaras industriales y cálculo de parámetros de lentes

La selección de la cámara es la base del sistema de visión para puentes grúa. Kelude Industrias Pesadas ha desarrollado un método sistemático de selección adaptado a los distintos escenarios de operación de los puentes grúa. Para la identificación convencional de cargas suspendidas, se recomienda una cámara industrial de 1,3 megapíxeles combinada con un sensor de profundidad. Para aplicaciones de agarre y posicionamiento de precisión, se opta por una cámara a color de 5 megapíxeles junto con un sistema de luz estructurada 3D.

El cálculo de la distancia focal es un paso crítico en la selección de la lente, siendo su fórmula principal: f = (sensor_width × working_distance) / FOV. En un escenario típico de captura cenital con un puente grúa, con un ancho de área objetivo de 1,5 m y una distancia de trabajo de 8 m, utilizando un sensor IMX265 (sensor_width 7,1 mm), se obtiene una distancia focal aproximada de 38 mm. En la práctica, se suelen emplear lentes de 35 mm o 50 mm. La distancia focal recomendada varía según la posición de montaje: para captura cenital (distancia de trabajo 8-15 m) se recomiendan lentes de 25-50 mm; para captura lateral, de 12-25 mm; y para escenarios de agarre a corta distancia, de 6-12 mm.

Para entornos de alta temperatura en acerías, es necesario emplear cámaras termográficas con cubierta protectora y camisa de enfriamiento especiales. La Solución Técnica de Kelude Industrias Pesadas recomienda una cámara termográfica con resolución de 640×480, capaz de operar de forma continua y estable en entornos de hasta 95 °C, satisfaciendo los requisitos de aplicaciones industriales exigentes como la identificación de palanquillas y el monitoreo en zonas de colada continua.

Entrenamiento del modelo YOLOv8 y estrategias de aumento de datos

El entrenamiento del modelo YOLOv8 para escenarios de puentes grúa requiere una metodología de ingeniería específica. En la recopilación de datos, se recomienda un mínimo de 500 muestras por categoría, que abarquen diferentes ángulos (80 % cenital + 20 % lateral), distintas condiciones de iluminación (diurna, nocturna, contraluz, luz intensa) y diversos estados de operación (sin carga, carga completa, diferentes tipos de carga suspendida). Para el etiquetado, se recomienda la herramienta LabelImg con formato PascalVOC, o CVAT para la anotación colaborativa en equipo.

La estrategia de aumento de datos debe adaptarse a las características de la captura cenital del puente grúa. A diferencia de escenarios como la conducción autónoma, la visión de puentes grúa no requiere un aumento con rotaciones de gran ángulo, sino que se centra en el aumento Mosaic (para simular escenarios de apilamiento desordenado) y el ajuste de brillo (para hacer frente a los cambios bruscos de iluminación en acerías). La configuración de entrenamiento estándar de Kelude Industrias Pesadas utiliza el modelo preentrenado YOLOv8n como punto de partida, con 200 épocas, tamaño de imagen de entrada de 640×640, tasa de aprendizaje inicial de 0,001 y parámetros de aumento de color HSV adecuados.

crane_dataset/ ├── train/images/ # Imágenes de Entrenamiento (*.jpg) ├── train/labels/ # YOLOAnotación de Formato (*.txt) ├── val/images/ # Imágenes de Validación ├── val/labels/ └── crane_dataset.yaml

La configuración del conjunto de datos debe definir 6 categorías de objetos: steel_coil (bobina de acero), steel_slab (palanquilla), container (contenedor), workpiece (pieza de trabajo), crane_hook (gancho) y spreader (esparcidor), que cubren los objetos más comunes en las operaciones de elevación con puente grúa.

Optimización con TensorRT e implementación en el borde con Jetson

La implementación en el borde es el paso clave para llevar la visión por IA de los puentes grúa del laboratorio a la ingeniería real. Kelude Industrias Pesadas utiliza la serie NVIDIA Jetson Orin como plataforma principal de Computación en el Borde. El modelo Jetson Orin NX, con una capacidad de cómputo de IA de 70-100 TOPS y un bajo consumo de 10-25 W, se presenta como la opción recomendada para satisfacer los requisitos de inferencia en tiempo real de la mayoría de los escenarios de puentes grúa.

El proceso de implementación del modelo comprende tres etapas técnicas: primero, el modelo PyTorch entrenado se exporta a un archivo de motor TensorRT mediante model.export(format="engine"), aprovechando las técnicas de fusión de capas, calibración de cuantificación y optimización de memoria de TensorRT para acelerar significativamente la inferencia; a continuación, se implementa el motor TensorRT en la plataforma Jetson, configurando DeepStream o una canalización de inferencia personalizada; por último, los resultados de la inferencia se envían en tiempo real al sistema de despacho superior mediante el protocolo MQTT, completando el ciclo cerrado de detección, decisión y control.

En cuanto al rendimiento de inferencia, las diferentes versiones de YOLO muestran diferencias significativas en Jetson Orin NX: YOLOv8n ofrece una velocidad de inferencia de aproximadamente 8 ms con un modelo de solo 6,3 MB; mientras que el más reciente YOLOv10n optimiza aún más estos valores hasta 7 ms y 5,5 MB, logrando una velocidad de inferencia superior con una precisión cercana a la de YOLOv8s. Por ello, YOLOv10n es el modelo preferido de Kelude Industrias Pesadas para la implementación en el borde.

Transformación de coordenadas y principios de posicionamiento con guiado por visión

El objetivo final del reconocimiento visual es traducirse en instrucciones mecánicas precisas, lo que implica una cadena completa de transformación desde las coordenadas de píxeles hasta las coordenadas del mundo. El sistema de visión por IA de Kelude Industrias Pesadas emplea el algoritmo de estimación de pose PnP (Perspective-n-Point), que combina los resultados de la calibración de los parámetros intrínsecos y extrínsecos de la cámara para convertir los cuadros delimitadores 2D detectados por YOLOv8 en información de pose de 6 grados de libertad (traslación X/Y/Z y rotación de cabeceo/guñada/alabeo).

En la práctica, tras una calibración precisa de la posición de montaje de la cámara, los resultados de la detección se mapean mediante una matriz de transformación de coordenadas a las instrucciones de control de los tres ejes físicos: desplazamiento del carro puente (eje X), desplazamiento del carro (eje Y) y elevación (eje Z). La latencia de extremo a extremo de todo el proceso de guiado por visión se mantiene por debajo de 150 ms, cumpliendo con los requisitos de control en tiempo real para puentes grúa no tripulados de nivel L4.

Preguntas frecuentes (FAQ)

P: ¿Cómo se garantiza la precisión de reconocimiento del sistema de visión artificial para puentes grúa en entornos con alta concentración de polvo?
R: Kelude adopta un enfoque de protección multicapa: el objetivo incorpora un dispositivo antipolvo por soplado de aire y una carcasa con Grado de Protección IP65; a nivel de algoritmo, se integran módulos de preprocesamiento para eliminación de niebla y mejora de contraste, lo que permite mantener una precisión de reconocimiento superior al 90% en condiciones de concentración de polvo ≤10 mg/m³. Este diseño cumple con los requisitos de adaptabilidad ambiental de la norma ISO 4301 para el diseño de grúas.
P: ¿Qué modelo es más adecuado para puentes grúa, YOLOv8 o YOLOv10?
R: Se recomienda optar por YOLOv10n como primera opción. En las pruebas comparativas realizadas por Kelude Industrias Pesadas, la velocidad de inferencia de YOLOv10n es aproximadamente un 12,5 % superior a la de YOLOv8n (7 ms frente a 8 ms), el tamaño del modelo es menor (5,5 MB frente a 6,3 MB) y la precisión mAP mejora en torno a 1,5 puntos porcentuales. Para escenarios que requieran mayor precisión, se puede elegir YOLOv8s.
P: ¿Cómo se integra el sistema de visión por IA con el sistema de control PLC existente del puente grúa?
R: El sistema de visión por IA de Kelude envía los resultados de detección (clase de objeto, coordenadas, nivel de confianza) al gateway perimetral mediante el protocolo MQTT. Tras la conversión de protocolo, el gateway escribe los datos en el bloque de datos (DB) del PLC Siemens S7-1500 a través del bus PROFINET, logrando así una sincronización en tiempo real entre la guía visual y el control de movimiento.
P: ¿Cuál es el ciclo recomendado y la precisión requerida para la calibración de la cámara?
R: Kelude Industrias Pesadas recomienda recalibrar los parámetros intrínsecos de la cámara cada 3 meses, con una recalibración obligatoria tras una revisión general o sustitución del objetivo. La calibración se realiza mediante el método de tablero de ajedrez de Zhang Zhengyou, manteniendo el error de reproyección por debajo de 0,3 píxeles. La precisión de posicionamiento en los ejes X/Y puede alcanzar ±3 mm (en combinación con la fusión de datos del encoder).

Artículos relacionados

contact

contact us

phone:
+86 13903802779

mail:3915269@qq.com

Working hours: Monday to Friday

Wechat
Wechat
SHARE
TOP