Detección de cargas con YOLOv8 en Jetson
Tecnología central de visión artificial: identificación de cargas suspendidas con YOLOv8 y despliegue en el borde con Jetson. En los sistemas inteligentes de puente grúa modernos, la visión artificial es la tecnología clave que permite a la grúa "comprender" el entorno de trabajo.
En los sistemas inteligentes de puente grúa actuales, la visión artificial constituye la tecnología esencial que capacita a la grúa para interpretar visualmente su entorno operativo. Kelude Industrias Pesadas ha desarrollado una solución técnica integral de visión artificial —desde la selección de cámaras hasta el entrenamiento de modelos y el despliegue en el borde— basada en el algoritmo de detección de objetos YOLOv8 y la plataforma de computación en el borde Jetson Orin. Esta arquitectura permite capacidades operativas no tripuladas en múltiples escenarios, incluyendo la identificación de cargas suspendidas, el posicionamiento de precisión y el monitoreo de seguridad. Este artículo analiza sistemáticamente la cadena tecnológica completa de la visión artificial aplicada a puentes grúa desde una perspectiva de ingeniería práctica.
Cuatro aplicaciones clave de la visión artificial en puentes grúa
Los distintos escenarios de aplicación de la visión artificial en puentes grúa presentan requisitos diferenciados en cuanto a precisión y tiempo real. A lo largo de años de experiencia en proyectos, Kelude Industrias Pesadas ha consolidado una solución técnica que abarca cuatro tipologías de aplicación representativas:
| Escenarios de aplicación | Funciones | Precisión | Tiempo real | Solución recomendada |
|---|---|---|---|---|
| Carga suspendida Identificación | Identificaciónbobina de acero/Palanquilla/Contenedor/Pieza de trabajo | ±50mm | 100ms | YOLOv10n + Jetson Orin NX |
| Agarre de precisión/Colocación | Guía por visión Elevación/Fijación Alineación | ±5mm | 50ms | YOLOv8s + Pn PEstimación de pose |
| Zona de seguridad Monitoreo | Detección Intrusión de personal Zona peligrosa | ±200mm | 200ms | YOLOv8n + Byte Track Seguimiento |
| Planta siderúrgica Entorno de Alta Temperatura | Termografía Identificación Material de alta temperatura | ±2℃ | 30fps | Optris PI 640Termografía |
Selección de cámaras industriales y cálculo de parámetros de lentes
La selección de la cámara es la base del sistema de visión para puentes grúa. Kelude Industrias Pesadas ha desarrollado un método sistemático de selección adaptado a los distintos escenarios de operación de los puentes grúa. Para la identificación convencional de cargas suspendidas, se recomienda una cámara industrial de 1,3 megapíxeles combinada con un sensor de profundidad. Para aplicaciones de agarre y posicionamiento de precisión, se opta por una cámara a color de 5 megapíxeles junto con un sistema de luz estructurada 3D.
El cálculo de la distancia focal es un paso crítico en la selección de la lente, siendo su fórmula principal: f = (sensor_width × working_distance) / FOV. En un escenario típico de captura cenital con un puente grúa, con un ancho de área objetivo de 1,5 m y una distancia de trabajo de 8 m, utilizando un sensor IMX265 (sensor_width 7,1 mm), se obtiene una distancia focal aproximada de 38 mm. En la práctica, se suelen emplear lentes de 35 mm o 50 mm. La distancia focal recomendada varía según la posición de montaje: para captura cenital (distancia de trabajo 8-15 m) se recomiendan lentes de 25-50 mm; para captura lateral, de 12-25 mm; y para escenarios de agarre a corta distancia, de 6-12 mm.
Para entornos de alta temperatura en acerías, es necesario emplear cámaras termográficas con cubierta protectora y camisa de enfriamiento especiales. La Solución Técnica de Kelude Industrias Pesadas recomienda una cámara termográfica con resolución de 640×480, capaz de operar de forma continua y estable en entornos de hasta 95 °C, satisfaciendo los requisitos de aplicaciones industriales exigentes como la identificación de palanquillas y el monitoreo en zonas de colada continua.
Entrenamiento del modelo YOLOv8 y estrategias de aumento de datos
El entrenamiento del modelo YOLOv8 para escenarios de puentes grúa requiere una metodología de ingeniería específica. En la recopilación de datos, se recomienda un mínimo de 500 muestras por categoría, que abarquen diferentes ángulos (80 % cenital + 20 % lateral), distintas condiciones de iluminación (diurna, nocturna, contraluz, luz intensa) y diversos estados de operación (sin carga, carga completa, diferentes tipos de carga suspendida). Para el etiquetado, se recomienda la herramienta LabelImg con formato PascalVOC, o CVAT para la anotación colaborativa en equipo.
La estrategia de aumento de datos debe adaptarse a las características de la captura cenital del puente grúa. A diferencia de escenarios como la conducción autónoma, la visión de puentes grúa no requiere un aumento con rotaciones de gran ángulo, sino que se centra en el aumento Mosaic (para simular escenarios de apilamiento desordenado) y el ajuste de brillo (para hacer frente a los cambios bruscos de iluminación en acerías). La configuración de entrenamiento estándar de Kelude Industrias Pesadas utiliza el modelo preentrenado YOLOv8n como punto de partida, con 200 épocas, tamaño de imagen de entrada de 640×640, tasa de aprendizaje inicial de 0,001 y parámetros de aumento de color HSV adecuados.
crane_dataset/ ├── train/images/ # Imágenes de Entrenamiento (*.jpg) ├── train/labels/ # YOLOAnotación de Formato (*.txt) ├── val/images/ # Imágenes de Validación ├── val/labels/ └── crane_dataset.yaml
La configuración del conjunto de datos debe definir 6 categorías de objetos: steel_coil (bobina de acero), steel_slab (palanquilla), container (contenedor), workpiece (pieza de trabajo), crane_hook (gancho) y spreader (esparcidor), que cubren los objetos más comunes en las operaciones de elevación con puente grúa.
Optimización con TensorRT e implementación en el borde con Jetson
La implementación en el borde es el paso clave para llevar la visión por IA de los puentes grúa del laboratorio a la ingeniería real. Kelude Industrias Pesadas utiliza la serie NVIDIA Jetson Orin como plataforma principal de Computación en el Borde. El modelo Jetson Orin NX, con una capacidad de cómputo de IA de 70-100 TOPS y un bajo consumo de 10-25 W, se presenta como la opción recomendada para satisfacer los requisitos de inferencia en tiempo real de la mayoría de los escenarios de puentes grúa.
El proceso de implementación del modelo comprende tres etapas técnicas: primero, el modelo PyTorch entrenado se exporta a un archivo de motor TensorRT mediante model.export(format="engine"), aprovechando las técnicas de fusión de capas, calibración de cuantificación y optimización de memoria de TensorRT para acelerar significativamente la inferencia; a continuación, se implementa el motor TensorRT en la plataforma Jetson, configurando DeepStream o una canalización de inferencia personalizada; por último, los resultados de la inferencia se envían en tiempo real al sistema de despacho superior mediante el protocolo MQTT, completando el ciclo cerrado de detección, decisión y control.
En cuanto al rendimiento de inferencia, las diferentes versiones de YOLO muestran diferencias significativas en Jetson Orin NX: YOLOv8n ofrece una velocidad de inferencia de aproximadamente 8 ms con un modelo de solo 6,3 MB; mientras que el más reciente YOLOv10n optimiza aún más estos valores hasta 7 ms y 5,5 MB, logrando una velocidad de inferencia superior con una precisión cercana a la de YOLOv8s. Por ello, YOLOv10n es el modelo preferido de Kelude Industrias Pesadas para la implementación en el borde.
Transformación de coordenadas y principios de posicionamiento con guiado por visión
El objetivo final del reconocimiento visual es traducirse en instrucciones mecánicas precisas, lo que implica una cadena completa de transformación desde las coordenadas de píxeles hasta las coordenadas del mundo. El sistema de visión por IA de Kelude Industrias Pesadas emplea el algoritmo de estimación de pose PnP (Perspective-n-Point), que combina los resultados de la calibración de los parámetros intrínsecos y extrínsecos de la cámara para convertir los cuadros delimitadores 2D detectados por YOLOv8 en información de pose de 6 grados de libertad (traslación X/Y/Z y rotación de cabeceo/guñada/alabeo).
En la práctica, tras una calibración precisa de la posición de montaje de la cámara, los resultados de la detección se mapean mediante una matriz de transformación de coordenadas a las instrucciones de control de los tres ejes físicos: desplazamiento del carro puente (eje X), desplazamiento del carro (eje Y) y elevación (eje Z). La latencia de extremo a extremo de todo el proceso de guiado por visión se mantiene por debajo de 150 ms, cumpliendo con los requisitos de control en tiempo real para puentes grúa no tripulados de nivel L4.