Sistema de Monitoreo de Seguridad con IA Visual para Puente Grúa

Cámara industrial + módulo de computación en el borde Jetson para el sistema de monitoreo de seguridad con IA visual en puentes grúa: detección en tiempo real del estado de la carga, identificación de intrusiones de personal y sustitución de las soluciones tradicionales de vallado perimetral.

En la seguridad de los puentes grúa, el mayor riesgo no es un fallo del hardware, sino que una persona entre en la zona de operación mientras la máquina sigue en movimiento. Las soluciones tradicionales, basadas en vallados y sensores fotoeléctricos, presentan numerosos ángulos muertos, generan falsas alarmas y exigen un mantenimiento costoso. En los últimos dos años, la monitorización de seguridad con IA visual ha pasado de ser una opción viable a una solución realmente eficaz: una cámara industrial combinada con un módulo de computación en el borde Jetson permite detectar en tiempo real el estado de la carga suspendida, identificar intrusiones de personal y verificar el uso del casco de seguridad, con una precisión de reconocimiento superior al 98 % y un coste por canal inferior a 5000 CNY.

Arquitectura del sistema de monitoreo por visión artificial en cuatro capas

El sistema de monitoreo de seguridad con IA visual se estructura en cuatro capas lógicas interconectadas mediante protocolos estándar (MQTT/RESTful API/RTSP), lo que permite un despliegue en cascada tanto para un único puente grúa como para múltiples unidades en todo el taller.

1.1 Capa de percepción

La capa de percepción está compuesta por cámaras industriales instaladas bajo la viga principal del puente grúa y en el carro. Su función es capturar el flujo de vídeo en tiempo real de la zona de carga, los pasillos laterales al carril y las áreas de trabajo del personal. Las cámaras transmiten el vídeo comprimido en H.265 a 1080P@30fps al nodo de computación en el borde, ya sea mediante cable PoE o WiFi industrial.

1.2 Capa de algoritmos

La capa de algoritmos se ejecuta en el dispositivo de computación en el borde (NVIDIA Jetson Orin NX) y utiliza el modelo YOLOv8 para la inferencia de detección de objetos. En este sentido, ya publicamos un artículo sobre la detección visual en línea de cordones de soldadura en puentes grúa con IA, donde compartimos nuestra experiencia en el despliegue de YOLO en este tipo de entornos. Los resultados de la detección incluyen: posición del personal y cuadros delimitadores, estado del casco de seguridad, tipo de carga y zona de elevación, así como el estado de las líneas de advertencia. La latencia de inferencia se mantiene por debajo de 30 ms, cumpliendo con los requisitos de monitoreo en tiempo real.

1.3 Capa de aplicación

La capa de aplicación transforma los resultados de la detección en decisiones de seguridad lógicas: la intrusión de personal en la zona de peligro del puente grúa activa una alarma acústica y visual y reduce la velocidad de operación; cuando no hay personas en la zona de carga, se permite la operación a velocidad máxima; la falta de casco de seguridad se registra como infracción y se captura una fotografía como evidencia. Esta capa también gestiona la interacción con el PLC del puente grúa, transmitiendo las señales de seguridad a través de los protocolos Modbus TCP o Profinet.

1.4 Capa de visualización

La capa de visualización ofrece una pantalla de monitoreo en la web y notificaciones de alarma en el teléfono móvil, mostrando en tiempo real las imágenes de detección de cada puente grúa, el registro de alarmas, el estado operativo y las estadísticas. Los datos se almacenan localmente en una base de datos SQLite, con capacidad de consulta histórica de 90 días.

Nivel PrincipalComponente Protocolo de comunicación Ubicación de despliegue
Capa de percepción cámara industrial,Luz de relleno,Encoder RTSP / GigE Vision puente grúaBandeja portacables/CarroInferior
Capa de algoritmos Jetson Orin NX,YOLOv8Modelo TensorRTMotor de inferencia armario eléctrico del puente grúaInterno
Capa de aplicación Motor de lógica de seguridad,PLCInterfazMódulo Modbus TCP / Profinet Nodo de borde / puente grúaPLCArmario
Capa de visualización WebPantalla principal,teléfono móvilTerminal,Base de datos MQTT / RESTful API TallerSala de control central / servidor en la nube

Selección del modelo YOLOv8 y comparativa de rendimiento

YOLOv8 es el framework de detección de objetos en tiempo real publicado por Ultralytics en 2023, que ofrece cinco modelos preentrenados de distinta escala —N, S, M, L y X—, desde opciones ligeras hasta configuraciones de alta precisión, para cubrir diferentes escenarios de despliegue. En el contexto del monitoreo de seguridad de puentes grúa, la elección del modelo requiere equilibrar la velocidad de inferencia, la precisión de detección y el coste del hardware.

Modelo ParámetroCantidad mAP50 FP16Latencia(ms) INT8Latencia(ms) Hardware recomendado
YOLOv8n 3.2M 37.3 4.5 2.1 Jetson Nano
YOLOv8s 11.2M 44.9 8.7 3.8 Jetson Orin Nano
YOLOv8m 25.9M 50.2 16.1 7.2 Jetson Orin NX
YOLOv8l 43.7M 52.9 26.4 12.3 Jetson Orin NX
YOLOv8x 68.2M 53.9 44.8 21.5 Jetson Orin AGX

Recomendación: se propone la combinación de YOLOv8m + Jetson Orin NX. Tras la cuantificación INT8, la latencia de inferencia es de 7,2 ms, y un único dispositivo de borde puede procesar simultáneamente 4 flujos de vídeo en 1080P, manteniendo la latencia total por debajo de 30 ms. Esto satisface los requisitos de tiempo real del monitoreo de seguridad del puente grúa, con un coste por canal de aproximadamente 4.500 CNY (unos 576 EUR).

Comparativa de hardware para computación en el borde

La elección del dispositivo de computación en el borde determina el rendimiento de inferencia y el coste de despliegue del sistema. A continuación se comparan tres opciones habituales en el contexto del monitoreo de seguridad de puentes grúa:

Parámetro Jetson Orin NX Jetson Orin Nano PC industrial(i5+GPU dedicada)
AIPotencia de cómputo(TOPS) 100 40 20~30
Consumo de energía(W) 15~25 7~15 65~150
Canales simultáneos 4Canal1080P 2Canal1080P 2~4Canal1080P
Temperatura de trabajo(℃) -25~80 -25~80 0~50
Costo por canal(RMB) ~4,500 ~3,000 ~6,000
Método de instalación armario eléctrico del puente grúaDINCarril DIN armario eléctrico del puente grúaDINCarril DIN Requiere por separadocaja de control

El Jetson Orin NX supera a las soluciones con PC industrial en potencia de cómputo, consumo energético, resistencia a la temperatura y facilidad de instalación, lo que lo convierte en la opción óptima para el despliegue de IA visual en el borde para puentes grúa.

Comparativa de las tres funciones principales del sistema de monitoreo de seguridad con IA visual para puentes grúa: identificación de carga suspendida YOLOv8m con precisión del 95 %, detección de presencia de personal con latencia de 50 ms y alerta en tiempo real con actuación sobre PLC
Las tres funciones principales del sistema de monitoreo de seguridad con IA visual para puentes grúa: identificación de carga suspendida, detección de presencia de personal y alerta en tiempo real con actuación sobre PLC

Identificación de carga suspendida en puentes grúa

La identificación de la carga suspendida es una de las funciones principales de la IA visual en puentes grúa. El sistema debe reconocer múltiples tipos de carga —bobinas de acero, palanquillas, chapa de acero, moldes y contenedores— y realizar un seguimiento continuo de su posición durante las maniobras de elevación. Integrado con la plataforma de monitoreo remoto IoT para vehículos, permite cerrar el ciclo completo de datos de la carga: desde su identificación y seguimiento hasta su registro en el almacén.

4.1 Captura y etiquetado de datos

Se recomienda recopilar entre 5000 y 10000 imágenes de campo que cubran distintas condiciones de iluminación (luz diurna, nocturna y contraluz), diferentes orientaciones de la carga (balanceo frontal, lateral y rotación) y variados entornos de fondo (limpio, desordenado y con obstrucciones). El etiquetado se realiza en formato YOLO, anotando en cada imagen la caja delimitadora de la carga y su categoría. Con herramientas como LabelImg o CVAT, un etiquetador puede procesar aproximadamente 100 imágenes por hora.

4.2 Parámetros de entrenamiento del modelo

# Configuración de entrenamiento de YOLOv8m (parámetros clave) model = YOLO('yolov8m.pt') results = model.train( data='crane_dataset.yaml', epochs=200, imgsz=640, batch=16, lr0=0.01, lrf=0.01, optimizer='AdamW', augment=True, hsv_h=0.015, # Aumento de tono hsv_s=0.7, # Aumento de saturación hsv_v=0.4, # Aumento de brillo degrees=5.0, # Aumento de rotación (en escenas de grúa, la carga suspendida tiene una ligera inclinación) translate=0.1, scale=0.5, fliplr=0.5, mosaic=1.0, mixup=0.3, )

El entrenamiento se realiza en una NVIDIA RTX 4090 y requiere aproximadamente de 4 a 6 horas, alcanzando un mAP50 de 92 a 95 %. Una vez finalizado, el modelo se exporta a formato ONNX y se convierte a un motor INT8 mediante TensorRT para su despliegue en el borde.

4.3 Despliegue con TensorRT

# Comando de despliegue de cuantización INT8 de TensorRT trtexec --onnx=yolov8m_crane.onnx \\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\ --saveEngine=yolov8m_crane_int8.engine \\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\ --int8 \\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\ --calib=crane_calib_data \\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\ --buildOnly \\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\ --workspace=4096

Tras la cuantificación INT8, el tamaño del modelo se reduce de 52 MB a 15 MB, y la velocidad de inferencia pasa de 16 ms (FP16) a 7 ms, con un control de pérdida de precisión inferior al 1 %.

Detección de presencia de personal en entornos de grúa

La detección de presencia de personal incluye tres funciones específicas: detección de intrusión en zonas de seguridad, detección de uso de casco de seguridad y cercado electrónico. El sistema ejecuta simultáneamente dos instancias independientes del modelo YOLOv8: una se encarga de detectar la presencia de personas y su caja delimitadora, y la otra analiza la región de la cabeza para clasificar si se lleva o no el casco de seguridad.

Función DetecciónObjeto Disparo de alarma Acción de enlace
Cruzar límite de zonaDetección Ingreso de personalpuente grúaZona de peligro operativo <=1s Alarma Acústica y Visual+puente grúaDesaceleración30%
Casco de seguridadDetección Uso de casco de seguridad por trabajadores <=2s Captura+Registro de infracción+Aviso por voz
Cerca electrónica Ingreso de personal bajo carga suspendida <=0.5s ElevaciónDetención+Alarma Acústica y Visual

6. Puntos clave de la implementación técnica

El sistema de visión artificial con IA para puentes grúa, desde el prototipo hasta el despliegue en producción, presenta algunos desafíos inevitables. Conocerlos de antemano puede ahorrar hasta tres meses de trabajo.

① Variaciones de iluminación: la mayor fuente de desviación en la distribución de datos
La iluminación en la zona de operación del puente grúa se ve afectada por múltiples factores como la orientación de la nave industrial, las condiciones meteorológicas, la estación del año o el encendido de las luces. El brillo de una misma escena puede variar hasta 100 veces. Solución: aplicar un fuerte aumento de datos durante el entrenamiento (parámetros hsv_h/hsv_s/hsv_v) y complementar con iluminación LED en el despliegue (temperatura de color 5000K, potencia superior a 30W), garantizando una iluminación mínima de 10 lux en la imagen.

② Oclusión y apilamiento de la carga: el punto ciego de la detección con una sola cámara
Durante el izado y transporte, la carga puede quedar ocluida por equipos circundantes u otras cargas, lo que afecta a la continuidad de la detección. Se recomienda instalar de 2 a 3 cámaras en diferentes ángulos para cubrir la misma zona y fusionar los resultados de detección multivista mediante un filtro de Kalman. Tras una pérdida de detección, se permite una extrapolación de predicción de hasta 5 fotogramas (aproximadamente 170 ms a 30 fps).

③ Vibraciones y oscilaciones: interferencias mecánicas durante el funcionamiento del puente grúa
El movimiento del Carro Puente y del Carro provoca vibraciones en la estructura y en las cámaras. Las vibraciones de baja frecuencia (2-10 Hz) pueden causar desenfoque en la imagen y fluctuaciones en la detección. Para el soporte de la cámara, se recomienda una base antivibración con amortiguador (capa de caucho natural de 10 mm de espesor). En el algoritmo, se debe configurar un filtro de IoU entre fotogramas: si el desplazamiento del cuadro de detección entre fotogramas adyacentes supera un umbral de píxeles, se marca como falso positivo y se descarta.

④ Latencia de red: el cuello de botella clave en las soluciones inalámbricas
Si se utiliza WiFi industrial para transmitir el flujo de video a la sala de control central para la inferencia centralizada, la latencia de extremo a extremo puede alcanzar los 100-200 ms, lo que no cumple con los requisitos de tiempo real para el enclavamiento de seguridad. Solución: realizar la inferencia en el borde del puente grúa (localmente con Jetson) y enviar únicamente los resultados de detección en JSON (aproximadamente 200 bytes por fotograma) y las imágenes de alarma (JPEG comprimido a menos de 50 KB) a la sala de control central. Este enfoque sigue la misma filosofía de diseño que la capa de Computación en el Borde en la arquitectura de cuatro capas del sistema de control del puente grúa, minimizando así el impacto de la red.

Preguntas frecuentes

P: ¿Qué ventajas ofrece el monitoreo de seguridad con IA visual frente a las soluciones tradicionales (vallados, rejillas ópticas)?
R: Las soluciones tradicionales solo brindan protección en un plano bidimensional, sin capacidad para distinguir entre personas y objetos, identificar comportamientos dinámicos (como el uso del casco de seguridad) ni rastrear la posición de la carga suspendida. La solución de IA visual permite detectar simultáneamente intrusiones de personal, uso del casco, estado de la carga y otra información relevante, además de ofrecer capturas de infracciones y registros de trazabilidad. Conforme a la norma ISO 4301, las áreas de operación del puente grúa deben contar con medidas de protección de seguridad; esta solución de IA visual ha superado la evaluación de seguridad equivalente a SIL2.
P: ¿Cómo se puede instalar el sistema en un puente grúa antiguo sin interfaz reservada? ¿Qué requisitos específicos tiene para el PLC?
R: Sí, es posible. El sistema se comunica con el PLC del puente grúa mediante el protocolo Modbus TCP. Siempre que el PLC sea compatible con Modbus TCP estándar (las principales marcas como Siemens S7-1200/1500, Mitsubishi FX5U, Inovance AMserie y Delta Electronics DVPserie lo soportan), se puede integrar sin modificar el programa original del PLC. Para la integración, el PLC solo necesita abrir un puerto TCP para leer el registro de alarmas de seguridad, sin necesidad de programación adicional. Si el puente grúa no dispone de PLC (modelos antiguos con controlador de levas), basta con añadir un controlador de borde (el Inovance AM401 cuesta aproximadamente 320 €), sin necesidad de sustituir todo el puente grúa. El plazo de reforma es de unos 2 días.
P: ¿Cuántos puentes grúa puede gestionar un solo sistema? ¿Cuál es el presupuesto? ¿Se puede reformar un puente grúa antiguo?
R: Un Jetson Orin NX procesa simultáneamente 4 flujos de vídeo en 1080P, cubriendo 2 puentes grúa. El coste por canal es de aproximadamente 4.500 CNY (incluyendo cámara + dispositivo de borde + instalación y puesta en marcha). Para una solución de 2 puentes grúa, el presupuesto total ronda entre 18.000 y 25.000 CNY; para una solución de 10 puentes grúa, se despliegan 3 unidades Jetson más un servidor central de control, con un presupuesto total que no supera los 80.000 CNY. Considerando que cada puente grúa evita al menos un incidente de seguridad al año, la inversión se amortiza en menos de dos años — y además, la norma ISO 4301 establece requisitos claros de cumplimiento para el monitoreo de seguridad en puentes grúa, por lo que reformar de forma temprana resulta más rentable que esperar a una inspección obligatoria.

Conclusión

La combinación de YOLOv8 y Jetson Orin NX ha reducido la barrera técnica para el monitoreo de seguridad con visión artificial e IA en puentes grúa hasta un nivel que permite su replicación a escala. El coste por canal se controla por debajo de los 5000 CNY (aproximadamente 640 EUR), con una latencia de identificación inferior a 50 ms y una precisión de identificación superior al 95%, superando ya el nivel de protección de seguridad de las barreras tradicionales combinadas con sensores fotoeléctricos. En el próximo artículo abordaremos la aplicación de la visión artificial con IA en la alineación y agarre automático de cargas en puentes grúa, un escenario que exige un orden de magnitud superior en precisión y latencia.

Artículos relacionados

contact

contact us

phone:
+86 13903802779

mail:3915269@qq.com

Working hours: Monday to Friday

Wechat
Wechat
SHARE
TOP