Detección de intrusión y anticolisión por IA en puentes grúa
Monitoreo de seguridad visual por IA en puentes grúa: detección de intrusión de personal y prevención de colisiones en zonas de elevación. El sistema de monitoreo de seguridad visual por IA para puentes grúa constituye la última línea de defensa activa en la protección inteligente del equipo: mediante cámaras industriales de IA instaladas en los testeros y la viga principal, captura en tiempo real imágenes de la zona de elevación y, basándose en el modelo de aprendizaje profundo YOLOv8, detecta intrusiones de personal bajo y alrededor de la carga suspendida. Al detectar la entrada de una persona en la zona peligrosa, activa automáticamente una advertencia de desaceleración o una parada de seguridad STO, elevando el aislamiento físico entre personas y cargas de una barrera pasiva a una protección activa inteligente.
El sistema de monitoreo de seguridad visual por IA para puentes grúa representa la última barrera activa en la protección inteligente del equipo. A través de cámaras industriales de IA montadas en los testeros y la viga principal, captura imágenes en tiempo real de la zona de elevación y, empleando el modelo de aprendizaje profundo YOLOv8, identifica intrusiones de personal bajo y alrededor de la carga. Ante la detección de una persona en la zona peligrosa, el sistema activa automáticamente una advertencia de desaceleración o una parada de seguridad STO, transformando el aislamiento físico entre personas y cargas de una barrera pasiva a una protección activa e inteligente. Kelude Industrias Pesadas, sobre la base de la plataforma de computación en el borde NVIDIA Jetson Orin NX y un modelo de detección visual de desarrollo propio, ha construido un sistema integral de monitoreo de seguridad por IA que abarca detección, alarmas escalonadas y control anticolisión integrado. Este artículo expone en detalle esta práctica de ingeniería, desde la arquitectura del sistema y el entrenamiento del modelo hasta el despliegue en campo.
Arquitectura del sistema de monitoreo de seguridad visual
El área de detección se divide en tres zonas de seguridad. La zona peligrosa (Danger Zone) es un área circular de 3 m de radio centrada en la carga suspendida: la entrada de una persona en esta zona activa inmediatamente una parada STO, y el freno del puente grúa se cierra en 200 ms. La zona de advertencia (Warning Zone) es un área anular de 3 a 6 m de radio alrededor de la zona peligrosa: la entrada de una persona activa la alarma acústica y visual y la desaceleración del puente grúa (reducción al 20% de la velocidad nominal), manteniéndose la señal de desaceleración hasta que la persona abandone la zona. La zona de monitoreo (Monitor Zone) es un área anular de 6 a 10 m de radio alrededor de la zona de advertencia: la entrada de una persona solo registra un evento en el registro de actividad sin intervención de control, utilizándose para estadísticas de frecuencia y patrones de actividad del personal en el área de elevación. Los parámetros de radio de las tres zonas de seguridad pueden ajustarse en campo a través del panel HMI según el tonelaje del puente grúa y las dimensiones de la carga.
Selección de cámaras y despliegue de instalación
La selección y la posición de instalación de las cámaras industriales de IA influyen directamente en la eficacia de la detección. Kelude Industrias Pesadas incorpora de serie dos modelos de cámara en el sistema de monitoreo de seguridad visual por IA para puentes grúa: para la posición del testero se utiliza la Hikvision DS-2CD2T87WD-L (8 megapíxeles, sensor de 1/1,2 pulgadas, iluminación mínima de 0,001 lux, alcance de iluminación infrarroja de 50 m), y para la posición inferior del carro se emplea la Imaging Source DMK 33GX290 (1,9 megapíxeles, obturador global, sensor de 1/3 de pulgada, 120 fps, adecuada para detectar cargas y personal en movimiento rápido). La lente de la cámara del testero tiene una distancia focal de 6 mm (ángulo de visión horizontal de aproximadamente 52°), instalada en el centro de la superficie inferior del testero, apuntando verticalmente hacia abajo para cubrir toda la zona de elevación bajo el puente grúa. La lente de la cámara inferior del carro tiene una distancia focal de 3,6 mm (ángulo de visión horizontal de aproximadamente 87°), instalada en la superficie inferior de la plataforma del carro, capturando el área cercana directamente bajo el elevación.
| Posición de montaje | CámaraModelo | Parámetro | Cobertura | Función |
|---|---|---|---|---|
| Testero(Izquierda) | DS-2CD2T87WD-L | 80010k/0.001Lux/6mm | Zona de elevación izquierda+Pasillo | detección de intrusión de personal |
| Testero(Derecha) | DS-2CD2T87WD-L | 80010k/0.001Lux/6mm | Zona de elevación derecha+Pasillo | detección de intrusión de personal |
| CarroAbajo | DMK 33GX290 | 19010k/Obturador global/3.6mm | ElevaciónCerca inferior | Oscilación de la carga/ObstáculoDetección |
| Viga PrincipalArriba | DS-2CD2T87WD-L | 80010k/0.001Lux/12mm | TotalTallerLarga distancia | Percepción global del entorno(Opcional) |
El soporte de montaje de la cámara utiliza un brazo articulado universal de acero inoxidable (capacidad de carga del brazo: 15 kg, capaz de soportar la carga de impacto durante el arranque y parada del puente grúa). La cámara se conecta mediante cable de red blindado Cat6A al módulo de computación en el borde Jetson Orin NX, ubicado en el armario de control. El cable se tiende por el interior de la viga principal del puente grúa y se fija con bridas, manteniendo una distancia mínima de 300 mm respecto al cable de alimentación del variador de frecuencia. La alimentación de la cámara se realiza mediante PoE+ (estándar 802.3at, potencia de 25 W por puerto). El módulo Jetson suministra energía a la cámara a través del puerto PoE+ del switch de red, eliminando la necesidad de un cableado de alimentación independiente.
Entrenamiento y despliegue del modelo de detección YOLOv8
YOLOv8 es el algoritmo principal del sistema de visión por computadora para la detección de seguridad en puentes grúa. Kelude selecciona la versión YOLOv8s (Small, 11.2M de parámetros, mAP 44.9% en COCO) para este escenario. Tras la optimización con TensorRT FP16 en la plataforma NVIDIA Jetson Orin NX, alcanza una velocidad de inferencia de 60 fps (con resolución de entrada de 640x640), cumpliendo con los requisitos de detección en tiempo real para un flujo de video de 30 fps. El conjunto de datos de entrenamiento proviene de tres fuentes: imágenes anotadas recopiladas en el campo de pruebas de puentes grúa de Kelude (aproximadamente 15,000 imágenes, que cubren diversas condiciones de iluminación, clima y tipos de carga), imágenes sintéticas que simulan escenarios de cola larga (aproximadamente 5,000 imágenes, que representan situaciones como caídas de personal, aglomeraciones y oclusiones parciales), y recopilaciones adicionales en talleres de fábrica (aproximadamente 3,000 imágenes, que ofrecen una variedad de fondos con diferentes estructuras de nave industrial y distribución de líneas de producción).
Configuración del entrenamiento del modelo. El entrenamiento se basa en el framework Ultralytics YOLOv8, con una resolución de imagen de entrada de 640x640, un tamaño de lote de 32 y 300 épocas de entrenamiento. El aumento de datos utiliza Mosaic (probabilidad 0.8, combinación de 4 imágenes), MixUp (probabilidad 0.2, mezcla de dos imágenes), aumento HSV (H±25°/S±30%/V±30%) y rotación aleatoria (±10 grados). La plataforma de entrenamiento utiliza una única NVIDIA RTX 4090 (24GB de memoria), con un tiempo de entrenamiento de aproximadamente 10 minutos por época, totalizando unas 50 horas para las 300 épocas. Una vez completado el entrenamiento, el modelo se exporta como motor TensorRT FP16 (archivo engine, aproximadamente 22MB) para su despliegue en el Jetson Orin NX.
Clasificación de los objetivos de detección. El modelo YOLOv8s produce tres clases de detección. Cada caja de detección incluye el ID de clase, la puntuación de confianza (se conserva si es ≥ 0.5) y las coordenadas normalizadas de la caja (cx, cy, w, h). Las coordenadas de la caja se mapean al sistema de coordenadas del mundo en el plano del suelo mediante una matriz de transformación de perspectiva, logrando un error de posicionamiento inferior a 10 cm. Los detalles de las tres clases son los siguientes:
Algoritmo de detección de intrusión de personal y lógica de zonas de seguridad
La secuencia de ejecución de la detección de intrusión de personal es la siguiente. Paso 1 — Detección de objetivos: el módulo Jetson ejecuta el modelo YOLOv8s y genera todos los cuadros de detección de personas en el fotograma actual. Paso 2 — Mapeo de coordenadas: las coordenadas del punto central de la base del cuadro de detección de cada persona se proyectan al sistema de coordenadas del plano del suelo mediante una matriz de transformación de perspectiva, obteniendo así la posición física real de la persona en el taller (x, y, en metros). Paso 3 — Cálculo de distancia: se calcula la distancia euclidiana entre la posición de la persona y la posición de la carga suspendida (posición absoluta del Carro Puente + posición absoluta del Carro leídas desde el PLC del puente grúa + desplazamiento por dimensiones de la carga). Paso 4 — Evaluación de zona de seguridad: según la distancia dist, se aplican las reglas de tres niveles de zona de seguridad — dist ≤ 3 m: zona Danger, se activa STO; 3 m < dist ≤ 6 m: zona Warning, se activa desaceleración con alarma; 6 m < dist ≤ 10 m: zona Monitor, solo se registra en el log; dist > 10 m: sin acción. Paso 5 — Salida de resultados: el módulo Jetson emite señales de alarma de tres niveles a través de GPIO — GPIO1 (Danger) conectado a la entrada DI de seguridad del PLC, GPIO2 (Warning) conectado a la entrada DI estándar del PLC, y GPIO3 (Monitor) conectado a la pasarela IO-Link para registro de eventos.
Lógica de ajuste dinámico del radio de la zona de seguridad. Las dimensiones reales de la carga suspendida y la trayectoria de elevación influyen en el radio de la zona de peligro. Cuando la carga mide menos de 1 m, el radio de la zona de peligro se mantiene en 3 m por defecto; cuando la carga mide entre 1 y 3 m, el radio se incrementa automáticamente en función de la diagonal de la carga (R_danger = 3,0 m + L_diag/2); cuando la carga supera los 3 m, el radio se fija en 5 m (para evitar que una zona de seguridad excesivamente amplia provoque activaciones frecuentes de STO y reduzca la eficiencia de producción). El valor actual del radio de la zona de seguridad se muestra en tiempo real en la página de monitoreo de seguridad del HMI, y el operador puede realizar ajustes manuales finos (en pasos de 0,5 m). Todas las modificaciones de los parámetros de la zona de seguridad quedan registradas en el log de eventos del PLC, con un período de conservación no inferior a 90 días.
Seguimiento multiobjetivo y tratamiento anti-fluctuación. Cuando se detectan múltiples personas en un mismo fotograma, el sistema asigna a cada objetivo un Track ID único y realiza el emparejamiento de objetivos entre fotogramas y el seguimiento de trayectorias mediante el algoritmo ligero DeepSORT. Cuando un Track ID de persona aparece de forma continua en la misma posición durante más de 5 fotogramas, el sistema confirma que la persona ha entrado en la zona de seguridad y activa la alarma, evitando falsas alarmas por detecciones erróneas en fotogramas individuales. Mientras la persona permanezca dentro de la zona de seguridad, la alarma se mantiene activa; al salir de la zona, la alarma se desactiva automáticamente (con un retardo de 2 segundos para eliminar fluctuaciones). Los eventos de alarma consecutivos se registran automáticamente en la base de datos local SQLite, con el siguiente formato: marca de tiempo, Track ID, coordenadas de la persona, nivel de zona de seguridad activado y estado operativo del puente grúa (velocidad/posición/dirección).
Control anticolisión integrado y activación de STO
La interconexión entre el sistema de inspección por visión con IA y el sistema de control de seguridad del puente grúa se realiza mediante una doble interfaz GPIO + PROFINET. La interfaz GPIO se utiliza para el frenado rápido en situaciones de emergencia: el GPIO1 (Danger) del Jetson se conecta directamente al canal de entrada del módulo F-DI de seguridad del PLC; cuando GPIO1 se eleva a 24 V, el PLC activa STO dentro del siguiente ciclo de escaneo de seguridad (20 ms). La interfaz PROFINET se utiliza para la desaceleración escalonada en situaciones no críticas: el Jetson, actuando como dispositivo IO PROFINET (archivo GSDML importado en TIA Portal para la configuración), escribe periódicamente en el PLC solicitudes de desaceleración (incluyendo nivel de desaceleración 0~3 y porcentaje de velocidad objetivo), y el PLC responde a la solicitud dentro del ciclo IO estándar (10 ms).
| nivel de seguridad | Condición de activación | ControlFrenadoOperación | Tiempo de respuesta | Modo de recuperación |
|---|---|---|---|---|
| Level 3 Peligro | Ingreso de personal≤3mZona de peligro | STOParada de emergencia | <100ms | ManualResetConfirmación |
| Level 2 Advertencia | Ingreso de personal3~6mZona de advertencia | Reducir velocidad a20%+Alarma Acústica y Visual | <200ms | Reanudación automática al abandonar el personal |
| Level 1 Detección | Ingreso de personal6~10mDetecciónZona de elevación izquierda | Solo registro de eventos | — | Automático |
Proceso de recuperación tras la activación de STO. Cuando se activa el STO de Nivel 3, el puente grúa se detiene inmediatamente. El sistema Jetson continúa monitoreando el estado de la zona de peligro: una vez confirmado que no hay personal en la zona, envía la señal de "peligro despejado" al PLC a través de PROFINET. Al recibir la señal, el PLC muestra un diálogo de confirmación de reinicio seguro en el HMI, solicitando al operador verificar visualmente que el área de elevación es segura y hacer clic en el botón "Confirmar reinicio". Solo entonces el PLC desactiva el estado STO y permite la reactivación del funcionamiento. El registro completo del evento STO se carga automáticamente al gateway perimetral y se envía al sistema de gestión de seguridad para su archivo mediante OPC UA.
Puesta en marcha y verificación en campo del sistema
La puesta en marcha del sistema de monitoreo de seguridad visual con IA se realiza en cuatro pasos. El primer paso es la calibración de la cámara: se utiliza un patrón de calibración de tablero de ajedrez (12×9 casillas, con lado de 30 mm) para capturar entre 15 y 20 imágenes de calibración desde diferentes ángulos, y se calcula la matriz de parámetros intrínsecos y el coeficiente de distorsión de la cámara mediante la función calibrateCamera de OpenCV. Una vez completada la calibración intrínseca, se procede a la calibración de la matriz de transformación de perspectiva: se coloca un lienzo de calibración en el suelo del taller (malla de 4×3 m, con puntos de rejilla espaciados 500 mm), se captura una vista cenital con la cámara y se seleccionan 4 esquinas y 4 puntos correspondientes con coordenadas conocidas del plano del suelo para calcular la matriz de transformación de perspectiva. Tras la calibración, se utiliza el Sensor de Distancia Láser para medir las coordenadas reales de cualquier punto en el suelo y verificar que el error de mapeo sea inferior a 10 cm.
El segundo paso es la prueba de aceptación del modelo: se despliega un escenario de prueba en el campo de ensayo (carga suspendida + maniquí) y se evalúa la precisión de detección en cuatro condiciones: iluminación normal (500 Lux), baja iluminación (50 Lux, solo con iluminación infrarroja), contraluz y lluvia/niebla (simulación con aspersión). Norma de Aceptación: con iluminación normal, mAP ≥ 95% para detección de personas; con baja iluminación, mAP ≥ 90%; con contraluz, mAP ≥ 85%; con lluvia/niebla, mAP ≥ 80%. La prueba de entrada del maniquí en las tres zonas de seguridad se ejecuta 20 veces cada una, requiriendo una tasa de activación del 100% en la zona de peligro de Nivel 3 (20/20 activaciones de STO), una tasa de activación ≥ 95% en la zona de advertencia de Nivel 2 (≥ 19/20 activaciones de alarma de desaceleración) y una tasa de registro del 100% en la zona de monitoreo de Nivel 1 (20/20 registros en el registro de eventos).
El tercer paso es la verificación de la implementación en campo: los parámetros de calibración y el modelo se despliegan en el módulo Jetson del puente grúa, y se visualizan en tiempo real las imágenes de la cámara y el efecto de superposición de los cuadros de detección a través de la página de monitoreo de seguridad del HMI. Se verifica que las cámaras del testero y la cámara inferior del carro no tengan puntos ciegos en la cobertura cenital en tres posiciones del puente grúa (extremo izquierdo/centro/extremo derecho del recorrido completo), y que las imágenes de las cámaras laterales, una vez combinadas, cubran toda el área de elevación debajo del puente grúa (cobertura aproximada de 20 m × 6 m). Se utiliza un walkie-talkie para coordinar al personal en el sitio mientras camina a lo largo del límite de la zona de seguridad, verificando la consistencia de la activación de alarmas del sistema de detección en cada punto límite. El cuarto paso es la transición al estado operativo: el sistema entra en un período de prueba de 24 horas, durante el cual se revisan las tasas de falsas alarmas y omisiones en el registro de detección cada 8 horas, requiriendo una tasa de falsas alarmas ≤ 5 veces/24 horas y una tasa de omisiones ≤ 1 vez/24 horas. Una vez superado el período de prueba, el sistema pasa a funcionamiento regular.