Plataforma en la nube de inspección visual por IA para puente grúa
Plataforma en la nube de inspección visual por IA para puentes grúa: cinco funciones de detección desplegables con un clic mediante SaaS. La tecnología de inspección visual por IA para puentes grúa está evolucionando de la implementación local a un modelo de servicio en la nube.
La tecnología de inspección visual por IA para puentes grúa está evolucionando de la implementación local a un modelo de servicio en la nube. Kelude Industrias Pesadas ha lanzado recientemente su plataforma en la nube de inspección visual para puentes grúa, que integra cinco funciones de detección principales —monitoreo de seguridad, posicionamiento de la carga, inspección de cables, inspección de soldadura y SLAM visual para mapeo y posicionamiento— empaquetadas bajo un modelo SaaS. Los usuarios ya no necesitan adquirir hardware de computación en el borde ni desplegar servidores de inferencia: basta con instalar cámaras industriales y terminales de comunicación en el puente grúa para obtener resultados de detección en tiempo real a través del motor de inferencia de IA en la nube. Durante la fase de pruebas internas, la plataforma se ha validado en 12 instalaciones de clientes, procesando más de 500.000 fotogramas de inspección, con un tiempo de respuesta medio de inferencia de IA inferior a 200 ms.
Este artículo presenta la solución técnica de la plataforma en la nube de inspección visual por IA para puentes grúa desde cuatro dimensiones: arquitectura de la plataforma, implementación técnica de las cinco funciones de detección, modelo de despliegue SaaS y resultados de ingeniería.
Arquitectura general de la plataforma en la nube
La plataforma en la nube de inspección visual por IA para puentes grúa adopta una arquitectura de tres capas (terminal, borde y nube), concentrando la capacidad de inferencia de IA en la nube y dejando en el lado del terminal únicamente la adquisición de imágenes y la transmisión, lo que minimiza el coste de hardware y la complejidad de mantenimiento en el puente grúa.
Lado del terminal (capa de adquisición): cada puente grúa incorpora de 1 a 4 cámaras industriales de IA (opcional según el escenario de detección, resolución de 5 a 20 megapíxeles, CMOS con obturador global), conectadas mediante Ethernet Gigabit al terminal de comunicación del puente grúa (gateway industrial 5G o DTU 4G). El terminal comprime las imágenes originales con codificación JPEG (relación de compresión aproximada de 15:1, con pérdida de calidad despreciable), añade una marca de tiempo y un identificador de dispositivo, y las transmite a la plataforma de inferencia en la nube a través de redes 5G/4G. La tasa de subida típica por cámara es de 2 a 4 Mbps (tras compresión 1080P@15fps), y la red 5G admite la subida simultánea de hasta 8 cámaras.
Lado de la nube (capa de inferencia de IA): desplegado en un clúster de computación GPU de Alibaba Cloud (GPU NVIDIA A10, con una capacidad de cómputo de aproximadamente 31 TFLOPS FP16 por tarjeta), ejecuta los motores de inferencia YOLOv8s, YOLOv8s-weld, EfficientNet-B4 y ORB-SLAM3. El motor de inferencia de IA en la nube emplea paralelismo de modelos y procesamiento por lotes dinámico (dynamic batching, tamaño máximo de lote = 32), lo que permite que una sola GPU procese simultáneamente solicitudes de detección en tiempo real de 4 flujos de video, con una latencia de inferencia por fotograma de 8 a 15 ms en la GPU (incluyendo descompresión y preprocesamiento de imagen). Los resultados de la inferencia se envían en tiempo real al usuario final (web, aplicación móvil o sistema MES del cliente) en formato JSON mediante el protocolo MQTT, con una latencia de entrega mediana de 45 ms.
Capa de aplicación (interacción y gestión de usuarios): ofrece un panel de administración web (compatible con Chrome/Edge/Firefox) y una aplicación móvil (iOS/Android). Las funciones principales incluyen: panel de resultados de detección en tiempo real (con superposición de cuadros de detección sobre el flujo de video, línea temporal de alertas históricas y gráficos estadísticos de detección), gestión de dispositivos (registro de puentes grúa, configuración de cámaras, calibración de áreas de detección), configuración de políticas de alerta (establecimiento de umbrales, selección del sistema de acceso para alertas —WeChat/SMS/correo electrónico—), exportación de datos de detección (formatos CSV/PDF, con filtros por dispositivo y período) y gestión de API (generación de tokens API para integración con sistemas MES/ERP).
El flujo de datos en la arquitectura de tres capas es el siguiente: la cámara del terminal captura la imagen, el terminal la comprime y codifica, se transmite por 5G/4G a la nube, la GPU realiza la inferencia, y los resultados se envían por MQTT al usuario final para su visualización. La latencia de extremo a extremo de todo el enlace (desde la adquisición de la imagen hasta que el usuario ve el resultado) es típicamente de 300 a 600 ms en redes 4G, y de 120 a 250 ms en redes 5G. Todo el enlace de datos utiliza cifrado TLS 1.3, y el almacenamiento de datos en la nube cumple con el nivel de protección Grado 2 de la norma GB/T 22239-2019 «Tecnología de seguridad de la información — Requisitos básicos para la protección clasificada de seguridad cibernética».
| Nivel | Componente | Hardware principal/Software | CríticoIndicador |
|---|---|---|---|
| Lado del dispositivo | adquisición de imágenesy transmisión | cámara industrial+5G/4GTerminal de comunicación | Relación de compresión15:1,Tasa de bits de subida2~4Mbps/Canal |
| Nube | AImotor de inferencia | Alibaba CloudA10 GPU + YOLOv8Serie | IndividualGPUProcesamiento4Canal de video,Inferencia8~15ms/Fotograma |
| capa de aplicación | Interacción y gestión de usuario | WebBackend+Teléfono móvilAPP+MQTTNotificación push | Notificación pushlatenciaMediana45ms,Extremo a extremo<600ms |
2. Módulos de detección del sistema
La plataforma en la nube integra cinco módulos funcionales de inspección visual por IA para puentes grúa. El usuario puede contratar módulos de forma independiente según sus necesidades, sin pagar por funciones que no utiliza:
Módulo 1: Monitoreo de seguridad (detección de intrusión de personal). Detección de personal en la zona de izaje del puente grúa basada en el modelo YOLOv8s, con tres cámaras en configuración redundante que cubren ambos testeros y la zona inferior del carro. Estrategia de alarma en tres niveles: zona amarilla de alerta temprana (5~8 m) activa alarma acústica y visual; zona naranja de advertencia (3~5 m) activa desaceleración; zona roja de peligro (<3 m) activa parada STO. mAP ≥ 95 % en condiciones de iluminación normal y mAP ≥ 90 % con iluminación infrarroja en entornos de baja luminosidad. Cumple los requisitos de la norma ISO 12480. Cuota de suscripción mensual: aproximadamente 100 € por puente grúa.
Módulo 2: Posicionamiento de la carga (guía por visión para el acoplamiento). El modelo YOLOv8s detecta cuatro tipos de cargas: bobinas de acero, chapas de acero, equipos y matrices. El módulo de transformación de coordenadas convierte las coordenadas de píxeles en coordenadas milimétricas sobre el plano del suelo, con una precisión de posicionamiento de ±5 mm. Compatible con PLC Siemens S7-1200/1500 mediante pasarela PROFINET, generando automáticamente comandos de movimiento para puente, carro y elevación. Cuota de suscripción mensual: aproximadamente 150 € por puente grúa.
Módulo 3: Inspección de cables de acero por IA. Captura coordinada mediante múltiples cámaras (cenital, lateral e inferior). El modelo YOLOv8s detecta tres tipos de defectos: rotura de alambre, desgaste y corrosión. El modelo EfficientNet-B4 realiza una segunda clasificación fina en 11 subtipos, con mAP global ≥ 0,93. Las alarmas se integran con la plataforma PHM; el tiempo de respuesta medio desde la detección hasta la generación de la orden de trabajo no supera los 30 segundos. Cuota de suscripción mensual: aproximadamente 75 € por puente grúa.
Módulo 4: Inspección de soldadura por IA. El modelo YOLOv8s-weld (con cabezal de detección específico para objetos pequeños) detecta cinco tipos de defectos: grietas, falta de penetración, porosidad, inclusión de escoria y mordedura, con mAP global ≥ 0,94. La capa de evaluación aplica automáticamente la norma ISO 5817 para emitir la clasificación de calidad de grado I a IV. Admite tres modalidades de despliegue: vehículo de inspección AGV, detector portátil y estación de trabajo fija. Cuota de suscripción mensual: aproximadamente 65 € por puente grúa.
Módulo 5: SLAM visual para mapeo y localización. Integra los marcos ORB-SLAM3 y VINS-Mono, utilizando cámaras monoculares/estéreo junto con un IMU de 6 ejes como sensores, para lograr estimación de pose en seis grados de libertad y construcción de mapas dispersos en entornos de nave industrial. Precisión de posicionamiento: ±10 cm. El acoplamiento estrecho con preintegración del IMU reduce la tasa de pérdida de seguimiento en condiciones de vibración del 8 % al 0,5 %. Cuota de suscripción mensual: aproximadamente 130 € por puente grúa.
Los cinco módulos pueden contratarse de forma independiente o combinada. El paquete completo con los cinco módulos tiene un precio de 355 € mensuales por puente grúa (frente a los 520 € de la suscripción individual, lo que supone un ahorro aproximado del 32 %). La plataforma ofrece dos modalidades de pago: suscripción mensual y suscripción anual, con un 10 % de descuento en la modalidad anual.
3. Modelo SaaS y ventajas técnicas
Frente a las soluciones tradicionales de despliegue local, la plataforma en la nube de inspección visual por IA en modalidad SaaS ofrece ventajas significativas en tres dimensiones: velocidad de despliegue, elasticidad de cómputo y coste de mantenimiento.
Velocidad de despliegue: El despliegue local requiere adquirir dispositivos de computación en el borde Jetson Orin NX/AGX (coste unitario de hardware de aproximadamente 650~1.900 €), instalar el entorno de inferencia (TensorRT, CUDA, exportación de modelos, etc., que suele llevar 1~2 días laborables) y mantener el servicio de inferencia (actualizaciones de software, actualización de modelos, tratamiento de fallos de hardware). En modalidad SaaS, solo es necesario instalar en el extremo local una cámara industrial y un terminal de comunicaciones (se pueden reutilizar las cámaras de vigilancia existentes siempre que sean compatibles con el protocolo RTSP). El terminal se registra automáticamente en la plataforma en la nube al conectarse a la red eléctrica y a Internet; la calibración de la cámara y la configuración de las zonas de detección se realizan a través del panel web, y el sistema queda listo para operar. El ciclo típico de despliegue se reduce de 3~5 días en local a 2~4 horas.
Elasticidad de cómputo: La capacidad de cómputo del Jetson Orin NX en despliegue local está fijada en 100 TOPS y no puede ajustarse dinámicamente según la carga real. En periodos de baja actividad (p. ej., paradas nocturnas), la capacidad de cómputo se desperdicia; en picos de detección (p. ej., varios puentes grúa operando simultáneamente), puede convertirse en un cuello de botella. El clúster de GPU en la nube SaaS admite escalado elástico bajo demanda: cuando aumentan las solicitudes de detección concurrentes, se amplían automáticamente las instancias de GPU (de 4 flujos de video por GPU a 8 flujos por GPU, con un tiempo de escalado de aproximadamente 2 minutos); cuando disminuyen las solicitudes, los recursos se liberan automáticamente. Las pruebas realizadas en la plataforma demuestran que, con 20 puentes grúa operando simultáneamente (60 cámaras en total), el rendimiento de inferencia en la nube alcanza 900 fotogramas por segundo, 4,5 veces superior a la solución local con Jetson (estimada en aproximadamente 200 fotogramas por segundo para la misma escala).
Coste de mantenimiento: El despliegue local de un sistema de inspección visual por IA requiere entre 1 y 2 módulos Jetson por puente grúa; para una flota de 5 puentes grúa, la inversión total en hardware oscila entre 3.800 y 12.700 €. Además, se necesita personal especializado en algoritmos de IA para el mantenimiento, actualización y solución de problemas del modelo, con un coste anual de personal de aproximadamente 19.000~31.800 €. En modalidad SaaS, el pago se realiza según consumo, sin inversión inicial en hardware; las actualizaciones del modelo (p. ej., de YOLOv8s a YOLOv11 o la incorporación de nuevas categorías de detección) las realiza la plataforma en la nube de forma unificada, sin ninguna intervención por parte del usuario. La suscripción anual de los cinco módulos completos para 5 puentes grúa asciende a aproximadamente 21.350 € (incluye cómputo en la nube, almacenamiento y mantenimiento del modelo), lo que supone un ahorro del 40~55 % frente al coste total de propiedad (TCO) a tres años de la solución local (depreciación de hardware + personal + mantenimiento).
4. Validación en pruebas internas y resultados
Desde octubre de 2025, la plataforma en la nube se encuentra en fase de pruebas internas en 12 instalaciones de clientes, abarcando cuatro sectores: metalúrgico (5), construcción naval (3), fabricación de equipos pesados (3) y nuevas energías (1). Durante este periodo se aplicó un modelo de prueba gratuita con recopilación de comentarios; cada puente grúa contó con 1 a 3 módulos de detección activos, acumulando 180 días de operación. A continuación se presentan los datos medidos más relevantes:
En las pruebas del módulo de monitoreo de seguridad, se registraron 142 eventos de intrusión de personal en los 12 emplazamientos. La detección por IA en la nube alertó correctamente en 136 ocasiones; se produjeron 6 omisiones (todas en escenarios de baja luminosidad combinada con obstrucción severa), lo que arroja una tasa de recuperación del 95,8 % y una tasa de falsas alarmas de 0,3 eventos por puente grúa y día. El módulo de inspección de cables de acero acumuló más de 12.000 metros de cable inspeccionado en 3 emplazamientos metalúrgicos, detectando 38 defectos de soldadura de grado 2 y superior; la concordancia con los resultados de la reinspección manual con parada de equipo fue del 93,2 %. En el módulo de inspección de soldadura, se realizó una validación comparativa mediante ensayo UT en soldaduras a tope de la viga principal en un astillero; la desviación de posicionamiento entre los defectos detectados por IA y la verificación UT fue inferior a 3 mm.
La encuesta de satisfacción del cliente (NPS, Net Promoter Score) obtuvo una puntuación de 62, por encima de la media del sector para software SaaS (aproximadamente 40). Las tres características más valoradas por los clientes fueron: la rápida puesta en marcha sin despliegue de hardware (puntuación media de 4,7/5), el modelo sin mantenimiento con actualización automática del modelo en la nube (4,5/5) y la facturación flexible por módulos (4,3/5). Las principales sugerencias de mejora se centran en la capacidad de almacenamiento en caché de resultados y detección offline en escenarios de red inestable; esta funcionalidad está prevista para el tercer trimestre de 2026.
Preguntas frecuentes (FAQ)
P: ¿La detección por IA en la plataforma en la nube ofrece la inmediatez necesaria para el control de seguridad del puente grúa?
R: La latencia de extremo a extremo de la plataforma en la nube de inspección visual por IA para puentes grúa de Kelude es de 120~250 ms en redes 5G y de 300~600 ms en redes 4G. Para escenarios de monitoreo de seguridad, se recomienda utilizar los resultados de detección como información auxiliar de seguridad, no como señales de control directo del circuito de seguridad. Según los requisitos de la norma GB/T 28264-2017 — Sistema de Monitoreo y Gestión de Seguridad para Aparatos de Elevación, la latencia de las señales que controlan directamente el circuito de seguridad debe ser inferior a 100 ms. La solución actual de la plataforma en la nube es adecuada para alertas y monitoreo auxiliar; para el control directo de enclavamiento de seguridad, se recomienda adoptar una solución de inferencia en el borde con Jetson local (latencia de extremo a extremo <100 ms). La plataforma en la nube admite implementación híbrida con la solución de borde local: el borde ejecuta el control de seguridad en tiempo real, mientras que la nube se encarga del almacenamiento de datos y el monitoreo remoto.
P: ¿Se puede utilizar en talleres con malas condiciones de red (sin cobertura 5G, señal 4G inestable)?
R: Sí. El terminal de comunicaciones admite doble SIM, redundancia de módulos duales y función de caché local: cuando la red funciona correctamente, las imágenes se cargan en tiempo real y se reciben los resultados de inferencia; cuando la red se interrumpe, se conmuta automáticamente al operador de reserva (tiempo de conmutación <15 segundos) y las imágenes capturadas durante la interrupción se almacenan en la memoria local del terminal (capacidad máxima de caché de 256 GB, que puede almacenar aproximadamente 72 horas de video comprimido 1080P@15fps). Cuando se restablece la red, las imágenes almacenadas en caché se cargan automáticamente y se completa la inferencia, garantizando que no se pierdan datos de detección. Para talleres con condiciones de red persistentemente deficientes, se recomienda optar por una implementación híbrida: el borde ejecuta un modelo ligero para la detección en tiempo real, y la nube se encarga de la actualización de modelos y la copia de seguridad de datos.
P: ¿Los datos de detección almacenados en la nube pueden filtrar información de producción del taller del cliente?
R: La plataforma sigue el principio de adquisición de datos mínima en su diseño: la nube solo almacena los resultados de detección por IA (categoría del objeto, coordenadas del cuadro delimitador, puntuación de confianza y marca de tiempo) y las imágenes clave que activan alertas; no se almacenan flujos de video completos. Los clientes pueden configurar de forma autónoma el período de retención de datos en el panel web (tres opciones: 7 días / 30 días / 90 días), y los datos caducados se eliminan automáticamente. El almacenamiento de datos utiliza una arquitectura de aislamiento físico multiinquilino (instancia de base de datos independiente para cada cliente), con cifrado en tránsito (TLS 1.3) y cifrado en reposo (AES-256). La plataforma ha superado la evaluación de nivel 2 de protección de seguridad de la información (Nivel 2 de protección de seguridad) y cuenta con la certificación ISO 27001 del sistema de gestión de la seguridad de la información. Según los requisitos de la norma GB/T 22239-2019, el nivel 2 de protección es aplicable a sistemas de internet industrial generales y satisface los requisitos de seguridad de datos en escenarios de telemantenimiento de puentes grúa.
P: En el modelo de suscripción SaaS, ¿cómo se actualizan las versiones del modelo? ¿Puede el cliente utilizar sus propios modelos?
R: El modelo de detección es mantenido y actualizado de forma centralizada por la plataforma en la nube. Actualmente se ejecutan modelos de la serie YOLOv8s, y la plataforma realiza una iteración del modelo cada trimestre (entrenamiento incremental basado en nuevos datos de entrenamiento y evaluación de precisión). Las nuevas versiones del modelo se publican de forma gradual (canary release) tras superar las pruebas de regresión (la precisión en el conjunto de prueba estándar no debe disminuir para su publicación). Para clientes con necesidades de detección personalizadas (como la detección de tipos especiales de piezas), la plataforma permite que el cliente cargue su propio conjunto de datos de entrenamiento; los ingenieros de la plataforma realizan el ajuste fino (fine-tuning) del modelo y lo implementan en una instancia de inferencia exclusiva para ese cliente. El servicio de ajuste fino se factura por evento (aproximadamente 380~1020 EUR por evento), con un plazo de entrega de aproximadamente 5 a 10 días hábiles. La actualización y el ajuste fino de modelos no afectan el funcionamiento normal de otros clientes.