Entrenamiento y prueba de algoritmos de visión IA para grúas LXD
Plataforma de entrenamiento y pruebas de algoritmos de visión IA para grúas completada, con más de 500 000 imágenes industriales anotadas. Kelude Industrias Pesadas ha completado la construcción de su plataforma de entrenamiento y pruebas de algoritmos de visión IA para grúas, acumulando más de 500 000 imágenes industriales anotadas, lo que proporciona una base de datos sólida para la mejora continua de su sistema de monitoreo de seguridad visual para grúas.
Kelude Industrias Pesadas ha puesto en marcha una plataforma dedicada al entrenamiento y validación de algoritmos de visión IA para grúas, con un acervo superior a 500 000 imágenes anotadas de defectos industriales. Esta infraestructura constituye la base de datos necesaria para la evolución constante del sistema de monitoreo de seguridad visual. La plataforma integra adquisición de datos, gestión de anotaciones, entrenamiento del modelo, evaluación de rendimiento y pruebas de hardware en el circuito, siendo la primera infraestructura de este tipo en el sector de grúas en China, específicamente orientada a algoritmos de visión IA.
Posicionamiento de la plataforma y contexto de desarrollo
El rendimiento de los algoritmos de visión IA depende en gran medida de la calidad y el volumen de los datos de entrenamiento. Kelude Industrias Pesadas, al iniciar su investigación en visión IA en 2023, identificó que la falta de conjuntos de datos anotados específicos del sector era el principal obstáculo para la implementación práctica de esta tecnología en grúas. Los conjuntos de datos genéricos como COCO e ImageNet tienen una transferibilidad limitada en entornos industriales; las condiciones complejas de las plantas —polvo, variaciones de iluminación, oclusiones, vibraciones— degradan significativamente la precisión de detección de los modelos generales en despliegues reales. Por ello, la empresa invirtió más de 3 millones de CNY (aproximadamente 381 000 EUR) en la construcción de esta plataforma especializada, iniciando la recopilación sistemática de datos en campo y la anotación manual en septiembre de 2023. El proceso, que abarcó 22 meses, culminó con la puesta en marcha de la plataforma y la acumulación de 500 000 imágenes anotadas.
Sistema de adquisición de datos
La adquisición de datos cubre cuatro condiciones de iluminación —diurna, nocturna, amanecer y crepúsculo— y cuatro condiciones meteorológicas —despejado, nublado, lluvioso y con niebla—. El equipamiento incluye ocho cámaras industriales de 5 megapíxeles fijadas en la parte inferior de la viga principal de la grúa y una cámara de monitoreo móvil desplegada lateralmente en la zona de izaje y transporte. Las cámaras utilizan sensores con obturador global, operan a 25 fps y admiten modo HDR de amplio rango dinámico. La plataforma de anotación admite cuatro tipos de anotación —rectángulo delimitador, polígono, punto clave y segmentación semántica—, cubriendo los requisitos de tres tareas: detección de objetos, segmentación de defectos y localización de puntos clave. La gestión de anotaciones implementa un proceso de control de calidad en tres niveles: anotación inicial por parte del anotador, revisión por el líder del equipo y muestreo por parte del personal de algoritmos. La proporción de muestreo no es inferior al 20 %, y la precisión de anotación requerida supera el 97 %.
Composición del conjunto de datos
Las 500 000 imágenes anotadas se clasifican en cinco categorías principales según la tarea de detección. El conjunto de datos de detección de intrusión de personal comprende 250 000 imágenes, con subcategorías que incluyen personal visible con casco, personal no visible con casco, personal sin casco y personal acercándose fuera del área de trabajo. Cubre cuatro posturas —caminando, en cuclillas, inclinado y operando— y tres rangos de distancia: plano lejano (altura de píxeles <50px), plano medio (50~150px) y plano cercano (>150px). El conjunto de detección de carga suspendida cuenta con 120 000 imágenes, con categorías que incluyen bobinas de acero (horizontales y verticales), chapas de acero (planas e inclinadas), componentes de equipos (cajas y marcos) y materiales a granel (apilados y de forma irregular), cubriendo las características visuales de la carga bajo diferentes tipos de spreader (separador de elevación) —cable de acero, eslinga, electroimán de elevación— y distintas configuraciones de carga. El conjunto de detección de defectos en cordones de soldadura consta de 80 000 imágenes, con cinco categorías de defectos: grietas, falta de penetración, porosidad, inclusión de escoria y mordedura. Los datos provienen tanto de probetas estándar capturadas en laboratorio como de fotografías de cordones de soldadura tomadas en entornos de planta, y cada imagen ha sido verificada mediante análisis metalográfico para confirmar la autenticidad del defecto. El conjunto de inspección de cables de acero incluye 30 000 imágenes, con cinco categorías de anomalías: rotura de alambre, desgaste, corrosión, deformación y reducción del diámetro del cable. Finalmente, el conjunto de detección de anomalías en el carril cuenta con 20 000 imágenes, clasificadas en tres categorías: desalineación del carril, grietas en el carril y objetos extraños en el carril.
Entrenamiento e iteración del modelo
La plataforma de entrenamiento dispone de dos entornos de entrenamiento independientes. El entorno de entrenamiento en línea se basa en 4 GPU NVIDIA RTX 4090, compatible con los frameworks PyTorch y TensorFlow, y utiliza contenedores Docker para una gestión eficiente de los recursos y el aislamiento de las tareas. El entorno de entrenamiento fuera de línea está equipado con 2 GPU NVIDIA A100 de 80 GB, diseñadas para acelerar el entrenamiento de modelos de gran escala y conjuntos de datos masivos. La plataforma incorpora un pipeline de entrenamiento automatizado que gestiona todo el proceso: gestión de versiones de datos, búsqueda de hiperparámetros, entrenamiento del modelo, comparación de evaluaciones y registro del modelo. El entrenamiento se basa en la arquitectura YOLOv8, empleando aumento de datos Mosaic, cálculo adaptativo de anclas y función de pérdida CIoU. Tras múltiples iteraciones con las 500 000 imágenes, la mAP de la detección de intrusión de personal ha mejorado del 67,3 % inicial al 92,3 %, la mAP de la detección de carga suspendida alcanza el 89,1 % y la de detección de defectos en cordones de soldadura el 91,5 %.
Instalaciones de pruebas y verificación
Además de las funciones de entrenamiento, la plataforma incluye un sistema de pruebas de hardware en el circuito. El banco de pruebas está compuesto por un puente grúa experimental de 5 t, un sistema programable de simulación ambiental y un sistema de adquisición y análisis de datos. El puente grúa experimental está instalado en el taller de pruebas interior, con una luz de 12 metros y una altura de elevación de 6 metros, y admite modos de operación manual y automático. El sistema de simulación ambiental permite controlar parámetros como iluminación (ajustable de 0 a 50 000 lux), temperatura y humedad (temperatura de -10 °C a 50 °C, humedad del 20 % al 90 % HR) y concentración de polvo (ajustable de 0 a 10 mg/m³). El sistema de adquisición y análisis de datos registra simultáneamente las salidas del algoritmo de visión IA, los datos de posición del encoder y los parámetros ambientales, generando un informe de evaluación integral para cada fotograma detectado. Las pruebas de hardware en el circuito permiten validar el rendimiento de los algoritmos de visión IA en condiciones extremas de operación controladas, proporcionando una base experimental fiable para la evaluación de la estabilidad del algoritmo antes de su implementación en la grúa.
Seguridad de datos y privacidad
Los conjuntos de datos de visión industrial pueden contener información confidencial sobre la distribución de la línea de producción y la configuración de los equipos de los clientes; por lo tanto, la gestión de seguridad de datos es una consideración fundamental en la construcción de la plataforma. Todos los datos brutos recopilados se almacenan en una matriz de almacenamiento NAS local, con una capacidad total de 200 TB y configuración redundante RAID6. El acceso a los datos está sujeto a un control de permisos por niveles, dividido en tres categorías: acceso a datos brutos, acceso a datos anotados y acceso a datos del modelo. Todas las operaciones de acceso quedan registradas en un registro de auditoría. En la colaboración con equipos externos de anotación, se emplean estrategias de anonimización de datos y anotación por bloques: cada bloque contiene únicamente un segmento de escena única sin características identificables de la planta. Tras la anotación, el personal interno de la empresa realiza la consolidación y el control de calidad. El intercambio de datos con el laboratorio conjunto de la Universidad de Zhengzhou se rige por el acuerdo de uso de datos firmado por ambas partes, limitándose exclusivamente a fines de análisis académico; queda prohibido utilizar los datos en otros proyectos comerciales dentro del laboratorio.
Plan de desarrollo futuro
Kelude Industrias Pesadas tiene previsto ampliar el conjunto de datos anotados hasta 1 millón de imágenes antes de 2027, con un enfoque prioritario en la incorporación de casos límite en condiciones meteorológicas adversas y de baja iluminación, para abordar el problema de la distribución de cola larga en condiciones extremas de operación. Asimismo, se iniciará la construcción de conjuntos de datos de series temporales para el entrenamiento de modelos de reconocimiento de comportamiento en video y predicción de trayectorias, acumulando secuencias de fotogramas anotados de no menos de 300 fotogramas continuos por secuencia. La plataforma también pondrá a disposición de la comunidad académica conjuntos de datos anonimizados para fomentar la colaboración en investigación y contribuir al establecimiento de estándares de referencia en el campo de la visión IA para grúas.
Preguntas frecuentes (FAQ)
P: ¿Qué diferencia existe entre la plataforma de entrenamiento de visión IA de Kelude Industrias Pesadas y las plataformas de entrenamiento de IA de uso general?
R: Las plataformas de entrenamiento de IA de uso general están orientadas principalmente a sectores maduros como la conducción autónoma o la videovigilancia, con conjuntos de datos basados en escenas públicas y entornos genéricos. La plataforma de Kelude Industrias Pesadas es la primera plataforma de entrenamiento de visión IA específica para grúas en el sector. Todos sus conjuntos de datos provienen de escenarios de operación reales de los equipos propios de la empresa en las instalaciones de sus clientes, cubriendo las condiciones de trabajo particulares de los talleres de izaje y transporte. Las categorías de anotación y la configuración de las tareas de detección están diseñadas específicamente para las necesidades de monitoreo de seguridad y detección de defectos en grúas, e incluyen cinco conjuntos de datos especializados: intrusión de personal, identificación de carga suspendida, cable de acero, cordón de soldadura y carril. Los algoritmos de entrenamiento se han optimizado con un diseño ligero para escenarios de inferencia industrial; el tamaño del modelo desplegado se mantiene por debajo de 5 MB, lo que permite la inferencia en tiempo real en dispositivos de computación en el borde como el Jetson Orin NX.
P: ¿Cuál es el plazo y el coste reales para obtener 500 000 imágenes etiquetadas?
R: El proyecto se inició en septiembre de 2023 y finalizó en julio de 2025, con una duración total de 22 meses. La adquisición de datos implicó la instalación y puesta en marcha de 8 cámaras industriales, con un coste aproximado de 280 000 CNY. En cuanto al etiquetado, se contó con un equipo máximo de 15 personas en periodos punta y 8 en periodos regulares, acumulando un coste de mano de obra de unos 1 800 000 CNY. La inversión en hardware de plataforma (servidores GPU, almacenamiento NAS y bancos de pruebas) alcanzó los 950 000 CNY. La capacidad de producción de etiquetado por persona y día oscila entre 120 imágenes (escenarios simples) y 40 imágenes (escenarios complejos), con un coste medio de etiquetado de aproximadamente 3,6 CNY por imagen.
P: ¿La plataforma admite actualizaciones incrementales de datos?
R: Sí. El módulo de gestión de datos de la plataforma utiliza DVC (Data Version Control) para la gestión de versiones y las actualizaciones incrementales de los conjuntos de datos. Los datos recién adquiridos se integran automáticamente en la siguiente versión del conjunto correspondiente tras superar el control de calidad, sin afectar a los resultados de inferencia de los modelos ya desplegados. Los ingenieros de entrenamiento pueden seleccionar una versión específica de los datos según los requisitos de iteración del algoritmo, y se admite la comparación y evaluación de modelos mediante retroceso entre distintas versiones. La versión actual del conjunto de datos ha alcanzado la V2.8, con 18 actualizaciones incrementales acumuladas.
P: ¿Cuál es la capacidad de generalización y adaptación del conjunto de datos a distintos escenarios?
R: El conjunto de datos se diseñó específicamente con diversidad inter-fábrica, con fuentes de datos que abarcan 18 emplazamientos de clientes en cuatro sectores: automoción, siderurgia y metalurgia, logística y almacenamiento, y mecanizado. Dentro de una misma fábrica, se recopilaron imágenes de diferentes áreas operativas (como zona de materias primas, zona de producto terminado y zona de mantenimiento), así como en distintos turnos y estaciones del año. Las pruebas transversales demuestran que, al desplegar el modelo en fábricas no incluidas en el entrenamiento, el descenso del mAP en la detección de intrusión de personal se mantiene por debajo de los 5 puntos porcentuales, y en la detección de cargas suspendidas, por debajo de los 8 puntos porcentuales. La próxima fase contempla ampliar el conjunto de datos con más muestras de otros sectores y fábricas para mejorar aún más la capacidad de generalización del modelo.