Detección de fallas en puente grúa con aprendizaje automático
Solución Técnica de Detección de Defectos en Puentes Grúa mediante Aprendizaje por Transferencia
Utilizando ResNet-18 preentrenado en ImageNet como modelo base, se transfiere el aprendizaje a la clasificación de defectos superficiales en componentes de puentes grúa (5 clases de defectos + 1 clase normal). Se comparan tres estrategias en cuatro niveles de muestra (50/100/300/500): aumento de datos (CutMix + transformaciones geométricas, mejora de precisión +4%~7%), congelación del extractor de características (entrenamiento solo de la capa FC, T1=89.5% @300 muestras) y ajuste fino completo del modelo (todas las capas participan, T1=93.2% @500 muestras). Flujo de trabajo recomendado: aumento de datos → congelación de FC como línea base rápida → ajuste fino completo para optimización final. Plataforma experimental: PyTorch 2.1.0 + NVIDIA A10, conforme a la norma FEM 1.001 para evaluación.
Uno de los principales desafíos en la detección de defectos industriales por visión artificial es la escasez de datos etiquetados: los componentes de puentes grúa (cables de acero, ruedas, carriles, ganchos, frenos) presentan morfologías de defecto muy diversas (grietas, desgaste, picaduras, deformaciones, fracturas), y recopilar cientos de muestras etiquetadas para cada tipo de defecto requiere semanas de trabajo. El aprendizaje con pocas muestras (Few-Shot Learning) y el aprendizaje por transferencia (Transfer Learning) aprovechan modelos visuales preentrenados en conjuntos de datos genéricos a gran escala (como ImageNet, con 14 millones de imágenes) para transferirlos a tareas de detección de defectos industriales donde los datos del dominio objetivo son escasos. Este artículo aborda la detección de cinco tipos comunes de defectos superficiales en componentes de puentes grúa (rotura de hilos en cables de acero, desgaste en la superficie de rodadura de ruedas, grietas en carriles, deformación de ganchos y fisuras en forros de freno) y compara sistemáticamente la eficacia de diferentes estrategias de transferencia con volúmenes de muestra de 50 a 500 imágenes.
Configuración Experimental y Conjunto de Datos
Conjunto de datos: base de imágenes de defectos superficiales en componentes de puentes grúa (anotación interna de Kelude, recopilada en 2024, capturada con cámara industrial Basler acA2440-75um + iluminación anular LED). Total de 1.875 imágenes, 6 clases (normal + 5 defectos), divididas en 4 niveles experimentales según volumen de muestra (50/100/300/500 imágenes por clase; el resto se destina a validación/prueba). Preprocesamiento uniforme: redimensionado a 224×224, normalización con media [0.485,0.456,0.406] y desviación estándar [0.229,0.224,0.225] (estándar ImageNet). Modelo base: ResNet-18 (preentrenado en ImageNet, 11,7 millones de parámetros). Métrica de evaluación: precisión Top-1 (métrica principal) y puntuación F1.
Métodos de Aumento de Datos
El aumento de datos es la estrategia más básica y eficaz en escenarios con pocas muestras. Este experimento combina tres tipos de métodos de aumento: ① Transformaciones geométricas — rotación aleatoria (±15°), volteo horizontal (probabilidad 0,5), traslación aleatoria (±10%), escala aleatoria (0,8~1,2×), recorte aleatorio (0,08~1,0); ② Transformaciones fotométricas — ajuste de brillo (±20%), ajuste de contraste (±15%), ajuste de saturación (±15%), perturbación de tono (±0,1), ruido gaussiano (σ=0,01); ③ Aumento avanzado — borrado aleatorio (Random Erasing, p=0,5, max_area=0,2), CutMix (mezcla con recorte aleatorio de otra imagen, α=1,0). El factor de aumento se controla entre 5 y 20 veces.
Comparativa de estrategias de transferencia
| Estrategia de transferencia | 50Muestras | 100Muestras | 300Muestras | 500Muestras | Tiempo de entrenamiento | Riesgo de sobreajuste |
|---|---|---|---|---|---|---|
| Congelación FC+Aumento de datos | 68.5% | 77.2% | 89.5% | 91.3% | <5min | Bajo |
| Ajuste fino completo+Aumento de datos | 70.1% | 80.8% | 91.7% | 93.2% | ~35min | Medio |
| Congelación FC(Sin aumento de datos) | 62.3% | 71.5% | 85.2% | 88.6% | <3min | Bajo |
| Ajuste fino completo(Sin aumento de datos) | 64.8% | 74.6% | 87.1% | 90.3% | ~30min | Medio-Alto |
El entrenamiento desde cero (sin pesos preentrenados) con 50 muestras alcanza solo un T1 del 41,8%, muy por debajo de cualquier estrategia de transferencia. El aumento de datos es más beneficioso con conjuntos pequeños (50/100 muestras), mejorando el T1 en +5~6%; esta ganancia se reduce a medida que aumenta el número de muestras (+4,3% con 300 muestras, +2,9% con 500). Con ≥300 imágenes etiquetadas, la estrategia de congelar la capa FC alcanza un T1≈90%, suficiente para la mayoría de despliegues industriales. Con 500 muestras, el ajuste completo logra un T1=93,2%, cerca del límite superior del aprendizaje supervisado.
Flujo de trabajo recomendado para entornos industriales
Con base en los experimentos anteriores, el flujo de trabajo recomendado es el siguiente: Paso 1 (establecer la línea base) — usar la estrategia de congelar la capa FC con aumento de datos básico (rotación, volteo, brillo y ruido) y 100~300 muestras etiquetadas para crear rápidamente un modelo base (T1≈90%). Paso 2 (optimización del aumento) — incorporar gradualmente estrategias avanzadas como CutMix y observar si la precisión en el conjunto de validación sigue mejorando. Paso 3 (ajuste completo) — una vez que la precisión base se estabiliza, descongelar todas las capas para un ajuste completo del modelo (tasa de aprendizaje reducida 10 veces hasta 0,0001), lo que suele aportar una mejora adicional del 1~2%. Paso 4 (despliegue) — exportar el modelo a formato ONNX, cuantificarlo con TensorRT INT8 y desplegarlo en Jetson Orin NX (latencia de inferencia de aproximadamente 1,2 ms por imagen). Todo el proceso puede completarse en 1~2 días.
Preguntas frecuentes sobre detección de defectos
P: ¿Por qué no usar directamente modelos más grandes como ResNet-50/101 en la detección de defectos en puentes grúa?
R: ResNet-18 suele ser la mejor opción en entornos industriales por tres razones: ① la detección de defectos en puentes grúa es una tarea de clasificación de grano fino, y una red demasiado profunda produce características demasiado abstractas que no favorecen la extracción de texturas locales; ② los conjuntos de datos industriales son mucho más pequeños que los de imágenes naturales, y los 11,7 millones de parámetros de ResNet-18 son suficientes; ③ la latencia de inferencia de ResNet-18 es solo el 60% de la de ResNet-50 (1,2 ms frente a 2,0 ms en Jetson Orin NX). Los modelos grandes solo ofrecen ventajas significativas con ≥5.000 imágenes por clase.
P: Entre CutMix y MixUp, ¿cuál es más adecuado para la detección de defectos industriales?
R: CutMix es más adecuado. MixUp realiza una mezcla lineal a nivel de píxeles (superposición de imágenes), lo que genera ”imágenes fantasma” poco naturales en imágenes industriales (defectos superpuestos semitransparentes) y reduce la sensibilidad del modelo a los bordes de los defectos. CutMix, en cambio, combina regiones (recorta un área rectangular de una imagen y la pega en otra), preservando la integridad de cada defecto. En este experimento, CutMix superó a MixUp en F1 en aproximadamente 2,3% (escenario de 300 muestras).
P: ¿Es necesario entrenar un modelo independiente para cada componente del puente grúa (cable de acero, rueda, carril, gancho)?
R: Se recomienda entrenar un modelo de clasificación de 6 clases por tipo de componente (5 clases de defectos + 1 clase normal) en lugar de un único modelo unificado para múltiples componentes y defectos. La razón es que la textura de fondo, las condiciones de iluminación y la morfología de los defectos varían considerablemente entre componentes, y un modelo unificado requeriría conjuntos de datos y capacidad de modelo mucho mayores. Con el modelo de 6 clases (50~300 imágenes por clase) y la estrategia de congelar la capa FC, el entrenamiento se completa en 30 minutos; en el despliegue, los 6 modelos ONNX se gestionan como microservicios contenedorizados.
P: ¿Cuánto espacio de almacenamiento requiere el modelo de transferencia desplegado en dispositivos periféricos Jetson?
R: ResNet-18 en FP32 ocupa aproximadamente 45 MB, y tras la cuantificación TensorRT INT8 se reduce a unos 12 MB. Los 6 modelos de componentes (6×12 MB = 72 MB) más el motor de inferencia (aproximadamente 200 MB) y los archivos de configuración suman menos de 300 MB. La versión de 16 GB de Jetson Orin NX puede alojar fácilmente más de 20 modelos. La latencia de inferencia de un solo modelo es de aproximadamente 1,2 ms (INT8, batch=1), y la inferencia en cascada de los 6 modelos es inferior a 8 ms.