Detección de anomalías en puentes grúa: Isolation Forest
Solución Técnica para la Detección de Anomalías No Supervisada en Puentes Grúa
Se comparan tres métodos de detección de anomalías no supervisada sobre la base de datos de vibraciones KL-PM-2024 (60 puentes grúa × 1,45 millones de registros, relación normal:anomalía = 95:5): Isolation Forest (F1=0,87, sin entrenamiento, latencia <1 ms), Autoencoder AE (F1=0,92, detección por error de reconstrucción, requiere entrenamiento offline) y One-Class SVM (F1=0,83, kernel RBF, ventaja en muestras pequeñas). Arquitectura de despliegue recomendada: detección en tiempo real en el borde con Isolation Forest + inspección offline precisa en la nube con Autoencoder. Este artículo proporciona el diseño completo de características, el método de ajuste de umbrales, el flujo de detección en dos niveles y el plan de despliegue en dispositivos Jetson.
La detección de anomalías en los componentes críticos del puente grúa es la primera línea de defensa del Mantenimiento Predictivo: permite identificar tendencias de degradación anómala antes de que el fallo se vuelva irreversible. A diferencia del aprendizaje supervisado, que requiere grandes volúmenes de datos etiquetados con fallos, la detección de anomalías no supervisada entrena el modelo únicamente con datos de funcionamiento normal (más del 95% de las muestras), determinando la anomalía por el grado de desviación respecto al patrón normal. Este artículo toma como objeto los datos de vibración del rodamiento del eje de entrada del reductor de puente grúa (17 características, 95% muestras normales / 5% anómalas), compara la implementación práctica y la precisión de tres métodos clásicos de detección de anomalías no supervisada, y ofrece un plan de despliegue en el borde. Fuente de datos: base de datos de vibraciones del proyecto KL-PM-2024 (según la especificación de extracción de características de la norma ISO 13373-1, equivalente a GB/T 19873.1-2005 sobre monitorización de condición y diagnóstico de máquinas — procesamiento y análisis de datos de vibración).
Datos y Configuración de Evaluación
Datos experimentales: características de vibración de 24 meses de los rodamientos del eje de entrada de reductores de puente grúa (SKF 6308) en 60 equipos, 17 características (9 en el dominio temporal + 8 en el dominio frecuencial), ventana deslizante de 30 días. Etiqueta de muestra normal: rodamiento en fase de desgaste normal (Vrms < 2,8 mm/s, según límites de las zonas A/B de ISO 10816-3). Etiqueta de muestra anómala: rodamiento en fase de degradación severa (Vrms ≥ 4,5 mm/s, zona C de ISO 10816-3). Distribución de datos: 469.834 muestras normales (95,4%) y 22.614 muestras anómalas (4,6%). Indicadores de evaluación: puntuación F1 (media armónica de Precision y Recall, ponderada hacia la clase anómala), Precision (tasa de acierto de las alarmas) y Recall (proporción de anomalías no detectadas).
Implementación de los Tres Métodos
Isolation Forest (implementación con scikit-learn 1.3.2): n_estimators=100 (número de árboles), max_samples=256 (muestras por árbol), contamination=0.05 (proporción de anomalías predefinida, ajustada a la distribución del conjunto de entrenamiento). La ventaja del Isolation Forest radica en que no requiere entrenamiento (la anomalía se determina directamente por la profundidad de corte aleatorio de los árboles), con una complejidad computacional de O(n·log(n)), idóneo para el procesamiento de datos en streaming. Latencia de inferencia < 1 ms (para una muestra de 17 características).
Autoencoder (implementación con PyTorch 2.1.0): red totalmente conectada de arquitectura 17-128-12-17, con activación ReLU en las capas ocultas y capa de salida lineal. Entrenamiento: 250 épocas, tasa de aprendizaje de 0,001 en las primeras 150 épocas y de 0,0001 en las 100 restantes (estrategia de decaimiento), Batch=128, función de pérdida MSE. Criterio de anomalía: se calcula el error de reconstrucción MSE entre entrada y salida; el umbral se fija en el percentil 99,5 de los errores de reconstrucción del conjunto de entrenamiento. El autoencoder es capaz de capturar patrones no lineales complejos, ofreciendo la mayor precisión, aunque requiere entrenamiento offline y soporte de GPU.
One-Class SVM (implementación de scikit-learn): kernel RBF (γ=0,1), nu=0,05 (estimación de la proporción de anomalías en el conjunto de entrenamiento), tol=0,001. OCSVM ofrece buenos resultados en escenarios con muestras reducidas (con unos cientos de registros ya se obtienen resultados estables), pero el tiempo de entrenamiento crece de forma cuadrática O(n²) al aumentar el volumen de datos (más de 100 000 registros), por lo que no es adecuado para el entrenamiento en línea con conjuntos de datos a gran escala. En este experimento se adelantó el muestreo aleatorio a 50 000 registros para el entrenamiento.
Comparativa de precisión entre modelos
| Método | F1Puntuación | Precision | Recall | Tiempo de entrenamiento | Latencia de inferencia | Escala aplicable |
|---|---|---|---|---|---|---|
| Bosque de aislamiento | 0.87 | 0.91 | 0.83 | Sin entrenamiento | <1ms | Cualquiera Escala aplicable |
| Desde Encoder AE | 0.92 | 0.94 | 0.90 | ~8min(GPU) | <3ms | ≥1Diez mil registros |
| One-Class SVM | 0.83 | 0.88 | 0.79 | ~15min(5Diez mil registros) | <5ms | ≤5Diez mil registros |
El autocodificador lidera la clasificación en precisión con un F1=0,92 (Recall=0,90, es decir, se detecta el 90 % de las degradaciones anómalas), pero requiere entrenamiento offline y soporte de GPU. El bosque de aislamiento ocupa el segundo lugar con un F1=0,87, aunque no necesita entrenamiento y su latencia de inferencia es inferior a 1 ms, lo que lo hace adecuado para despliegue en línea. La One-Class SVM presenta el F1 más bajo, 0,83, y su tiempo de entrenamiento crece de forma O(n²) con el volumen de datos, por lo que no es adecuada para despliegues a gran escala.
Arquitectura de detección en dos niveles
La solución de despliegue recomendada es una arquitectura de dos niveles: cribado en tiempo real con bosque de aislamiento en el borde y verificación offline precisa con autocodificador en la nube. Primer nivel (borde, Jetson Orin NX): el modelo de bosque de aislamiento (sin entrenamiento, tamaño del modelo de solo 2,3 MB) recibe el vector de características de 17 dimensiones que el puente grúa envía diariamente a través de la pasarela perimetral y determina si el estado actual es anómalo. La latencia de inferencia es inferior a 1 ms por registro; con 60 puentes grúa y una comprobación diaria, el tiempo total es de aproximadamente 60 ms. Cuando el bosque de aislamiento detecta una anomalía, empaqueta la secuencia de características de los últimos 30 días y la envía a la nube.
Segundo nivel (nube, servidor GPU): el autocodificador recibe las secuencias sospechosas enviadas desde el primer nivel, calcula el error de reconstrucción de cada día y genera la curva de tendencia del error. Se establece un umbral dinámico mediante un gráfico de control EWMA (media móvil exponencialmente ponderada) (coeficiente de suavizado λ=0,2, límite de control 3σ). Cuando el error de reconstrucción supera el límite de control superior durante tres días consecutivos, se confirma la anomalía. Tras la verificación precisa, la tasa de falsas alarmas se reduce del 17 % del primer nivel (el bosque de aislamiento tiene un 1-Precision=0,09 pero un Recall=0,83, lo que provoca algunas falsas alarmas) al 6 % en el segundo nivel.
Validación en despliegue real
En un proyecto de mantenimiento predictivo para seis puentes grúa de 32 t en una empresa siderúrgica (número de proyecto KL-PM-2024-017), se desplegó la arquitectura de detección en dos niveles descrita anteriormente. Durante 14 meses de operación, el bosque de aislamiento en línea generó un total de 408 alarmas (89 anomalías reales y 319 falsas alarmas, con una tasa de falsas alarmas por grúa de aproximadamente 3,8 veces al mes). De las 319 falsas alarmas, tras la verificación del autocodificador se confirmaron 287 como falsas alarmas y 32 se reclasificaron como anomalías reales. Finalmente, se registraron 121 alarmas efectivas (106 predicciones correctas de anomalías reales, con una precisión del 87,6 %), con un promedio de 18 días de antelación en la alerta. En comparación con el método de umbral fijo basado en reglas (Vrms≥4,5 mm/s), la arquitectura de dos niveles aumentó el margen de alerta de 0 a 18 días.
Preguntas frecuentes
P: ¿Por qué se utiliza la puntuación F1 como indicador principal en la detección de anomalías no supervisada en lugar de la precisión directa?
R: Porque los conjuntos de datos de detección de anomalías están muy desequilibrados (normal:anomalía = 95:5). Si el modelo clasificara todo como "normal", la precisión sería del 95 %, pero el modelo no tendría ninguna utilidad. La puntuación F1 considera tanto la precisión (exactitud de las alarmas) como el recall (tasa de captura de anomalías), y es el indicador estándar para evaluar problemas de clasificación desequilibrados (según la norma ISO 4301 y las especificaciones de evaluación de modelos de aprendizaje automático).
P: ¿Cómo se configuran los parámetros contamination del bosque de aislamiento y nu de la One-Class SVM?
R: Tanto contamination como nu representan la estimación de la proporción de anomalías en el conjunto de datos. La mejor práctica es estimar primero el valor mediante conocimiento del dominio (por ejemplo, la tasa histórica de fallas de los rodamientos en puentes grúa es de aproximadamente el 3 %-5 %) y, a continuación, realizar una búsqueda en cuadrícula en un rango reducido (0,02-0,08) para ajustar el parámetro. En este experimento, contamination=0,05 se aproxima a la proporción real de anomalías del 4,6 % en el conjunto de entrenamiento. Si la estimación se desvía demasiado (por ejemplo, se establece en 0,01), se producirán numerosas omisiones de anomalías reales.
P: ¿Cuánto aumenta el coste de despliegue la arquitectura de dos niveles?
R: Nivel de borde (Jetson Orin NX): el coste de hardware por unidad es de aproximadamente 3.500 CNY (incluida la carcasa de disipación), lo que supone una inversión única de unos 210.000 CNY para 60 puentes grúa. Servidor GPU en la nube: se pueden utilizar los recursos GPU existentes del sistema de mantenimiento predictivo (NVIDIA A10), sin coste adicional. El principal coste adicional de la arquitectura de dos niveles frente a la solución de autocodificador de un solo nivel son los dispositivos Jetson en el borde, pero a cambio se reduce el volumen de transmisión de red en aproximadamente un 95 % (solo se transmiten los datos anómalos), lo que resulta adecuado para entornos industriales con ancho de banda limitado.
P: ¿Cómo se establece y actualiza el umbral del autocodificador?
R: Umbral inicial: se toma el percentil 99,5 del error de reconstrucción MSE del conjunto de entrenamiento (datos normales) como umbral inicial. Actualización adaptativa del umbral en funcionamiento: cada 30 días se recalcula el percentil 99,5 con los datos normales de los últimos 3 meses, de modo que el umbral se ajusta automáticamente a la deriva de la línea base debida al desgaste natural del equipo. Si el equipo se somete a una revisión general (sustitución de rodamientos, etc.), es necesario recopilar 30 días de datos normales tras la revisión para establecer una nueva línea base.