Predicción de series temporales para grúas: LSTM vs Transformer

📋 Resumen clave

La predicción de series temporales es la capacidad central del mantenimiento predictivo en grúas: permite que el modelo capture la tendencia de degradación a partir de secuencias históricas de vibración, corriente, temperatura, etc., y genere una ventana de alerta temprana antes de que se produzca el fallo. Este artículo aborda las dos líneas principales —LSTM y Transformer—, comenzando por las condiciones límite de la secuencia de entrada, continuando con la deducción de las fórmulas clave de ambos enfoques y finalizando con un ejemplo de verificación sobre una secuencia de vibración, ofreciendo una base de selección desde las dimensiones de complejidad computacional y coste de despliegue. Cabe señalar que la eficacia de la predicción de series temporales depende en gran medida de la condición de operación y de la calidad de los datos; este artículo no garantiza una exactitud uniforme, sino que proporciona un marco de decisión aplicable en la práctica de ingeniería.

Comparación de parámetros de selección entre LSTM y Transformer para predicción de series temporales.

Límites de entrada y salida en la predicción de series temporales: cómo definir longitud de secuencia, frecuencia de muestreo y volumen de datos

Empecemos por la conclusión: la predicción de series temporales no consiste en introducir todos los datos históricos en el modelo y esperar resultados. La entrada del modelo es una secuencia multicanal ordenada cronológicamente, y la salida son los valores de predicción o indicadores de salud para los próximos pasos. Si las condiciones límite no se definen correctamente, el modelo aprenderá ruido de muestreo en lugar de la verdadera ley de degradación.

En cuanto a la fuente de datos, la adquisición de parámetros de estado en aparatos de elevación no se diseña de forma arbitraria. La norma GB/T 28264 — Sistema de Monitoreo y Gestión de Seguridad para aparatos de elevación establece requisitos uniformes sobre los tipos de parámetros monitorizados, así como sobre su adquisición y registro en el sistema de monitoreo y gestión de seguridad. Magnitudes clave como la Capacidad de Elevación, la Velocidad de Traslación y la Altura de Elevación cuentan con especificaciones de adquisición claras. Kelude Industrias Pesadas, al desplegar el monitoreo de condición, suele tomar estas especificaciones como base para la adquisición de datos y añade señales de alta frecuencia, como vibración y corriente, como canales de entrada para la predicción de series temporales.

La frecuencia de muestreo es el segundo límite. Tomando como ejemplo la vibración de una caja de engranajes, la frecuencia de engrane suele estar en el orden de cientos de hercios; la frecuencia de muestreo debe ser al menos el doble de la frecuencia característica de fallo más alta; de lo contrario, se produce solapamiento espectral y las componentes de fallo de alta frecuencia se pliegan hacia la banda baja, de modo que el modelo recibe un espectro contaminado. La longitud de la secuencia determina el contexto histórico que el modelo puede observar: si es demasiado corta, no se captura el ciclo de rotación completo; si es demasiado larga, se introduce un lastre histórico irrelevante.

El volumen de datos es el tercer límite. El conjunto de entrenamiento debe cubrir combinaciones de condiciones de operación con diferentes Capacidades de Elevación, diferentes tasas de carga y diferentes Velocidades de rotación; de lo contrario, el modelo falla al cambiar de condición de operación. La Clase de Funcionamiento de la grúa se divide en A1 a A8 según la norma FEM 1.001 — Especificación de diseño de grúa, y cada nivel corresponde a un espectro de carga completamente distinto. Un modelo entrenado únicamente en condiciones de servicio ligero (A3) inevitablemente perderá precisión al predecir en condiciones de servicio pesado (A6). Este aspecto suele subestimarse y, sin embargo, es la causa más directa de la degradación del rendimiento tras el despliegue del modelo.

Deducción de las fórmulas del mecanismo de compuertas en LSTM y de la autoatención en Transformer: qué calcula realmente cada uno

Para decidir cuál elegir, primero hay que entender qué hace cada uno matemáticamente. El núcleo de LSTM es el mecanismo de compuertas, que utiliza tres compuertas para controlar la retención y el olvido de la información; el núcleo de Transformer es la autoatención, que permite que cada posición de la secuencia se relacione directamente con todas las demás.

En un paso temporal de LSTM, el estado oculto anterior y la entrada actual se concatenan y, a través de matrices de pesos aprendibles, se calculan las tres compuertas y la memoria candidata:

Compuerta de olvido: f_t = σ(W_f·[h_{t-1}, x_t] + b_f)

Compuerta de entrada: i_t = σ(W_i·[h_{t-1}, x_t] + b_i)

Memoria candidata: c~t = tanh(W_c·[h_{t-1}, x_t] + b_c)

Estado de celda: c_t = f_t ⊙ c_{t-1} + i_t ⊙ c~t

Compuerta de salida: o_t = σ(W_o·[h_{t-1}, x_t] + b_o)

Estado oculto: h_t = o_t ⊙ tanh(c_t)

La esencia de las tres compuertas es un conjunto de salidas sigmoideas con valores entre 0 y 1, que se multiplican elemento a elemento sobre el vector de estado para lograr una retención ponderada de la información. El estado de celda c_t es la vía principal que atraviesa toda la secuencia; las compuertas solo realizan una superposición lineal, por lo que el gradiente puede propagarse de forma relativamente estable a lo largo de esta vía, aliviando la desaparición del gradiente en el entrenamiento de secuencias largas.

Transformer, por su parte, toma un camino diferente: la autoatención no depende de la transmisión secuencial, sino que cada posición calcula una similitud con todas las demás y agrega la información ponderada según dicha similitud. La fórmula de puntuación de atención es la siguiente:

Puntuación de atención: Attention(Q, K, V) = softmax(QK^T / √d_k) · V

Aquí, Q, K y V son las matrices de consulta, clave y valor, respectivamente; la división por √d_k evita que el producto escalar alcance valores demasiado grandes y empuje al softmax a la zona de saturación. La atención multicabeza consiste en dividir Q, K y V en varios subespacios que se calculan en paralelo, permitiendo que el modelo atienda simultáneamente dependencias a diferentes escalas. Al aplicar esta fórmula en la práctica de ingeniería de Kelude Industrias Pesadas, lo que realmente genera debate no es la fórmula en sí, sino cómo ajustar los hiperparámetros que se muestran en la siguiente tabla.

← Deslice la tabla para verla completa →
Símbolo Denominación Valor típico/Significado Nota de ingeniería
nLongitud de secuenciaNúmero de muestras de la ventana de entrada,Por ejemplo512Cuanto mayor, más amplio el campo receptivo,potencia de cálculoMayor costo computacional
f_sfrecuencia de muestreoPor ejemplo2560 HzDebe ser superior a la falla máximafrecuencia característica2veces o más
dDimensión de característicasPor paso de tiemposistema de accesoNúmero de muestras de la ventana de entradavibración、Corriente、Temperatura, etc.sistema de accesoConcatenación
hNúmero de cabezas de atención multi-cabezaUso común8Cuantas más cabezasParámetroCuantas más cabezas,Debe coincidir con el volumen de datos
d_kDimensión por cabezaIgual ad/hsoftmaxFactor de escala previo
σsigmoidActivaciónRango de salida(0,1)Proporción de retención de la compuerta
tanhTangente hiperbólicaRango de salida(-1,1)No linealidad de memoria candidata
Multiplicación elemento a elementoMultiplicación de compuerta por estadoMemoria selectiva implementada

Verificación de una secuencia de vibración: ¿una secuencia más larga implica siempre un mejor modelo?

Veamos un ejemplo práctico que relaciona los parámetros anteriores. Supongamos que el eje de entrada del reductor de una grúa gira a 1000 r/min, la rueda motriz del engranaje de la primera etapa tiene 21 dientes y el sensor de vibración utiliza una frecuencia de muestreo de 2560 Hz. Este cálculo solo pretende ilustrar las relaciones cuantitativas entre los parámetros; los valores reales dependen de la condición de operación en campo.

Primero calculamos la frecuencia de rotación: la velocidad de rotación del eje de entrada, 1000 r/min, dividida entre 60, da una frecuencia de rotación de aproximadamente 16,7 Hz. A continuación, la frecuencia de engrane: multiplicamos el número de dientes, 21, por la frecuencia de rotación, lo que resulta en unos 350 Hz. La frecuencia de Nyquist correspondiente a la frecuencia de muestreo de 2560 Hz es de 1280 Hz, que cubre la frecuencia fundamental de 350 Hz y su tercer armónico de 1050 Hz; esta configuración de muestreo es razonable desde el punto de vista de la ingeniería.

Analicemos ahora la longitud de la secuencia. El número de puntos de muestreo en un período de frecuencia de rotación es 2560 dividido entre 16,7, aproximadamente 153 puntos. Si la longitud de la secuencia es de 512 puntos, la ventana cubre alrededor de 3,3 períodos de frecuencia de rotación, lo que permite observar completamente la forma de onda de vibración de varios ciclos de rotación del engranaje. Si extendemos la secuencia a 4096 puntos, se cubren unos 26,7 períodos, lo que amplía el campo receptivo, pero el coste computacional de la autoatención se dispara de 512 al cuadrado a 4096 al cuadrado, un aumento de aproximadamente 64 veces.

Esta es la razón matemática por la que una secuencia más larga no siempre es mejor: el crecimiento del campo receptivo es lineal, mientras que el coste computacional de la autoatención es cuadrático. En Kelude, durante la selección, normalmente se reduce la longitud de la secuencia hasta cubrir varios ciclos completos de fallo y, a continuación, se aumenta gradualmente para realizar estudios de comparación.

← Deslice la tabla para verla completa →
Ítem Fórmula de cálculo Resultado Descripción
Frecuencia de rotación f_r1000 / 6016.7 HzEje de EntradaVelocidad de rotaciónReducción
EngraneFrecuencia f_m21 × 16.7Aproximadamente350 HzPrimera etapaEngranajePar
Muestras por ciclo2560 / 16.7Aproximadamente153PuntosUn período de frecuencia de rotación
512PuntoscoberturaUn período de frecuencia de rotación512 / 153Aproximadamente3.3unidadesVentana de entrada
AtenciónParTamaño de la matriz512 × 512262144ParCosto de orden cuadrático

Los cuatro errores más comunes en predicción de series temporales: fuga de datos, longitud de secuencia, sobreajuste y desalineación de etiquetas

Cuando un modelo de series temporales pierde precisión tras su despliegue, la causa no suele ser que el modelo no sea lo bastante nuevo, sino que se ha cometido un error en la fase de ingeniería de datos. A continuación se enumeran los cuatro tipos de errores, ordenados de mayor a menor gravedad.

El primer error: la fuga de datos. Consiste en mezclar información futura en las características de entrenamiento, por ejemplo, utilizando la media de todo el conjunto de datos para la normalización, o aplicando estadísticas del conjunto de prueba al conjunto de entrenamiento. El modelo muestra un rendimiento excelente en el conjunto de validación, pero falla en cuanto se pone en producción. Los datos de series temporales deben dividirse estrictamente por tiempo; los conjuntos de entrenamiento, validación y prueba no pueden solaparse.

El segundo error: la falta de correspondencia entre la longitud de la secuencia y la frecuencia de muestreo. Una frecuencia de muestreo demasiado baja provoca el solapamiento espectral de las características de fallo de alta frecuencia, de modo que el espectro que aprende el modelo es falso; o la secuencia es demasiado corta para abarcar un ciclo de rotación completo. Primero hay que calcular la frecuencia de giro y la frecuencia de engrane, y a partir de ahí determinar la frecuencia de muestreo y la longitud de la secuencia.

El tercer error: el sobreajuste del modelo. El Transformer tiene un número de parámetros elevado y, cuando los datos son insuficientes, es muy propenso al sobreajuste: la pérdida de entrenamiento desciende continuamente mientras que la pérdida de validación aumenta cada vez más. En este caso, lo prioritario es reducir el tamaño del modelo y añadir regularización, en lugar de seguir acumulando datos o agrandando el modelo.

El cuarto error: la desalineación de etiquetas. Consiste en asociar la lectura del sensor en el instante t con la etiqueta de fallo del instante t+1, o en tomar el momento de la alarma como el inicio del fallo. Si la etiqueta se desvía un solo punto de muestreo, el objetivo de predicción se desplaza por completo. En Kelude, al anotar datos de series temporales, se realiza una verificación de alineación temporal de las etiquetas; es el paso más fácil de pasar por alto y, sin embargo, el más crítico.

Volviendo a la pregunta del título: ¿LSTM o Transformer? En escenarios como el monitoreo de estado de grúas, donde la cantidad de datos es limitada y las secuencias no son largas, la LSTM suele ser un punto de partida más fiable: su número de parámetros es menor, el entrenamiento es estable y el coste de despliegue en dispositivos periféricos es bajo. Cuando los datos se acumulan hasta alcanzar una escala suficiente y se necesita capturar dependencias globales a largo plazo, entonces se puede considerar la introducción del Transformer o utilizarlo para la fusión multicanal. No existe una respuesta estándar en la selección del modelo; solo existe la respuesta que se ajusta a la condición de operación. Primero se definen las condiciones límite, luego se calcula la complejidad y, por último, se valida con experimentos a pequeña escala; este es el orden de implementación que Kelude ha verificado en repetidas ocasiones.

📖 Lecturas relacionadas: PHM para la gestión de la salud de los equipos: práctica de ingeniería de mantenimiento predictivo para puentes grúa con macrodatos y ML | ¿Qué aplicaciones reales tiene un gran modelo en el mantenimiento de grúas? Escenarios prácticos y límite de capacidad

Preguntas frecuentes

P: ¿Qué requisitos establece el sistema de monitoreo y gestión de seguridad para aparatos de elevación en cuanto al monitoreo de parámetros de estado?

R: La norma GB/T 28264 — Sistema de Monitoreo y Gestión de Seguridad para aparatos de elevación exige el monitoreo y registro en tiempo real de parámetros clave del estado operativo, como la Capacidad de Elevación, la Velocidad de Traslación y la Altura de Elevación, con el fin de proporcionar una base de datos unificada para el posterior análisis de fallos y la predicción de series temporales. En Kelude, al construir la plataforma de Monitoreo de Condición, primero se organizan los puntos de captura según la clasificación de parámetros de dicha norma y, a continuación, se superponen señales de alta frecuencia como vibración y corriente. Los parámetros específicos y el período de registro se ajustan a la versión vigente de la norma y a los requisitos de inspección in situ.

P: ¿Dentro de qué rango de error se considera aceptable un modelo de predicción de series temporales?

R: La aceptabilidad del error de predicción depende del equilibrio entre el tiempo de anticipación de alerta y la tasa de falsas alarmas; no existe un valor universal. El criterio principal es si la alerta temprana deja una ventana de mantenimiento suficiente y si la tasa de falsas alarmas se mantiene dentro de una frecuencia aceptable para el personal de operación y mantenimiento. Las diferencias de referencia entre distintos modelos de máquina y condiciones de operación son considerables; el umbral específico debe determinarse mediante validación en campo, atendiendo a la condición de operación real.

P: ¿Por qué, si el Transformer es teóricamente más potente, en entornos industriales se suele empezar con LSTM?

R: Porque los datos de series temporales industriales suelen ser limitados y las secuencias no son largas. La autoatención del Transformer requiere una gran cantidad de datos para aprovechar su ventaja de modelado global; con datos insuficientes es propenso al sobreajuste. La LSTM, en cambio, tiene una estructura más simple y un número de parámetros menor, lo que la hace más estable con muestras pequeñas. Además, la complejidad cuadrática del Transformer supone una presión de potencia de cálculo considerable al desplegarlo en dispositivos periféricos. Por ello, en Kelude se utiliza la LSTM como modelo base y se decide introducir el Transformer en función del volumen de datos disponible.

Artículos relacionados

contact

contact us

phone:
+86 13903802779

mail:3915269@qq.com

Working hours: Monday to Friday

Wechat
Wechat
SHARE
TOP