LSTM ou Transformer para previsão em pontes rolantes
📋 Resumo principal
A previsão de séries temporais é a capacidade central da manutenção preditiva em guindastes: o modelo aprende a tendência de degradação a partir de sequências históricas de vibração, corrente, temperatura, entre outros sinais, e gera uma janela de alerta precoce antes da ocorrência de falhas. Este artigo aborda as duas principais abordagens — LSTM e Transformer —, começando por definir as condições de contorno da sequência de entrada, seguindo com a dedução das fórmulas principais de cada uma e concluindo com um exemplo de verificação aplicado a uma sequência de vibração, fornecendo uma base de seleção sob as perspetivas de complexidade computacional e custo de implementação. É importante salientar que a eficácia da previsão de séries temporais depende fortemente da condição de operação e da qualidade dos dados; este artigo não promete uma precisão uniforme, mas sim um quadro de decisão aplicável na prática.
Condições de contorno da previsão de séries temporais: comprimento da sequência, frequência de amostragem e volume de dados
Começando pela conclusão: a previsão de séries temporais não consiste simplesmente em alimentar o modelo com dados históricos. A entrada do modelo é uma sequência multicanal ordenada no tempo, e a saída são valores previstos ou indicadores de saúde para os passos futuros. Se as condições de contorno não forem bem definidas, o modelo pode aprender padrões reais de degradação ou, pelo contrário, ruído de amostragem.
Do ponto de vista da fonte de dados, a aquisição de parâmetros de estado em equipamentos de elevação não é concebida de forma arbitrária. A norma GB/T 28264 — Sistema de Monitoramento e Gestão de Segurança estabelece requisitos uniformes para os tipos de parâmetros monitorizados, a aquisição e o registo no sistema de monitoramento e gestão de segurança. Grandezas críticas como a capacidade de elevação, a velocidade de translação e a altura de elevação possuem especificações de aquisição claras. A Kelude Indústrias Pesadas, ao implementar o monitoramento de condição, utiliza normalmente estas especificações como base para a aquisição de dados, adicionando sinais de alta frequência, como vibração e corrente, como canais de entrada para a previsão de séries temporais.
A frequência de amostragem é a segunda condição de contorno. Tomando como exemplo a vibração de uma caixa de engrenagens, a frequência de engrenamento situa-se tipicamente na ordem das centenas de hertz; a frequência de amostragem deve ser superior ao dobro da frequência característica de falha mais elevada, caso contrário ocorre aliasing, e as componentes de alta frequência são dobradas para a banda baixa, fazendo com que o modelo veja um espectro contaminado. O comprimento da sequência determina o contexto histórico que o modelo consegue observar: demasiado curto não captura o ciclo completo de rotação; demasiado longo introduz um lastro histórico irrelevante.
O volume de dados é a terceira condição de contorno. O conjunto de treinamento deve cobrir combinações de condições de operação que incluam diferentes capacidades de elevação, taxas de carga e velocidades de rotação; caso contrário, o modelo perde validade ao mudar de condição de operação. A classe de funcionamento do guindaste é dividida em A1 a A8 na norma FEM 1.001 — Especificação de Projeto de Ponte Rolante, e cada nível corresponde a um espectro de carga completamente distinto. Um modelo treinado apenas em condições de nível leve A3 produzirá previsões necessariamente imprecisas quando aplicado a condições de nível pesado A6. Este aspeto é frequentemente subestimado, mas é a causa mais direta da degradação de desempenho após a implementação do modelo.
Dedução das fórmulas: portas LSTM vs. autoatenção do Transformer
Para decidir qual abordagem adotar, é preciso compreender o que cada uma faz matematicamente. O núcleo da LSTM é o mecanismo de portas, que controla a retenção e o esquecimento de informação através de três portas; o núcleo do Transformer é a autoatenção, que permite a cada posição da sequência estabelecer relações diretas com todas as outras posições.
Num passo temporal da LSTM, o estado oculto anterior e a entrada atual são concatenados e, através de matrizes de pesos aprendíveis, são calculadas as três portas e a memória candidata:
Porta de esquecimento: f_t = σ(W_f·[h_{t-1}, x_t] + b_f)
Porta de entrada: i_t = σ(W_i·[h_{t-1}, x_t] + b_i)
Memória candidata: c~t = tanh(W_c·[h_{t-1}, x_t] + b_c)
Estado da célula: c_t = f_t ⊙ c_{t-1} + i_t ⊙ c~t
Porta de saída: o_t = σ(W_o·[h_{t-1}, x_t] + b_o)
Estado oculto: h_t = o_t ⊙ tanh(c_t)
A essência das três portas é um conjunto de saídas sigmoid, com valores entre 0 e 1, multiplicadas elemento a elemento pelo vetor de estado, permitindo uma retenção ponderada da informação. O estado da célula c_t é a via principal que atravessa toda a sequência; as portas realizam apenas uma sobreposição linear, o que permite que o gradiente flua de forma relativamente estável ao longo deste caminho, mitigando o desaparecimento do gradiente em sequências longas.
O Transformer segue um caminho diferente: a autoatenção não depende da transmissão sequencial, mas sim do cálculo de uma similaridade entre cada posição e todas as outras, seguido de uma agregação ponderada por essa similaridade. A fórmula de pontuação da atenção é a seguinte:
Pontuação de atenção: Attention(Q, K, V) = softmax(QK^T / √d_k) · V
Aqui, Q, K e V são as matrizes de consulta, chave e valor, respetivamente; a divisão por √d_k evita que o produto interno atinja valores excessivos, o que levaria a softmax a uma região de saturação. A atenção multi-cabeça consiste em dividir Q, K e V em vários subespaços processados em paralelo, permitindo que o modelo capture dependências em diferentes escalas simultaneamente. Na prática de engenharia da Kelude, a questão central nunca foi a fórmula em si, mas sim como definir os hiperparâmetros apresentados na tabela seguinte.
| Símbolo | Designação | Valor típico/Significado | Observação de engenharia |
|---|---|---|---|
| n | Comprimento da sequência | Número de amostras da janela de entrada,Por exemplo512 | Quanto maior, mais forte o campo receptivo,potência de computaçãoMaior custo computacional |
| f_s | frequência de amostragem | Por exemplo2560 Hz | Deve ser superior à falha máximafrequência característica2vezes ou mais |
| d | Dimensionalidade dos recursos | Por etapa de temposistema de acessoNúmero de amostras da janela de entrada | vibração、Corrente、Temperatura, entre outrossistema de acessoConcatenação |
| h | Número de cabeças de atenção multi-cabeça | Comumente usado8 | Quanto mais cabeçasParâmetroQuanto mais cabeças,Deve corresponder ao volume de dados |
| d_k | Dimensionalidade por cabeça | Igual ad/h | softmaxFator de escala anterior |
| σ | sigmoidAtivação | Intervalo de saída(0,1) | Proporção de retenção da porta |
| tanh | Tangente hiperbólica | Intervalo de saída(-1,1) | Não linearidade da memória candidata |
| ⊙ | Multiplicação elemento a elemento | Multiplicação da porta pelo estado | Implementa memória seletiva |
Verificação de uma sequência de vibração: será que uma sequência mais longa implica sempre um melhor modelo?
Vamos ilustrar os parâmetros acima com um exemplo prático. Suponhamos que o eixo de entrada do redutor de um guindaste gira a 1000 r/min, que a roda motriz do par de engrenagens de primeiro estágio tem 21 dentes e que o sensor de vibração utiliza uma frequência de amostragem de 2560 Hz. Os cálculos seguintes servem apenas para demonstrar as relações quantitativas entre os parâmetros; os valores reais devem ser determinados pela condição de operação no local.
Primeiro, calculamos a frequência de rotação: a velocidade de rotação do eixo de entrada de 1000 r/min dividida por 60 resulta numa frequência de rotação de aproximadamente 16,7 Hz. De seguida, calculamos a frequência de engrenamento: multiplicando o número de dentes (21) pela frequência de rotação, obtemos cerca de 350 Hz. A frequência de amostragem de 2560 Hz corresponde a uma frequência de Nyquist de 1280 Hz, que cobre a frequência fundamental de 350 Hz e a sua terceira harmónica de 1050 Hz. Esta configuração de amostragem é razoável do ponto de vista da engenharia.
Consideremos agora o comprimento da sequência. O número de pontos de amostragem correspondente a um período de rotação é 2560 dividido por 16,7, ou seja, aproximadamente 153 pontos. Se o comprimento da sequência for de 512 pontos, a janela cobre cerca de 3,3 períodos de rotação, permitindo visualizar integralmente a forma de onda de vibração do par de engrenagens ao longo de vários ciclos de rotação. Se aumentarmos a sequência para 4096 pontos, a cobertura passa a ser de cerca de 26,7 períodos, proporcionando um campo de perceção mais amplo. No entanto, o custo computacional da autoatenção aumenta drasticamente, passando do quadrado de 512 para o quadrado de 4096, um acréscimo de aproximadamente 64 vezes.
Esta é a razão matemática pela qual um comprimento de sequência maior não é necessariamente melhor: o crescimento do campo de perceção é linear, enquanto o custo computacional da autoatenção é quadrático. Na Kelude, durante o processo de seleção, normalmente comprime-se o comprimento da sequência até que cubra alguns ciclos completos de falha e, em seguida, aumenta-se gradualmente para realizar estudos de comparação.
| Item | Fórmula de cálculo | Resultado | Descrição |
|---|---|---|---|
| Frequência de rotação f_r | 1000 / 60 | 16.7 Hz | Eixo de EntradaVelocidade de rotaçãoConversão |
| EngrenamentoFrequência f_m | 21 × 16.7 | Aproximadamente350 Hz | Primeiro estágioEngrenagemSecundário |
| Número de amostras por ciclo | 2560 / 16.7 | Aproximadamente153Pontos | Um período de frequência de rotação |
| 512PontoscoberturaUm período de frequência de rotação | 512 / 153 | Aproximadamente3.3unidades | Janela de entrada |
| AtençãoTorqueTamanho da matriz | 512 × 512 | 262144Par | Custo de ordem quadrática |
Os quatro erros mais comuns na previsão de séries temporais: fuga de dados, comprimento da sequência, sobreajuste e desalinhamento de rótulos
Quando um modelo de séries temporais perde desempenho após a implementação, a causa raramente é a falta de modernidade do modelo, mas sim falhas na engenharia de dados. Os quatro tipos de erro abaixo estão ordenados por gravidade, do maior para o menor impacto.
Primeiro erro: fuga de dados. Informação futura é misturada nas características de treino, por exemplo, usando a média de todo o conjunto de dados para normalização ou aplicando estatísticas do conjunto de teste ao conjunto de treino. O modelo apresenta um desempenho excelente no conjunto de validação, mas colapsa assim que é colocado em produção. Os dados de séries temporais devem ser estritamente divididos por tempo, sem sobreposição entre os conjuntos de treino, validação e teste.
Segundo erro: incompatibilidade entre o comprimento da sequência e a taxa de amostragem. Uma taxa de amostragem demasiado baixa causa aliasing de características de falha de alta frequência, resultando num espetro aprendido pelo modelo que é falso; ou a sequência é demasiado curta para conter um ciclo completo de rotação. Primeiro, calcule a frequência de rotação e a frequência de engrenamento e, só depois, defina a taxa de amostragem e o comprimento da sequência.
Terceiro erro: sobreajuste do modelo. O Transformer tem um número elevado de parâmetros e, com dados insuficientes, é altamente propenso a sobreajuste — a perda de treino continua a diminuir enquanto a perda de validação aumenta progressivamente. Neste caso, a prioridade é reduzir o tamanho do modelo e adicionar regularização, em vez de continuar a acumular dados ou aumentar o modelo.
Quarto erro: desalinhamento de rótulos. Atribuir a leitura do sensor no instante t ao rótulo de falha do instante t+1, ou tratar o momento do alarme como o início da falha. Um desalinhamento de um único ponto de amostragem nos rótulos desloca todo o objetivo de previsão. Na Kelude Indústrias Pesadas, ao anotar dados de séries temporais, é realizada uma verificação de alinhamento temporal dos rótulos — este é o aspeto mais facilmente ignorado e, simultaneamente, o mais crítico.
Voltando à questão do título: LSTM ou Transformer? Em cenários como o monitoramento de condição de pontes rolantes, onde a quantidade de dados é limitada e as sequências são curtas, a LSTM é geralmente o ponto de partida mais fiável: tem menos parâmetros, treino estável e baixo custo de implementação em dispositivos de borda. Quando os dados atingem uma escala suficiente e é necessário capturar dependências globais de longo prazo, considera-se a introdução do Transformer ou a sua utilização para fusão multicanal. Não existe uma resposta padrão para a seleção do modelo — apenas a resposta que se adequa à condição de operação. Definir primeiro as condições de contorno, calcular depois a complexidade e, por fim, validar com experiências em pequena escala é a sequência de implementação repetidamente validada pela Kelude Indústrias Pesadas.
📖 Leituras relacionadas: Gestão da saúde de equipamentos PHM: prática de engenharia de manutenção preditiva de pontes rolantes com big data e ML | O que os grandes modelos podem realmente fazer na manutenção de guindastes? Cenários práticos e limite de capacidade
Perguntas frequentes
P: Que requisitos o sistema de monitoramento e gestão de segurança de equipamentos de elevação impõe ao monitoramento de parâmetros de estado?
R: A norma GB/T 28264 — Sistema de Monitoramento e Gestão de Segurança — exige o monitoramento em tempo real e o registo de parâmetros críticos de estado operacional, como a Capacidade de Elevação, a velocidade de translação e a Altura de Elevação, fornecendo uma base de dados unificada para posterior análise de falhas e previsão de séries temporais. Ao construir a plataforma de monitoramento de condição, a Kelude Indústrias Pesadas começa por organizar os itens de aquisição de acordo com a classificação de parâmetros da norma, adicionando depois sinais de alta frequência, como vibração e corrente. Os parâmetros específicos e o período de registo devem estar em conformidade com a versão atual da norma e com os requisitos de inspeção no local.
P: Qual é a margem de erro aceitável na previsão de séries temporais para considerar o modelo utilizável?
R: A aceitabilidade do erro de previsão depende do equilíbrio entre o tempo de antecedência do alerta e a taxa de falsos alarmes; não existe um valor universal. A avaliação centra-se em saber se o alerta precoce deixa uma janela de manutenção suficiente e se a frequência de falsos alarmes é tolerável para a equipa de operação e manutenção. As referências variam significativamente entre diferentes modelos de máquinas e condições de operação. O limiar específico deve ser determinado através de validação no local, com base na condição de operação real.
P: Porque é que o Transformer é teoricamente superior, mas a LSTM é frequentemente a primeira escolha em cenários industriais?
R: Porque os dados de séries temporais industriais são frequentemente limitados e as sequências são curtas. A autoatenção do Transformer requer grandes volumes de dados para aproveitar a sua vantagem de modelação global; com dados insuficientes, é propenso a sobreajuste. A LSTM tem uma estrutura simples, menos parâmetros e é mais estável em amostras de sequências pequenas. Além disso, a complexidade quadrática do Transformer coloca pressão sobre a potência de computação em dispositivos de borda. Por isso, a Kelude Indústrias Pesadas utiliza normalmente a LSTM como linha de base e decide introduzir o Transformer com base na escala de dados disponível.