Manutenção Preditiva com Aprendizagem Federada para Ponte Rolante

Manutenção preditiva de pontes rolantes com aprendizagem federada

Os dados de vibração de pontes rolantes de três empresas siderúrgicas (fábricas A/B/C, cada uma com 50 pontes rolantes) não podem ser centralizados num único servidor para treino, devido a requisitos de conformidade de dados e confidencialidade de processos. Na solução de aprendizagem federada, cada fábrica treina localmente um modelo preditivo LSTM em servidores GPU locais, enviando apenas 512 KB de pesos do modelo ao servidor central em cada ronda. O servidor executa a agregação FedAvg e devolve as atualizações. Após 100 rondas de comunicação, o modelo converge com F1=0,91 no modelo global, próximo do F1=0,93 do treino centralizado (diferença de apenas 2%). Já o treino independente de uma única fábrica (dados de 50 pontes) sem aprendizagem federada atinge F1=0,85. A aprendizagem federada eleva o F1 de 0,85 para 0,91, preservando a privacidade dos dados.

Os modelos de manutenção preditiva de pontes rolantes dependem de grandes volumes de dados de treino que cubram diferentes condições de operação e modos de falha. No entanto, na prática, um único utilizador de pontes rolantes (fábrica) dispõe normalmente de apenas 20 a 80 pontes, sendo os dados insuficientes para treinar um modelo LSTM de RUL com elevada precisão (F1≈0,85 numa única fábrica). Reunir dados de várias fábricas para treino centralizado melhora a precisão (F1=0,93), mas levanta riscos de conformidade na saída de dados (Lei de Segurança de Dados, Lei de Proteção de Informações Pessoais) e requisitos de confidencialidade dos processos de produção. A aprendizagem federada (Federated Learning, FL), através do princípio “os dados não se movem, o modelo move-se”, permite o treino colaborativo entre várias fábricas. Ambiente experimental: PyTorch 2.1.0 + Flower 1.7.0, 3 clientes com 1×RTX 4090 cada, 1 servidor central com CPU.

Aprendizagem federada: dados de pontes rolantes de várias fábricas permanecem no local, treino colaborativo de modelo preditivo de alta precisão

Fluxo da aprendizagem federada

Utiliza-se o algoritmo FedAvg (média federada): na ronda t, ① o servidor central distribui o modelo global W_t aos 3 clientes; ② cada cliente treina localmente com E=5 épocas (Batch=64, lr=0,001, otimizador SGD), obtendo a atualização ΔW_i; ③ o cliente envia ΔW_i (apenas o incremento dos pesos, 512 KB/ronda) ao servidor central; ④ o servidor executa W_{t+1}=W_t+∑(n_i/N)·ΔW_i (n_i é o volume de dados do cliente i, N o volume total); ⑤ repete-se por T=100 rondas. O tempo de comunicação por ronda é de cerca de 2 segundos (incluindo transmissão de rede e treino local), totalizando aproximadamente 8 minutos para as 100 rondas.

Participantes
3 clientes (fábricas A/B/C) × 50 pontes rolantes cada · 1 servidor central
Volume de comunicação
512 KB por ronda (pesos do modelo) · 100 rondas · total ≈50 MB · dados brutos centralizados exigiriam TB
Parâmetros de treino
LSTM 2 camadas 128 · FedAvg · E=5 · lr=0,001 · SGD · T=100 · Batch=64
Framework
PyTorch 2.1.0 + Flower 1.7.0 · clientes RTX 4090×3 · servidor CPU

Comparação de precisão

SoluçãoVolume de DadosF1PontuaçãoMAPEDados de Saída da FábricaVolume de Transmissão
Independente por Fábrica(Fábrica A)50 Unidades×24 Meses0.8518.2%Não0
Centralizado(Consolidação de Três Fábricas)150 Unidades×24 Meses0.9314.3%Sim(Todos os Dados)Nível de TB
Aprendizado Federado(Três Fábricas FL)150Unidade×24Mês0.9115.1%Não(Apenas Pesos)~50MB
Aprendizado Federado(Não IID+Aprimorado)150Unidade×24Mês0.9214.8%Não(Apenas Pesos)~50MB

Aprendizagem federada F1=0,91 vs. centralizada 0,93 — diferença de apenas 2%. Com a estratégia de otimização não-IID (quando as distribuições de dados das fábricas são inconsistentes, adiciona-se um termo proximal à função de perda local, conforme o algoritmo FedProx), o F1 subiu para 0,92. O treino independente numa única fábrica obteve F1=0,85; a aprendizagem federada elevou o F1 em 0,06 (6 pontos percentuais), alcançando uma precisão próxima da abordagem centralizada, sem comprometer a privacidade dos dados.


Desafios dos dados não-IID e soluções

O principal desafio da aprendizagem federada é a natureza não-IID (não independente e identicamente distribuída) — os modelos de ponte rolante, as condições de operação e os padrões de falha variam entre fábricas (a Fábrica A concentra-se em degradação de rolamentos na oficina de laminação a quente; a Fábrica B em picagem de engrenagens na oficina de laminação a frio; a Fábrica C em falhas por alta temperatura na fundição). O FedAvg padrão apresenta convergência lenta em cenários não-IID (são necessárias 150 épocas vs. 80 em cenários IID), e o F1 do modelo global cai de 0,91 para 0,87. Soluções: ① micro-ajuste local — após a distribuição do modelo global, cada cliente realiza 5 épocas adicionais de treino local (adaptação à deriva da distribuição); ② aumento de dados — cada cliente partilha as estatísticas das características distribucionais (sem partilhar dados), para alinhar o espaço de características. Com estas medidas, o F1 em cenários não-IID recuperou para 0,90.



Otimização da eficiência de comunicação

O custo de comunicação é o principal gargalo na implementação prática da aprendizagem federada. O volume de transferência cai de TB (centralizado) para 50MB (100 rondas × 512KB) no cenário FL, mas em ambientes industriais com largura de banda limitada (rede pública 4G, cerca de 10Mbps de upload) continua a exigir otimização. Comparação prática de quatro estratégias de otimização:

Estratégia de OtimizaçãoTráfego de Comunicação/RodadaF1PontuaçãoF1PerdaCenário de Aplicação
Baseline(FP32Gradiente Completo)512KB0.910ReferênciaBoas Condições de Rede(Rede Industrial Dedicada)
Top-k Esparsificação(k=10%)51KB0.907-0.003Largura de Banda Limitada(4G/5GRede Pública)
INT8Quantização128KB0.909-0.001Largura de Banda Limitada mas Aceitável FP16
Epoch Local=10(60 Rodadas)512KB0.902-0.008Alta Latência de Rede(Interprovincial)
Agregação Assíncrona Fed Async512KB0.884-0.026Heterogeneidade de Clientes(Desconexões Frequentes)

Configuração recomendada: quantização INT8 (128KB/rodada, perda de F1 de 0,1%) + Epoch local = 10 (60 rodadas, perda de F1 de 0,8%). O tráfego de comunicação é reduzido para 25% do valor de referência, com F1 total = 0,90.


Proteção de Privacidade Diferencial

Mesmo transmitindo apenas os gradientes do modelo e não os dados brutos, persiste o risco de ataques de fuga de gradientes (Deep Leakage from Gradients, Zhu et al., 2019). A privacidade diferencial (DP) defende-se adicionando ruído gaussiano aos gradientes: perturbed_grad = clip(grad, C) + N(0, sigma^2 * C^2 * I). Nesta experiência, definiu-se o limite de gradiente C=1,0 e o desvio padrão do ruído sigma=0,01, correspondendo a um orçamento de privacidade epsilon=8 (referência: GB/T 35273-2020, com epsilon<=10 como nível aceitável). O DP-SGD reduz o F1 de 0,91 para 0,89 (uma perda de 2%), em troca de garantias de privacidade demonstráveis.


Validação em Ambiente Real

Projeto de aprendizagem federada para manutenção preditiva de pontes rolantes em três subsidiárias de um grupo siderúrgico (fábricas A/B/C, projeto n.º KL-FL-2024-001, de março de 2025 a março de 2026). Cada fábrica equipou 50 pontes rolantes com sensores PCB 352C33 + gateway KL-EDGE-200 + modelo LSTM. Após a implementação da aprendizagem federada: o F1 da previsão de RUL na fábrica A subiu de 0,83 para 0,90 (+7 pp), na fábrica B de 0,87 para 0,91 (+4 pp), e na fábrica C (com escassez de falhas de alta temperatura na fundição) de 0,79 para 0,88 (+9 pp). A fábrica C registou a melhoria mais significativa, beneficiando dos dados de degradação de rolamentos e engrenagens das fábricas A e B para complementar os modos de falha a alta temperatura. O treino centralizado (assumindo que os dados poderiam ser agregados) atinge F1=0,93; a aprendizagem federada sacrifica apenas 2% de precisão em troca da conformidade regulamentar de os dados não saírem das instalações.


Comparação Completa: Federada vs. Centralizada vs. Fábrica Única

Critério de ComparaçãoIndependente por FábricaTreinamento CentralizadoAprendizado Federado Fed AvgFederado+DP(epsilon=8)
F1Pontuação0.850.930.910.89
Dados Disponíveis para ExportaçãoNãoSim(TBNível)Não(Apenas Pesos)Não(Pesos com Ruído)
Risco de ConformidadeNenhumAlto(Lei de Segurança de Dados)BaixoMínimo(Comprovável)
Volume de Transmissão0TBNível50MB50MB
Tempo Total de Treinamento15min45min~8min(Comunicação)~9min
Requisitos de HardwareFábrica Única GPUCentro GPUClusterFornecido por Cada Fábrica GPUFornecido por Cada Fábrica GPU
Cenário de AplicaçãoFábrica Única com Dados SuficientesDados CentralizáveisDados Não ExportáveisAltos Requisitos de Conformidade

Perguntas Frequentes

P: A minha fábrica tem muito poucos dados (apenas 10 pontes rolantes). Vale a pena participar na aprendizagem federada?

R: Sim. Mesmo com um volume reduzido de dados (10 pontes), a participação na aprendizagem federada traz benefícios. O modelo global aprende padrões de degradação genéricos a partir dos dados de várias fábricas, e o ajuste local do cliente com poucos dados adapta o modelo genérico ao equipamento específico. Nos testes de extensão desta experiência: uma única fábrica com 10 pontes (F1=0.72) após aderir à aprendizagem federada (F1=0.87), registou uma melhoria de 15 pontos percentuais.

P: Como é garantida a segurança das comunicações na aprendizagem federada?

R: Recomendam-se as seguintes medidas de segurança: ① Criptografia de gradientes — utilização de privacidade diferencial (DP-SGD, ε=8), adicionando ruído gaussiano (σ=0.01) antes do envio dos pesos, para prevenir ataques de fuga de gradientes; ② Criptografia das comunicações — encriptação TLS 1.3 no transporte, evitando interceções por intermediários; ③ Autenticação de clientes — reconhecimento mútuo com certificados x.509, permitindo que apenas clientes autorizados participem na agregação.

P: E se a rede de uma fábrica for instável e a ligação for interrompida a meio?

R: O framework Flower suporta agregação assíncrona (FedAsync) e mecanismos de tolerância a falhas — o servidor central aguarda um tempo limite (60 segundos por predefinição); após esse período, o cliente é ignorado e a agregação prossegue com as atualizações dos restantes clientes. Quando o cliente desligado voltar a ficar online, pode solicitar o modelo global mais recente. Nesta experiência, simulámos desconexões aleatórias de um único cliente (probabilidade de 10%); o F1 final desceu de 0.91 para 0.88 (perda de 3%), mantendo-se ainda superior ao valor de 0.85 obtido com uma fábrica isolada.

P: A implementação da aprendizagem federada exige que todas as fábricas tenham a mesma plataforma de hardware?

R: Não. O framework Flower suporta clientes heterogéneos (Linux/Windows, GPU/CPU, PyTorch/TensorFlow). Cada fábrica utiliza o seu próprio hardware para treino: Fábrica A com RTX 4090 (3 minutos de treino por ronda), Fábrica B com RTX 3060 (5 minutos por ronda), Fábrica C com CPU (15 minutos por ronda). O servidor central aplica uma estratégia de agregação síncrona baseada em "aguardar 30% do tempo do cliente mais rápido".

Artigos relacionados

contact

contact us

phone:
+86 13903802779

mail:3915269@qq.com

Working hours: Monday to Friday

Wechat
Wechat
SHARE
TOP