Detecção de Carga e Pessoas com IA para Ponte Rolante YOLOv8

Câmera industrial + edge computing Jetson para monitoramento de segurança com IA em pontes rolantes — deteção em tempo real do estado da carga, identificação de intrusão de pessoas, substituindo as soluções tradicionais de barreiras físicas.

No monitoramento de segurança de pontes rolantes, o maior risco não é a falha do equipamento, mas sim a presença de pessoas na área de operação enquanto a máquina continua em movimento — as soluções tradicionais, baseadas em barreiras físicas e sensores fotoelétricos, apresentam muitos pontos cegos, falsos alarmes e custos de manutenção elevados. Nos últimos dois anos, o uso de IA visual para segurança evoluiu de "funcional" para "eficaz": uma câmera industrial combinada com um dispositivo de computação de borda Jetson permite detetar em tempo real o estado da carga, identificar a intrusão de pessoas e verificar o uso de capacete de segurança, com uma precisão de reconhecimento superior a 98% e um custo por canal inferior a 5000 CNY.

Arquitetura do sistema de monitoramento com IA visual

O sistema de monitoramento de segurança com IA visual está estruturado em quatro camadas lógicas, desacopladas entre si através de protocolos padrão (MQTT/RESTful API/RTSP), suportando implementação em cascata para uma única ponte rolante ou para múltiplas pontes em toda a oficina.

1.1 Camada de perceção

A camada de perceção é composta por câmeras industriais instaladas sob a viga principal da ponte rolante e no carro no carro, responsáveis pela captura de fluxos de vídeo em tempo real da área de carga, dos corredores laterais ao longo do trilho e das zonas de trabalho dos operadores. As câmeras ligam-se ao nó de computação de borda através de cabo PoE ou WiFi industrial, transmitindo vídeo H.265 comprimido a 1080P@30fps.

1.2 Camada de algoritmos

A camada de algoritmos opera no dispositivo de computação de borda (NVIDIA Jetson Orin NX), executando o modelo YOLOv8 para inferência de deteção de objetos — anteriormente publicámos um artigo sobre deteção visual com IA do cordão de solda em pontes rolantes, que aborda igualmente a implementação do YOLO neste contexto. Os resultados da deteção incluem: posição e caixa delimitadora de pessoas, estado do uso de capacete, tipo de carga e área de movimentação, e estado das linhas de advertência. A latência de inferência é mantida abaixo de 30ms, cumprindo os requisitos de monitoramento em tempo real.

1.3 Camada de aplicação

A camada de aplicação converte os resultados da camada de algoritmos em lógica de decisão de segurança: a intrusão de pessoas na zona de perigo da ponte rolante aciona o alarme sonoro e visual e a desaceleração do movimento; quando a área de carga está desocupada, é permitida a operação a velocidade total; a ausência de capacete é registada como infração, com captura de fotografia para arquivo. Esta camada também gere a interação com o PLC da ponte rolante, transmitindo sinais de segurança ao módulo de segurança do PLC através dos protocolos Modbus TCP ou Profinet.

1.4 Camada de apresentação

A camada de apresentação disponibiliza um painel de monitoramento via Web e notificações de alarme para telefone celular, exibindo em tempo real as imagens de deteção, registos de alarme, estado operacional e estatísticas de cada ponte rolante. Os dados são armazenados numa base de dados SQLite local, com histórico consultável de 90 dias.

Nível PrincipalComponente Protocolo de Comunicação Local de Implantação
Camada de Percepção câmera industrial,Luz de Preenchimento,Encoder RTSP / GigE Vision ponte rolanteEletrocalha/CarroAbaixo
Camada de Algoritmos Jetson Orin NX,YOLOv8Modelo TensorRTMotor de Inferência quadro elétrico da ponte rolanteInterno
Camada de Aplicação Motor de Lógica de Segurança,PLCInterfaceMódulo Modbus TCP / Profinet Nó de Borda / Gabinete do PLC da ponte rolante
Camada de Exibição WebPainel de Grande Formato,telefone celularTerminal,Banco de Dados MQTT / RESTful API Sala de Controle Central da oficina / servidor em nuvem

Seleção do modelo YOLOv8 e comparação de desempenho

O YOLOv8 é um framework de detecção de objetos em tempo real lançado pela Ultralytics em 2023, oferecendo cinco modelos pré-treinados em escala N/S/M/L/X, que vão desde versões leves até alta precisão para atender a diferentes cenários de implantação. No contexto de monitoramento de segurança de pontes rolantes, a escolha do modelo exige um equilíbrio entre velocidade de inferência, precisão de detecção e custo de hardware.

Modelo ParâmetroQuantidade mAP50 FP16Latência(ms) INT8Latência(ms) Hardware Recomendado
YOLOv8n 3.2M 37.3 4.5 2.1 Jetson Nano
YOLOv8s 11.2M 44.9 8.7 3.8 Jetson Orin Nano
YOLOv8m 25.9M 50.2 16.1 7.2 Jetson Orin NX
YOLOv8l 43.7M 52.9 26.4 12.3 Jetson Orin NX
YOLOv8x 68.2M 53.9 44.8 21.5 Jetson Orin AGX

Recomendação: combinação YOLOv8m + Jetson Orin NX. Após quantização INT8, a latência de inferência é de 7,2 ms; um único dispositivo de computação de borda processa simultaneamente 4 fluxos de vídeo 1080P, com latência total inferior a 30 ms, cumprindo os requisitos de tempo real do monitoramento de segurança de pontes rolantes. Custo por canal: cerca de 4.500 CNY.

Comparativo de Hardware para Computação de Borda

A escolha do dispositivo de computação de borda determina o desempenho de inferência e o custo de implantação do sistema. Segue a comparação de três abordagens principais no contexto de monitoramento de segurança de pontes rolantes:

Parâmetro Jetson Orin NX Jetson Orin Nano computador industrial(i5+Placa de Vídeo Dedicada)
AICapacidade de Processamento(TOPS) 100 40 20~30
Consumo de Energia(W) 15~25 7~15 65~150
Número de Canais Simultâneos 4Canal1080P 2Canal1080P 2~4Canal1080P
Temperatura de Operação(℃) -25~80 -25~80 0~50
Custo por Canal(RMB) ~4,500 ~3,000 ~6,000
Método de Instalação trilho DIN no quadro elétrico da ponte rolante DIN quadro elétrico da ponte rolanteDINTrilho DIN Requer caixa de controle separada

O Jetson Orin NX supera as soluções com computador industrial em capacidade de processamento, consumo energético, resistência à temperatura e facilidade de instalação, sendo atualmente a melhor escolha para implementação de IA visual de ponta em pontes rolantes.

Comparação das três funções principais do sistema de monitoramento de segurança com IA visual para pontes rolantes: identificação de carga suspensa YOLOv8m com precisão de 95, detecção de segurança de pessoal com latência de 50ms, alarme em tempo real integrado ao PLC
As três funções principais do Sistema de Monitoramento de Segurança com IA visual para pontes rolantes: identificação de carga suspensa, detecção de segurança de pessoal e alarme em tempo real integrado ao PLC

Identificação de Carga Suspensa em Pontes Rolantes

A identificação de carga suspensa é uma das funções centrais da IA visual em pontes rolantes. O sistema deve reconhecer diversos tipos de carga — bobinas de aço, tarugos, chapas de aço, moldes, contêineres — e acompanhar continuamente a sua posição durante o movimento. Integrada à plataforma de monitoramento remoto IoT para pontes rolantes, esta função permite um ciclo completo de dados, desde a identificação e o rastreamento até a armazenagem da carga.

4.1 Aquisição e Anotação de Dados

Recomenda-se a recolha de 5000 a 10000 imagens no local, abrangendo diferentes condições de iluminação (diurna, noturna, contraluz), diferentes posturas da carga suspensa (oscilação frontal, oscilação lateral, rotação) e diferentes cenários de fundo (limpo, desordenado, com obstruções). A anotação segue o formato YOLO, com cada imagem a incluir a caixa delimitadora da carga e a respetiva etiqueta de classe. Com ferramentas como LabelImg ou CVAT, a eficiência de anotação é de aproximadamente 100 imagens por hora por pessoa.

4.2 Parâmetros de Treino do Modelo

# YOLOv8m Configuração de Treinamento(parâmetros-chave) model = YOLO('yolov8m.pt') results = model.train( data='crane_dataset.yaml', epochs=200, imgsz=640, batch=16, lr0=0.01, lrf=0.01, optimizer='AdamW', augment=True, hsv_h=0.015, # Realce de Matiz hsv_s=0.7, # Realce de Saturação hsv_v=0.4, # Realce de Brilho degrees=5.0, # Realce de Rotação(Carga suspensa com leve inclinação em cenário de ponte rolante) translate=0.1, scale=0.5, fliplr=0.5, mosaic=1.0, mixup=0.3, )

O treino numa NVIDIA RTX 4090 demora cerca de 4 a 6 horas, com mAP50 a atingir 92 a 95%. Após o treino, o modelo é exportado para o formato ONNX e posteriormente convertido para um motor INT8 com TensorRT para implementação na periferia.

4.3 Implementação com TensorRT

# TensorRT INT8 Comando de Implantação Quantizada trtexec --onnx=yolov8m_crane.onnx \\\\ --saveEngine=yolov8m_crane_int8.engine \\\\ --int8 \\\\ --calib=crane_calib_data \\\\ --buildOnly \\\\ --workspace=4096

Após a quantização INT8, o tamanho do modelo é reduzido de 52MB para 15MB, a velocidade de inferência diminui de 16ms (FP16) para 7ms, e o controle de perda de precisão mantém-se abaixo de 1%.

Detecção de Segurança de Pessoal

A detecção de segurança de pessoal inclui três subfunções: detecção de violação de zona de segurança, detecção de uso de capacete e cerca eletrónica. O sistema executa simultaneamente duas instâncias independentes do modelo YOLOv8 — uma dedicada à detecção do corpo humano e da respetiva caixa delimitadora, e outra focada na região da cabeça para classificar o uso de capacete de segurança.

Função DetecçãoObjeto Acionamento de Alarme Ação de Intertravamento
Invasão de ÁreaDetecção Entrada de PessoalZona de Perigo Operacional da ponte rolante <=1s Alarme Sonoro e Visual+ponte rolanteDesaceleração30%
Capacete de SegurançaDetecção Uso de Capacete por Trabalhadores <=2s Captura de Imagem+Registro de Violação+Alerta por Voz
Cerca Eletrônica Entrada de Pessoal na Área sob a Carga Suspensa <=0.5s Parada de elevação+Alarme Sonoro e Visual

6. Pontos-chave para a implementação em obra

Ao passar do protótipo para a implementação em série do sistema de visão AI para pontes rolantes, existem alguns desafios que vão surgir inevitavelmente. Conhecê-los antecipadamente pode poupar três meses de retrabalho.

① Variação de iluminação — a maior fonte de desvio na distribuição de dados
A iluminação na área de operação da ponte rolante é influenciada por vários fatores, como a orientação do edifício industrial, condições meteorológicas, estação do ano e interruptores de luz. O brilho na mesma cena pode variar até 100 vezes. Solução: utilizar forte aumento de dados durante o treino (parâmetros hsv_h/hsv_s/hsv_v) e complementar com luzes LED (temperatura de cor 5000K, potência superior a 30W) na implementação, garantindo uma iluminação mínima de 10 lux na imagem.

② Obstrução e empilhamento da carga — o ponto cego da detecção por câmara única
Durante o movimento, a carga suspensa pode ficar obstruída por equipamentos circundantes ou outras cargas, afetando a continuidade da detecção. Recomenda-se instalar 2 a 3 câmaras em ângulos diferentes para cobrir a mesma área, fundindo os resultados de detecção multivista através do filtro de Kalman. Quando a detecção é perdida, é tolerada uma extrapolação de previsão de no máximo 5 frames (aproximadamente 170ms@30fps).

③ Vibração e oscilação — interferência mecânica durante a operação da ponte rolante
O movimento do carrinho do ponte e do carro provoca vibrações na viga principal e nas câmaras. Vibrações de baixa frequência (2~10Hz) podem causar imagens desfocadas e oscilação na detecção. Os suportes das câmaras devem usar bases de amortecimento (camada de borracha natural com 10mm de espessura). No lado do algoritmo, configurar filtragem IOU entre frames: quando o deslocamento da caixa de detecção entre frames adjacentes excede o limiar de pixels, esta é marcada como falso positivo e descartada.

④ Latência de rede — o gargalo crítico em soluções sem fios
Se for utilizado Wi-Fi industrial para transmitir o fluxo de vídeo para a sala de controlo central para inferência centralizada, a latência de ponta a ponta pode atingir 100~200ms, o que não cumpre os requisitos em tempo real para interligações de segurança. Solução: realizar a inferência na extremidade da ponte rolante (localmente com Jetson), enviando apenas os resultados de detecção em JSON (cerca de 200 bytes/frame) e imagens de alarme (JPEG comprimido <50KB) para a sala de controlo — esta abordagem está alinhada com o design da camada de computação de borda na arquitetura de quatro camadas do sistema de controle da ponte rolante. O impacto da rede é minimizado.

Perguntas Frequentes

P: Quais são as vantagens da monitorização de segurança com IA visual em comparação com as soluções de segurança tradicionais (grades/barreiras fotoelétricas)?
R: As soluções tradicionais apenas oferecem proteção planar, não distinguem pessoas de objetos, não identificam comportamentos dinâmicos (como o uso de capacete) e não monitorizam a posição da carga. A solução com IA visual permite detetar simultaneamente intrusões de pessoas, uso de capacete e estado da carga, além de fornecer registos fotográficos de infrações e histórico de eventos. Em conformidade com a norma ISO 4301, as áreas de operação da ponte rolante devem dispor de medidas de proteção de segurança, e a solução com IA visual já obteve avaliação de segurança equivalente a SIL2.
P: Como instalar o sistema numa ponte rolante antiga sem interface pré-instalada? Quais são os requisitos específicos para o CLP?
R: É possível. O sistema comunica com o CLP da ponte rolante através do protocolo Modbus TCP. Desde que o CLP suporte o Modbus TCP padrão (as principais marcas como Siemens S7-1200/1500, Mitsubishi FX5U, Inovance AM Series e Delta Electronics DVP Series suportam), a integração pode ser feita sem modificar o programa original do CLP. Na integração, o CLP apenas precisa de abrir uma porta TCP para ler o registrador de alarmes de segurança, sem necessidade de programação adicional. Se a ponte rolante não tiver CLP (modelos antigos com controlador de cames), basta instalar um controlador de borda (Inovance AM401, cerca de €320), sem necessidade de substituir toda a ponte rolante. O período de reforma é de aproximadamente 2 dias.
P: Quantas pontes rolantes pode gerir um único sistema? Qual é o orçamento necessário? É possível reformar pontes rolantes antigas?
R: Um Jetson Orin NX processa simultaneamente 4 fluxos de vídeo 1080P, cobrindo 2 pontes rolantes. O custo por canal é de aproximadamente 4.500 CNY (incluindo câmara + equipamento de edge + instalação e comissionamento), perfazendo um orçamento total de cerca de 18.000 a 25.000 CNY para um sistema de 2 pontes. Para um parque de 10 pontes, a solução envolve 3 unidades Jetson e um servidor central de controlo, com um orçamento total não superior a 80.000 CNY. Considerando que cada ponte evita, em média, um acidente por ano, o investimento é recuperado em menos de dois anos — e, uma vez que a norma ISO 4301 (equivalente à ISO 4301 / FEM 1.001) impõe requisitos claros de monitoramento de segurança para pontes rolantes, uma reforma antecipada é mais vantajosa do que uma inspeção reativa.

Conclusão

A combinação YOLOv8 + Jetson Orin NX reduziu a barreira de engenharia para a monitorização de segurança por visão AI em pontes rolantes a um nível que permite replicação em série. O custo por canal é controlado em menos de 5000 RMB, com latência de identificação <50ms e precisão de identificação >95%, superando já o nível de proteção de segurança de cercas tradicionais combinadas com sensores fotoelétricos. No próximo artigo, abordaremos a aplicação da visão AI no posicionamento automático e na recolha de carga por pontes rolantes — nesse cenário, os requisitos de precisão e latência são uma ordem de grandeza superiores.

Artigos relacionados

contact

contact us

phone:
+86 13903802779

mail:3915269@qq.com

Working hours: Monday to Friday

Wechat
Wechat
SHARE
TOP