Detecção de Carga e Pessoas com IA para Ponte Rolante YOLOv8
Câmera industrial + edge computing Jetson para monitoramento de segurança com IA em pontes rolantes — deteção em tempo real do estado da carga, identificação de intrusão de pessoas, substituindo as soluções tradicionais de barreiras físicas.
No monitoramento de segurança de pontes rolantes, o maior risco não é a falha do equipamento, mas sim a presença de pessoas na área de operação enquanto a máquina continua em movimento — as soluções tradicionais, baseadas em barreiras físicas e sensores fotoelétricos, apresentam muitos pontos cegos, falsos alarmes e custos de manutenção elevados. Nos últimos dois anos, o uso de IA visual para segurança evoluiu de "funcional" para "eficaz": uma câmera industrial combinada com um dispositivo de computação de borda Jetson permite detetar em tempo real o estado da carga, identificar a intrusão de pessoas e verificar o uso de capacete de segurança, com uma precisão de reconhecimento superior a 98% e um custo por canal inferior a 5000 CNY.
Arquitetura do sistema de monitoramento com IA visual
O sistema de monitoramento de segurança com IA visual está estruturado em quatro camadas lógicas, desacopladas entre si através de protocolos padrão (MQTT/RESTful API/RTSP), suportando implementação em cascata para uma única ponte rolante ou para múltiplas pontes em toda a oficina.
1.1 Camada de perceção
A camada de perceção é composta por câmeras industriais instaladas sob a viga principal da ponte rolante e no carro no carro, responsáveis pela captura de fluxos de vídeo em tempo real da área de carga, dos corredores laterais ao longo do trilho e das zonas de trabalho dos operadores. As câmeras ligam-se ao nó de computação de borda através de cabo PoE ou WiFi industrial, transmitindo vídeo H.265 comprimido a 1080P@30fps.
1.2 Camada de algoritmos
A camada de algoritmos opera no dispositivo de computação de borda (NVIDIA Jetson Orin NX), executando o modelo YOLOv8 para inferência de deteção de objetos — anteriormente publicámos um artigo sobre deteção visual com IA do cordão de solda em pontes rolantes, que aborda igualmente a implementação do YOLO neste contexto. Os resultados da deteção incluem: posição e caixa delimitadora de pessoas, estado do uso de capacete, tipo de carga e área de movimentação, e estado das linhas de advertência. A latência de inferência é mantida abaixo de 30ms, cumprindo os requisitos de monitoramento em tempo real.
1.3 Camada de aplicação
A camada de aplicação converte os resultados da camada de algoritmos em lógica de decisão de segurança: a intrusão de pessoas na zona de perigo da ponte rolante aciona o alarme sonoro e visual e a desaceleração do movimento; quando a área de carga está desocupada, é permitida a operação a velocidade total; a ausência de capacete é registada como infração, com captura de fotografia para arquivo. Esta camada também gere a interação com o PLC da ponte rolante, transmitindo sinais de segurança ao módulo de segurança do PLC através dos protocolos Modbus TCP ou Profinet.
1.4 Camada de apresentação
A camada de apresentação disponibiliza um painel de monitoramento via Web e notificações de alarme para telefone celular, exibindo em tempo real as imagens de deteção, registos de alarme, estado operacional e estatísticas de cada ponte rolante. Os dados são armazenados numa base de dados SQLite local, com histórico consultável de 90 dias.
| Nível | PrincipalComponente | Protocolo de Comunicação | Local de Implantação |
|---|---|---|---|
| Camada de Percepção | câmera industrial,Luz de Preenchimento,Encoder | RTSP / GigE Vision | ponte rolanteEletrocalha/CarroAbaixo |
| Camada de Algoritmos | Jetson Orin NX,YOLOv8Modelo | TensorRTMotor de Inferência | quadro elétrico da ponte rolanteInterno |
| Camada de Aplicação | Motor de Lógica de Segurança,PLCInterfaceMódulo | Modbus TCP / Profinet | Nó de Borda / Gabinete do PLC da ponte rolante |
| Camada de Exibição | WebPainel de Grande Formato,telefone celularTerminal,Banco de Dados | MQTT / RESTful API | Sala de Controle Central da oficina / servidor em nuvem |
Seleção do modelo YOLOv8 e comparação de desempenho
O YOLOv8 é um framework de detecção de objetos em tempo real lançado pela Ultralytics em 2023, oferecendo cinco modelos pré-treinados em escala N/S/M/L/X, que vão desde versões leves até alta precisão para atender a diferentes cenários de implantação. No contexto de monitoramento de segurança de pontes rolantes, a escolha do modelo exige um equilíbrio entre velocidade de inferência, precisão de detecção e custo de hardware.
| Modelo | ParâmetroQuantidade | mAP50 | FP16Latência(ms) | INT8Latência(ms) | Hardware Recomendado |
|---|---|---|---|---|---|
| YOLOv8n | 3.2M | 37.3 | 4.5 | 2.1 | Jetson Nano |
| YOLOv8s | 11.2M | 44.9 | 8.7 | 3.8 | Jetson Orin Nano |
| YOLOv8m | 25.9M | 50.2 | 16.1 | 7.2 | Jetson Orin NX |
| YOLOv8l | 43.7M | 52.9 | 26.4 | 12.3 | Jetson Orin NX |
| YOLOv8x | 68.2M | 53.9 | 44.8 | 21.5 | Jetson Orin AGX |
Recomendação: combinação YOLOv8m + Jetson Orin NX. Após quantização INT8, a latência de inferência é de 7,2 ms; um único dispositivo de computação de borda processa simultaneamente 4 fluxos de vídeo 1080P, com latência total inferior a 30 ms, cumprindo os requisitos de tempo real do monitoramento de segurança de pontes rolantes. Custo por canal: cerca de 4.500 CNY.
Comparativo de Hardware para Computação de Borda
A escolha do dispositivo de computação de borda determina o desempenho de inferência e o custo de implantação do sistema. Segue a comparação de três abordagens principais no contexto de monitoramento de segurança de pontes rolantes:
| Parâmetro | Jetson Orin NX | Jetson Orin Nano | computador industrial(i5+Placa de Vídeo Dedicada) |
|---|---|---|---|
| AICapacidade de Processamento(TOPS) | 100 | 40 | 20~30 |
| Consumo de Energia(W) | 15~25 | 7~15 | 65~150 |
| Número de Canais Simultâneos | 4Canal1080P | 2Canal1080P | 2~4Canal1080P |
| Temperatura de Operação(℃) | -25~80 | -25~80 | 0~50 |
| Custo por Canal(RMB) | ~4,500 | ~3,000 | ~6,000 |
| Método de Instalação | trilho DIN no quadro elétrico da ponte rolante DIN | quadro elétrico da ponte rolanteDINTrilho DIN | Requer caixa de controle separada |
O Jetson Orin NX supera as soluções com computador industrial em capacidade de processamento, consumo energético, resistência à temperatura e facilidade de instalação, sendo atualmente a melhor escolha para implementação de IA visual de ponta em pontes rolantes.

Identificação de Carga Suspensa em Pontes Rolantes
A identificação de carga suspensa é uma das funções centrais da IA visual em pontes rolantes. O sistema deve reconhecer diversos tipos de carga — bobinas de aço, tarugos, chapas de aço, moldes, contêineres — e acompanhar continuamente a sua posição durante o movimento. Integrada à plataforma de monitoramento remoto IoT para pontes rolantes, esta função permite um ciclo completo de dados, desde a identificação e o rastreamento até a armazenagem da carga.
4.1 Aquisição e Anotação de Dados
Recomenda-se a recolha de 5000 a 10000 imagens no local, abrangendo diferentes condições de iluminação (diurna, noturna, contraluz), diferentes posturas da carga suspensa (oscilação frontal, oscilação lateral, rotação) e diferentes cenários de fundo (limpo, desordenado, com obstruções). A anotação segue o formato YOLO, com cada imagem a incluir a caixa delimitadora da carga e a respetiva etiqueta de classe. Com ferramentas como LabelImg ou CVAT, a eficiência de anotação é de aproximadamente 100 imagens por hora por pessoa.
4.2 Parâmetros de Treino do Modelo
# YOLOv8m Configuração de Treinamento(parâmetros-chave) model = YOLO('yolov8m.pt') results = model.train( data='crane_dataset.yaml', epochs=200, imgsz=640, batch=16, lr0=0.01, lrf=0.01, optimizer='AdamW', augment=True, hsv_h=0.015, # Realce de Matiz hsv_s=0.7, # Realce de Saturação hsv_v=0.4, # Realce de Brilho degrees=5.0, # Realce de Rotação(Carga suspensa com leve inclinação em cenário de ponte rolante) translate=0.1, scale=0.5, fliplr=0.5, mosaic=1.0, mixup=0.3, )
O treino numa NVIDIA RTX 4090 demora cerca de 4 a 6 horas, com mAP50 a atingir 92 a 95%. Após o treino, o modelo é exportado para o formato ONNX e posteriormente convertido para um motor INT8 com TensorRT para implementação na periferia.
4.3 Implementação com TensorRT
# TensorRT INT8 Comando de Implantação Quantizada trtexec --onnx=yolov8m_crane.onnx \\\\ --saveEngine=yolov8m_crane_int8.engine \\\\ --int8 \\\\ --calib=crane_calib_data \\\\ --buildOnly \\\\ --workspace=4096
Após a quantização INT8, o tamanho do modelo é reduzido de 52MB para 15MB, a velocidade de inferência diminui de 16ms (FP16) para 7ms, e o controle de perda de precisão mantém-se abaixo de 1%.
Detecção de Segurança de Pessoal
A detecção de segurança de pessoal inclui três subfunções: detecção de violação de zona de segurança, detecção de uso de capacete e cerca eletrónica. O sistema executa simultaneamente duas instâncias independentes do modelo YOLOv8 — uma dedicada à detecção do corpo humano e da respetiva caixa delimitadora, e outra focada na região da cabeça para classificar o uso de capacete de segurança.
| Função | DetecçãoObjeto | Acionamento de Alarme | Ação de Intertravamento |
|---|---|---|---|
| Invasão de ÁreaDetecção | Entrada de PessoalZona de Perigo Operacional da ponte rolante | <=1s | Alarme Sonoro e Visual+ponte rolanteDesaceleração30% |
| Capacete de SegurançaDetecção | Uso de Capacete por Trabalhadores | <=2s | Captura de Imagem+Registro de Violação+Alerta por Voz |
| Cerca Eletrônica | Entrada de Pessoal na Área sob a Carga Suspensa | <=0.5s | Parada de elevação+Alarme Sonoro e Visual |
6. Pontos-chave para a implementação em obra
Ao passar do protótipo para a implementação em série do sistema de visão AI para pontes rolantes, existem alguns desafios que vão surgir inevitavelmente. Conhecê-los antecipadamente pode poupar três meses de retrabalho.
① Variação de iluminação — a maior fonte de desvio na distribuição de dados
A iluminação na área de operação da ponte rolante é influenciada por vários fatores, como a orientação do edifício industrial, condições meteorológicas, estação do ano e interruptores de luz. O brilho na mesma cena pode variar até 100 vezes. Solução: utilizar forte aumento de dados durante o treino (parâmetros hsv_h/hsv_s/hsv_v) e complementar com luzes LED (temperatura de cor 5000K, potência superior a 30W) na implementação, garantindo uma iluminação mínima de 10 lux na imagem.
② Obstrução e empilhamento da carga — o ponto cego da detecção por câmara única
Durante o movimento, a carga suspensa pode ficar obstruída por equipamentos circundantes ou outras cargas, afetando a continuidade da detecção. Recomenda-se instalar 2 a 3 câmaras em ângulos diferentes para cobrir a mesma área, fundindo os resultados de detecção multivista através do filtro de Kalman. Quando a detecção é perdida, é tolerada uma extrapolação de previsão de no máximo 5 frames (aproximadamente 170ms@30fps).
③ Vibração e oscilação — interferência mecânica durante a operação da ponte rolante
O movimento do carrinho do ponte e do carro provoca vibrações na viga principal e nas câmaras. Vibrações de baixa frequência (2~10Hz) podem causar imagens desfocadas e oscilação na detecção. Os suportes das câmaras devem usar bases de amortecimento (camada de borracha natural com 10mm de espessura). No lado do algoritmo, configurar filtragem IOU entre frames: quando o deslocamento da caixa de detecção entre frames adjacentes excede o limiar de pixels, esta é marcada como falso positivo e descartada.
④ Latência de rede — o gargalo crítico em soluções sem fios
Se for utilizado Wi-Fi industrial para transmitir o fluxo de vídeo para a sala de controlo central para inferência centralizada, a latência de ponta a ponta pode atingir 100~200ms, o que não cumpre os requisitos em tempo real para interligações de segurança. Solução: realizar a inferência na extremidade da ponte rolante (localmente com Jetson), enviando apenas os resultados de detecção em JSON (cerca de 200 bytes/frame) e imagens de alarme (JPEG comprimido <50KB) para a sala de controlo — esta abordagem está alinhada com o design da camada de computação de borda na arquitetura de quatro camadas do sistema de controle da ponte rolante. O impacto da rede é minimizado.
Perguntas Frequentes
Conclusão
A combinação YOLOv8 + Jetson Orin NX reduziu a barreira de engenharia para a monitorização de segurança por visão AI em pontes rolantes a um nível que permite replicação em série. O custo por canal é controlado em menos de 5000 RMB, com latência de identificação <50ms e precisão de identificação >95%, superando já o nível de proteção de segurança de cercas tradicionais combinadas com sensores fotoelétricos. No próximo artigo, abordaremos a aplicação da visão AI no posicionamento automático e na recolha de carga por pontes rolantes — nesse cenário, os requisitos de precisão e latência são uma ordem de grandeza superiores.