Visão IA: Identificação de Cargas com YOLOv8 e Implementação Jetson
Tecnologia central de visão IA: identificação de cargas com YOLOv8 e implementação de edge computing com Jetson. Nos sistemas modernos de ponte rolante inteligente, a visão IA é a tecnologia essencial que permite ao guindaste "compreender" o ambiente de trabalho.
Nos sistemas modernos de ponte rolante inteligente, a visão IA é a tecnologia essencial que permite ao guindaste "compreender" o ambiente de trabalho. A Kelude Indústrias Pesadas desenvolveu, com base no algoritmo de detecção de objetos YOLOv8 e na plataforma de Computação de Borda Jetson Orin, uma stack tecnológica completa de visão IA — desde a seleção de câmeras e o treino de modelos até à implementação em edge computing — que viabiliza capacidades de operação não tripulada em múltiplos cenários, incluindo identificação de cargas, Posicionamento de precisão e Monitoramento de segurança. Este artigo analisa, numa perspetiva de engenharia, toda a cadeia tecnológica da visão IA aplicada a pontes rolantes.
Quatro cenários de aplicação da visão IA em pontes rolantes
Os diferentes cenários de aplicação da visão IA em pontes rolantes impõem requisitos distintos de Precisão e tempo real. Ao longo de anos de prática em projetos, a Kelude Indústrias Pesadas consolidou uma Solução Técnica que abrange quatro cenários típicos:
| Cenários de Aplicação | Funcionalidades | Precisão | Tempo Real | Solução Recomendada |
|---|---|---|---|---|
| Carga SuspensaIdentificação | Identificaçãobobina de aço/Tarugo de Aço/Contêiner/Peça de Trabalho | ±50mm | 100ms | YOLOv10n + Jetson Orin NX |
| Agarre de Precisão/Posicionamento | Guia por VisãoElevação/FixaçãoAlinhamento | ±5mm | 50ms | YOLOv8s + PnPEstimativa de Pose |
| Zona de SegurançaMonitoramento | DetecçãoInvasão de PessoalÁrea perigosa | ±200mm | 200ms | YOLOv8n + ByteTrackRastreamento |
| SiderúrgicaAmbiente de Alta Temperatura | TermografiaIdentificaçãoMaterial de Alta Temperatura | ±2℃ | 30fps | Optris PI 640Termografia |
Seleção de Câmeras Industriais e Cálculo de Parâmetros de Lente
A seleção da câmera é a base do sistema de visão para pontes rolantes. A Kelude desenvolveu um processo sistemático de escolha de câmeras, adaptado às necessidades específicas de cada cenário de operação. Para a identificação padrão de cargas, recomenda-se uma câmera industrial de 1,3 megapixels combinada com um sensor de profundidade. Em aplicações que exigem posicionamento preciso para aperto, a solução ideal combina uma câmera colorida de 5 megapixels com uma câmera de luz estruturada 3D.
O cálculo da distância focal é uma etapa crítica na seleção, sendo a fórmula central: f = (sensor_width × working_distance) / FOV. Num cenário típico de captura aérea por ponte rolante, com uma área alvo de 1,5 m de largura e uma distância de trabalho de 8 m, utilizando um sensor IMX265 (sensor_width 7,1 mm), a distância focal calculada é de aproximadamente 38 mm. Na prática, opta-se por lentes de 35 mm ou 50 mm. A distância focal recomendada varia conforme a posição de montagem: para captura aérea (distância de trabalho de 8-15 m), recomenda-se 25-50 mm; para captura lateral, 12-25 mm; e para cenários de aperto a curta distância, 6-12 mm é o ideal.
Para operar em ambientes de alta temperatura, como em siderúrgicas, é necessário utilizar câmeras termográficas com cobertura de proteção e camisa de resfriamento dedicadas. Na Solução Técnica da Kelude, recomenda-se um termovisor com resolução de 640×480, capaz de operar continuamente e de forma estável em temperaturas acima de 95°C, atendendo a requisitos exigentes como a identificação de tarugos e a monitorização de áreas de lingotamento contínuo.
Treino do Modelo YOLOv8 e Estratégias de Aumento de Dados
O treino do modelo YOLOv8 para cenários de pontes rolantes segue uma metodologia de engenharia dedicada. Na aquisição de dados, recomenda-se um mínimo de 500 amostras por categoria, abrangendo diferentes ângulos (80% de captura aérea + 20% de captura lateral), condições de iluminação variadas (dia, noite, contraluz, luz forte) e diferentes estados de operação (vazio, carga total, diferentes tipos de carga). Para a anotação, recomenda-se a ferramenta LabelImg no formato PascalVOC, ou o CVAT para anotação colaborativa online em equipa.
A estratégia de aumento de dados deve ser personalizada para as características da captura aérea. Ao contrário de cenários como condução autónoma, a visão para pontes rolantes não necessita de aumento por rotação em grandes ângulos. O foco deve estar no reforço do aumento Mosaic (para simular cenários de empilhamento desordenado) e no ajuste de brilho (para lidar com as mudanças abruptas de iluminação em siderúrgicas). A configuração de treino padrão da Kelude utiliza o modelo pré-treinado YOLOv8n como ponto de partida, com 200 épocas, tamanho de imagem de entrada de 640×640, taxa de aprendizagem inicial de 0,001, complementado por parâmetros de aumento de espaço de cor HSV adequados.
crane_dataset/ ├── train/images/ # Imagens de Treinamento (*.jpg) ├── train/labels/ # YOLOAnotação de Formato (*.txt) ├── val/images/ # Imagens de Validação ├── val/labels/ └── crane_dataset.yaml
A configuração do conjunto de dados define 6 classes de objetos: steel_coil (bobina de aço), steel_slab (tarugo de aço), container (contêiner), workpiece (peça de trabalho), crane_hook (gancho) e spreader (espalhador), cobrindo os objetos mais comuns nas operações de elevação com pontes rolantes.
Otimização TensorRT e Implementação em Jetson
A implementação em borda é a etapa crucial que leva a visão de IA para pontes rolantes do laboratório para a engenharia real. A Kelude utiliza a série NVIDIA Jetson Orin como plataforma central de Computação de Borda, sendo o Jetson Orin NX a opção preferida, com capacidade de IA de 70-100 TOPS e baixo consumo de energia de 10-25W, satisfazendo os requisitos de inferência em tempo real na maioria dos cenários de pontes rolantes.
O processo de implementação do modelo envolve três etapas técnicas: primeiro, o modelo PyTorch treinado é exportado para um ficheiro de motor TensorRT usando model.export(format="engine"), aproveitando a fusão de camadas, calibração de quantização e otimização de memória do TensorRT para acelerar significativamente a inferência; em seguida, o motor TensorRT é implementado na plataforma Jetson, configurando o DeepStream ou um pipeline de inferência personalizado; finalmente, os resultados da inferência são enviados em tempo real para o sistema de despacho superior via protocolo MQTT, completando o ciclo fechado de deteção, decisão e controlo.
Em termos de desempenho de inferência, diferentes versões do YOLO apresentam diferenças significativas no Jetson Orin NX: o YOLOv8n tem uma velocidade de inferência de cerca de 8 ms, com um modelo de apenas 6,3 MB; enquanto o mais recente YOLOv10n otimiza ainda mais para 7 ms e 5,5 MB, alcançando uma inferência mais rápida com precisão próxima à do YOLOv8s, sendo o modelo preferido da Kelude para implementação em borda.
Transformação de Coordenadas e Princípios de Posicionamento por Guiamento Visual
O objetivo final da identificação visual é traduzir-se em comandos mecânicos precisos, o que envolve uma cadeia completa de transformação de coordenadas de pixel para coordenadas do mundo. O sistema de visão de IA da Kelude utiliza o algoritmo de estimativa de pose PnP (Perspective-n-Point), combinado com os resultados da calibração de parâmetros intrínsecos e extrínsecos da câmera, para converter a caixa delimitadora 2D detetada pelo YOLOv8 em informações de pose 6-DOF (translação X/Y/Z e rotação de pitch/yaw/roll).
Na engenharia prática, após a calibração precisa da posição de montagem da câmera, os resultados da deteção são mapeados através de uma matriz de transformação de coordenadas para comandos de controlo nos três eixos físicos: movimento da ponte (eixo X), movimento do carrinho (eixo Y) e Elevação (eixo Z). A latência de ponta a ponta de todo o processo de guiamento visual é mantida abaixo de 150 ms, cumprindo os requisitos de controlo em tempo real para pontes rolantes não tripuladas de nível L4.