Visão IA: Identificação de Cargas com YOLOv8 e Implementação Jetson

Tecnologia central de visão IA: identificação de cargas com YOLOv8 e implementação de edge computing com Jetson. Nos sistemas modernos de ponte rolante inteligente, a visão IA é a tecnologia essencial que permite ao guindaste "compreender" o ambiente de trabalho.

Nos sistemas modernos de ponte rolante inteligente, a visão IA é a tecnologia essencial que permite ao guindaste "compreender" o ambiente de trabalho. A Kelude Indústrias Pesadas desenvolveu, com base no algoritmo de detecção de objetos YOLOv8 e na plataforma de Computação de Borda Jetson Orin, uma stack tecnológica completa de visão IA — desde a seleção de câmeras e o treino de modelos até à implementação em edge computing — que viabiliza capacidades de operação não tripulada em múltiplos cenários, incluindo identificação de cargas, Posicionamento de precisão e Monitoramento de segurança. Este artigo analisa, numa perspetiva de engenharia, toda a cadeia tecnológica da visão IA aplicada a pontes rolantes.

Diagrama da arquitetura tecnológica completa do sistema de visão IA para ponte rolante

Quatro cenários de aplicação da visão IA em pontes rolantes

Os diferentes cenários de aplicação da visão IA em pontes rolantes impõem requisitos distintos de Precisão e tempo real. Ao longo de anos de prática em projetos, a Kelude Indústrias Pesadas consolidou uma Solução Técnica que abrange quatro cenários típicos:

← Deslize a tabela para vê-la completa →
Cenários de AplicaçãoFuncionalidadesPrecisãoTempo RealSolução Recomendada
Carga SuspensaIdentificaçãoIdentificaçãobobina de aço/Tarugo de Aço/Contêiner/Peça de Trabalho±50mm100msYOLOv10n + Jetson Orin NX
Agarre de Precisão/PosicionamentoGuia por VisãoElevação/FixaçãoAlinhamento±5mm50msYOLOv8s + PnPEstimativa de Pose
Zona de SegurançaMonitoramentoDetecçãoInvasão de PessoalÁrea perigosa±200mm200msYOLOv8n + ByteTrackRastreamento
SiderúrgicaAmbiente de Alta TemperaturaTermografiaIdentificaçãoMaterial de Alta Temperatura±2℃30fpsOptris PI 640Termografia

Seleção de Câmeras Industriais e Cálculo de Parâmetros de Lente

A seleção da câmera é a base do sistema de visão para pontes rolantes. A Kelude desenvolveu um processo sistemático de escolha de câmeras, adaptado às necessidades específicas de cada cenário de operação. Para a identificação padrão de cargas, recomenda-se uma câmera industrial de 1,3 megapixels combinada com um sensor de profundidade. Em aplicações que exigem posicionamento preciso para aperto, a solução ideal combina uma câmera colorida de 5 megapixels com uma câmera de luz estruturada 3D.

O cálculo da distância focal é uma etapa crítica na seleção, sendo a fórmula central: f = (sensor_width × working_distance) / FOV. Num cenário típico de captura aérea por ponte rolante, com uma área alvo de 1,5 m de largura e uma distância de trabalho de 8 m, utilizando um sensor IMX265 (sensor_width 7,1 mm), a distância focal calculada é de aproximadamente 38 mm. Na prática, opta-se por lentes de 35 mm ou 50 mm. A distância focal recomendada varia conforme a posição de montagem: para captura aérea (distância de trabalho de 8-15 m), recomenda-se 25-50 mm; para captura lateral, 12-25 mm; e para cenários de aperto a curta distância, 6-12 mm é o ideal.

Para operar em ambientes de alta temperatura, como em siderúrgicas, é necessário utilizar câmeras termográficas com cobertura de proteção e camisa de resfriamento dedicadas. Na Solução Técnica da Kelude, recomenda-se um termovisor com resolução de 640×480, capaz de operar continuamente e de forma estável em temperaturas acima de 95°C, atendendo a requisitos exigentes como a identificação de tarugos e a monitorização de áreas de lingotamento contínuo.

Treino do Modelo YOLOv8 e Estratégias de Aumento de Dados

O treino do modelo YOLOv8 para cenários de pontes rolantes segue uma metodologia de engenharia dedicada. Na aquisição de dados, recomenda-se um mínimo de 500 amostras por categoria, abrangendo diferentes ângulos (80% de captura aérea + 20% de captura lateral), condições de iluminação variadas (dia, noite, contraluz, luz forte) e diferentes estados de operação (vazio, carga total, diferentes tipos de carga). Para a anotação, recomenda-se a ferramenta LabelImg no formato PascalVOC, ou o CVAT para anotação colaborativa online em equipa.

A estratégia de aumento de dados deve ser personalizada para as características da captura aérea. Ao contrário de cenários como condução autónoma, a visão para pontes rolantes não necessita de aumento por rotação em grandes ângulos. O foco deve estar no reforço do aumento Mosaic (para simular cenários de empilhamento desordenado) e no ajuste de brilho (para lidar com as mudanças abruptas de iluminação em siderúrgicas). A configuração de treino padrão da Kelude utiliza o modelo pré-treinado YOLOv8n como ponto de partida, com 200 épocas, tamanho de imagem de entrada de 640×640, taxa de aprendizagem inicial de 0,001, complementado por parâmetros de aumento de espaço de cor HSV adequados.

crane_dataset/ ├── train/images/ # Imagens de Treinamento (*.jpg) ├── train/labels/ # YOLOAnotação de Formato (*.txt) ├── val/images/ # Imagens de Validação ├── val/labels/ └── crane_dataset.yaml

A configuração do conjunto de dados define 6 classes de objetos: steel_coil (bobina de aço), steel_slab (tarugo de aço), container (contêiner), workpiece (peça de trabalho), crane_hook (gancho) e spreader (espalhador), cobrindo os objetos mais comuns nas operações de elevação com pontes rolantes.

Otimização TensorRT e Implementação em Jetson

A implementação em borda é a etapa crucial que leva a visão de IA para pontes rolantes do laboratório para a engenharia real. A Kelude utiliza a série NVIDIA Jetson Orin como plataforma central de Computação de Borda, sendo o Jetson Orin NX a opção preferida, com capacidade de IA de 70-100 TOPS e baixo consumo de energia de 10-25W, satisfazendo os requisitos de inferência em tempo real na maioria dos cenários de pontes rolantes.

O processo de implementação do modelo envolve três etapas técnicas: primeiro, o modelo PyTorch treinado é exportado para um ficheiro de motor TensorRT usando model.export(format="engine"), aproveitando a fusão de camadas, calibração de quantização e otimização de memória do TensorRT para acelerar significativamente a inferência; em seguida, o motor TensorRT é implementado na plataforma Jetson, configurando o DeepStream ou um pipeline de inferência personalizado; finalmente, os resultados da inferência são enviados em tempo real para o sistema de despacho superior via protocolo MQTT, completando o ciclo fechado de deteção, decisão e controlo.

Em termos de desempenho de inferência, diferentes versões do YOLO apresentam diferenças significativas no Jetson Orin NX: o YOLOv8n tem uma velocidade de inferência de cerca de 8 ms, com um modelo de apenas 6,3 MB; enquanto o mais recente YOLOv10n otimiza ainda mais para 7 ms e 5,5 MB, alcançando uma inferência mais rápida com precisão próxima à do YOLOv8s, sendo o modelo preferido da Kelude para implementação em borda.

Transformação de Coordenadas e Princípios de Posicionamento por Guiamento Visual

O objetivo final da identificação visual é traduzir-se em comandos mecânicos precisos, o que envolve uma cadeia completa de transformação de coordenadas de pixel para coordenadas do mundo. O sistema de visão de IA da Kelude utiliza o algoritmo de estimativa de pose PnP (Perspective-n-Point), combinado com os resultados da calibração de parâmetros intrínsecos e extrínsecos da câmera, para converter a caixa delimitadora 2D detetada pelo YOLOv8 em informações de pose 6-DOF (translação X/Y/Z e rotação de pitch/yaw/roll).

Na engenharia prática, após a calibração precisa da posição de montagem da câmera, os resultados da deteção são mapeados através de uma matriz de transformação de coordenadas para comandos de controlo nos três eixos físicos: movimento da ponte (eixo X), movimento do carrinho (eixo Y) e Elevação (eixo Z). A latência de ponta a ponta de todo o processo de guiamento visual é mantida abaixo de 150 ms, cumprindo os requisitos de controlo em tempo real para pontes rolantes não tripuladas de nível L4.

Perguntas Frequentes (FAQ)

P: Como é garantida a precisão de reconhecimento do sistema de visão por IA da ponte rolante em ambiente poeirento?
R: A Kelude Indústrias Pesadas adota uma solução de proteção em múltiplas camadas: a lente é equipada com dispositivo de limpeza por jato de ar e invólucro com Grau de Proteção IP65; a nível de algoritmo, são integrados módulos de pré-processamento para remoção de nevoeiro e realce de contraste, mantendo uma precisão de reconhecimento superior a 90% em ambientes com concentração de poeira ≤10mg/m³. Em conformidade com os requisitos de adaptabilidade ambiental da norma ISO 4301 / FEM 1.001 para especificação de projeto de guindastes.
P: Qual é o mais adequado para pontes rolantes: YOLOv8 ou YOLOv10?
R: Recomendamos o YOLOv10n como primeira escolha. Nos testes comparativos realizados na Kelude, o YOLOv10n apresentou uma velocidade de inferência cerca de 12,5% superior à do YOLOv8n (7ms vs 8ms), um modelo mais compacto (5,5MB vs 6,3MB) e uma melhoria de aproximadamente 1,5 pontos percentuais na precisão mAP. Para cenários que exigem maior precisão, o YOLOv8s é a opção indicada.
P: Como é feita a integração do sistema de visão IA com o sistema de controle PLC existente na ponte rolante?
R: O sistema de visão IA da Kelude envia os resultados da detecção (classe do objeto, coordenadas e nível de confiança) para o gateway de borda através do protocolo MQTT. Após a conversão de protocolo, o gateway escreve os dados no bloco de dados (DB) do PLC Siemens S7-1500 via barramento PROFINET, garantindo a sincronização em tempo real entre a orientação por visão e o controle de movimento.
P: Qual é o período e a precisão exigidos para a calibração da câmara?
R: A Kelude recomenda uma recalibração dos parâmetros intrínsecos da câmara a cada 3 meses, sendo obrigatória uma nova calibração após uma revisão geral ou substituição da lente. A calibração utiliza o método do tabuleiro de xadrez de Zhang Zhengyou, com erro de reprojeção controlado abaixo de 0,3 pixels. A precisão de posicionamento nos eixos X/Y pode atingir ±3 mm (com fusão de dados do encoder).

Artigos relacionados

contact

contact us

phone:
+86 13903802779

mail:3915269@qq.com

Working hours: Monday to Friday

Wechat
Wechat
SHARE
TOP