Identificação Visual e Posicionamento de Precisão para Ponte Rolante

Sistema de identificação visual e posicionamento de precisão para cargas de ponte rolante: prática de engenharia com deteção de cargas YOLOv8 e posicionamento por visão guiada. O sistema de identificação visual e posicionamento de precisão para cargas de ponte rolante baseia-se no algoritmo de deteção de objetos YOLOv8 e em tecnologia de visão guiada, resolvendo problemas tradicionais como oscilação da carga, posicionamento impreciso e zonas de sombra na operação de pontes rolantes. É adequado para necessidades de movimentação automatizada em ambientes de Indústria 4.0 e Manufatura Inteligente.

Em oficinas modernas de metalurgia, construção naval e fabrico de equipamentos pesados, a ponte rolante é responsável pela movimentação e posicionamento de bobinas de aço, chapas de aço, equipamentos de grande porte e moldes. A operação tradicional depende da experiência visual do operador e da comunicação verbal com o pessoal de solo, resultando em baixa precisão de posicionamento, estrangulamentos de eficiência evidentes e riscos de segurança devido a zonas de sombra. Com o avanço da Indústria 4.0 e da Manufatura Inteligente, as tecnologias de identificação visual e posicionamento baseadas em aprendizagem profunda estão a revolucionar as operações de movimentação de cargas com pontes rolantes. Este artigo descreve de forma sistemática a arquitetura de engenharia, o percurso de implementação e os algoritmos-chave de um sistema de identificação visual e posicionamento de precisão para cargas baseado em YOLOv8, fornecendo uma referência técnica completa para a atualização inteligente de pontes rolantes.

Arquitetura do sistema de identificação visual e posicionamento de precisão para cargas de ponte rolante

Arquitetura geral do sistema de posicionamento visual

O sistema de identificação visual e posicionamento de precisão para cargas de ponte rolante adota uma arquitetura de quatro camadas: camada de perceção, camada de inferência, camada de conversão e camada de controlo, interligadas por Ethernet de alta velocidade e barramento de campo industrial, formando um circuito de controlo de malha fechada.

Camada de perceção é a porta de entrada de dados do sistema. Uma câmera industrial de matriz de área, instalada sob a viga principal da ponte rolante, captura imagens em tempo real da zona de carga. A câmera é um modelo industrial Hikvision ou Basler, com resolução normalmente entre 5 e 12 megapíxeis, complementada por iluminação LED estroboscópica para superar variações de luz e interferência de sombras na oficina. Os dados de imagem são transmitidos através de interface Gigabit Ethernet (protocolo GigE Vision) para o nó de computação de borda, garantindo transmissão estável a alta taxa de fotogramas (até 60 fps). O hardware da camada de perceção está alojado num invólucro de liga de alumínio com grau de proteção IP67, adequado para ambientes com poeira intensa, altas temperaturas e interferência eletromagnética em oficinas metalúrgicas.

Camada de inferência tem como núcleo a plataforma de computação NVIDIA Jetson Orin NX, onde é executado o modelo de deteção de objetos YOLOv8. Este módulo oferece até 100 TOPS de potência de computação de IA, permitindo inferência em imagens de 1920×1080 em 15 ms, cumprindo os requisitos de tempo real. A camada de inferência recebe o fluxo de imagens brutas da camada de perceção e produz coordenadas de caixas delimitadoras, etiquetas de classificação e pontuações de confiança para cada objeto detetado no sistema de coordenadas da imagem. Paralelamente, a camada de inferência executa algoritmos de pré-processamento de imagem, incluindo equalização de histograma, ajuste de contraste adaptativo e recorte de regiões de interesse (ROI), para melhorar a robustez da deteção em condições de iluminação complexas.

Camada de conversão executa o algoritmo central de transformação de coordenadas. Utilizando a matriz de parâmetros intrínsecos da câmera e a matriz de transformação de perspetiva previamente calibradas, as coordenadas de píxeis da camada de inferência são mapeadas para coordenadas do sistema de coordenadas mundial no plano do solo (em mm). A camada de conversão também realiza correção de translação e rotação do sistema de coordenadas, eliminando distorções de projeção causadas pelo ângulo e altura de montagem da câmera. O cálculo da transformação de coordenadas utiliza interpolação bilinear e otimização de nível subpíxel, garantindo precisão de conversão adequada aos requisitos de posicionamento industrial.

Camada de controlo envia as coordenadas calculadas da posição da carga e o desvio de alinhamento do equipamento ao PLC do sistema de controle da ponte rolante (série Siemens S7-1200/1500) através de gateway de Ethernet industrial PROFINET. Após receber os dados de desvio, o PLC gera comandos de movimento para o carrinho do ponte, o carro e o mecanismo de elevação com base no algoritmo de controlo de malha fechada de posição predefinido, realizando alinhamento automático e colocação de precisão. A camada de controlo também trata a troca de dados com o sistema MES e o Sistema de Monitoramento de Segurança, enviando resultados de posicionamento e estado do equipamento em tempo real para a plataforma de gestão ao nível da oficina.

A vantagem da arquitetura de quatro camadas reside na clara separação de módulos e na padronização de interfaces. A atualização ou substituição de qualquer camada (como versão do modelo ou ajuste de parâmetros da câmera) não afeta o funcionamento das restantes camadas, reduzindo significativamente a complexidade de manutenção e iteração do sistema. A latência de processamento de ponta a ponta do sistema é mantida abaixo de 100 ms, satisfazendo os requisitos de controlo em tempo real para operação a baixa velocidade (≤20 m/min) da ponte rolante.

Segue-se uma tabela comparativa dos modelos de câmeras industriais compatíveis com o sistema, para referência na seleção:

Modelo Resolução Interface Grau de Proteção (IP) Aplicação típica
Hikvision MV-CA050-10GM 5 MP GigE Vision IP67 Deteção de bobinas de aço e chapas de aço
Basler acA2500-14gm 5 MP GigE Vision IP67 Posicionamento de precisão em ambientes com poeira
Hikvision MV-CA013-20GM 1,3 MP GigE Vision IP67 Deteção de moldes e equipamentos de grande porte
Basler acA1920-40gm 2,3 MP GigE Vision IP67 Monitoramento de área de carga em tempo real
Item de parâmetro Hikvision MV-CA050-10GC Basler acA5472-17gc Daheng MER-502-79U3C
resolução 2448×2048(5MP) 5472×3648(20MP) 2592×1944(5MP)
Taxa de quadros 60fps 17fps 79fps
Sensor Sony IMX264 CMOS 1/1.8" Sony IMX183 CMOS 1/1.2" Sony IMX264 CMOS 1/1.8"
Interface GigE / PoE GigE / PoE USB3.0
Grau de Proteção (IP) IP67 IP40(Proteção necessária) IP30(Proteção necessária)
Temperatura de operação -30℃~65℃ 0℃~50℃ 0℃~60℃
Cenário recomendado Metalurgia/FundiçãoAlta temperaturaOficina Altura de peças grandesPrecisãoPosicionamento Linha de montagemAgarramento dinâmico em alta velocidade

2. Deteção e classificação de objetos suspensos

A deteção precisa e a classificação detalhada de objetos suspensos constituem a etapa fundamental de todo o sistema de posicionamento visual. O sistema adota o YOLOv8 (variante Ultralytics YOLOv8s) como modelo de deteção principal, submetido a aprendizagem por transferência num conjunto de dados próprio de objetos suspensos, permitindo a identificação em tempo real de quatro tipos principais de cargas.

Definição das classes de deteção (Hook_Load): O sistema agrupa os objetos suspensos numa categoria geral Hook_Load, subdividida em quatro subclasses — Steel_Coil (bobina de aço), Steel_Plate (chapa de aço), Equipment (equipamento) e Mold (molde). As bobinas de aço apresentam forma predominantemente cilíndrica, com superfície frequentemente marcada por corrosão e textura de cintas de amarração. As chapas de aço são superfícies metálicas planas e extensas, com forte reflexo e arestas cortantes. Os equipamentos referem-se a componentes mecânicos de grande porte (como estruturas de laminadores ou carcaças de redutores), de contorno irregular mas com características bem definidas. Os moldes distinguem-se por contornos de cavidade precisos e pinos de guia. As quatro classes diferem significativamente em dimensão, forma e textura superficial, exigindo do modelo uma forte capacidade de discriminação interclasses.

Construção do conjunto de dados e anotação: A equipa do projeto recolheu imagens reais em múltiplas oficinas metalúrgicas e de maquinário pesado, abrangendo diversas condições de iluminação — céu limpo, céu nublado e iluminação artificial noturna — bem como diferentes posturas da carga: plena, vazia e com desequilíbrio. Foram recolhidas mais de 12.000 imagens brutas, das quais 8.500 amostras válidas foram retidas após triagem de qualidade. A anotação das classes e das caixas delimitadoras foi realizada individualmente com a ferramenta LabelImg no formato COCO, com a especificação de que a caixa delimitadora deve ajustar-se ao contorno real do objeto suspenso, com margem residual não superior a 5 pixels. Durante a anotação, deu-se especial atenção a cenários de oclusão severa (como empilhamento de bobinas) e de pequenos objetos (como moldes à distância), garantindo a capacidade de generalização do modelo de deteção.

Estratégia de aumento de dados: Para melhorar o desempenho de generalização e a robustez a interferências, o pipeline de treino integra um conjunto abrangente de estratégias de aumento de dados: (1) Aumento Mosaic — combinação aleatória de quatro imagens de treino numa única, forçando o modelo a aprender representações de características em contextos complexos, com efeitos notáveis em objetos pequenos e cenários de oclusão; (2) Aumento MixUp — mistura de duas imagens e respetivos rótulos numa proporção aleatória, introduzindo combinações adicionais de objetos; (3) Perturbação no espaço de cor HSV — ajuste aleatório do tom (H), saturação (S) e valor (V) dentro de ±30°, ±50% e ±50%, respetivamente, simulando variações de iluminação e temperatura de cor na oficina; (4) Escalonamento e recorte aleatórios — simulação de variações no campo de visão a diferentes alturas de trabalho da câmara; (5) Ruído gaussiano e desfoque de movimento — simulação do ruído do sensor da câmara industrial e do efeito de arrasto em imagens durante movimentos rápidos da carga. Após o aumento, o número equivalente de amostras de treino expandiu para aproximadamente 60.000 imagens.

Treino e implementação do modelo: O treino baseia-se nos pesos pré-treinados do YOLOv8s, com imagens de entrada de 640×640, utilizando o otimizador AdamW, taxa de aprendizagem inicial de 0,001, agendamento de taxa de aprendizagem por recozimento de cosseno e um total de 300 épocas. O treino foi concluído numa única GPU NVIDIA RTX 4090, com duração aproximada de 18 horas. Os resultados da avaliação no conjunto de validação (1.000 amostras independentes) são: mAP@0.5 de 0,962, mAP@0.5:0.95 de 0,738 e velocidade de inferência por frame de 12 a 18 ms no Jetson Orin NX (após otimização TensorRT FP16). As caixas de deteção são emitidas no formato (x_center, y_center, width, height), normalizadas no intervalo [0,1], e convertidas pelo módulo de pós-processamento em coordenadas de pixel da imagem original para utilização na camada de transformação de coordenadas.

3. Calibração da câmara e transformação de coordenadas

A conversão precisa das coordenadas de pixel fornecidas pelo modelo de deteção em coordenadas mundiais no plano do solo constitui o núcleo técnico do posicionamento por visão. O sistema adota um "método de calibração em duas etapas" — primeiro, a calibração dos parâmetros intrínsecos da câmara para corrigir a distorção da lente; em seguida, a calibração dos parâmetros extrínsecos para estabelecer a correspondência entre pixels e o plano do solo, culminando na transformação de coordenadas a nível subpixel através da matriz de transformação de perspetiva.

Etapa 1
Método de calibração planar
Calibração dos parâmetros intrínsecos
R: Calibração Intrínseca
Padrão de calibração: Padrão xadrez cerâmico 12×9, quadrados de 30mm (±0,01mm)
Número de imagens: 20 a 30 (em diferentes ângulos)
Algoritmo: OpenCV cv2.calibrateCamera
Saída: Matriz intrínseca K(fx,fy,cx,cy) + coeficientes de distorção (k1,k2,p1,p2,k3)
Erro de reprojeção: ≤0,15 pixels
Tipo de distorção: Distorção em barril, desvio máximo de 8 a 15 pixels nas bordas
Etapa 2
PnP + DLT
Calibração extrínseca e transformação de perspetiva
R: Extrínseca e Transformação de Perspetiva
Objetivo: Determinar a matriz de rotação R + vetor de translação T
Pontos de calibração: ≥4 pontos de referência conhecidos (Xw,Yw,0) (alvos diagonais ou padrão xadrez no chão)
Algoritmo: PnP para parâmetros extrínsecos; DLT para derivar a matriz de transformação de perspetiva H
Utilização prática: 8 a 12 pontos uniformemente distribuídos, ajuste por mínimos quadrados
Fórmula central: λ·[Xw,Yw,1]^T = H·[u,v,1]^T
Graus de liberdade: A matriz H tem 8 graus de liberdade
Etapa 3
Validação de precisão
Controlo da precisão da transformação de coordenadas
R: Controlo de precisão
Medição dos pontos de calibração: Sensor de Distância a Laser + estação total, erro ±1mm
Extração de pixels: deteção de cantos subpixel (cv2.cornerSubPix), nível de 0,1 pixel
Altura da câmara: 6~12m
Campo de visão: 8m×6m
Erro médio global: 3,2mm
Erro máximo: ≤8mm
Precisão satisfeita: precisão de repetição de posicionamento de ±5mm

O processo de calibração em três etapas (validação da precisão dos parâmetros intrínsecos e extrínsecos) estabelece a cadeia de mapeamento completa entre as coordenadas de pixel e as coordenadas mundiais do plano do solo, com um erro médio global de 3,2mm, cumprindo o requisito de precisão de repetição de posicionamento de ±5mm.

É importante salientar que, quando a câmara sofre um ligeiro deslocamento da sua posição de montagem devido à vibração da ponte rolante em funcionamento, os parâmetros de calibração sofrem deriva. O sistema foi concebido com um esquema de calibração automática periódica — utilizando marcadores de referência de Código QR fixados no plano do solo, a validação e o ajuste fino dos parâmetros extrínsecos são executados automaticamente a cada arranque do sistema ou após cada 2 horas de operação, garantindo a estabilidade e fiabilidade da precisão da transformação de coordenadas durante a operação de longo prazo. Esta solução cumpre os requisitos de manutenção de precisão do sistema de posicionamento definidos na norma JB/T 1306-2018 para Pontes Monoviga Elétricas e na norma ISO 4301 / FEM 1.001 para especificações de projeto de guindastes.

Estratégia de alinhamento por visão guiada

O alinhamento por visão guiada é o objetivo de controlo final de todo o sistema, abrangendo o Controle de Malha Fechada completo, desde a identificação da carga até à execução do posicionamento. O sistema integra perceção visual, mapeamento de coordenadas, cálculo de desvios e controlo de movimento PLC numa estratégia de controlo unificada, permitindo o alinhamento automático e preciso da carga suspensa da ponte rolante.

Processo de alinhamento: O processo global está dividido em cinco fases. (1) Identificação e bloqueio da carga — o modelo YOLOv8 deteta em tempo real o tipo de carga suspensa e emite a caixa delimitadora; o sistema bloqueia o alvo com base no ponto central da caixa e no resultado da classificação, gerando simultaneamente uma região de interesse (ROI) de rastreamento dinâmico em torno do alvo, reduzindo o volume de dados de imagem para processamento subsequente. (2) Mapeamento de coordenadas — as coordenadas de pixel (u, v) do ponto central da caixa delimitadora são convertidas em coordenadas mundiais do plano do solo (X_load, Y_load) através da matriz de transformação de perspetiva. Se existir um marco auxiliar de Código QR/identificação sob o alvo, as coordenadas mundiais precisas do marco (X_mark, Y_mark) são também lidas. (3) Cálculo do desvio de alinhamento — calcula-se o desvio entre a posição atual da carga e a posição alvo (centro da zona de colocação ou posição do marco): ΔX = X_target - X_load, ΔY = Y_target - Y_load, bem como o desvio angular Δθ (para peças alongadas que requerem orientação específica). (4) Controle de Malha Fechada PLC — o desvio é enviado ao PLC através do gateway PROFINET; o Controlador PID integrado no PLC utiliza o desvio como entrada e em

Artigos relacionados

contact

contact us

phone:
+86 13903802779

mail:3915269@qq.com

Working hours: Monday to Friday

Wechat
Wechat
SHARE
TOP