Seleção de Caixa de Computação de Borda para Ponte Rolante

Parâmetros principais

O dispositivo de Computação de Borda recomendado é o NVIDIA Jetson Orin NX (100 TOPS, 16GB, 15W), com o modelo de deteção de objetos YOLOv8n (quantização TensorRT INT8, latência de inferência de 5 a 12 ms) e o rastreador multi-objetos ByteTrack (2 a 3 ms), a uma taxa de deteção de 30 fps. Cada dispositivo processa simultaneamente 2 a 4 câmaras de IA. Já foram instaladas mais de 50 unidades em fábricas de aço, fábricas de cimento e fábricas de automóveis, com uma precisão de alerta de colisão superior a 97%.

Funcionalidades avançadas como anticolisão por visão de IA em pontes rolantes, rastreamento da trajetória do gancho e deteção de fios rompidos em cabo de aço dependem da Computação de Borda para realizar inferência de IA em tempo real no local. Ao contrário do envio de vídeo para processamento na nuvem, a solução de Computação de Borda executa a inferência localmente na ponte rolante, reduzindo a latência de mais de 500 ms para 5 a 12 ms e eliminando a instabilidade da rede e o gargalo de largura de banda. Este artigo analisa de forma completa a implementação do dispositivo de Computação de Borda para pontes rolantes, desde a seleção de hardware, implantação de modelos e otimização de quantização até a comunicação com o PLC.

Esquema de seleção do dispositivo de Computação de Borda e implantação de inferência de IA para pontes rolantes

Comparativo de hardware para Computação de Borda

Os requisitos essenciais da visão de IA para pontes rolantes em relação ao dispositivo de Computação de Borda são: capacidade de IA ≥ 40 TOPS (INT8), suporte para múltiplas câmaras (≥ 2 entradas MIPI CSI ou USB3.0), faixa de temperatura industrial (-25°C a 70°C) e suporte para protocolos industriais como Profinet e EtherNet/IP. Segue uma comparação abrangente de três dispositivos de Computação de Borda populares no cenário de pontes rolantes —

← Deslize a tabela para vê-la completa →
ParâmetroJetson Orin NX 16GBJetson Orin Nano 8GBRK3588 16GB
AICapacidade de Processamento(INT8)100 TOPS40 TOPS6 TOPS
GPUArquiteturaAmpere 1024Núcleo@918MHzAmpere 512Núcleo@765MHzMali-G610 MP4
Memória/Largura de Banda16GB LPDDR5 68GB/s8GB LPDDR5 34GB/s16GB LPDDR4X 17GB/s
Decodificação de Vídeo2×4K@30 + 4×1080@301×4K@30 + 2×1080@308K@30 + 4K@120
Consumo de Energia15W/25WComutável7W/15WComutável8~15W
Protocolo IndustrialProfinet/Modbus TCP/EIPProfinet/Modbus TCP/EIPModbus TCP
YOLOv8nLatência de Inferência5~8ms (INT8)12~18ms (INT8)80~150ms (FP16)
Preço de Referência¥6,500~7,500¥2,500~3,500¥800~1,200
ponte rolante Nível de Recomendação

Treino do modelo YOLOv8n e quantização TensorRT INT8

O YOLOv8n (versão nano, com 3,2M de parâmetros) é atualmente o modelo de deteção de objetos com o melhor equilíbrio entre precisão e velocidade para cenários de visão artificial em pontes rolantes. Em comparação com o YOLOv8s (11,2M de parâmetros), a velocidade de inferência é 2,5 vezes superior, com uma redução de apenas 1,2% no mAP. O treino utiliza o conjunto de dados anotados acumulado pela Kelude Indústrias Pesadas (120.000 imagens, abrangendo cinco classes de alvos: gancho de ponte rolante, cabo de aço, pessoal, AGV e obstáculos, cobrindo 12 condições de iluminação, incluindo dia, noite, céu nublado e contraluz).

Fluxo de implementação da quantização: Conjunto de calibração de treino FP32 (500 imagens de cenários típicos) → Quantização INT8 PTQ TensorRT → Serialização do motor de inferência (ficheiro .plan). Parâmetros críticos: resolução de entrada 640×640, limiar de confiança 0,5, limiar NMS IoU 0,45. Após a quantização, o modelo reduz de 12,5MB (FP32) para 4,2MB (INT8) (compressão de 66%), e a latência de inferência diminui de 8~12ms (FP16) para 5~8ms (INT8). Os ficheiros de implementação são distribuídos via OTA para a unidade de computação de borda (pacote de atualização incremental de aproximadamente 5MB por envio).

Pipeline de inferência (fluxo de processamento por frame): ① Captura de frame pela câmara (30fps, resize de 1920×1080 para 640×640) ② Inferência TensorRT (YOLOv8n INT8, 5~8ms) ③ Pós-processamento NMS (1~2ms) ④ Rastreamento de objetos ByteTrack (2~3ms, baseado em filtro de Kalman + correspondência húngara) ⑤ Cálculo da distância de colisão (1ms) ⑥ Escrita do resultado na memória partilhada para leitura pelo PLC. A latência total por frame é de 10~14ms, cumprindo os requisitos de deteção em tempo real a 30fps (intervalo de 33ms por frame, com 19~23ms restantes para lógica de nível superior).

Diagrama do pipeline de inferência YOLOv8n+ByteTrack

Rastreamento multiobjeto ByteTrack e cálculo de distância de colisão

O YOLOv8n fornece apenas deteção de objetos em frames individuais (caixa delimitadora + classe + confiança), sem capacidade de rastrear a trajetória contínua de movimento dos objetos. O algoritmo ByteTrack, com base nos resultados da deteção, prevê a posição de cada objeto no frame seguinte através do filtro de Kalman e, em seguida, utiliza o algoritmo húngaro para corresponder os resultados da deteção às trajetórias existentes. Vantagem do ByteTrack em relação ao DeepSORT: dispensa a extração de características ReID (eliminando a sobrecarga adicional de inferência CNN), sendo adequado para implementação em dispositivos de borda com capacidade computacional limitada.

Cálculo da distância de colisão: Após o rastreamento de trajetórias obter a posição em tempo real e o vetor de velocidade de cada equipamento (gancho de ponte rolante, AGV, pessoal), calcula-se a distância de aproximação mais próxima (DCPA, Closest Point of Approach) e o tempo de aproximação mais próxima (TCPA) entre cada par. Fórmula: DCPA = |d × (v_rel)| / |v_rel|, onde d é a diferença dos vetores de posição entre dois objetos e v_rel é o vetor de velocidade relativa. O alerta é acionado quando DCPA < limiar de segurança (ponte rolante-ponte rolante 1,5m, ponte rolante-pessoa 2,0m) ou TCPA < 2 segundos. O cálculo de colisão é executado a cada frame, e o resultado é escrito no bloco de dados de memória partilhada (64 bytes, contendo ID do objeto, distância, velocidade, grau de risco) entre a unidade de borda e o PLC.


Configuração do protocolo de comunicação entre unidade de borda e PLC

A unidade de computação de borda troca dados com o PLC da ponte rolante (S7-1200/1500) via Profinet ou Modbus TCP. Recomendação: a unidade de borda (Jetson Orin NX) executa a pilha de protocolo Profinet slave (PROFINET Stack for Linux da Siemens + configuração da placa de rede como RT Class 1, com ciclo de comunicação de 4ms), e no lado do PLC, a unidade de borda é adicionada como Profinet IO Device na configuração de hardware. Bloco de troca de dados (Input/Output de 64 bytes cada): Input (unidade de borda → PLC) contém grau de risco de colisão (0~3), distância do objeto (mm), velocidade recomendada (% do nominal), estado do sistema; Output (PLC → unidade de borda) contém coordenadas atuais da ponte rolante, velocidade e modo de operação. Redundância de comunicação: se a conexão Profinet for interrompida por mais de 3 ciclos (12ms), o PLC alterna automaticamente para o modo de intertravamento básico sem assistência de IA, e a falha da unidade de borda não afeta a operação básica da ponte rolante.


Validação da implementação e indicadores de desempenho

A Kelude Indústrias Pesadas concluiu a implementação de unidades de computação de borda em 12 pontes rolantes no vão de lingotamento contínuo de uma siderúrgica. Antes da implementação, o alerta de colisão dependia de inspeção visual manual, com latência de resposta de 3~5 segundos. Após a implementação, os indicadores-chave: mAP@0.5 de deteção de objetos = 0,953 (média das cinco classes), latência média de inferência por frame de 6,8ms (INT8), latência de alerta de colisão ponta a ponta ≤50ms (desde a captura do frame pela câmara até o acionamento do alerta no PLC), e MTBF de operação contínua sem falhas ≥10.000 horas (aproximadamente 14 meses). Nas estatísticas dos 6 meses após a implementação, os eventos de risco de colisão diminuíram de uma média diária de 23 para 0,4 (os restantes são manobras de emergência devido a entrada súbita de pessoal), e a pontuação de satisfação dos operadores aumentou de 62 para 91. A Kelude Indústrias Pesadas oferece um serviço completo, desde a seleção de hardware, treino de modelos até a implementação no local, com um custo de reforma de computação de borda por ponte rolante de aproximadamente 1,5~2,5 milhões de CNY (incluindo unidade de borda + câmaras + instalação e comissionamento).


Comparação de desempenho de inferência de IA: FP16 vs quantização INT8

FP32
Bruto Precisão 12.5MB
Latência de Inferência 18~25ms
m AP 0.953(Máximo)
ponte rolante Não Recomendado para o Cenário
FP16
Meio Precisão 6.3MB
Latência de Inferência 8~12ms
m AP 0.951(-0.2%)
Nano Recomendação de Versão
INT8
Quantização 4.2MB
Latência de Inferência 5~8ms
m AP 0.948(-0.5%)
NXRecomendação de Versão

Perguntas Frequentes (FAQ)

P: O poder de computação do RK3588 é insuficiente; por que não usá-lo para visão de IA?

R: O NPU do RK3588 oferece apenas 6 TOPS, executando inferência FP16 do YOLOv8n com latência de 80~150ms, incapaz de atender à detecção em tempo real de 30fps (intervalo de 33ms por quadro). Se a taxa de quadros for reduzida para 10fps (latência de 100ms aceitável), o intervalo de detecção para alvos em movimento rápido (como um AGV a 1m/s, movendo 100mm por quadro) torna-se excessivo, degradando significativamente a precisão do alerta de colisão. Portanto, o RK3588 é adequado apenas como gateway de aquisição de dados, não sendo recomendado para inferência de IA em tempo real. A Kelude recomenda, no mínimo, o Jetson Orin Nano (40 TOPS), que oferece o melhor custo-benefício.

P: Quais configurações são necessárias para a comunicação Profinet entre o edge box e o PLC?

R: São necessários três passos: ① Instalar a pilha de protocolo Profinet no sistema Linux do edge box (recomendamos o SDK PROFINET IO-Device da Siemens ou o pnio_stack de código aberto), configurando o nome do dispositivo e o endereço IP; ② No PLC (TIA Portal), em Dispositivos e Redes, adicionar o edge box como IO Device Profinet, atribuindo endereços IO (64 bytes de Entrada/Saída cada); ③ Implementar funções de leitura/escrita de dados IO na aplicação do edge box, escrevendo os resultados da inferência de IA na área de Entrada e lendo o estado do PLC na área de Saída. A configuração inicial leva cerca de 1 dia. A Kelude fornece uma imagem de comunicação Profinet pré-configurada, permitindo implantação imediata sem configuração adicional.

P: Quantos dados são necessários para o treinamento do modelo? Qual precisão pode ser alcançada?

R: A Kelude recomenda, para o primeiro treinamento, ≥20.000 imagens anotadas (≥4.000 por classe), cobrindo condições típicas como dia/noite, céu limpo/nublado e contraluz. O mAP@0.5 pode atingir 0,93~0,96. A anotação de dados utiliza a ferramenta LabelImg (anotação por caixa delimitadora, ~30 segundos por imagem). A Kelude já possui um conjunto de dados base anotado com 120.000 imagens de cenários de ponte rolante. Novos clientes podem ajustar o modelo base com 500~1.000 imagens do seu próprio cenário (Fine-tune), concluindo a adaptação em 2~3 dias, com mAP estável acima de 0,90.

P: O edge box pode operar de forma estável em siderúrgicas/fábricas de cimento com alta temperatura e poeira?

R: A versão industrial do Jetson Orin NX (Jetson Orin NX Industrial) suporta temperatura ampla de -40°C a 85°C, com dissipador de calor padrão e ventoinha de refrigeração ativa. Em aciarias (temperatura ambiente de 45~55°C, concentração de poeira ~5mg/m³), mais de 50 unidades já foram implantadas, operando continuamente por 12 meses sem desligamento por superaquecimento. O edge box é instalado em um armário de proteção IP54 (com ventilador de refrigeração e filtro de poeira), com temperatura da GPU medida estável entre 65~72°C. A Kelude oferece a opção de armário à prova de poeira e alta temperatura (incluindo resfriamento por ar forçado e monitoramento de temperatura), ao preço de 800R$/unidade.

Artigos relacionados

contact

contact us

phone:
+86 13903802779

mail:3915269@qq.com

Working hours: Monday to Friday

Wechat
Wechat
SHARE
TOP