Treino e teste de algoritmo de visão IA para guindastes
Plataforma de treino e teste do algoritmo de visão IA para guindastes concluída, com mais de 500 mil imagens anotadas de defeitos industriais acumuladas. A Kelude Indústrias Pesadas concluiu a plataforma de treino e teste do algoritmo de visão IA para guindastes, acumulando mais de 500 mil imagens anotadas de defeitos industriais, fornecendo uma base sólida de dados para a iteração contínua do sistema de monitoramento de segurança visual para guindastes.
A Kelude Indústrias Pesadas concluiu a plataforma de treino e teste do algoritmo de visão IA para guindastes, acumulando mais de 500 mil imagens anotadas de defeitos industriais, o que constitui uma base sólida de dados para a evolução contínua do sistema de monitoramento de segurança visual para guindastes. A plataforma integra aquisição de dados, gestão de anotações, treinamento do modelo, avaliação de desempenho e testes hardware-in-the-loop, sendo a primeira infraestrutura dedicada de treino e validação para algoritmos de visão IA na indústria de guindastes do país.
Posicionamento da plataforma e contexto de desenvolvimento
O desempenho dos algoritmos de visão IA depende fortemente da qualidade e da escala dos dados de treino. Quando a Kelude Indústrias Pesadas iniciou o desenvolvimento de visão IA em 2023, a empresa reconheceu que a falta de conjuntos de dados anotados específicos do setor era o principal gargalo para a implementação da tecnologia de visão IA em guindastes. Conjuntos de dados genéricos como COCO e ImageNet têm eficácia limitada em contextos industriais; poeira, variações de iluminação, oclusões e vibrações nas fábricas fazem com que a precisão de detecção dos modelos genéricos caia drasticamente na implementação real. Para tal, a empresa investiu mais de 300 mil euros na construção de uma plataforma dedicada de treino e teste de algoritmos de visão IA, iniciando a aquisição sistemática de dados no terreno e a anotação manual em setembro de 2023. Ao longo de 22 meses, a plataforma foi concluída e foram acumuladas 500 mil imagens anotadas.
Sistema de aquisição de dados
A aquisição de dados cobre quatro condições de iluminação — diurna, noturna, crepuscular e amanhecer — e quatro condições meteorológicas — céu limpo, nublado, chuva e nevoeiro. O equipamento de aquisição inclui 8 câmeras industriais de 5 megapixels fixadas na parte inferior da Viga Principal do guindaste e uma câmera móvel de monitoramento instalada lateralmente à área de içamento e transporte. As câmeras utilizam sensor de obturador global, taxa de quadros de 25fps e suportam modo HDR de ampla faixa dinâmica. A plataforma de anotação suporta quatro tipos de anotação — caixa delimitadora, polígono, ponto-chave e segmentação semântica — atendendo aos requisitos de três tarefas: deteção (deteção de objetos), segmentação (segmentação de defeitos) e localização (localização de pontos-chave). A gestão de anotações implementa um processo de controlo de qualidade em três níveis: anotação inicial pelo anotador, revisão pelo líder da equipa e amostragem pelo pessoal de algoritmos, com uma proporção de amostragem não inferior a 20% e uma precisão de anotação exigida superior a 97%.
Composição do conjunto de dados
As 500 mil imagens anotadas estão divididas em cinco grandes categorias de acordo com a tarefa de deteção. O conjunto de dados de detecção de intrusão de pessoas contém 250 mil imagens, com quatro subcategorias de anotação: pessoas visíveis com capacete, pessoas não visíveis com capacete, pessoas sem capacete e pessoas que se aproximam fora da área de trabalho, abrangendo quatro posturas — caminhar, agachar, inclinar e operar — e três intervalos de distância: longe (altura do pixel <50px), médio (50~150px) e perto (>150px). O conjunto de dados de deteção de cargas suspensas contém 120 mil imagens, com categorias de anotação que incluem bobinas de aço (horizontais e verticais), Chapas de Aço (planas e inclinadas), componentes de equipamento (caixas e estruturas) e materiais a granel (pilhas e formas irregulares), cobrindo as características visuais das cargas sob diferentes tipos de Spreader (espalhador de elevação) (Cabo de Aço, Cinta de Elevação, Eletroímã de elevação) e diferentes configurações de carga. O conjunto de dados de deteção de defeitos em Cordão de Solda contém 80 mil imagens, com cinco categorias de defeitos: Trinca, falta de penetração, Porosidade, Inclusão de Escória e Mordedura. As fontes de dados incluem amostras padrão fotografadas em laboratório e fotografias de Cordão de Solda em ambiente fabril, sendo cada imagem validada por análise metalográfica para confirmar a autenticidade do defeito. O conjunto de dados de Inspeção de Cabos contém 30 mil imagens, com cinco categorias de anomalias: ruptura de fio, Desgaste, Corrosão, Deformação e redução do Diâmetro do cabo. O conjunto de dados de deteção de anomalias no Trilho contém 20 mil imagens, com três categorias: desalinhamento do trilho, Trinca no Trilho e objetos estranhos no Trilho.
Treinamento do modelo e iteração
A plataforma de treino dispõe de dois ambientes de treino independentes. O ambiente de treino online é baseado em 4 GPUs NVIDIA RTX 4090, suporta os dois frameworks PyTorch e TensorFlow e utiliza gestão de contentores Docker para implantação rápida de tarefas de treino e isolamento de recursos. O ambiente de treino offline está equipado com 2 GPUs NVIDIA A100 80GB, destinadas à aceleração do treino de modelos de grande dimensão e conjuntos de dados em larga escala. A plataforma inclui um pipeline automatizado de treino que suporta a gestão do processo completo, desde o gerenciamento de versões de dados, pesquisa de hiperparâmetros, treinamento do modelo, avaliação comparativa até ao registo do modelo. O treinamento do modelo baseia-se na arquitetura YOLOv8, com aumento de dados Mosaic, cálculo adaptativo de âncoras e função de perda CIoU. Após múltiplas rondas de treino iterativo com as 500 mil imagens, o mAP da detecção de intrusão de pessoas aumentou de 67,3% para 92,3%, o mAP da deteção de cargas suspensas atingiu 89,1% e o mAP da deteção de defeitos em Cordão de Solda atingiu 91,5%.
Instalações de testes e verificação
Além das funções de treino, a plataforma inclui instalações de testes hardware-in-the-loop. O equipamento de teste é composto por uma ponte rolante experimental de 5 toneladas, um sistema programável de simulação ambiental e um sistema de aquisição e análise de dados. A ponte rolante experimental está instalada numa oficina de testes interior, com Vão de 12 metros e Altura de Elevação de 6 metros, suportando modos de operação manual e automático. O sistema programável de simulação ambiental permite o controlo simulado de parâmetros ambientais como iluminação (ajustável de 0 a 50000 lux), temperatura e humidade (temperatura de -10°C a 50°C, humidade de 20% a 90% RH) e concentração de poeiras (ajustável de 0 a 10 mg/m³). O sistema de aquisição e análise de dados regista sincronizadamente os resultados de saída da visão IA, os dados de posição do Encoder e os parâmetros ambientais, gerando um relatório de avaliação abrangente para cada quadro. Os testes hardware-in-the-loop permitem validar o desempenho dos algoritmos de visão IA em condições extremas de operação sob condições experimentais controladas, fornecendo uma base laboratorial fiável para a avaliação da estabilidade do algoritmo antes da implementação no equipamento.
Segurança de dados e privacidade
Os conjuntos de dados de visão industrial podem envolver informações sobre a disposição da linha de produção e a configuração de equipamentos das fábricas dos clientes; a gestão de segurança dos dados é uma consideração importante na construção da plataforma. Todos os dados brutos recolhidos são armazenados em matrizes NAS locais da empresa, com capacidade total de 200TB e configuração de redundância RAID6. O acesso aos dados é gerido por níveis de permissão, divididos em três graus: acesso a dados brutos, acesso a dados anotados e acesso a dados de modelo. Todas as operações de acesso são registadas no registro de auditoria. Na colaboração com equipas externas de anotação, são adotadas estratégias de anonimização e anotação por blocos: cada bloco contém apenas um único cenário, sem características identificáveis da fábrica. Após a conclusão da anotação, o pessoal interno da empresa procede à consolidação e ao controlo de qualidade dos dados. A partilha de dados com o laboratório conjunto da Universidade de Zhengzhou segue o acordo de utilização de dados assinado por ambas as partes, limitando-se a fins de análise académica; é proibida a utilização dos dados noutros projetos comerciais dentro do laboratório.
Plano de desenvolvimento
A Kelude Indústrias Pesadas planeia expandir a escala dos dados anotados para 1 milhão de imagens até 2027, com foco no reforço de casos extremos em condições meteorológicas adversas e de baixa luminosidade, de modo a resolver o problema da distribuição de cauda longa dos modelos em condições extremas de operação. Simultaneamente, será iniciada a construção de conjuntos de dados de séries temporais, acumulando dados anotados de quadros contínuos para o treino de modelos de reconhecimento de comportamento em vídeo e previsão de trajetórias. Cada anotação temporal inclui sequências contínuas de deteção com não menos de 300 quadros. A plataforma disponibilizará também parte dos dados anonimizados para colaboração em investigação académica, promovendo o estabelecimento de normas de referência no domínio da visão IA para guindastes.
Perguntas frequentes (FAQ)
P: Qual é a diferença entre a plataforma de treino de visão IA da Kelude e as plataformas genéricas de treino de IA?
R: As plataformas genéricas de treino de IA destinam-se principalmente a setores maduros como condução autónoma e videovigilância, com conjuntos de dados baseados em cenas públicas e cenários genéricos. A plataforma da Kelude é a primeira plataforma dedicada de treino de visão IA para guindastes no setor. Os conjuntos de dados provêm exclusivamente de cenários de operação real dos equipamentos da própria empresa em instalações de clientes, cobrindo as condições de operação específicas das oficinas de içamento e transporte em fábricas. As categorias de anotação e a configuração das tarefas de deteção são totalmente adaptadas às necessidades de monitoramento de segurança e deteção de defeitos em guindastes, incluindo cinco conjuntos de dados dedicados: intrusão de pessoas, identificação de cargas suspensas, Cabo de Aço, Cordão de Solda e Trilho. Os algoritmos de treino foram otimizados com projeto leve para cenários de inferência industrial; na implementação, o número de parâmetros do modelo é mantido abaixo de 5MB, permitindo inferência em tempo real em dispositivos de Computação de Borda Jetson Orin NX.
P: Qual é o prazo e o custo real para obter 500.000 imagens anotadas?
R: O processo decorreu entre setembro de 2023 e julho de 2025, num total de 22 meses. A aquisição de dados envolveu 8 câmeras industriais e custos de instalação e implantação de aproximadamente 280.000 CNY. A gestão de anotação contou com uma equipa de 15 anotadores em período de pico e 8 em período normal, totalizando cerca de 1.800.000 CNY em custos de mão de obra. O investimento em hardware de plataforma (servidores GPU, armazenamento NAS e bancadas de teste) foi de aproximadamente 950.000 CNY. A capacidade de produção diária de anotação por pessoa é de cerca de 120 imagens (cenários simples) a 40 imagens (cenários complexos), resultando num custo médio de anotação de aproximadamente 3,6 CNY por imagem.
P: A plataforma suporta atualizações incrementais de dados?
R: Sim. O módulo de gestão de dados da plataforma utiliza DVC (Data Version Control) para implementar o gerenciamento de versões e atualizações incrementais dos conjuntos de dados. Os dados recém-adquiridos, após passarem no controle de qualidade, são automaticamente integrados na versão seguinte do conjunto de dados correspondente, sem afetar os resultados de inferência dos modelos já implantados. Os engenheiros de treinamento podem selecionar versões específicas dos dados conforme a necessidade de iteração dos algoritmos, e o sistema suporta avaliação comparativa de rollback entre diferentes versões. Atualmente, o número da versão do conjunto de dados da plataforma já atingiu V2.8, com 18 atualizações incrementais acumuladas.
P: Qual é a capacidade de generalização e adaptabilidade entre cenários do conjunto de dados?
R: O conjunto de dados foi concebido com uma diversidade deliberada entre fábricas, com a fonte de dados a abranger 18 locais de clientes em quatro setores: fabricação automóvel, siderurgia e metalurgia, logística e armazenagem, e maquinário. Dentro da mesma fábrica, foram recolhidas imagens de diferentes áreas operacionais (como zona de matérias-primas, zona de produtos acabados e zona de manutenção), em diferentes períodos do dia e estações do ano. Os testes entre cenários demonstram que, ao implantar em fábricas não incluídas no treino, a Descida do mAP para a detecção de intrusão de pessoas é controlada em menos de 5 pontos percentuais, e a Descida do mAP para a detecção de cargas suspensas é controlada em menos de 8 pontos percentuais. A próxima fase prevê a expansão do conjunto de dados com mais dados diversificados de outros setores e fábricas, de modo a reforçar ainda mais a capacidade de generalização do modelo.