Test et entraînement d'algorithmes de vision IA pour grues
Plateforme d'entraînement et de test d'algorithmes de vision IA pour grues : plus de 500 000 images industrielles annotées. Kelude Industries Lourdes a mis en service sa plateforme dédiée à l'entraînement et au test d'algorithmes de vision IA pour grues, accumulant plus de 500 000 images industrielles annotées de défauts. Cette base de données constitue un socle solide pour l'amélioration continue de son système de surveillance de sécurité visuelle.
Kelude Industries Lourdes a développé une plateforme d'entraînement et de test d'algorithmes de vision IA pour grues, avec un corpus de plus de 500 000 images industrielles annotées de défauts. Cette infrastructure, qui intègre l'acquisition de données, la gestion des annotations, l'entraînement des modèles, l'évaluation des performances et les essais matériel-dans-la-boucle, constitue la première installation spécialisée de ce type dans le secteur de la grue en Chine.
Positionnement et contexte de la plateforme
Les performances des algorithmes de vision IA dépendent fortement de la qualité et de l'échelle des données d'entraînement. Dès le lancement de ses travaux de recherche en vision IA en 2023, Kelude Industries Lourdes a identifié le manque de jeux de données annotés spécifiques au secteur comme un frein majeur au déploiement de cette technologie sur les grues. Les jeux de données génériques tels que COCO ou ImageNet se transfèrent mal aux environnements industriels : poussière, variations d'éclairage, occultations et vibrations sur site entraînent une dégradation significative de la précision de détection des modèles génériques. C'est pourquoi l'entreprise a investi plus de 300 000 EUR dans la construction d'une plateforme dédiée d'entraînement et de test, avec un lancement systématique de l'acquisition de données terrain et de l'annotation manuelle à partir de septembre 2023. La plateforme a été achevée en 22 mois, avec un corpus de 500 000 images annotées.
Système d'acquisition de données
L'acquisition couvre quatre conditions d'éclairage (jour, nuit, aube, crépuscule) et quatre conditions météorologiques (ciel clair, couvert, pluie, brouillard). Le parc d'équipements comprend 8 caméras industrielles de 5 mégapixels fixées sous la poutre principale de la grue et une caméra mobile de surveillance positionnée latéralement à la zone de levage. Les caméras sont équipées de capteurs à obturateur global, avec une cadence d'images de 25 fps et un mode HDR grand dynamique. La plateforme d'annotation prend en charge quatre types d'annotations — boîte englobante, polygone, point clé et segmentation sémantique — couvrant les besoins des tâches de détection (détection d'objets), de segmentation (segmentation de défauts) et de localisation (localisation de points clés). Un processus de contrôle qualité à trois niveaux est appliqué : annotation initiale par l'annotateur, relecture par le chef d'équipe et échantillonnage par les ingénieurs algorithmes. Le taux d'échantillonnage est d'au moins 20 %, et la précision d'annotation exigée est supérieure à 97 %.
Composition du jeu de données
Les 500 000 images annotées sont réparties en cinq grandes catégories selon la tâche de détection. Le jeu de données de détection d'intrusion de personnel comprend 250 000 images, avec quatre sous-classes : personnel visible avec casque, personnel visible sans casque, personnel sans casque et personnel approchant hors zone de travail. Il couvre quatre postures (marche, accroupi, penché, opération) et trois plages de distance : plan lointain (hauteur de pixel 150 px). Le jeu de données de détection de charge suspendue comprend 120 000 images, avec des classes incluant les bobines d'acier (horizontales et verticales), les tôles d'acier (à plat et inclinées), les composants d'équipement (caisses et châssis) et les matières en vrac (tas et formes irrégulières), couvrant les caractéristiques visuelles de la charge sous différents types d'élingage (câble métallique, élingue, électroaimant de levage) et différentes configurations de charge. Le jeu de données de détection de défauts de cordon de soudure comprend 80 000 images, avec cinq classes de défauts : fissure, manque de pénétration, soufflure, inclusion de laitier et caniveau. Les données proviennent d'échantillons normalisés photographiés en laboratoire et de photos de soudures prises en atelier ; chaque image est validée par analyse métallographique pour confirmer la présence réelle du défaut. Le jeu de données d'inspection de câbles métalliques comprend 30 000 images, avec cinq classes d'anomalies : rupture de fil, usure, corrosion, déformation et réduction du diamètre du câble. Enfin, le jeu de données de détection d'anomalies de rail comprend 20 000 images, avec trois classes : désalignement du rail, fissure du rail et corps étranger sur le rail.
Entraînement et itération des modèles
La plateforme d'entraînement dispose de deux environnements indépendants. L'environnement en ligne est basé sur 4 GPU NVIDIA RTX 4090, prend en charge les frameworks PyTorch et TensorFlow, et utilise la conteneurisation Docker pour un déploiement rapide des tâches et l'isolation des ressources. L'environnement hors ligne est équipé de 2 GPU NVIDIA A100 80 Go pour accélérer l'entraînement des grands modèles et des grands jeux de données. La plateforme intègre un pipeline d'entraînement automatisé couvrant l'ensemble du processus : gestion de versions des données, recherche d'hyperparamètres, entraînement du modèle, comparaison des évaluations et enregistrement du modèle. L'entraînement s'appuie sur l'architecture YOLOv8, avec augmentation de données Mosaic, calcul adaptatif des ancres et fonction de perte CIoU. Après plusieurs cycles d'itération sur les 500 000 images, la mAP de la détection d'intrusion de personnel est passée de 67,3 % à 92,3 %, celle de la détection de charge suspendue atteint 89,1 % et celle de la détection de défauts de cordon de soudure 91,5 %.
Installations d'essais et de vérification
En complément de la fonction d'entraînement, la plateforme est dotée d'une installation d'essais matériel-dans-la-boucle. Le banc d'essai se compose d'un pont roulant expérimental de 5 t, d'un système programmable de simulation environnementale et d'un système d'acquisition et d'analyse de données. Le pont roulant est installé dans l'atelier d'essai intérieur, avec une portée de 12 m et une hauteur de levage de 6 m, et prend en charge les modes de fonctionnement manuel et automatique. Le système de simulation environnementale permet de contrôler l'éclairage (0 à 50 000 lux), la température et l'humidité (température de −10 °C à 50 °C, humidité de 20 % à 90 % HR) ainsi que la concentration de poussière (0 à 10 mg/m³). Le système d'acquisition et d'analyse de données enregistre de manière synchrone les sorties visuelles de l'IA, les données de position des codeurs et les paramètres environnementaux, et génère un rapport d'évaluation complet pour chaque image. Les essais matériel-dans-la-boucle permettent de valider les performances des algorithmes de vision IA dans des conditions d'exploitation extrêmes contrôlées, fournissant ainsi une base de laboratoire fiable pour l'évaluation de la stabilité des algorithmes avant leur déploiement sur les grues.
Sécurité des données et confidentialité
Les jeux de données de vision industrielle peuvent révéler des informations sensibles sur l'agencement des lignes de production et la configuration des équipements des clients. La gestion de la sécurité des données est donc une considération essentielle de la plateforme. Toutes les données brutes collectées sont stockées sur un stockage NAS local, d'une capacité totale de 200 To, configuré en RAID6 pour la redondance. L'accès aux données est soumis à un contrôle hiérarchique à trois niveaux : accès aux données brutes, accès aux données annotées et accès aux données de modèle. Toutes les opérations d'accès sont consignées dans un journal d'audit. Pour la collaboration avec des équipes d'annotation externes, une stratégie de dé-identification et d'annotation par blocs est appliquée : chaque bloc ne contient qu'un seul segment de scène, sans caractéristiques identifiables de l'usine. Après annotation, les données sont consolidées et vérifiées en interne. Le partage de données avec le laboratoire commun de l'Université de Zhengzhou est régi par un accord d'utilisation des données signé par les deux parties, limité à des fins de recherche académique ; toute utilisation à des fins commerciales est strictement interdite au sein du laboratoire.
Feuille de route de développement
Kelude Industries Lourdes prévoit de porter le volume de données annotées à 1 million d'images d'ici 2027, en mettant l'accent sur les cas limites dans des conditions météorologiques difficiles et de faible luminosité, afin de résoudre le problème de la distribution à longue traîne des modèles dans des conditions d'exploitation extrêmes. Parallèlement, la construction d'un jeu de données de séries temporelles sera lancée pour accumuler des séquences d'images annotées en continu, destinées à l'entraînement de modèles de reconnaissance d'actions vidéo et de prédiction de trajectoires. Chaque annotation temporelle comprendra une séquence de détection continue d'au moins 300 images. La plateforme prévoit également d'ouvrir une partie des données dé-identifiées à des fins de collaboration de recherche académique, afin de contribuer à l'établissement de normes de référence dans le domaine de la vision IA pour grues.
Questions fréquentes (FAQ)
Q : Quelle est la différence entre la plateforme d'entraînement en vision IA de Kelude et les plateformes d'IA génériques ?
A : Les plateformes d'IA génériques sont principalement destinées à des domaines matures comme la conduite autonome ou la vidéosurveillance, avec des jeux de données basés sur des scènes de rue publiques et des environnements généraux. La plateforme de Kelude est la première infrastructure d'entraînement en vision IA spécifiquement dédiée aux grues. Son jeu de données provient exclusivement de scénarios d'exploitation réels des équipements de l'entreprise chez ses clients, couvrant les conditions de service particulières des ateliers de levage. Les catégories d'annotation et la configuration des tâches de détection sont entièrement adaptées aux besoins de surveillance de sécurité et de détection de défauts des grues, avec cinq jeux de données spécialisés : intrusion de personnel, identification de charge, câbles métalliques, cordons de soudure et rails. Les algorithmes d'entraînement sont optimisés pour l'inférence industrielle avec une conception allégée : le nombre de paramètres du modèle est limité à 5 Mo, ce qui permet une inférence en temps réel sur un dispositif d'informatique en périphérie Jetson Orin NX.
Q : Quel est le délai et le coût d'acquisition des 500 000 images annotées ?
A : Le projet a démarré en septembre 2023 et s'est achevé en juillet 2025, soit une durée de 22 mois. L'acquisition de données a mobilisé 8 caméras industrielles et des frais d'installation et de déploiement d'environ 280 000 CNY. L'annotation a nécessité une équipe de 15 personnes en période de pointe et de 8 personnes en période normale, pour un coût de main-d'œuvre cumulé d'environ 1,8 million CNY. L'investissement en équipements matériels de la plateforme (serveurs GPU, stockage NAS, outillages de test) s'élève à environ 950 000 CNY. La capacité de production quotidienne par annotateur est d'environ 120 images (scénarios simples) à 40 images (scénarios complexes), avec un coût moyen d'annotation d'environ 3,6 CNY par image.
Q : La plateforme prend-elle en charge les mises à jour incrémentales des données ?
A : Oui. Le module de gestion des données de la plateforme s'appuie sur DVC (Data Version Control) pour assurer la gestion de versions et les mises à jour incrémentales des ensembles de données. Les données nouvellement acquises, après validation qualité, sont automatiquement fusionnées dans la version suivante de l'ensemble de données correspondant. Chaque mise à jour n'affecte pas les résultats d'inférence des modèles déjà déployés. Les ingénieurs d'entraînement peuvent sélectionner une version de données spécifique pour l'entraînement en fonction des besoins d'itération des algorithmes, et peuvent effectuer des évaluations comparatives de rollback des modèles entre différentes versions de données. Le numéro de version actuel des données de la plateforme a été itéré jusqu'à V2.8, avec 18 mises à jour incrémentales cumulées.
Q : Quelle est la capacité de généralisation et l'adaptabilité inter-environnements de l'ensemble de données ?
A : La conception de l'ensemble de données a intégré une diversité inter-usines. Les sources de données couvrent 18 sites clients répartis dans quatre secteurs : construction automobile, sidérurgie, logistique et entreposage, et usinage mécanique. Au sein d'une même usine, des images ont été collectées dans différentes zones d'exploitation (zones de matières premières, de produits finis, de maintenance), à différents moments de la journée et en différentes saisons. Les tests inter-environnements montrent que, lors d'un déploiement sur un site non inclus dans l'entraînement, la Descente du mAP pour la détection d'intrusion de personnel est limitée à moins de 5 points de pourcentage, et celle pour la détection de charge suspendue à moins de 8 points de pourcentage. L'étape suivante prévoit d'enrichir l'ensemble de données avec des données diversifiées provenant d'un plus grand nombre de secteurs et d'usines afin d'améliorer encore la capacité de généralisation des modèles.