Détection de charge par YOLOv8 et déploiement Jetson en périphérie

Technologie clé de l'IA visuelle : identification des charges suspendues basée sur YOLOv8 et déploiement en périphérie avec Jetson. Dans un système de pont roulant intelligent moderne, l'IA visuelle est la technologie essentielle qui permet à la grue de « comprendre » son environnement de travail.

Dans un système de pont roulant intelligent moderne, l'IA visuelle est la technologie essentielle qui permet à la grue de « comprendre » son environnement de travail. Kelude Industries Lourdes a développé, sur la base de l'algorithme de détection d'objets YOLOv8 et de la plateforme d'informatique en périphérie Jetson Orin, une stack technologique complète d'IA visuelle couvrant la sélection des caméras, l'entraînement des modèles et le déploiement en périphérie. Cette solution permet l'identification des charges suspendues, le positionnement de précision et la surveillance de sécurité dans des scénarios d'exploitation sans personnel. Cet article analyse, d'un point de vue ingénierie, l'ensemble de la chaîne technologique de l'IA visuelle pour ponts roulants.

Schéma de l'architecture technologique complète du système d'IA visuelle pour pont roulant

Quatre scénarios d'application majeurs de l'IA visuelle pour pont roulant

Les différents scénarios d'application de l'IA visuelle pour pont roulant imposent des exigences différenciées en matière de précision et de temps réel. Forte de nombreuses années d'expérience projet, Kelude Industries Lourdes a développé une solution technique couvrant quatre scénarios typiques :

← Faites défiler le tableau →
Scénarios dFonctionnalitésPrécisionTemps réelSolution recommandée
Identification de la charge suspendue Identification de bobine d'acier/brame/conteneur/pièce à usiner±50mm100msYOLOv10n + Jetson Orin NX
Préhension de précision/DéposeGuidage par vision Positionnement de l'élingue/de la fixation±5mm50msYOLOv8s + PnPEstimation de pose
Zone de sécuritéSurveillanceDétection d'intrusion de personnel dans la zone dangereuse±200mm200msYOLOv8n + ByteTrackSuivi
AciérieEnvironnement Haute TempératureIdentification par imagerie thermique de matériaux à haute température±2℃30fpsOptris PI 640Imagerie thermique

2. Sélection de la caméra industrielle et calcul des paramètres optiques

Le choix de la caméra constitue la base du système de vision du pont roulant. Kelude Industries Lourdes a développé une méthodologie de sélection systématique, adaptée aux exigences spécifiques de chaque scénario d'exploitation. Pour la reconnaissance standard de charges, une caméra industrielle de 1,3 mégapixel associée à un capteur de profondeur est recommandée. Pour les opérations de préhension de précision, une caméra couleur de 5 mégapixels couplée à une caméra à lumière structurée 3D s'impose.

Le calcul de la distance focale est une étape déterminante. La formule de base est la suivante : f = (sensor_width × working_distance) / FOV. Pour une prise de vue verticale typique, avec une largeur de zone cible de 1,5 m et une distance de travail de 8 m, un capteur IMX265 (largeur de capteur 7,1 mm) donne une focale d'environ 38 mm. En pratique, on retiendra des objectifs de 35 mm ou 50 mm. La focale recommandée varie selon la position d'installation : 25-50 mm pour une vue plongeante (distance de travail 8-15 m), 12-25 mm pour une prise de vue latérale, et 6-12 mm pour les opérations de préhension à courte distance.

Dans les environnements à haute température des aciéries, l'utilisation d'une caméra thermique est requise, protégée par un carter de protection et une chemise de refroidissement dédiés. La Solution Technique de Kelude Industries Lourdes préconise une caméra thermique avec une résolution de 640×480, garantissant un fonctionnement stable et continu à des températures dépassant 95 °C, pour des applications industrielles exigeantes telles que l'identification des brames et la surveillance des zones de coulée continue.

3. Entraînement du modèle YOLOv8 et stratégies d'augmentation de données

L'entraînement d'un modèle YOLOv8 pour les applications de pont roulant repose sur une méthodologie d'ingénierie dédiée. Pour la collecte de données, il est recommandé de disposer d'au moins 500 échantillons par catégorie, couvrant différents angles (80 % en vue plongeante, 20 % en vue latérale), diverses conditions d'éclairage (jour, nuit, contre-jour, forte luminosité) et différentes conditions de fonctionnement (à vide, en charge, types de charges variés). Pour l'annotation, l'outil LabelImg au format PascalVOC est recommandé, ou CVAT pour une annotation collaborative en ligne.

La stratégie d'augmentation des données doit être adaptée aux spécificités de la vue plongeante du pont roulant. Contrairement aux scénarios de conduite autonome, la vision du pont roulant ne nécessite pas de fortes rotations ; l'accent est mis sur l'augmentation par mélange Mosaic (simulant des empilements désordonnés) et sur le réglage de la luminosité (pour faire face aux variations brutales d'éclairage en aciérie). La configuration standard de Kelude Industries Lourdes utilise le modèle pré-entraîné YOLOv8n comme point de départ, avec 200 époques, des images d'entrée de 640×640, un taux d'apprentissage initial de 0,001 et des paramètres d'augmentation HSV adaptés.

crane_dataset/ ├── train/images/ # Images d'entraînement (*.jpg) ├── train/labels/ # YOLOAnnotation de format (*.txt) ├── val/images/ # Images de validation ├── val/labels/ └── crane_dataset.yaml

La configuration du jeu de données doit définir 6 catégories d'objets : steel_coil (bobine d'acier), steel_slab (brame), container (conteneur), workpiece (pièce), crane_hook (crochet) et spreader (élingue), couvrant les objets les plus couramment identifiés lors des opérations de levage.

4. Optimisation TensorRT et déploiement en périphérie avec Jetson

Le déploiement en périphérie est l'étape cruciale qui fait passer l'IA de vision du pont roulant du laboratoire au terrain. Kelude Industries Lourdes utilise la série NVIDIA Jetson Orin comme plateforme centrale d'Informatique en Périphérie. Le Jetson Orin NX, avec sa puissance de calcul IA de 70 à 100 TOPS et sa faible consommation de 10-25 W, est le choix privilégié pour répondre aux besoins d'inférence en temps réel de la plupart des scénarios de pont roulant.

Le processus de déploiement du modèle comprend trois étapes techniques : tout d'abord, le modèle PyTorch entraîné est exporté en fichier moteur TensorRT via model.export(format="engine"), exploitant les techniques de fusion de couches, d'étalonnage de quantification et d'optimisation mémoire de TensorRT pour accélérer considérablement l'inférence ; ensuite, le moteur TensorRT est déployé sur la plateforme Jetson, avec configuration de DeepStream ou d'un pipeline d'inférence personnalisé ; enfin, les résultats d'inférence sont transmis en temps réel au système de dispatching de niveau supérieur via le protocole MQTT, complétant ainsi la boucle fermée de détection, décision et contrôle.

En termes de performances d'inférence, les différentes versions de YOLO présentent des différences notables sur Jetson Orin NX : YOLOv8n atteint une vitesse d'inférence d'environ 8 ms avec un modèle de seulement 6,3 Mo ; la version plus récente YOLOv10n optimise encore avec 7 ms et 5,5 Mo, offrant une précision comparable à YOLOv8s tout en étant plus rapide. C'est le modèle de prédilection recommandé par Kelude Industries Lourdes pour le déploiement en périphérie.

5. Transformation des coordonnées et principe de positionnement par guidage visuel

L'objectif final de la reconnaissance visuelle est de générer des commandes mécaniques précises, ce qui implique une chaîne complète de transformation des coordonnées, des pixels au repère mondial. Le système d'IA de vision de Kelude Industries Lourdes utilise l'algorithme d'estimation de pose PnP (Perspective-n-Point), combiné aux résultats d'étalonnage intrinsèque et extrinsèque de la caméra, pour convertir les boîtes englobantes 2D détectées par YOLOv8 en informations de pose 6-DOF (translations X/Y/Z et rotations tangage/lacet/roulis).

En conditions réelles, après un étalonnage précis de la position de la caméra, les résultats de détection sont mappés via une matrice de transformation de coordonnées vers les commandes de contrôle des trois axes physiques : déplacement du pont du pont roulant (axe X), déplacement du chariot (axe Y) et levage (axe Z). La latence de bout en bout de l'ensemble du processus de guidage visuel est maintenue sous les 150 ms, répondant aux exigences de contrôle en temps réel d'un pont roulant sans conducteur de niveau L4.

Questions fréquentes (FAQ)

Q : Comment la précision de reconnaissance du système d'IA visuelle pour ponts roulants est-elle garantie en milieu poussiéreux ?
A : Kelude Industries Lourdes déploie une solution de protection multicouche : l'objectif est équipé d'un dispositif anti-poussière à soufflage d'air et d'un boîtier certifié Indice de Protection (IP) IP65. Au niveau algorithmique, un module de prétraitement par débrumage et renforcement de contraste est intégré, permettant de maintenir une précision de reconnaissance supérieure à 90 % même dans un environnement où la concentration de poussières atteint ≤ 10 mg/m³. Cette approche s'appuie sur les exigences d'adaptabilité environnementale de la norme ISO 4301, conformément aux spécifications de conception des grues.
Q : YOLOv8 ou YOLOv10 : lequel est le plus adapté aux applications sur pont roulant ?
A : Nous recommandons YOLOv10n en priorité. Lors des essais comparatifs menés par Kelude, la vitesse d'inférence de YOLOv10n est supérieure d'environ 12,5 % à celle de YOLOv8n (7 ms contre 8 ms), avec un modèle plus léger (5,5 Mo contre 6,3 Mo) et un gain de précision mAP d'environ 1,5 point. Pour les applications exigeant une précision accrue, YOLOv8s reste une alternative pertinente.
Q : Comment le système d'IA visuelle s'interface-t-il avec le système de commande PLC existant du pont roulant ?
A : Le système d'IA visuelle Kelude transmet les résultats de détection (catégorie de cible, coordonnées, indice de confiance) à la passerelle périphérique via le protocole MQTT. Après conversion de protocole, la passerelle écrit ces données dans le bloc de données (DB) du PLC Siemens S7-1500 via le bus PROFINET, assurant ainsi une synchronisation en temps réel entre le guidage visuel et la commande de mouvement.
Q : Quelle est la périodicité recommandée pour l'étalonnage de la caméra et quelles sont les exigences de précision ?
A : Kelude recommande un contrôle de l'étalonnage des paramètres internes de la caméra tous les 3 mois, avec un étalonnage obligatoire après une révision générale ou le remplacement de l'objectif. L'étalonnage est effectué selon la méthode du damier de Zhang Zhengyou, avec une erreur de reprojection maîtrisée à moins de 0,3 pixel. La précision de positionnement sur les axes X/Y peut atteindre ±3 mm (en combinaison avec la fusion des données du codeur).

Articles connexes

contact

contact us

phone:
+86 13903802779

mail:3915269@qq.com

Working hours: Monday to Friday

Wechat
Wechat
SHARE
TOP