Système de Surveillance IA pour Pont Roulant avec YOLOv8
Caméra industrielle + boîtier d'informatique en périphérie Jetson pour la surveillance de sécurité par vision IA des ponts roulants : détection en temps réel de l'état de la charge, identification des intrusions de personnel, en remplacement des solutions de clôture traditionnelles.
Ce qui préoccupe le plus dans la surveillance de sécurité des ponts roulants, ce n'est pas une panne matérielle, mais le fait qu'une personne pénètre dans la zone pendant que la machine continue de fonctionner. Les solutions traditionnelles reposent sur des clôtures et des cellules photoélectriques : elles présentent de nombreux angles morts, génèrent de fausses alarmes et entraînent des coûts de maintenance élevés. La surveillance de sécurité par vision IA a évolué ces dernières années, passant d'un stade « fonctionnel » à un stade « performant » : une caméra industrielle associée à un boîtier d'informatique en périphérie Jetson suffit pour détecter en temps réel l'état de la charge, identifier les intrusions de personnel et vérifier le port du casque de sécurité, avec une précision de reconnaissance supérieure à 98%érieure à 98 %, le tout pour un coût par voie maîtrisé sous la barre des 640 EUR.
Architecture du système de surveillance : conception en quatre couches
Le système de surveillance de sécurité par vision IA est organisé en quatre couches logiques, découplées entre elles par des protocoles standard (MQTT/RESTful API/RTSP). Il prend en charge le déploiement en cascade sur un seul pont roulant ou sur plusieurs ponts roulants à l'échelle de l'atelier.
1.1 Couche de perception
La couche de perception est composée de caméras industrielles installées sous la charpente du pont roulant et sur le chariot. Elles capturent les flux vidéo en temps réel de la zone de levage, des passages latéraux le long des rails et des zones de travail du personnel. Les caméras transmettent les flux vidéo compressés en H.265 (1080P@30fps) au nœud d'informatique en périphérie via un câble Ethernet PoE ou un réseau WiFi industriel.
1.2 Couche algorithmique
La couche algorithmique s'exécute sur l'équipement d'informatique en périphérie (NVIDIA Jetson Orin NX) et déploie le modèle YOLOv8 pour l'inférence de détection d'objets. Nous avons précédemment publié un article sur la détection visuelle IA en ligne des cordons de soudure sur ponts roulants, qui relate également notre expérience de déploiement de YOLO dans ce contexte. Les résultats de détection incluent : la position du personnel et les boîtes englobantes, l'état du port du casque de sécurité, le type de charge et sa zone de levage, ainsi que l'état des lignes d'alerte. La latence d'inférence est maintenue sous les 30 ms, répondant ainsi aux exigences de surveillance en temps réel.
1.3 Couche applicative
La couche applicative transforme les résultats de détection de la couche algorithmique en logique de sécurité : toute intrusion de personnel dans la zone dangereuse de fonctionnement du pont roulant déclenche une alarme sonore et visuelle ainsi qu'une décélération ; la pleine vitesse est autorisée lorsque la zone de levage est dégagée ; l'absence de port du casque de sécurité est enregistrée comme infraction avec capture photo à l'appui. La couche applicative assure également l'interaction avec l'automate du pont roulant : les signaux de sécurité sont transmis au module de sécurité de l'automate via les protocoles Modbus TCP ou Profinet.
1.4 Couche de présentation
La couche de présentation fournit un écran de surveillance Web et des notifications push sur téléphone mobile, affichant en temps réel les images de détection, les historiques d'alarmes, les états de fonctionnement et les statistiques de chaque pont roulant. Les données sont stockées dans une base SQLite locale, avec un historique consultable sur 90 jours.
| Niveau | Principal Composant | Protocole de communication | Emplacement de déploiement |
|---|---|---|---|
| Couche de perception | caméra industrielle, Lampe d, Codeur | RTSP / Gig E Vision | pont roulant Chemin de câbles/Chariot En dessous |
| Couche algorithmique | Jetson Orin NX, YOLOv8Modèle | Tensor RTMoteur d | armoire électrique du pont roulant Dans |
| Couche applicative | Moteur de logique de sécurité, PLCInterface Module | Modbus TCP / Profinet | Nœud périphérique / pont roulant PLCArmoire |
| Couche de présentation | WebÉcran grand format, téléphone mobile Terminal, Base de données | MQTT / RESTful API | Salle de contrôle centralisée de l'atelier / serveur cloud |
Choix du modèle YOLOv8 et comparaison des performances
YOLOv8, framework de détection d'objets en temps réel publié par Ultralytics en 2023, propose cinq modèles pré-entraînés — N, S, M, L et X — couvrant un spectre allant de la version légère à la version haute précision, pour répondre à divers scénarios de déploiement. Dans le contexte de la surveillance de sécurité des ponts roulants, la sélection du modèle implique un arbitrage entre la vitesse d'inférence, la précision de détection et le coût matériel.
| Modèle | Paramètre Quantité | m AP50 | FP16Latence(ms) | INT8Latence(ms) | Matériel recommandé |
|---|---|---|---|---|---|
| YOLOv8n | 3.2M | 37.3 | 4.5 | 2.1 | Jetson Nano |
| YOLOv8s | 11.2M | 44.9 | 8.7 | 3.8 | Jetson Orin Nano |
| YOLOv8m | 25.9M | 50.2 | 16.1 | 7.2 | Jetson Orin NX |
| YOLOv8l | 43.7M | 52.9 | 26.4 | 12.3 | Jetson Orin NX |
| YOLOv8x | 68.2M | 53.9 | 44.8 | 21.5 | Jetson Orin AGX |
Solution recommandée : combinaison YOLOv8m + Jetson Orin NX. Après quantification INT8, la latence d'inférence est de 7,2 ms ; une seule unité d'informatique en périphérie peut traiter simultanément 4 flux vidéo 1080P, avec une latence totale maîtrisée sous 30 ms. Cette configuration répond aux exigences de temps réel de la surveillance de sécurité des ponts roulants, pour un coût d'environ 4 500 € par voie.
Comparatif des solutions matérielles en périphérie
Le choix de l'équipement d'informatique en périphérie détermine les performances d'inférence et le coût de déploiement du système. Voici une comparaison de trois approches courantes dans le cadre de la surveillance de sécurité des ponts roulants :
| Paramètre | Jetson Orin NX | Jetson Orin Nano | PC industriel(i5+Carte graphique dédiée) |
|---|---|---|---|
| AIPuissance de calcul(TOPS) | 100 | 40 | 20~30 |
| Consommation électrique(W) | 15~25 | 7~15 | 65~150 |
| Nombre de canaux simultanés | 4Canaux1080P | 2Canaux1080P | 2~4Canaux1080P |
| Température de fonctionnement(℃) | -25~80 | -25~80 | 0~50 |
| Coût par canal(RMB) | ~4,500 | ~3,000 | ~6,000 |
| Mode d | rail DIN de l'armoire électrique du pont roulant DIN | armoire électrique du pont roulant DINRail DIN | Requiert séparémentboîtier de commande |
Le Jetson Orin NX surpasse les PC industriels sur tous les plans — puissance de calcul, consommation électrique, résistance à la température et facilité d'installation — et constitue aujourd'hui la solution optimale pour le déploiement de l'IA visuelle en périphérie sur les ponts roulants.

Identification des charges suspendues : mode opératoire détaillé
L'identification des charges suspendues est l'une des fonctions clés de l'IA visuelle pour ponts roulants. Le système doit reconnaître une grande variété de charges — bobines d'acier, billettes, tôles d'acier, moules, conteneurs, etc. — et suivre leur position en continu pendant le levage. Couplée à la plateforme de surveillance à distance IoT pour ponts roulants, cette fonction permet de boucler la boucle de données complète, de l'identification au suivi jusqu'à l'entrée en stock.
4.1 Collecte et annotation des données
Il est recommandé de collecter 5 000 à 10 000 images sur site, couvrant différentes conditions d'éclairage (jour/nuit/contre-jour), différentes orientations des charges (balancement avant/balancement latéral/rotation) et différents arrière-plans (propre/encombré/avec occlusion). L'annotation est effectuée au format YOLO : chaque image est annotée avec la boîte englobante de la charge et son étiquette de catégorie. Avec les outils LabelImg ou CVAT, un annotateur seul atteint un débit d'environ 100 images/heure.
4.2 Paramètres d'entraînement du modèle
# Configuration d'entraînement YOLOv8m (paramètres clés) model = YOLO('yolov8m.pt') results = model.train( data='crane_dataset.yaml', epochs=200, imgsz=640, batch=16, lr0=0.01, lrf=0.01, optimizer='AdamW', augment=True, hsv_h=0.015, # augmentation de la teinte hsv_s=0.7, # augmentation de la saturation hsv_v=0.4, # augmentation de la luminosité degrees=5.0, # augmentation de la rotation (dans le scénario du pont roulant, la charge suspendue présente une légère inclinaison) translate=0.1, scale=0.5, fliplr=0.5, mosaic=1.0, mixup=0.3, )
L'entraînement sur NVIDIA RTX 4090 prend environ 4 à 6 heures, avec un mAP50 atteignant 92 à 95 %. Une fois l'entraînement terminé, le modèle est exporté au format ONNX, puis converti en moteur INT8 via TensorRT pour le déploiement en périphérie.
4.3 Déploiement TensorRT
# Commande de déploiement de quantification INT8 TensorRT trtexec --onnx=yolov8m_crane.onnx \\\\\\\\\\\\\\\\ --saveEngine=yolov8m_crane_int8.engine \\\\\\\\\\\\\\\\ --int8 \\\\\\\\\\\\\\\\ --calib=crane_calib_data \\\\\\\\\\\\\\\\ --buildOnly \\\\\\\\\\\\\\\\ --workspace=4096
Après quantification INT8, le volume du modèle passe de 52 Mo à 15 Mo, la vitesse d'inférence passe de 16 ms (FP16) à 7 ms, et le contrôle de la perte de précision reste inférieur à 1 %.
Détection de sécurité du personnel : trois fonctions complémentaires
La détection de sécurité du personnel comprend trois sous-fonctions : la détection d'intrusion en zone de sécurité, la détection du port du casque de sécurité et la fonction de clôture électronique. Le système exécute simultanément deux instances indépendantes du modèle YOLOv8 — l'une dédiée à la détection du corps du personnel et de sa boîte englobante, l'autre à la détection de la zone de tête et à la classification du port du casque.
| Fonction | Détection Objet | Déclenchement d | Action de couplage |
|---|---|---|---|
| Intrusion de zone Détection | Entrée de personnel dans la zone dangereuse de fonctionnement du pont roulant en fonctionnement | <=1s | Alarme sonore et visuelle + décélération du pont roulant de 30%lant Décélération30% |
| Casque de sécurité Détection | Port du casque par les opérateurs | <=2s | Capture+Enregistrement d+Alerte vocale |
| Clôture électronique | Entrée de personnel sous la charge suspendue | <=0.5s | Levage Arrêt+Alarme Sonore et Visuelle |
Points clés de la mise en œuvre technique
Le passage d'un prototype de système de vision IA pour pont roulant à un déploiement en série comporte quelques pièges inévitables. Les connaître à l'avance permet d'économiser trois mois de détours.
① Variations de luminosité — la principale source de dérive de la distribution des données
La luminosité de la zone de travail du pont roulant est influencée par l'orientation du bâtiment d'usine, les conditions météorologiques, les saisons et l'allumage/extinction de l'éclairage. L'intensité lumineuse d'une même scène peut varier d'un facteur 100. Solution : utiliser un renforcement de données intensif lors de l'entraînement (paramètres hsv_h/hsv_s/hsv_v) et associer un éclairage LED d'appoint (température de couleur 5 000 K, puissance ≥ 30 W) en phase de déploiement, afin de garantir un éclairement minimal de 10 lux sur l'image.
② Occultation et empilement de la charge — les angles morts de la détection monoculaire
Pendant le levage, la charge peut être occultée par les équipements environnants ou par d'autres charges, ce qui perturbe la continuité de la détection. Il est recommandé d'installer 2 à 3 caméras sous des angles différents pour couvrir une même zone, de fusionner les résultats de détection multi-vues via un filtre de Kalman et de tolérer au maximum 5 trames d'extrapolation prédictive (environ 170 ms @ 30 fps) en cas de perte de détection.
③ Vibrations et secousses — les interférences mécaniques en fonctionnement
Le déplacement du pont du pont roulant et du chariot entraîne des vibrations du pont et des caméras. Les vibrations à basse fréquence (2 à 10 Hz) provoquent un flou de l'image et une instabilité de la détection. Le support de caméra doit être équipé d'une base amortissante (coussin en caoutchouc naturel de 10 mm d'épaisseur). Côté algorithme, un filtrage inter-trames IOU est configuré : toute boîte de détection dont le déplacement entre trames adjacentes dépasse un seuil de pixels est marquée comme fausse alerte et écartée.
④ Latence réseau — le goulot d'étranglement des solutions sans fil
Si la transmission du flux vidéo vers la salle de contrôle centrale pour une inférence centralisée via Wi-Fi industriel génère une latence de bout en bout de 100 à 200 ms, elle ne peut pas satisfaire aux exigences de temps réel des interverrouillages de sécurité. Solution : déplacer l'inférence à la périphérie du pont roulant (Jetson local) et ne transmettre à la salle de contrôle que les résultats de détection au format JSON (environ 200 octets/trame) et les images d'alarme (JPEG compressé < 50 Ko) — une approche qui s'inscrit dans la continuité de la conception de la couche d'informatique en périphérie de l'architecture à quatre niveaux du système de commande du pont roulant. L'impact du réseau est ainsi réduit au minimum.
Questions fréquentes
Conclusion
La combinaison YOLOv8 + Jetson Orin NX a réduit le seuil technique du déploiement de la surveillance de sécurité par vision IA sur pont roulant à un niveau reproductible à grande échelle. Le coût d'une voie unique est maîtrisé sous la barre des 5 000 €, le délai d'identification est inférieur à 50 ms et la précision d'identification dépasse 95 %, surpassant ainsi le niveau de protection offert par les barrières traditionnelles associées aux capteurs photoélectriques. Le prochain article abordera l'application de la vision IA dans la saisie automatique par positionnement sur pont roulant — un scénario où les exigences de précision et de latence sont d'un ordre de grandeur supérieur.