Système de Surveillance IA pour Pont Roulant avec YOLOv8

Caméra industrielle + boîtier d'informatique en périphérie Jetson pour la surveillance de sécurité par vision IA des ponts roulants : détection en temps réel de l'état de la charge, identification des intrusions de personnel, en remplacement des solutions de clôture traditionnelles.

Ce qui préoccupe le plus dans la surveillance de sécurité des ponts roulants, ce n'est pas une panne matérielle, mais le fait qu'une personne pénètre dans la zone pendant que la machine continue de fonctionner. Les solutions traditionnelles reposent sur des clôtures et des cellules photoélectriques : elles présentent de nombreux angles morts, génèrent de fausses alarmes et entraînent des coûts de maintenance élevés. La surveillance de sécurité par vision IA a évolué ces dernières années, passant d'un stade « fonctionnel » à un stade « performant » : une caméra industrielle associée à un boîtier d'informatique en périphérie Jetson suffit pour détecter en temps réel l'état de la charge, identifier les intrusions de personnel et vérifier le port du casque de sécurité, avec une précision de reconnaissance supérieure à 98%érieure à 98 %, le tout pour un coût par voie maîtrisé sous la barre des 640 EUR.

Architecture du système de surveillance : conception en quatre couches

Le système de surveillance de sécurité par vision IA est organisé en quatre couches logiques, découplées entre elles par des protocoles standard (MQTT/RESTful API/RTSP). Il prend en charge le déploiement en cascade sur un seul pont roulant ou sur plusieurs ponts roulants à l'échelle de l'atelier.

1.1 Couche de perception

La couche de perception est composée de caméras industrielles installées sous la charpente du pont roulant et sur le chariot. Elles capturent les flux vidéo en temps réel de la zone de levage, des passages latéraux le long des rails et des zones de travail du personnel. Les caméras transmettent les flux vidéo compressés en H.265 (1080P@30fps) au nœud d'informatique en périphérie via un câble Ethernet PoE ou un réseau WiFi industriel.

1.2 Couche algorithmique

La couche algorithmique s'exécute sur l'équipement d'informatique en périphérie (NVIDIA Jetson Orin NX) et déploie le modèle YOLOv8 pour l'inférence de détection d'objets. Nous avons précédemment publié un article sur la détection visuelle IA en ligne des cordons de soudure sur ponts roulants, qui relate également notre expérience de déploiement de YOLO dans ce contexte. Les résultats de détection incluent : la position du personnel et les boîtes englobantes, l'état du port du casque de sécurité, le type de charge et sa zone de levage, ainsi que l'état des lignes d'alerte. La latence d'inférence est maintenue sous les 30 ms, répondant ainsi aux exigences de surveillance en temps réel.

1.3 Couche applicative

La couche applicative transforme les résultats de détection de la couche algorithmique en logique de sécurité : toute intrusion de personnel dans la zone dangereuse de fonctionnement du pont roulant déclenche une alarme sonore et visuelle ainsi qu'une décélération ; la pleine vitesse est autorisée lorsque la zone de levage est dégagée ; l'absence de port du casque de sécurité est enregistrée comme infraction avec capture photo à l'appui. La couche applicative assure également l'interaction avec l'automate du pont roulant : les signaux de sécurité sont transmis au module de sécurité de l'automate via les protocoles Modbus TCP ou Profinet.

1.4 Couche de présentation

La couche de présentation fournit un écran de surveillance Web et des notifications push sur téléphone mobile, affichant en temps réel les images de détection, les historiques d'alarmes, les états de fonctionnement et les statistiques de chaque pont roulant. Les données sont stockées dans une base SQLite locale, avec un historique consultable sur 90 jours.

Niveau Principal Composant Protocole de communication Emplacement de déploiement
Couche de perception caméra industrielle, Lampe d, Codeur RTSP / Gig E Vision pont roulant Chemin de câbles/Chariot En dessous
Couche algorithmique Jetson Orin NX, YOLOv8Modèle Tensor RTMoteur d armoire électrique du pont roulant Dans
Couche applicative Moteur de logique de sécurité, PLCInterface Module Modbus TCP / Profinet Nœud périphérique / pont roulant PLCArmoire
Couche de présentation WebÉcran grand format, téléphone mobile Terminal, Base de données MQTT / RESTful API Salle de contrôle centralisée de l'atelier / serveur cloud

Choix du modèle YOLOv8 et comparaison des performances

YOLOv8, framework de détection d'objets en temps réel publié par Ultralytics en 2023, propose cinq modèles pré-entraînés — N, S, M, L et X — couvrant un spectre allant de la version légère à la version haute précision, pour répondre à divers scénarios de déploiement. Dans le contexte de la surveillance de sécurité des ponts roulants, la sélection du modèle implique un arbitrage entre la vitesse d'inférence, la précision de détection et le coût matériel.

Modèle Paramètre Quantité m AP50 FP16Latence(ms) INT8Latence(ms) Matériel recommandé
YOLOv8n 3.2M 37.3 4.5 2.1 Jetson Nano
YOLOv8s 11.2M 44.9 8.7 3.8 Jetson Orin Nano
YOLOv8m 25.9M 50.2 16.1 7.2 Jetson Orin NX
YOLOv8l 43.7M 52.9 26.4 12.3 Jetson Orin NX
YOLOv8x 68.2M 53.9 44.8 21.5 Jetson Orin AGX

Solution recommandée : combinaison YOLOv8m + Jetson Orin NX. Après quantification INT8, la latence d'inférence est de 7,2 ms ; une seule unité d'informatique en périphérie peut traiter simultanément 4 flux vidéo 1080P, avec une latence totale maîtrisée sous 30 ms. Cette configuration répond aux exigences de temps réel de la surveillance de sécurité des ponts roulants, pour un coût d'environ 4 500 € par voie.

Comparatif des solutions matérielles en périphérie

Le choix de l'équipement d'informatique en périphérie détermine les performances d'inférence et le coût de déploiement du système. Voici une comparaison de trois approches courantes dans le cadre de la surveillance de sécurité des ponts roulants :

Paramètre Jetson Orin NX Jetson Orin Nano PC industriel(i5+Carte graphique dédiée)
AIPuissance de calcul(TOPS) 100 40 20~30
Consommation électrique(W) 15~25 7~15 65~150
Nombre de canaux simultanés 4Canaux1080P 2Canaux1080P 2~4Canaux1080P
Température de fonctionnement(℃) -25~80 -25~80 0~50
Coût par canal(RMB) ~4,500 ~3,000 ~6,000
Mode d rail DIN de l'armoire électrique du pont roulant DIN armoire électrique du pont roulant DINRail DIN Requiert séparémentboîtier de commande

Le Jetson Orin NX surpasse les PC industriels sur tous les plans — puissance de calcul, consommation électrique, résistance à la température et facilité d'installation — et constitue aujourd'hui la solution optimale pour le déploiement de l'IA visuelle en périphérie sur les ponts roulants.

Comparaison des trois fonctions clés de la surveillance de sécurité par IA visuelle pour ponts roulants : identification des charges suspendues YOLOv8m précision 95, détection de présence du personnel latence 50 ms, alarme en temps réel couplée à l'automate
Les trois fonctions essentielles du système de surveillance de sécurité par IA visuelle pour ponts roulants : identification des charges suspendues, détection de présence du personnel et alarme en temps réel

Identification des charges suspendues : mode opératoire détaillé

L'identification des charges suspendues est l'une des fonctions clés de l'IA visuelle pour ponts roulants. Le système doit reconnaître une grande variété de charges — bobines d'acier, billettes, tôles d'acier, moules, conteneurs, etc. — et suivre leur position en continu pendant le levage. Couplée à la plateforme de surveillance à distance IoT pour ponts roulants, cette fonction permet de boucler la boucle de données complète, de l'identification au suivi jusqu'à l'entrée en stock.

4.1 Collecte et annotation des données

Il est recommandé de collecter 5 000 à 10 000 images sur site, couvrant différentes conditions d'éclairage (jour/nuit/contre-jour), différentes orientations des charges (balancement avant/balancement latéral/rotation) et différents arrière-plans (propre/encombré/avec occlusion). L'annotation est effectuée au format YOLO : chaque image est annotée avec la boîte englobante de la charge et son étiquette de catégorie. Avec les outils LabelImg ou CVAT, un annotateur seul atteint un débit d'environ 100 images/heure.

4.2 Paramètres d'entraînement du modèle

# Configuration d'entraînement YOLOv8m (paramètres clés) model = YOLO('yolov8m.pt') results = model.train( data='crane_dataset.yaml', epochs=200, imgsz=640, batch=16, lr0=0.01, lrf=0.01, optimizer='AdamW', augment=True, hsv_h=0.015, # augmentation de la teinte hsv_s=0.7, # augmentation de la saturation hsv_v=0.4, # augmentation de la luminosité degrees=5.0, # augmentation de la rotation (dans le scénario du pont roulant, la charge suspendue présente une légère inclinaison) translate=0.1, scale=0.5, fliplr=0.5, mosaic=1.0, mixup=0.3, )

L'entraînement sur NVIDIA RTX 4090 prend environ 4 à 6 heures, avec un mAP50 atteignant 92 à 95 %. Une fois l'entraînement terminé, le modèle est exporté au format ONNX, puis converti en moteur INT8 via TensorRT pour le déploiement en périphérie.

4.3 Déploiement TensorRT

# Commande de déploiement de quantification INT8 TensorRT trtexec --onnx=yolov8m_crane.onnx \\\\\\\\\\\\\\\\ --saveEngine=yolov8m_crane_int8.engine \\\\\\\\\\\\\\\\ --int8 \\\\\\\\\\\\\\\\ --calib=crane_calib_data \\\\\\\\\\\\\\\\ --buildOnly \\\\\\\\\\\\\\\\ --workspace=4096

Après quantification INT8, le volume du modèle passe de 52 Mo à 15 Mo, la vitesse d'inférence passe de 16 ms (FP16) à 7 ms, et le contrôle de la perte de précision reste inférieur à 1 %.

Détection de sécurité du personnel : trois fonctions complémentaires

La détection de sécurité du personnel comprend trois sous-fonctions : la détection d'intrusion en zone de sécurité, la détection du port du casque de sécurité et la fonction de clôture électronique. Le système exécute simultanément deux instances indépendantes du modèle YOLOv8 — l'une dédiée à la détection du corps du personnel et de sa boîte englobante, l'autre à la détection de la zone de tête et à la classification du port du casque.

Fonction Détection Objet Déclenchement d Action de couplage
Intrusion de zone Détection Entrée de personnel dans la zone dangereuse de fonctionnement du pont roulant en fonctionnement <=1s Alarme sonore et visuelle + décélération du pont roulant de 30%lant Décélération30%
Casque de sécurité Détection Port du casque par les opérateurs <=2s Capture+Enregistrement d+Alerte vocale
Clôture électronique Entrée de personnel sous la charge suspendue <=0.5s Levage Arrêt+Alarme Sonore et Visuelle

Points clés de la mise en œuvre technique

Le passage d'un prototype de système de vision IA pour pont roulant à un déploiement en série comporte quelques pièges inévitables. Les connaître à l'avance permet d'économiser trois mois de détours.

① Variations de luminosité — la principale source de dérive de la distribution des données
La luminosité de la zone de travail du pont roulant est influencée par l'orientation du bâtiment d'usine, les conditions météorologiques, les saisons et l'allumage/extinction de l'éclairage. L'intensité lumineuse d'une même scène peut varier d'un facteur 100. Solution : utiliser un renforcement de données intensif lors de l'entraînement (paramètres hsv_h/hsv_s/hsv_v) et associer un éclairage LED d'appoint (température de couleur 5 000 K, puissance ≥ 30 W) en phase de déploiement, afin de garantir un éclairement minimal de 10 lux sur l'image.

② Occultation et empilement de la charge — les angles morts de la détection monoculaire
Pendant le levage, la charge peut être occultée par les équipements environnants ou par d'autres charges, ce qui perturbe la continuité de la détection. Il est recommandé d'installer 2 à 3 caméras sous des angles différents pour couvrir une même zone, de fusionner les résultats de détection multi-vues via un filtre de Kalman et de tolérer au maximum 5 trames d'extrapolation prédictive (environ 170 ms @ 30 fps) en cas de perte de détection.

③ Vibrations et secousses — les interférences mécaniques en fonctionnement
Le déplacement du pont du pont roulant et du chariot entraîne des vibrations du pont et des caméras. Les vibrations à basse fréquence (2 à 10 Hz) provoquent un flou de l'image et une instabilité de la détection. Le support de caméra doit être équipé d'une base amortissante (coussin en caoutchouc naturel de 10 mm d'épaisseur). Côté algorithme, un filtrage inter-trames IOU est configuré : toute boîte de détection dont le déplacement entre trames adjacentes dépasse un seuil de pixels est marquée comme fausse alerte et écartée.

④ Latence réseau — le goulot d'étranglement des solutions sans fil
Si la transmission du flux vidéo vers la salle de contrôle centrale pour une inférence centralisée via Wi-Fi industriel génère une latence de bout en bout de 100 à 200 ms, elle ne peut pas satisfaire aux exigences de temps réel des interverrouillages de sécurité. Solution : déplacer l'inférence à la périphérie du pont roulant (Jetson local) et ne transmettre à la salle de contrôle que les résultats de détection au format JSON (environ 200 octets/trame) et les images d'alarme (JPEG compressé < 50 Ko) — une approche qui s'inscrit dans la continuité de la conception de la couche d'informatique en périphérie de l'architecture à quatre niveaux du système de commande du pont roulant. L'impact du réseau est ainsi réduit au minimum.

Questions fréquentes

Q : Quels sont les avantages de la surveillance de sécurité par IA visuelle par rapport aux solutions traditionnelles (barrières, cellules photoélectriques) ?
A : Les solutions traditionnelles ne permettent qu'une protection planaire, sans distinguer une personne d'un objet, sans identifier les comportements dynamiques (port du casque ou non) ni suivre la position de la charge suspendue. La solution d'IA visuelle détecte simultanément l'intrusion de personnel, le port du casque, l'état de la charge, et fournit des captures d'infraction avec historique consultable. Conformément à la norme ISO 4301, la zone de fonctionnement du pont roulant doit être équipée de dispositifs de protection ; cette solution d'IA visuelle a obtenu une évaluation de sécurité équivalente à SIL2.
Q : Comment installer le dispositif sur un pont roulant ancien sans interface prévue ? Quelles sont les exigences spécifiques pour l'automate ?
A : C'est tout à fait possible. Le système communique avec l'automate du pont roulant via le protocole Modbus TCP. Dès lors que l'automate prend en charge le Modbus TCP standard (ce qui est le cas des principales marques telles que Siemens S7-1200/1500, Mitsubishi FX5U, Inovance série AM, Delta Electronics série DVP, etc.), l'intégration peut se faire sans modifier le programme existant de l'automate. Lors du raccordement, il suffit d'ouvrir un port TCP sur l'automate pour lire le registre d'alarmes de sécurité, sans programmation supplémentaire. Si le pont roulant ne dispose pas d'automate (ancien modèle à contrôleur à cames), l'ajout d'un contrôleur périphérique (Inovance AM401, environ 320 EUR) suffit, sans avoir à remplacer l'ensemble du pont roulant. La rénovation prend environ 2 jours.
Q : Combien de ponts roulants une seule installation peut-elle gérer ? Quel est le budget à prévoir ? Une rénovation d'ancien pont est-elle possible ?
A : Un système Jetson Orin NX traite simultanément 4 flux vidéo 1080P, couvrant ainsi 2 ponts roulants. Le coût par pont est d'environ 4 500 € (caméra + équipement périphérique + installation et mise en service compris). Pour une solution couvrant 2 ponts, le budget total est d'environ 18 000 à 25 000 € ; pour 10 ponts, le déploiement de 3 Jetson et d'un serveur central ne dépasse pas 80 000 €. En partant du principe qu'un accident est évité par pont et par an, l'investissement est rentabilisé en moins de deux ans — d'autant que la norme ISO 4301 / FEM 1.001 impose des exigences claires en matière de surveillance de sécurité des ponts roulants. Mieux vaut anticiper la rénovation que de subir les contrôles.

Conclusion

La combinaison YOLOv8 + Jetson Orin NX a réduit le seuil technique du déploiement de la surveillance de sécurité par vision IA sur pont roulant à un niveau reproductible à grande échelle. Le coût d'une voie unique est maîtrisé sous la barre des 5 000 €, le délai d'identification est inférieur à 50 ms et la précision d'identification dépasse 95 %, surpassant ainsi le niveau de protection offert par les barrières traditionnelles associées aux capteurs photoélectriques. Le prochain article abordera l'application de la vision IA dans la saisie automatique par positionnement sur pont roulant — un scénario où les exigences de précision et de latence sont d'un ordre de grandeur supérieur.

Articles connexes

contact

contact us

phone:
+86 13903802779

mail:3915269@qq.com

Working hours: Monday to Friday

Wechat
Wechat
SHARE
TOP