Détection de défauts pont roulant : modèles pour données limitées

Solution Technique de Détection de Défauts par Transfert d'Apprentissage pour Ponts Roulants

En utilisant un modèle ResNet-18 pré-entraîné sur ImageNet comme modèle de base, nous l'avons adapté à la classification de défauts de surface de composants de ponts roulants (5 classes de défauts + 1 classe normale). Pour quatre niveaux de taille d'échantillons (50/100/300/500), nous comparons trois stratégies : l'augmentation de données (CutMix + transformations géométriques, amélioration de la précision de +4 % à +7 %), le gel de l'extracteur de caractéristiques (entraînement de la couche FC uniquement, T1=89,5 % @300 échantillons) et le fine-tuning complet du modèle (toutes les couches entraînées, T1=93,2 % @500 échantillons). Le flux de travail recommandé est le suivant : augmentation de données → gel de la FC pour une baseline rapide → fine-tuning complet pour une optimisation finale. Plateforme expérimentale : PyTorch 2.1.0 + NVIDIA A10, conformément à la norme ISO 4301.

L'un des principaux problèmes de la détection de défauts par vision industrielle est la rareté des données annotées. Les défauts sur les composants de ponts roulants (câbles métalliques, roues, rails, crochets, freins) sont variés (fissures, usure, piqûres, déformation, rupture), et collecter des centaines d'images annotées pour chaque type de défaut peut prendre des semaines. L'apprentissage en quelques coups (Few-Shot Learning) et le transfert d'apprentissage (Transfer Learning) exploitent des modèles visuels pré-entraînés sur de grands ensembles de données génériques (comme ImageNet, 14 millions d'images) pour les adapter à des tâches où les données cibles sont rares, comme la détection de défauts industriels. Cet article prend pour exemple la détection de cinq types courants de défauts de surface sur les composants de ponts roulants (rupture de fils de câble métallique, usure de la surface de roulement des roues, fissures sur le rail, déformation du crochet, fissuration de la garniture de frein) et compare systématiquement l'efficacité de différentes stratégies de transfert avec des tailles d'échantillons allant de 50 à 500.

Application de l'apprentissage en quelques coups et du transfert d'apprentissage à la détection de défauts sur ponts roulants

Configuration expérimentale et jeu de données

Jeu de données : images de défauts de surface de composants de ponts roulants (annotations internes de Kelude, collectées en 2024, caméra industrielle Basler acA2440-75um + anneau lumineux LED). Total de 1 875 images, 6 classes (normale + 5 défauts), réparties en 4 séries expérimentales selon la taille d'échantillons (50/100/300/500 images/classe, le reste servant à la validation/test). Prétraitement unifié : redimensionnement à 224×224, normalisation avec moyenne [0.485,0.456,0.406] et écart-type [0.229,0.224,0.225] (standard ImageNet). Modèle de base : ResNet-18 (pré-entraîné sur ImageNet, 11,7 millions de paramètres). Métrique d'évaluation : précision Top-1 (métrique principale), score F1.

Types de défauts
Rupture de câble métallique · Usure de la surface de roulement · Fissure sur rail · Déformation du crochet · Fissuration de la garniture de frein · Normal
Distribution des données
Total : 1 875 images · 6 classes équilibrées (312 images/classe) · RVB 224×224 · Caméra industrielle Basler
Expériences sur la taille d'échantillons
4 niveaux : 50/100/300/500 images/classe · Le reste pour la validation/test · Moyenne sur 5 répétitions par niveau
Modèle de base
ResNet-18 · Pré-entraîné sur ImageNet · 11,7 millions de paramètres · PyTorch 2.1.0 · GPU A10

Méthodes d'augmentation de données

L'augmentation de données est la stratégie la plus fondamentale et la plus efficace dans les scénarios de rareté des données. Cette expérience combine trois types de méthodes d'augmentation : ① Transformations géométriques — rotation aléatoire (±15°), retournement horizontal (probabilité 0,5), translation aléatoire (±10%), zoom aléatoire (0,8 à 1,2 fois), recadrage aléatoire (0,08 à 1,0) ; ② Transformations photométriques — ajustement de la luminosité (±20%), ajustement du contraste (±15%), ajustement de la saturation (±15%), variation de la teinte (±0,1), bruit gaussien (σ=0,01) ; ③ Augmentation avancée — effacement aléatoire (Random Erasing, p=0,5, max_area=0,2), CutMix (mélange avec une autre image aléatoirement recadrée, α=1,0). Le facteur d'augmentation est contrôlé entre 5 et 20 fois.

Transformations géométriques
Rotation ±15° · Retournement horizontal · Translation ±10% · Zoom 0,8~1,2 · Recadrage aléatoire 0,08~1,0
Transformations photométriques
Luminosité ±20 % · Contraste ±15 % · Saturation ±15 % · Teinte ±0,1 · Bruit gaussien σ=0,01
Augmentation avancée
Random Erasing p=0,5 · CutMix α=1,0 · Facteur d’augmentation 5 à 20x
Gain de précision
50 échantillons + augmentation : T1 de 62,3 % à 68,5 % (+6,2 %) · 300 échantillons : 85,2 % à 89,5 % (+4,3 %)

Comparaison des stratégies de transfert

Stratégie de transfert50Échantillon100Échantillon300Échantillon500ÉchantillonTemps dRisque de surapprentissage
Gel FC+Augmentation68.5%77.2%89.5%91.3%<5minFaible
Ajustement complet+Augmentation70.1%80.8%91.7%93.2%~35minMoyen
Gel FC(Sans augmentation)62.3%71.5%85.2%88.6%<3minFaible
Ajustement complet(Sans augmentation)64.8%74.6%87.1%90.3%~30minMoyen-Élevé
Entraînement from scratch (sans poids pré-entraînés) : T1 de 41,8 % avec 50 échantillons, bien en dessous de toute stratégie de transfert. L'augmentation de données apporte le gain le plus significatif avec de faibles volumes d'échantillons (50/100, +5 à 6 %), et ce gain diminue à mesure que le volume augmente (300 échantillons : +4,3 % ; 500 échantillons : +2,9 %). Avec ≥300 échantillons annotés, la stratégie FC gelé atteint déjà T1 ≈ 90 %, répondant aux besoins de la plupart des déploiements industriels. Dans le scénario à 500 échantillons, le fine-tuning complet atteint T1 = 93,2 %, proche de la limite de l'apprentissage supervisé.
Augmentation de donnéesGain le plus significatif avec de faibles volumes (50/100 échantillons, +5 à 6 %). Gain décroissant avec l'augmentation du volume (300 échantillons : +4,3 %; 500 échantillons : +2,9 %).
Stratégie FC gelé (≥300 échantillons)Atteint T1 ≈ 90 %, répondant aux besoins de la plupart des déploiements industriels.
Fine-tuning complet (500 échantillons)T1 = 93,2 %, proche de la limite de l'apprentissage supervisé.

Procédure recommandée pour le déploiement industriel

Sur la base des expériences ci-dessus, la procédure recommandée est la suivante :

  1. Étape 1 – Établissement de la baseline : utiliser la stratégie FC gelé avec une augmentation de données de base (rotation, retournement, luminosité, bruit) sur 100 à 300 échantillons annotés pour établir rapidement un modèle de référence (T1 ≈ 90 %).
  2. Étape 2 – Optimisation de l'augmentation : intégrer progressivement des stratégies avancées comme CutMix et vérifier si la précision sur l'ensemble de validation continue de s'améliorer.
  3. Étape 3 – Fine-tuning complet : une fois la précision de référence stabilisée, dégeler toutes les couches pour un fine-tuning complet (taux d'apprentissage réduit d'un facteur 10, à 0,0001), ce qui permet généralement un gain supplémentaire de 1 à 2 %.
  4. Étape 4 – Déploiement : exporter le modèle au format ONNX, quantifier en INT8 avec TensorRT, puis déployer sur Jetson Orin NX (latence d'inférence d'environ 1,2 ms/image). L'ensemble du processus peut être réalisé en 1 à 2 jours.

Questions fréquentes sur la détection de défauts par transfert d'apprentissage

Q : Pourquoi ne pas utiliser directement un modèle plus grand comme ResNet-50/101 pour la détection de défauts sur ponts roulants ?

A : ResNet-18 est souvent un meilleur choix en environnement industriel pour trois raisons : ① la détection de défauts sur ponts roulants est une tâche de classification à grains fins ; des couches trop profondes produisent des caractéristiques trop abstraites, au détriment des textures locales ; ② les jeux de données de défauts industriels sont bien plus petits que les jeux de données d'images naturelles ; les 11,7 millions de paramètres de ResNet-18 sont largement suffisants ; ③ la latence d'inférence de ResNet-18 ne représente qu'environ 60 % de celle de ResNet-50 (1,2 ms contre 2,0 ms sur Jetson Orin NX). Les grands modèles ne présentent un avantage significatif qu'à partir de 5 000 échantillons par classe.

Q : CutMix ou MixUp : quelle augmentation de données est la plus adaptée à la détection de défauts industriels ?

A : CutMix est plus adapté. MixUp effectue un mélange linéaire au niveau des pixels (superposition d'images), ce qui génère des « images fantômes » non naturelles (défauts superposés semi-transparents) dans les images industrielles, réduisant la sensibilité du modèle aux contours des défauts. CutMix réalise un assemblage au niveau des régions (découpage d'une zone rectangulaire d'une image et collage sur une autre), préservant l'intégrité de chaque défaut. Dans nos expériences, CutMix dépasse MixUp d'environ 2,3 % en F1 (scénario à 300 échantillons).

Q : Faut-il entraîner un modèle distinct pour chaque composant du pont roulant (câble métallique, roue, rail, crochet) ?

A : Il est recommandé d'entraîner un modèle de classification à 6 classes (5 défauts + 1 normal) par type de composant, plutôt qu'un modèle unifié multi-composants et multi-défauts. Les textures d'arrière-plan, les conditions d'éclairage et les morphologies de défauts varient considérablement entre les composants ; un modèle unifié exigerait des volumes de données et une capacité de modèle bien plus importants. Un modèle à 6 classes (50 à 300 échantillons par classe) peut être entraîné en 30 minutes avec la stratégie FC gelé. En déploiement, les 6 modèles ONNX sont conteneurisés et gérés via une architecture de microservices.

Q : Quel espace de stockage est nécessaire pour déployer les modèles de transfert d'apprentissage sur un périphérique edge Jetson ?

A : ResNet-18 en FP32 occupe environ 45 Mo, et environ 12 Mo après quantification INT8 avec TensorRT. Les 6 modèles de composants (6 × 12 Mo = 72 Mo) + le moteur d'inférence (environ 200 Mo) + les fichiers de configuration représentent un total inférieur à 300 Mo. La version 16 Go de Jetson Orin NX peut facilement héberger plus de 20 modèles. La latence d'inférence d'un modèle unique est d'environ 1,2 ms (INT8, batch = 1), et l'inférence en cascade des 6 modèles est inférieure à 8 ms.

Articles connexes

contact

contact us

phone:
+86 13903802779

mail:3915269@qq.com

Working hours: Monday to Friday

Wechat
Wechat
SHARE
TOP