Précision des grands modèles : distillation des connaissances

📋 Résumé clé

La distillation des connaissances consiste à transférer la distribution de probabilité de sortie d'un grand modèle déjà entraîné (l'enseignant) — c'est-à-dire les relations de similarité entre les étiquettes molles et les catégories — vers un modèle bien plus compact (l'élève). En apprenant à partir des étiquettes molles de l'enseignant plutôt qu'en mémorisant uniquement les étiquettes dures, le petit modèle parvient à conserver l'essentiel de la précision tout en réduisant son nombre de paramètres d'un ordre de grandeur. Cet article détaille les quatre conditions limites de la distillation, la dérivation de la perte avec adoucissement de température et divergence KL, un exemple de vérification pour la détection de défauts sur grue, ainsi que quatre erreurs courantes. Conditions de service applicables : le modèle enseignant fonctionne déjà sur serveur avec une précision satisfaisante, et l'objectif est de déporter l'inférence vers un boîtier périphérique pour gagner en temps de réponse et réduire la consommation électrique. Non applicable : précision insuffisante de l'enseignant, distribution des données d'entraînement trop éloignée de celle du déploiement, ou besoin de décisions strictement explicables.

Schéma de distillation des connaissances : aperçu du calcul des grands modèles compressés en petits modèles.

Faisons le calcul : pour déployer un modèle de détection visuelle en périphérie sur une grue, précision et compacité sont intrinsèquement antagonistes. Un grand modèle profond de plusieurs dizaines de couches, avec des centaines de millions de paramètres, identifie plus fi ablement la rupture de fils de câble et évalue mieux la position de la charge. Mais il s'exécute soit sur serveur avec une inférence de plusieurs dizaines de millisecondes, soit il sature tout simplement le boîtier périphérique. Or, pour le préhension et l'inspection en ligne qui exigent une réponse au niveau de la milliseconde, une latence de plusieurs dizaines de millisecondes constitue déjà un risque.

À l'inverse, un petit modèle pur offre une latence faible et une consommation électrique réduite — un boîtier de quelques watts suffit — mais sa précision laisse souvent à désirer. En fin de compte, le grand modèle cloud dispose d'une puissance de calcul abondante mais souffre d'une latence élevée, tandis que le petit modèle périphérique gagne en réactivité mais perd en précision. C'est précisément cet écart de précision que la distillation des connaissances vient combler : non pas en ajoutant du matériel plus puissant, mais en faisant en sorte que le grand modèle transmette au petit son savoir-faire en matière de jugement.

Cela évoque l'adage « le maître transmet à l'apprenti », mais d'un point de vue ingénierie, la distillation repose sur une fonction de perte calculable et des conditions limites bien définies. Kelude Industries Lourdes l'a vérifié à plusieurs reprises lors de ses déploiements d'inférence en périphérie : la réussite d'une distillation dépend d'abord de la clarté des conditions limites, bien plus que de la mémorisation des formules. Commençons donc par ces conditions limites pour clarifier les choses.

Quand la distillation des connaissances vaut-elle le coup ? Quatre conditions limites à clarifier

Première condition : le modèle enseignant doit déjà atteindre les critères de réception. La distillation est un transfert de connaissances, pas une réparation de modèle. Si la précision du modèle enseignant est insuffisante, la distillation ne fera que transmettre ses erreurs de jugement au petit modèle, voire les amplifier en raison de la capacité réduite de ce dernier. Chez Kelude Industries Lourdes, le principe pour tout déploiement en périphérie est simple : d'abord entraîner le grand modèle sur serveur jusqu'à satisfaction des critères de réception, ensuite seulement envisager la compression.

Deuxième condition : l'objectif de déploiement doit être clairement défini. Si le déploiement final vise un boîtier périphérique avec une latence de l'ordre de la milliseconde et une consommation de quelques watts, compresser le grand modèle présente un bénéfice évident. En revanche, si le modèle tourne déjà sur un cluster de serveurs sans contrainte de latence, la distillation perd sa raison d'être. Le budget de puissance de calcul détermine la taille maximale du modèle élève et, par conséquent, la pertinence de l'opération.

Troisième condition : la distribution des données d'entraînement doit correspondre à celle des données de déploiement. Le modèle élève issu de la distillation, plus compact et moins robuste en généralisation, est plus sensible aux dérives de données. Plus l'écart entre l'ensemble d'entraînement et les conditions de fonctionnement réelles est grand, plus la perte de précision du petit modèle s'en trouve amplifiée. Quatrième condition : la perte de précision acceptable doit être quantifiée à l'avance — la distillation entraîne presque toujours une légère baisse de précision ; l'essentiel est de savoir si cette baisse reste dans les limites permises par le projet, avec validation sur la base des conditions de service réelles.

← Faites défiler le tableau →
Paramètre Signification Valeur typique surdistillationl
modèle enseignantnombre de paramètres du modèletaille du grand modèle cloudcentaines de millions(selon le projet)plus cParamètredistillation,plus la marge de compression est grande
modèle élèvenombre de paramètres du modèletaille du petit modèle embarquéplusieurs millionsdétermine le côté embarquélatenceetconsommation électrique
températureCoefficient Tramollissementsoftmaxl4~8(à ajuster selon la tâche)plus elle est élevée, plus la distribution est douce、plus il y a de connaissances implicites
pondération des pertes αratio perte douce / perte dure0.5~0.9équilibre entre relations inter-classes et étiquettes réelles
données d'entraînementquantitétaille de letmodèle enseignantensemble d'entraînementmême distributionla dérive des données amplifieperte de précision
latence d'inférenceobjectifinférence unique embarquéetemps d'inférenceordre de la milliseconde(seloncondition de fonctionnementselon le projet)détermine le modèle élèvetaille du modèlelimite supérieure
puissance de calculetconsommation électriquebudgetressources disponibles côté embarquéquelques watts~dizaines de wattsdétermine si le modèle élève peut être déployé
Précisionobjectif de rétentiondégradation acceptable par rapport à lselon les mesures réellescondition de fonctionnementRéceptionselon le projetdéterminedistillationsi cela vaut la peine

Calcul de la perte de distillation : dérivation des formules d'adoucissement thermique et de divergence KL

Le problème central que la distillation des connaissances cherche à résoudre est d'amener la distribution de sortie de l'élève à se rapprocher le plus possible de celle du professeur. Deux mécanismes clés entrent en jeu : l'adoucissement thermique et la divergence KL.

La première étape est l'adoucissement thermique. Un softmax standard projette les logits en une distribution de probabilités de type étiquette dure, tandis que la distillation divise d'abord par un coefficient de température T pour aplatir la distribution. Plus la température est élevée, plus la distribution est lisse et plus les différences relatives entre les catégories sont clairement exposées. La probabilité adoucie peut s'écrire :

q_i = exp(z_i / T) / Σ_j exp(z_j / T)

où z_i est le logit brut de sortie du modèle pour la i-ème catégorie, T est le coefficient de température et q_i est la probabilité adoucie.

La deuxième étape consiste à calculer la divergence entre les distributions de l'élève et du professeur. La fonction de perte utilise la divergence KL (entropie relative) pour mesurer à quel point deux distributions de probabilités sont dissemblables. La perte douce de distillation s'écrit comme T² multiplié par la divergence KL ; la multiplication par T² compense l'effet de la mise à l'échelle de la température sur le gradient. La perte totale finale est une moyenne pondérée de la perte douce et de la perte dure :

L = α · T² · KL(q_teacher ‖ q_student) + (1 − α) · CE(y_true, p_student)

où α est le poids de la perte douce, CE est la perte d'entropie croisée par rapport aux étiquettes réelles, et p_student est la sortie standard du modèle élève à température T = 1.

Pourquoi conserver le terme d'étiquette dure ? Parce que les étiquettes douces enseignent les relations entre catégories, tandis que les étiquettes dures garantissent que l'élève ne s'écarte pas de la réponse réelle. Les deux sont indispensables ; le poids α est généralement compris entre 0,5 et 0,9, la valeur exacte étant déterminée par réglage des hyperparamètres.

Exemple de vérification : distillation d'un modèle de détection de défauts de grue, de plusieurs centaines de millions à quelques millions de paramètres

Prenons un scénario concret pour illustrer les formules ci-dessus. Imaginons une usine qui souhaite mettre en place une inspection en ligne des défauts de surface d'un câble métallique : le modèle professeur est un grand réseau entraîné sur un serveur, avec un nombre de paramètres de l'ordre de plusieurs centaines de millions. Les données d'entraînement proviennent d'une base d'images de défauts accumulée sur site à long terme — dans l'industrie, ce type de données atteint souvent des volumes de plusieurs dizaines à plusieurs centaines de milliers d'images. Le système d'annotation de défauts de Kelude contribue également à l'enrichissement continu de ces échantillons. Une fois que le modèle professeur atteint la précision requise sur le serveur, il est distillé en un modèle élève de quelques millions de paramètres, déployé sur une box périphérique en bordure de réseau pour une détection image par image du câble métallique en fonctionnement.

La question centrale de cet exemple de vérification est simple : après une telle compression, la précision reste-t-elle acceptable ? Il n'existe pas de chiffre universel — la perte de précision relative après distillation dépend d'une série de variables telles que la redondance du modèle professeur, la température T, le volume de données, etc. Elle doit être mesurée dans les conditions de fonctionnement réelles. Cependant, une règle relativement stable se dégage en ingénierie : plus le modèle professeur est grand et surparamétré, plus la marge de compression est importante et plus le taux de précision préservé par la distillation est élevé.

← Faites défiler le tableau →
Indicateur modèle enseignant modèle élève(distillationaprès) remarque
nombre de paramètrescentaines de millionsplusieurs millionscompression d
inférence unique embarquéelatence d'inférenceserveurdizaines de millisecondesordre de la milliseconde côté embarquéselon les mesures réellescondition de fonctionnementmesures réelles comme référence
emplacement de déploiementcloud/serveurboîtier edge/embarquédonnées nonsortie d'usine、réponse plus rapide
par rapport àPrécisionréférence(noté comme100%)conserve la plupartdégradation spécifique selon mesures réelles
consommation électriqueserveurcentaines de millionsquelques watts~une dizaine de wattsfaible côté embarquéconsommation électriqueexécution

Concrètement, le modèle étudiant voit son nombre de paramètres réduit d’un ordre de grandeur, la latence d’inférence passe de quelques dizaines de millisecondes côté serveur à quelques millisecondes en périphérie, et la consommation électrique tombe à quelques watts, voire une dizaine de watts. Ces gains profitent directement aux opérations sensibles au temps réel, comme la préhension et l’inspection en ligne. Dans son déploiement en périphérie, Kelude Industries Lourdes utilise précisément ces petits modèles distillés comme unités d’inférence principales, tandis que le grand modèle reste cantonné à l’entraînement ou à la vérification de secours.

Il faut toutefois souligner une limite : les sorties de ces modèles d’inspection en périphérie doivent s’intégrer à la logique de surveillance de sécurité et d’interverrouillage de la grue. Le périmètre de déploiement doit donc respecter les exigences d’acquisition de données et de temps réel de la norme GB/T 28264 — Système de surveillance et de gestion de la sécurité des appareils de levage, tandis que les jugements de charge et de condition de fonctionnement restent soumis au cadre défini par la spécification de conception de grue FEM 1.001. La distillation des connaissances ne modifie pas ces frontières de sécurité ; elle n’agit que sur la taille et la vitesse du modèle.

Quatre erreurs courantes qui ruinent la distillation

Première erreur : distiller un modèle enseignant mal entraîné. Ce qui entre est mauvais, ce qui sort l’est aussi — la distillation amplifie les écarts du modèle enseignant au lieu de les corriger.

Deuxième erreur : mal régler la température T. Trop basse, les étiquettes molles dégénèrent en étiquettes dures et la connaissance implicite disparaît ; trop haute, la distribution devient trop lisse et l’élève ne parvient plus à discerner. La température doit être ajustée pour chaque tâche, pas copiée d’un projet à l’autre.

Troisième erreur : n’apprendre que les étiquettes molles et négliger les étiquettes dures. Les premières enseignent les relations, les secondes garantissent l’exactitude ; les deux sont indispensables et doivent être équilibrées par le poids de perte α.

Quatrième erreur : ignorer la dérive de la distribution des données. Le modèle étudiant a une capacité réduite et une généralisation plus faible ; si les données d’entraînement et les conditions de déploiement divergent, la perte de précision s’amplifie. Une vérification de la distribution des données s’impose avant et après la distillation.

Faire entrer la précision d’un grand modèle dans un petit modèle revient à arbitrer de manière calculable entre trois variables : précision, latence et consommation électrique. Dans ses déploiements d’IA en périphérie, Kelude Industries Lourdes fait de la distillation des connaissances un moyen clé pour faire descendre les capacités des modèles lourds vers des boîtiers de périphérie, en l’associant à des étapes amont comme le nettoyage des données et l’apprentissage semi-supervisé. L’objectif : que la grue effectue la détection et l’alerte précoce au plus près du terrain, sans attendre le cloud. La condition reste toujours la même : les conditions limites doivent être calculées au préalable, et la perte de précision est validée par des critères de réception mesurés.

📖 Lectures connexes :Exécuter un modèle d’IA en périphérie sur une grue : comment arbitrer entre précision et coût de calcul | Ce que les grands modèles peuvent concrètement apporter à la maintenance des grues

Questions fréquentes

Q : Un petit modèle distillé déployé en périphérie respecte-t-il encore les exigences de temps réel de la surveillance de sécurité d’une grue ?

A : La distillation des connaissances modifie la taille du modèle et la vitesse d’inférence, mais pas les frontières de la fonction de sécurité du système. En prenant pour référence les exigences d’acquisition de données et de temps réel de la norme GB/T 28264 relative au système de surveillance et de gestion de la sécurité des appareils de levage, le déploiement est possible dès lors que la latence d’inférence et la précision du modèle distillé satisfont les critères de réception techniques et que les sorties restent intégrées aux flux d’interverrouillage et d’examen manuel existants. Kelude Industries Lourdes le maintient dans toutes ses solutions en périphérie : les indicateurs concrets doivent être vérifiés un par un lors de la réception du projet, en fonction des conditions de fonctionnement réelles — un modèle plus petit ne dispense jamais de la vérification de sécurité.

Q : Dans quels cas la distillation des connaissances ne vaut-elle pas la peine, et comment décider si un projet doit l’utiliser ?

A : Trois signaux doivent alerter. Premier signal : le modèle enseignant n’atteint pas lui-même la précision requise — la distillation transmettra ses erreurs au petit modèle. Deuxième signal : un écart important entre la distribution des données d’entraînement et celle des conditions de déploiement — le petit modèle généralise moins bien et dérive davantage. Troisième signal : le budget de calcul en périphérie permet déjà d’exécuter le grand modèle, auquel cas l’économie de puissance de calcul n’a pas lieu d’être. Dès qu’un de ces trois signaux apparaît, il faut d’abord traiter les problèmes de données et de modèle enseignant avant d’envisager la distillation.

Q : Pourquoi un petit modèle qui apprend les étiquettes molles du grand modèle est-il plus précis que s’il apprenait directement les étiquettes dures ?

A : Parce que la sortie softmax du grand modèle ne se contente pas d’indiquer la bonne réponse : elle fournit aussi une distribution de probabilité qui montre à quel point cette réponse ressemble aux autres. C’est ce qu’on appelle la connaissance implicite. Par exemple, face à une image d’usure, le modèle enseignant peut produire usure 0,7, corrosion 0,2, normal 0,1. En apprenant cette distribution, l’élève capture la relation de proximité entre usure et corrosion dans l’espace des caractéristiques. C’est une quantité d’information bien supérieure à celle d’une simple étiquette dure — c’est la raison fondamentale pour laquelle la distillation préserve la précision.

Articles connexes

contact

contact us

phone:
+86 13903802779

mail:3915269@qq.com

Working hours: Monday to Friday

Wechat
Wechat
SHARE
TOP