Reducción de parámetros en IA sin perder precisión

📋 Resumen clave

La destilación de conocimiento consiste, en esencia, en transferir la distribución de probabilidad de salida de un modelo grande ya entrenado (el profesor) —es decir, la relación de similitud entre las etiquetas blandas y las categorías— a un modelo mucho más pequeño (el estudiante). El modelo estudiante aprende siguiendo las etiquetas blandas del profesor, en lugar de memorizar únicamente las etiquetas duras, lo que le permite reducir el número de parámetros en aproximadamente un orden de magnitud mientras conserva la mayor parte de la precisión. Este artículo expone las cuatro condiciones límite de la destilación, la derivación de la pérdida con suavizado de temperatura y divergencia KL, un ejemplo de verificación para la detección de defectos en grúas y cuatro errores comunes. Condiciones de trabajo aplicables: el modelo profesor ya funciona en el servidor con la precisión requerida y el objetivo es trasladar la inferencia a un dispositivo de borde para obtener respuesta en tiempo real y bajo consumo energético. No aplicable: precisión insuficiente del profesor, gran divergencia entre la distribución de los datos de entrenamiento y los de implementación, o escenarios que requieran decisiones estrictamente explicables.

Diagrama general del cálculo de destilación de conocimiento de modelos grandes a modelos pequeños.

Hagamos números: en la implementación en el borde de modelos de inspección visual para grúas, la precisión y el tamaño son enemigos irreconciliables. Un modelo profundo de decenas de capas, con cientos de millones de parámetros, identifica con mayor exactitud la rotura de alambre en cable y evalúa la posición de la carga, pero o bien se ejecuta en un servidor con una latencia de decenas de milisegundos por inferencia, o bien el dispositivo de borde no tiene la potencia de cálculo necesaria para soportarlo. Y para aplicaciones de agarre y posicionamiento, así como de inspección en línea que requieren respuesta de nivel de milisegundos, una latencia de decenas de milisegundos ya supone un riesgo en sí misma.

Por el contrario, un modelo pequeño puro ofrece baja latencia y bajo consumo de energía —puede ejecutarse en un dispositivo de borde de pocos vatios—, pero su precisión suele ser inferior. En el balance final, el modelo grande en la nube dispone de abundante potencia de cálculo pero sufre una latencia elevada, mientras que el modelo pequeño en el borde tiene baja latencia pero menor precisión. Esa diferencia de precisión intermedia es precisamente lo que la destilación de conocimiento debe compensar: no se logra con hardware más potente, sino haciendo que el modelo grande enseñe al pequeño «cómo juzgar».

Suena a «pasar el oficio al aprendiz», pero en ingeniería esto se sustenta en una función de pérdida calculable y unas condiciones límite bien definidas. Kelude Industrias Pesadas ha verificado en repetidas ocasiones en la implementación de inferencia en el borde un aspecto clave: el éxito de la destilación depende en primer lugar de que las condiciones límite estén correctamente definidas, y no de dominar las fórmulas de memoria. A continuación, partimos de las condiciones límite para abordar este cálculo con rigor.

¿Cuándo merece la pena la destilación de conocimiento? Cuatro condiciones límite que deben verificarse

La primera condición límite es que el modelo profesor debe cumplir ya los requisitos. La destilación de conocimiento es una transferencia de conocimiento, no una reparación del modelo. Si el modelo profesor no alcanza por sí mismo la precisión exigida, la destilación transmitirá sus errores de juicio al modelo pequeño tal cual, e incluso los amplificará debido a la menor capacidad de este último. El principio de Kelude Industrias Pesadas al impulsar la implementación en el borde es claro: primero se entrena el modelo grande en el servidor hasta cumplir los criterios de aceptación, y solo después se aborda la compresión.

La segunda condición límite es que el objetivo de implementación debe estar claramente definido. Si el destino final es un dispositivo de borde con requisitos de latencia de nivel de milisegundos y un consumo de energía de solo unos vatios, comprimir el modelo grande aporta un beneficio evidente; si, por el contrario, el modelo se ejecuta en un clúster de servidores sin sensibilidad a la latencia, la destilación carece de motivación. El presupuesto de potencia de cálculo determina el límite superior del modelo estudiante y, con ello, la viabilidad del proyecto.

La tercera condición límite es que la distribución de los datos de entrenamiento y la de los datos de implementación deben ser coherentes. El modelo estudiante destilado tiene menor capacidad y una capacidad de generalización más débil, por lo que es más sensible a la deriva de datos. Cuanto mayor sea la diferencia entre el conjunto de entrenamiento y las condiciones de operación reales, mayor será la pérdida de precisión del modelo pequeño. La cuarta condición límite es que la pérdida de precisión aceptable debe tener una expectativa cuantificada: la destilación casi siempre conlleva una ligera disminución de la precisión, y la clave es si esa disminución se encuentra dentro del margen permitido por el proyecto, verificándose según las condiciones de operación reales.

← Deslice la tabla para verla completa →
Parámetro Significado Valor típico sobredestilaciónel impacto en
Profesor (modelo profesor)número de parámetros del modeloEscala del modelo grande en la nubeEscala de cientos de millones(Según el proyecto)Cuanto mayor, más excesivoParámetro-ización,Mayor espacio de compresión
Estudiante (modelo estudiante)número de parámetros del modeloEscala del modelo pequeño en el lado del dispositivoEscala de millonesDetermina el lado del dispositivolatenciayconsumo de energía
TemperaturaCoeficiente TSuavizadosoftmaxla escala de4~8(Requiere ajuste por tarea)Cuanto mayor, más suave la distribución、Más conocimiento oscuro
Peso de pérdida αProporción entre pérdida suave y pérdida dura0.5~0.9Equilibra relaciones entre clases y etiquetas reales
datos de entrenamientoCantidadEscala de muestras etiquetadascon el profesorconjunto de entrenamientoMisma distribuciónLa deriva de datos amplificapérdida de precisión
latencia de inferenciaObjetivoUna sola vez en el lado del dispositivotiempo de inferenciaEscala de milisegundos(segúncondición de operaciónSegún el proyecto)Determina el estudiantetamaño del modeloLímite superior
potencia de cálculoyconsumo de energíaPresupuestoRecursos disponibles en el lado del dispositivoVarios vatios~Decenas de vatiosDetermina si el estudiante puede desplegarse
PrecisiónObjetivo de retenciónDegradación aceptable relativa al profesorsegún el valor realcondición de operaciónAceptaciónSegún el proyectoDeterminadestilaciónSi vale la pena hacerlo

Cálculo de la pérdida por destilación: deducción de la fórmula del ablandamiento por temperatura y la divergencia KL

El objetivo central de la destilación de conocimiento es lograr que la distribución de salida del modelo alumno se aproxime lo más posible a la del modelo profesor. Para ello intervienen dos mecanismos clave: el ablandamiento por temperatura y la divergencia KL.

El primer paso consiste en el ablandamiento por temperatura. El softmax estándar asigna a los logits una distribución de probabilidad similar a una etiqueta rígida, mientras que en la destilación se divide primero por un coeficiente de temperatura T para suavizar la distribución. Cuanto mayor sea la temperatura, más plana será la distribución y más claramente se revelarán las diferencias relativas entre clases. La probabilidad ablandada puede expresarse como:

q_i = exp(z_i / T) / Σ_j exp(z_j / T)

donde z_i es el logit de salida original del modelo para la clase i, T es el coeficiente de temperatura y q_i es la probabilidad ablandada.

El segundo paso consiste en calcular la divergencia entre las distribuciones del alumno y del profesor. La función de pérdida utiliza la divergencia KL (entropía relativa) para medir la discrepancia entre dos distribuciones de probabilidad. La pérdida blanda de destilación se expresa como T² multiplicado por la divergencia KL; el factor T² compensa el efecto del escalado de temperatura sobre el gradiente. La pérdida total final es una combinación ponderada de la pérdida blanda y la pérdida dura:

L = α · T² · KL(q_teacher ‖ q_student) + (1 − α) · CE(y_true, p_student)

donde α es el peso de la pérdida blanda, CE es la pérdida de entropía cruzada con las etiquetas reales, y p_student es la salida estándar del modelo alumno con temperatura T igual a 1.

¿Por qué se mantiene el término de la etiqueta dura? Porque las etiquetas blandas enseñan las relaciones entre clases, mientras que las etiquetas duras garantizan que el alumno no se desvíe de la respuesta correcta. Ambos términos son imprescindibles; el peso α suele situarse entre 0,5 y 0,9, y su valor óptimo se determina mediante ajuste de hiperparámetros.

Ejemplo de verificación: de cientos de millones a millones de parámetros en detección de defectos

Veamos un escenario práctico que ilustra las fórmulas anteriores. Supongamos que una planta necesita realizar inspección en línea de defectos superficiales en cables de acero. El modelo profesor es una red de gran tamaño entrenada en un servidor, con un número de parámetros del orden de cientos de millones. Los datos de entrenamiento provienen de un archivo de imágenes de defectos acumulado durante años en la instalación —en este sector, suelen requerirse decenas de miles o incluso cientos de miles de imágenes—. El sistema de anotación de defectos de Kelude contribuye continuamente a la acumulación de estas muestras. Una vez que el modelo profesor alcanza la precisión requerida en el servidor, se destila a un modelo alumno con unos pocos millones de parámetros, que se despliega en un dispositivo de borde para la inspección fotograma a fotograma del cable de acero en funcionamiento.

La cuestión central de este ejemplo de verificación es una sola: tras una compresión tan agresiva, ¿se mantiene una precisión aceptable? No existe una cifra universalmente válida: la pérdida de precisión relativa tras la destilación depende de una serie de variables como la redundancia del modelo profesor, la temperatura T o el volumen de datos, por lo que debe evaluarse empíricamente en la condición de operación real. No obstante, en la práctica se observa una tendencia relativamente estable: cuanto mayor y más sobredimensionado sea el modelo profesor, mayor será el margen de compresión y mayor la proporción de precisión que se conserva mediante la destilación.

← Deslice la tabla para verla completa →
Indicador Modelo profesor Modelo estudiante(destilaciónDespués) Descripción
número de parámetrosEscala de cientos de millonesEscala de millonesCompresión de aproximadamente un orden de magnitud
Una sola vez en el lado del dispositivolatencia de inferenciaservidorDecenas de milisegundosEscala de milisegundos en el lado del dispositivosegún el valor realcondición de operaciónSegún medición real
Ubicación de despliegueNube/servidorCaja de borde (edge box)/Empotrado (embebido)Los datos nosalida de fábrica、Respuesta más rápida
Relativo aPrecisiónReferencia(Se registra como100%)Conserva la mayor parteLa degradación específica según medición real
consumo de energíaservidorEscala de cientos de millonesVarios vatios~De diez a veinte vatiosBajo en el lado del dispositivoconsumo de energíaFuncionamiento

Desde el punto de vista de los resultados, el modelo alumno comprime el número de parámetros en aproximadamente un orden de magnitud, la latencia de inferencia se reduce de decenas de milisegundos a nivel de servidor a milisegundos en el borde, y el consumo de energía baja a unos pocos vatios o algo más de una decena. Estos beneficios se corresponden con operaciones sensibles a la latencia, como la detección en línea y el posicionamiento de agarre. En su solución de implementación en el borde, Kelude Industrias Pesadas utiliza precisamente estos modelos pequeños destilados como unidad principal de inferencia, mientras que el modelo grande se mantiene solo en la fase de entrenamiento o como respaldo para la revisión manual.

Es necesario subrayar los límites: la salida de estos modelos de detección en el borde debe integrarse finalmente en la lógica de monitoreo de seguridad y enclavamiento de la grúa. El límite de implementación debe cumplir los requisitos de adquisición de datos y tiempo real establecidos en la norma GB/T 28264 — Sistema de Monitoreo y Gestión de Seguridad para Aparatos de Elevación, y las evaluaciones de carga y condiciones de operación que involucra el modelo deben enmarcarse en el marco de condiciones de operación definido por la norma FEM 1.001 — Especificación de Diseño de Grúa. La destilación de conocimiento no altera estos límites de seguridad; solo modifica el tamaño y la velocidad del modelo en sí.

Cuatro errores comunes que suelen arruinar la destilación

Primer error: destilar apresuradamente sin haber entrenado bien el modelo profesor. Basura entra, basura sale; la destilación amplifica las desviaciones existentes del profesor, no las corrige.

Segundo error: configurar mal la temperatura T. Si T es demasiado baja, las etiquetas blandas degeneran en etiquetas duras y se pierde el conocimiento oscuro; si T es demasiado alta, la distribución se vuelve demasiado plana y el alumno no aprende capacidad discriminativa. La temperatura debe ajustarse específicamente para cada tarea, no copiarse de un valor fijo.

Tercer error: aprender solo las etiquetas blandas y descartar las duras. Las blandas enseñan relaciones; las duras garantizan la corrección. Ambas son imprescindibles y deben equilibrarse mediante el peso de pérdida α.

Cuarto error: ignorar la deriva en la distribución de datos. El modelo alumno tiene menor capacidad y peor generalización; si los datos de entrenamiento y las condiciones de operación de implementación no coinciden, la pérdida de precisión se amplifica. La verificación de la distribución de datos debe realizarse tanto antes como después de la destilación.

Comprimir la precisión de un modelo grande en uno pequeño es, en esencia, un equilibrio calculable entre tres variables: precisión, latencia y consumo de energía. En su implementación de IA en el borde, Kelude Industrias Pesadas utiliza la destilación de conocimiento como un medio clave para trasladar la capacidad de modelos pesados a cajas de borde, combinada con etapas previas como la limpieza de datos y el aprendizaje semisupervisado, permitiendo que la grúa realice la detección y la alerta temprana cerca del punto de operación, sin depender del servidor para todo. La premisa sigue siendo la misma: definir primero las condiciones límite y aceptar la pérdida de precisión según la verificación de los criterios de aceptación en la práctica.

📖 Lecturas relacionadas: Modelos de IA en el borde para grúas: cómo equilibrar precisión y coste de potencia de cálculo | Qué aplicaciones reales puede tener un modelo grande en el mantenimiento de grúas

Preguntas frecuentes

P: ¿El modelo pequeño destilado e implementado en el borde sigue cumpliendo los requisitos de tiempo real del monitoreo de seguridad de la grúa?

R: La destilación de conocimiento modifica el tamaño del modelo y la velocidad de inferencia, pero no altera los límites de la función de seguridad del sistema. Tomando como referencia los requisitos de adquisición de datos y tiempo real de la norma GB/T 28264 — Sistema de Monitoreo y Gestión de Seguridad para Aparatos de Elevación, la implementación es viable siempre que la latencia de inferencia y la precisión tras la destilación cumplan los criterios de aceptación de ingeniería y la salida del modelo siga conectada al enclavamiento existente y al flujo de revisión manual. Kelude Industrias Pesadas mantiene este principio en sus soluciones de borde: los indicadores concretos deben verificarse uno a uno según las condiciones de operación reales durante la aceptación del proyecto; un modelo más pequeño no exime de la verificación de seguridad.

P: ¿En qué casos no merece la pena hacer destilación de conocimiento y cómo saber si un proyecto debería hacerla?

R: Hay que fijarse en tres señales. La primera: el modelo profesor no alcanza por sí mismo la precisión requerida; la destilación transmitirá ese error al modelo alumno. La segunda: existe una diferencia significativa entre la distribución de los datos de entrenamiento y la de las condiciones de operación de implementación; el modelo alumno generaliza peor y la deriva es más evidente. La tercera: el presupuesto de potencia de cálculo en el borde ya permite ejecutar el modelo grande, por lo que el ahorro de cómputo no es un beneficio real. Si aparece cualquiera de estas tres señales, conviene resolver primero los problemas de datos y del modelo profesor antes de plantearse la destilación.

P: ¿Por qué el modelo pequeño aprende mejor con las etiquetas blandas del modelo grande que directamente con las etiquetas duras?

R: Porque la salida softmax del modelo grande no solo indica cuál es la respuesta, sino que también proporciona una distribución de probabilidad de cuán similar es esa respuesta a las demás: eso es el conocimiento oscuro. Por ejemplo, ante una imagen de desgaste, el modelo profesor puede generar desgaste 0,7, corrosión 0,2, normal 0,1; al aprender esta distribución, el alumno capta además la relación de cercanía entre desgaste y corrosión en términos de características. Esto aporta mucha más información que memorizar una única etiqueta dura, y es la razón fundamental por la que la destilación conserva la precisión.

Artículos relacionados

contact

contact us

phone:
+86 13903802779

mail:3915269@qq.com

Working hours: Monday to Friday

Wechat
Wechat
SHARE
TOP