Algoritmo Antibalanceo RL para Puente Grúa: Implementación PPO a SAC

Kelude Industrias Pesadas ha desarrollado un ciclo completo de control antibalanceo que abarca desde la simulación hasta el despliegue en PLC S7-1500, basado en algoritmos de aprendizaje por refuerzo profundo PPO y SAC. El tiempo de amortiguación del antibalanceo por RL se reduce un 74,4% frente al PID, con un ángulo residual de solo 0,3°, sin necesidad de reajustar parámetros ante variaciones de longitud de cable o de carga.

Antibalanceo en puentes grúa: el reto que la IA resuelve

Kelude Industrias Pesadas · Arquitectura de control antibalanceo por RL
Sensor
Ángulo · Posición · Oscilación
Observador de estado
Filtrado · Normalización
Agente RL
Red de políticas PPO / SAC
Orden de acción
Velocidad · Par
Sistema de grúa
Puente · Carro · esparcidor
Retroalimentación del entorno (señal de recompensa · siguiente estado) Iteración de entrenamiento en bucle cerrado
En entornos industriales como puertos, acerías y almacenes logísticos, la oscilación de la elevación en puentes grúa constituye el principal cuello de botella para la eficiencia operativa y la seguridad. Durante los arranques y paradas, la elevación genera oscilaciones residuales; el operador tradicional debe recurrir a su experiencia para el antibalanceo manual, y una sola operación de posicionamiento puede requerir decenas de segundos o incluso minutos de ajustes repetidos, lo que penaliza gravemente el ritmo de trabajo. Los métodos de antibalanceo clásicos —como los sistemas mecánicos, el antibalanceo electrónico (PID) o el conformado de entrada (Input Shaping)— ofrecen un rendimiento aceptable en condiciones fijas, pero su robustez se degrada notablemente ante variaciones de longitud de cable, diferencias de masa de carga o perturbaciones por viento, exigiendo un reajuste manual constante de parámetros. Desde 2020, la inteligencia artificial, y en particular el aprendizaje por refuerzo (Reinforcement Learning, RL), ha abierto una vía completamente nueva para el control antibalanceo. El agente RL interactúa de forma continua con el entorno y aprende de manera autónoma la política de control óptima, sin necesidad de modelar explícitamente la dinámica del sistema, con una gran capacidad de ajuste no lineal y adaptación. El equipo de Kelude ha sido pionero en la aplicación de dos algoritmos de aprendizaje por refuerzo profundo —PPO (Proximal Policy Optimization) y SAC (Soft Actor-Critic)— a sistemas reales de control antibalanceo en grúas inteligentes. Este artículo analiza de forma sistemática la pila tecnológica completa de la solución: desde los principios algorítmicos y el entorno de simulación hasta el entrenamiento, la optimización y el despliegue industrial, con datos comparativos cuantitativos frente a los métodos clásicos.

Diseño del espacio de estados y del espacio de acciones

Control de oscilación con RL: diseño de MDP y sistema de recompensas multicriterio

La primera tarea del control de oscilación con RL es mapear el sistema físico de la grúa como un Proceso de Decisión de Markov (MDP), donde la definición del espacio de estados y del espacio de acciones influye directamente en la eficacia del aprendizaje de la política y en la velocidad de convergencia. El espacio de estados de la solución de Kelude comprende cinco dimensiones principales:
  • Ángulo de oscilación del Elevación θ: medido en tiempo real mediante un Sensor de Inclinación o un sistema de visión, con una Precisión típica de ±0.1°. Es la variable de realimentación más crítica para el Antibalanceo, ya que refleja directamente la amplitud de la oscilación.
  • Velocidad angular ω: primera derivada del ángulo de oscilación. Indica la tendencia y dirección del movimiento, lo que permite al agente anticipar cambios de estado y aplicar acciones de amortiguamiento preventivas.
  • Posición del Carro x: obtenida mediante la realimentación de un Encoder. Es fundamental para lograr un Posicionamiento preciso, ya que el objetivo final del Antibalanceo es detener el Carro sobre la posición objetivo con la mínima oscilación posible.
  • velocidad del carro v: valor de realimentación del lazo cerrado de velocidad. Previene oscilaciones secundarias causadas por cambios bruscos de aceleración y ayuda al agente a comprender las características de momento del sistema.
  • Longitud del Cable de Acero L: valor en tiempo real de la longitud del Cable de Acero del mecanismo de elevación. Influye directamente en la Frecuencia natural del sistema (T=2π√(L/g)). A mayor longitud, mayor período de oscilación, por lo que la estrategia del Controlador debe adaptarse en consecuencia.
La dimensión del vector de estados determina directamente el tamaño de la capa de entrada de la red de política (Policy Network). Las cinco dimensiones cubren físicamente todas las variables observables del sistema subactuado, garantizando una observabilidad completa del sistema para el agente de RL. En la implementación, cada dimensión de estado debe normalizarse al intervalo [-1, 1] o [0, 1] para evitar inestabilidades en el entrenamiento de la red debido a diferentes unidades de medida. El espacio de acciones se diseña como una salida continua bidimensional:
  • Instrucción de aceleración del Carro ax: rango de valores [-1.0, 1.0] m/s², utilizado como valor objetivo del lazo de velocidad del Controlador de Frecuencia. La aceleración positiva impulsa el Carro hacia adelante; la negativa, frena o desacelera.
  • Compensación de la Velocidad de Elevación Δvh: compensa la Velocidad de Elevación cuando varía la longitud del Cable de Acero. Si el Carro se mueve y la carga se eleva simultáneamente, el cambio de longitud altera la dinámica del sistema; este término de compensación evita perturbaciones adicionales debidas a la variación de la longitud.
En comparación con las acciones discretas (por ejemplo, solo controlar aceleración/desaceleración/velocidad constante en tres niveles), un espacio de acciones continuo permite una curva de velocidad más suave. Esto es crucial para equipos de carga pesada como las grúas: las paradas y arranques bruscos frecuentes no solo aumentan la Fatiga de la Maquinaria y acortan la vida útil del Cable de Acero, sino que también pueden provocar riesgos de seguridad como la caída de la carga. La salida de acciones continuas bidimensional permite al agente, como un operador experimentado, realizar una maniobra de Antibalanceo y Posicionamiento perfecta con una curva de aceleración suave.

Diseño de la función de recompensa con objetivos múltiples

La función de recompensa es el núcleo del entrenamiento de RL: codifica el conocimiento del ingeniero en los objetivos de aprendizaje del agente. La solución de Kelude emplea una recompensa combinada ponderada que incluye cuatro subcomponentes: R = w₁·Rswing + w₂·Rpos + w₃·Renergy + w₄·Rterminal
  • Penalización por ángulo de oscilación Rswing = -α·θ² – β·ω². Este término aplica una recompensa negativa continua cuando el ángulo o la velocidad angular no son cero, impulsando al agente a eliminar la oscilación de manera prioritaria. La relación entre α y β controla la preferencia entre "prioridad de Posicionamiento" y "prioridad de ángulo": en escenarios de seguridad se puede aumentar el valor de αβ, mientras que en escenarios de eficiencia se puede reducir.
  • Recompensa por Posicionamiento Rpos = -γ·|x – xtarget|. Cuando el Carro está lejos de la posición objetivo, se aplica una recompensa negativa mayor, incentivando al agente a alcanzar el objetivo rápidamente. Combinada con la recompensa terminal, evita que el agente se centre solo en eliminar la oscilación sin realizar el Posicionamiento.
  • Término de consumo energético Renergy = -δ·ax² – ε·Δvh². Penaliza aceleraciones y acciones de compensación innecesarias. Este diseño busca un equilibrio entre la calidad del control y el consumo de energía, evitando comportamientos de "sobrecontrol" con vibraciones de alta Frecuencia.
  • Recompensa terminal Rterminal: se otorga una recompensa positiva única cuando |θ| < θth (umbral de ángulo, típicamente 0.5°) y |x – xtarget| < dth (umbral de Posicionamiento, establecido en 10mm) se mantienen durante más de 3 segundos, incentivando al agente a completar la tarea con un estado estable.
Los coeficientes de ponderación {w₁, w₂, w₃, w₄} se determinan mediante una búsqueda de hiperparámetros. El equipo de Kelude utiliza la Optimización Bayesiana (Bayesian Optimization) para explorar el espacio de parámetros y encontrar la combinación óptima de pesos. El principio final establecido es: la penalización por ángulo tiene el mayor peso (w₁ como primera prioridad), seguida por el peso del Posicionamiento (w₂ como segunda prioridad), y el peso del consumo energético es el mínimo (w₃ como restricción suave). Este diseño jerárquico asegura que el agente aprenda primero a eliminar la oscilación, luego a posicionarse con precisión y, finalmente, a ahorrar energía, lo que se alinea con el principio primordial de la seguridad industrial.

Entorno de simulación: co-simulación Simulink + Adams

El entrenamiento de RL requiere millones de pasos de interacción. Entrenar directamente en la máquina real no es seguro ni económico: una sola acción incorrecta podría provocar el vuelco de la grúa o la Fractura del Cable de Acero. La solución de Kelude se basa en un entorno de co-simulación de alta fidelidad con MATLAB/Simulink + Adams, que combina la flexibilidad algorítmica de Simulink con la Precisión de la dinámica multicuerpo de Adams. En Simulink se implementa un modelo de péndulo simple con longitud de Cable de Acero variable, cuya ecuación dinámica central es: (mL²)·θ” + 2mL·vh·θ’ + mgL·sinθ = -mL·cosθ·ax Donde m es la masa de la carga, L es la longitud del Cable de Acero, vh es la Velocidad de Elevación y ax es la aceleración del Carro. El primer término de la izquierda representa el Par de inercia, el segundo el Par de Coriolis (debido a la variación de la longitud del Cable de Acero) y el tercero el Par de restauración gravitacional; el lado derecho representa el Par de excitación transmitido a la carga a través del Cable de Acero debido a la aceleración del Carro. Aunque este modelo asume un cuerpo rígido, ya es capaz de describir las principales características dinámicas del Antibalanceo de la grúa. Por su parte, Adams proporciona una simulación detallada de dinámica multicuerpo en 3D, incluyendo factores no lineales como el modelado del Cable de Acero como cuerpo flexible (discretizado en múltiples segmentos rígidos conectados con Resortes y amortiguadores), el contacto y la fricción entre las ruedas y el Carril (modelo de fricción de Coulomb con efecto Stribeck), y las características del Par del Motor (incluyendo saturación y retardo de respuesta). Simulink intercambia datos cada 10ms a través de la interfaz de co-simulación (Simulink Coder / Adams Controls Toolkit): Simulink envía las instrucciones de aceleración a Adams, y Adams devuelve el ángulo de oscilación, la posición y otros estados a Simulink, formando un lazo cerrado de alta fidelidad. La ventaja de esta co-simulación es aprovechar lo mejor de cada herramienta: Simulink se encarga de la iteración rápida de los algoritmos de RL y la optimización de hiperparámetros, mientras que Adams se encarga de la verificación de la fidelidad física. El equipo de Kelude ha observado en proyectos reales que las políticas de RL entrenadas únicamente con el modelo de péndulo simple de Simulink, al ser probadas en el entorno de alta fidelidad de Adams, muestran una degradación del rendimiento de aproximadamente el 15% al 20%. Sin embargo, tras un ajuste fino adicional con datos de Adams, el rendimiento se recupera hasta niveles cercanos a los de la simulación.

Comparativa de entrenamiento PPO vs SAC y ajuste de hiperparámetros

Kelude ha llevado a cabo una verificación y comparación sistemática de dos algoritmos: PPO (Proximal Policy Optimization) y SAC (Soft Actor-Critic). Esta es la primera vez en la industria de grúas a nivel nacional que se realiza una evaluación comparativa completa de dos algoritmos de RL principales en la misma plataforma. PPO es conocido por su estabilidad de entrenamiento y robustez de hiperparámetros. En tareas de Antibalanceo converge rápidamente: se alcanza un nivel utilizable con un tiempo de eliminación de oscilación inferior a 3 segundos en aproximadamente 500,000 pasos de tiempo. Su mecanismo central utiliza una operación de clip para limitar el tamaño del paso de actualización de la política, evitando que una actualización individual se desvíe demasiado de la política anterior y cause el colapso del entrenamiento. La configuración clave de hiperparámetros es: clip epsilon=0.2, tasa de aprendizaje=3×10⁻⁴, GAE λ=0.95, objetivo de divergencia KL=0.02, y una estructura de red de dos capas totalmente conectadas con 256 nodos. El mecanismo de clip de PPO ofrece una ventaja única en proyectos industriales: incluso si el diseño de la función de recompensa no es perfecto, PPO puede converger de manera robusta, reduciendo la exigencia de experiencia en el ajuste de parámetros por parte del ingeniero. SAC, por otro lado, destaca en eficiencia de exploración y rendimiento final. SAC se basa en el marco de entropía máxima (Maximum Entropy), que maximiza la entropía de la política además de maximizar la recompensa, fomentando una exploración completa del espacio de acciones durante el entrenamiento. Después de aproximadamente 800,000 pasos de tiempo, SAC puede acercarse a una solución óptima: el ángulo de oscilación residual promedio se reduce en aproximadamente un 15%, aunque la curva de entrenamiento inicial fluctúa más que la de PPO y es más sensible a los hiperparámetros de la función de recompensa. Los hiperparámetros clave de SAC incluyen: coeficiente de temperatura α=0.2 (con mecanismo de ajuste automático), entropía objetivo = -dim(A) (donde A es la dimensión del espacio de acciones, aquí 2), y una estructura de red también de dos capas con 256 nodos. El análisis de las curvas de entrenamiento revela diferencias interesantes: la curva de recompensa acumulada de PPO converge más rápido pero alcanza una meseta en etapas posteriores, lo que refleja que la restricción KL limita el margen de mejora adicional de la política; la curva de SAC muestra una mayor oscilación inicial pero continúa su tendencia ascendente en etapas posteriores, demostrando un mayor potencial de exploración. Basándose en este hallazgo, el equipo de Kelude implementó de manera innovadora una estrategia de entrenamiento en dos fases: en la primera fase, se utiliza PPO (1 millón de pasos de tiempo) para obtener rápidamente una política inicial fiable; en la segunda fase, partiendo de esta política, se utiliza SAC (500,000 pasos de tiempo adicionales) para un ajuste fino. El rendimiento combinado final es aproximadamente un 12% superior al de usar cualquiera de los algoritmos por separado.

Transferencia Sim2Real: estrategia de aleatorización de dominios

La transferencia de la simulación a la máquina real (Sim2Real) es uno de los mayores cuellos de botella para la implementación industrial del aprendizaje por refuerzo (RL) y la brecha más difícil de superar entre el mundo académico y la industria. El entorno de simulación nunca puede reflejar perfectamente todas las propiedades físicas del mundo real: ruido del sensor, anisotropía de la fuerza de fricción, fluctuaciones en el retardo de respuesta del motor, rigidez no lineal del cable de acero, resistencia del aire, etc. La solución de Kelude emplea una estrategia de Domain Randomization para cerrar sistemáticamente esta brecha.

La implementación específica consiste en muestrear aleatoriamente los parámetros físicos clave al inicio de cada episodio de simulación:

  • Longitud del cable L: muestreo uniforme de 3 m a 15 m, cubriendo el rango de trabajo más común de la grúa.
  • Masa de la carga m: aleatoria de 500 kg a 10000 kg, simulando la variación desde vacío hasta plena carga.
  • Coeficiente de fricción: variación de ±30% sobre el valor nominal, simulando diferentes grados de desgaste y condiciones de lubricación.
  • Ruido del sensor: se añade ruido gaussiano N(0, σ²) a la medición del ángulo de oscilación, con σ aleatorio en el rango de 0.01~0.05 rad, simulando interferencias eléctricas en el entorno industrial.
  • Retardo de respuesta del motor: muestreo uniforme de 5~20 ms, simulando la fluctuación en el tiempo de respuesta del variador de frecuencia.
  • Coeficiente de amortiguamiento del cable de acero: variación de ±50% sobre el valor nominal, simulando las diferencias en las características de amortiguamiento bajo diferentes longitudes y diámetros de cable.

Mediante este método de entrenamiento de "supervivencia en el caos", la red de políticas aprende a encontrar una estrategia de antibalanceo robusta bajo diversas condiciones de incertidumbre. Esto es similar a un atleta que, tras entrenar en diversas condiciones climáticas, puede rendir de manera estable en cualquier entorno. El equipo de Kelude ha validado la eficacia del Domain Randomization en pruebas con máquinas reales: la estrategia RL entrenada sin aleatorización tiene una tasa de éxito de transferencia Sim2Real inferior al 30%, y es casi seguro que las primeras operaciones tras el despliegue presenten oscilaciones severas. En cambio, la estrategia entrenada con un Domain Randomization exhaustivo alcanza una tasa de éxito de transferencia superior al 85%, logrando una calidad de control cercana a la simulación desde la primera operación en la máquina real.

Análisis comparativo con métodos de antibalanceo clásicos

El equipo de Kelude realizó una comparación horizontal sistemática de tres enfoques en la misma plataforma experimental estandarizada: antibalanceo electrónico PID (optimizado mediante ingeniería), input shaper (Zero Vibration Shaper, ZV) y antibalanceo RL (esquema integrado de entrenamiento en dos fases PPO+SAC). Las condiciones experimentales fueron altamente estandarizadas para garantizar la objetividad y reproducibilidad de los datos comparativos.

Parámetros del experimento: capacidad de elevación de 10 t, longitud de cable de 10 m, distancia de traslación del carro de 20 m, requisito de precisión de posicionamiento del objetivo de ±10 mm.

Comparativa del tiempo de amortiguación: El antibalanceo RL lidera claramente con un tiempo de amortiguación de 2,1 segundos, un 74,4% menos que los 8,2 segundos del PID y un 62,5% menos que los 5,6 segundos del input shaper ZV. Esto significa que, en una sola tarea de manipulación, el enfoque RL puede ahorrar de 3,5 a 6,1 segundos de espera por la amortiguación. Calculando con 30 ciclos de trabajo por hora, se ahorran de 105 a 183 segundos por hora, lo que equivale a completar de 2 a 3 manipulaciones adicionales por hora.

Comparativa del ángulo residual: El ángulo residual del antibalanceo RL es de solo 0,3°, muy superior a los 1,8° del PID y los 0,9° del ZV. Un ángulo residual menor significa que la alineación del elevación y la operación de desenganche pueden realizarse inmediatamente después del posicionamiento, sin esperar a que la oscilación se disipe, acortando significativamente el tiempo de ciclo de cada operación.

Comparativa de robustez: En las pruebas comparativas con una longitud de cable que variaba de 6 m a 14 m, el PID requirió un reajuste manual de parámetros; de lo contrario, el tiempo de amortiguación se deterioraba hasta más de 12 segundos. El input shaper ZV necesitaba recalcular los parámetros del pulso de conformación; de lo contrario, se producían oscilaciones secundarias severas. En cambio, el enfoque RL no requirió ningún ajuste y mantuvo el tiempo de amortiguación entre 2,1 y 2,8 segundos en todo el rango de longitudes de cable, demostrando una excelente capacidad de adaptación.

Cabe señalar que el antibalanceo RL no reemplaza por completo a los métodos tradicionales; al contrario, se basa en un control subyacente maduro y fiable. A nivel del lazo cerrado de velocidad, se sigue utilizando un lazo de velocidad PID; el RL solo genera la secuencia de decisiones óptimas a nivel de aceleración. Esta arquitectura híbrida de "decisión RL + ejecución PID" combina la inteligencia de la estrategia con la fiabilidad del control subyacente, siendo el paradigma dominante actual para la implementación industrial del RL.

Despliegue real: modelo ONNX en PLC S7-1500

Desplegar la red neuronal profunda en un PLC industrial es la última pieza del rompecabezas y el paso con mayor desafío de ingeniería. Los frameworks tradicionales de inferencia de aprendizaje profundo (como PyTorch, TensorFlow) no pueden ejecutarse directamente en un PLC. Por lo tanto, Kelude utiliza ONNX Runtime como motor de inferencia multiplataforma, exportando la red de políticas entrenada al formato estándar ONNX y desplegándola en un PLC Siemens S7-1500.

El procesamiento de modelo ligero es el núcleo técnico de todo el esquema de despliegue e incluye tres pasos clave:

  • Cuantización: Se utiliza la cuantización estática para comprimir los pesos y activaciones de 32 bits en coma flotante (FP32) a enteros de 8 bits (INT8). El tamaño del modelo se reduce drásticamente de 2,3 MB a 0,6 MB, una reducción del 74%. La pérdida de precisión de inferencia del modelo cuantizado se controla dentro del 3%, sin un impacto perceptible en la calidad del control.
  • Fusión de capas: Los operadores consecutivos BatchNorm + ReLU + Conv (o completamente conectados) se fusionan en un único nodo de cálculo, reduciendo el cuello de botella del ancho de banda de memoria y acelerando la velocidad de inferencia en aproximadamente un 40%.
  • Poda de red: Se aplica una poda estructurada basada en la magnitud de los pesos, reduciendo los nodos de la capa oculta de 256 a 128, y eliminando todos los pesos de conexión con una contribución inferior al 0,1%. Finalmente, el número de parámetros del modelo se reduce en aproximadamente un 56%, con una pérdida de rendimiento inferior al 3%.

La estructura final del modelo desplegado en el S7-1500 es una red neuronal de capa completamente conectada: capa de entrada con 5 nodos (θ, ω, x, v, L), capa oculta con 128 nodos (activación ReLU) y capa de salida con 2 nodos (activación tanh, que produce ax y Δvh). El tiempo de inferencia por ejecución es de aproximadamente 0,8 ms (medido en la CPU local del S7-1500), cumpliendo completamente con el requisito de tiempo real de un ciclo de control de 10 ms. El PLC llama a la biblioteca dinámica de ONNX Runtime a través de un bloque de función (FB) personalizado, ejecutando la inferencia directa cada 10 ms en un ciclo estándar y emitiendo las instrucciones de acción.

En cuanto a los mecanismos de seguridad, el esquema de despliegue incorpora limitación de salida y lógica de protección por degradación: si la inferencia de ONNX Runtime es anómala o la salida supera los umbrales de seguridad preestablecidos, se degrada automáticamente al control PID subyacente, asegurando que el sistema nunca ejecute instrucciones de acción peligrosas bajo ninguna circunstancia.

Resumen y perspectivas

El algoritmo de antibalanceo RL de Kelude ha llevado con éxito dos algoritmos de aprendizaje por refuerzo profundo, PPO y SAC, de la investigación académica a la práctica industrial. Mediante un diseño meticuloso del espacio de estados, una función de recompensa con compensación de múltiples objetivos, la validación mediante simulación conjunta Simulink+Adams, la estrategia de transferencia Domain Randomization y el despliegue ligero del modelo ONNX en el PLC S7-1500, se ha construido un bucle técnico completo de "entrenamiento en simulación, despliegue en máquina real".

Este enfoque supera significativamente a los métodos clásicos como PID e input shaping en eficiencia de amortiguación, precisión de posicionamiento y adaptabilidad a las condiciones de trabajo, reduciendo el tiempo de amortiguación en más de un 60%. Proporciona una ruta técnica viable y práctica para la inteligencia y la operación no tripulada de grúas industriales. En el futuro, Kelude explorará direcciones más avanzadas como el antibalanceo con múltiples grúas colaborativas, la observación directa del ángulo de oscilación basada en visión por máquina, el aprendizaje adaptativo en línea en el borde y la programación colaborativa multiagente, impulsando continuamente la evolución de los aparatos de elevación de la automatización a la inteligencia.

Referencias

Preguntas frecuentes (FAQ)

P: ¿Qué algoritmo de aprendizaje por refuerzo, PPO o SAC, es mejor para el antibalanceo en grúas?
R: PPO converge más rápido (aproximadamente 500 000 pasos de tiempo) y ofrece una buena estabilidad de entrenamiento, lo que lo hace adecuado para obtener rápidamente una solución viable. SAC logra un mejor rendimiento final (ángulo de oscilación residual un 15 % menor), pero su curva de entrenamiento presenta mayores fluctuaciones y requiere unos 800 000 pasos de tiempo. El equipo de Kelude adopta una estrategia en dos fases: primero utiliza PPO para una convergencia rápida y luego ajusta con SAC para optimizar, logrando un rendimiento global aproximadamente un 12 % superior al de cualquiera de los algoritmos por separado.
P: ¿Cómo se transfiere el algoritmo de antibalanceo RL del entorno de simulación a una grúa real?
R: Kelude emplea una estrategia de Domain Randomization (aleatorización de dominio). Durante el entrenamiento, se aleatorizan parámetros como la longitud del cable (de 3 m a 15 m), la masa de la carga (de 500 kg a 10000 kg), la fuerza de fricción (±30 %), el ruido del sensor y el retardo del motor (de 5 a 20 ms). Al entrenar la política en entornos diversos, se aprende una estrategia de control robusta que eleva la tasa de éxito de la transferencia Sim2Real de menos del 30 % a más del 85 %.
P: ¿Cómo se ejecuta un modelo de aprendizaje por refuerzo profundo en un PLC S7-1500?
R: La red de políticas PPO/SAC entrenada se comprime mediante cuantificación INT8 (de 2,3 MB a 0,6 MB), fusión de capas (incremento del 40 % en la velocidad de inferencia) y poda de red (reducción del 56 % en el número de parámetros) antes de desplegarse como una red totalmente conectada de tres capas (5 entradas, capa oculta de 128 con ReLU, 2 salidas con tanh). La inferencia individual tarda aproximadamente 0,8 ms, lo que cumple con el ciclo de control de 10 ms del PLC S7-1500, e incorpora mecanismos de seguridad como limitación de salida y protección de degradación.
P: ¿Qué ventajas ofrece el sistema Antibalanceo RL frente a los métodos tradicionales de PID y de conformación de entrada?
R: El sistema Antibalanceo RL reduce el tiempo de amortiguación de la oscilación en un 74,4 % en comparación con el PID (2,1 s frente a 8,2 s) y en un 62,5 % frente a la conformación de entrada ZV (2,1 s frente a 5,6 s). El ángulo residual de oscilación es de solo 0,3° (frente a 1,8° con PID) y el error de posicionamiento es de 8 mm (frente a 25 mm con PID). Además, no requiere reajuste de parámetros ante variaciones de longitud de cable o de carga, lo que demuestra una adaptabilidad y robustez notablemente superiores a los métodos clásicos.

Normas relacionadas recomendadas

GB/T 6974.6-2008 — Grúas. Vocabulario. Parte 6: Grúa ferroviaria
GB/T 6974.7-2008 — Grúas. Vocabulario. Parte 7: Grúa flotante
GB/T 24818.4-2009 — Grúas. Pasarelas y dispositivos de seguridad. Parte 4: Grúa de pluma

Artículos relacionados

contact

contact us

phone:
+86 13903802779

mail:3915269@qq.com

Working hours: Monday to Friday

Wechat
Wechat
SHARE
TOP