Guía de selección YOLOv8n para puente grúa
Parámetros clave
Para la Computación en el Borde se recomienda NVIDIA Jetson Orin NX (100 TOPS, 16GB, 15W), con despliegue del modelo de detección de objetos YOLOv8n (cuantización TensorRT INT8, latencia de inferencia de 5~12 ms) junto con seguimiento multiobjeto ByteTrack (2~3 ms), a una frecuencia de detección de 30 fps. Un solo dispositivo de borde puede procesar simultáneamente 2~4 cámaras de IA. Ya se han desplegado más de 50 unidades en acerías, plantas de cemento y fábricas de automoción, con una precisión de alerta anticolisión ≥97%.
Las funciones avanzadas del puente grúa, como la anticolisión por visión artificial, el seguimiento de la trayectoria del gancho y la detección de rotura de alambres del cable de acero, dependen de que la Computación en el Borde realice la inferencia de IA en tiempo real de forma local. A diferencia del procesamiento en la nube, donde el vídeo se sube para su análisis, la solución de Computación en el Borde ejecuta la inferencia directamente en el propio puente grúa, reduciendo la latencia de más de 500 ms a solo 5~12 ms y eliminando a la vez la fluctuación de red y los cuellos de botella de ancho de banda. Este artículo analiza en detalle la implementación completa de la caja de Computación en el Borde para puentes grúa, desde la selección de hardware, el despliegue de modelos y la optimización de cuantización hasta la comunicación con el PLC.
Selección de hardware para la caja de Computación en el Borde
Los requisitos clave de la visión artificial para puentes grúa en la caja de Computación en el Borde son: potencia de IA ≥40 TOPS (INT8), soporte para múltiples cámaras (≥2 vías MIPI CSI o USB3.0), rango de temperatura industrial (-25°C~70°C) y compatibilidad con protocolos industriales como Profinet o EtherNet/IP. A continuación se presenta una comparativa exhaustiva de tres cajas de Computación en el Borde líderes en aplicaciones de puente grúa:
| Parámetro | Jetson Orin NX 16GB | Jetson Orin Nano 8GB | RK3588 16GB |
|---|---|---|---|
| AIPotencia de cómputo(INT8) | 100 TOPS | 40 TOPS | 6 TOPS |
| GPUArquitectura | Ampere 1024Núcleo@918MHz | Ampere 512Núcleo@765MHz | Mali-G610 MP4 |
| Memoria/Ancho de banda | 16GB LPDDR5 68GB/s | 8GB LPDDR5 34GB/s | 16GB LPDDR4X 17GB/s |
| Decodificación de video | 2×4K@30 + 4×1080@30 | 1×4K@30 + 2×1080@30 | 8K@30 + 4K@120 |
| Consumo de energía | 15W/25WConmutable | 7W/15WConmutable | 8~15W |
| Protocolo industrial | Profinet/Modbus TCP/EIP | Profinet/Modbus TCP/EIP | Modbus TCP |
| YOLOv8nLatencia de inferencia | 5~8ms (INT8) | 12~18ms (INT8) | 80~150ms (FP16) |
| Precio de referencia | ¥6,500~7,500 | ¥2,500~3,500 | ¥800~1,200 |
| puente grúa Nivel de recomendación |
Entrenamiento del modelo YOLOv8n y cuantificación INT8 con TensorRT
YOLOv8n (versión nano, 3,2M de parámetros) es actualmente el modelo de detección de objetos con el mejor equilibrio entre precisión y velocidad para escenarios de visión artificial en puentes grúa. En comparación con YOLOv8s (11,2M de parámetros), la velocidad de inferencia es 2,5 veces superior, con una caída del mAP de solo el 1,2%. El entrenamiento utiliza el conjunto de datos etiquetados acumulado por Kelude Industrias Pesadas (120.000 imágenes que incluyen cinco clases de objetos: gancho de puente grúa, cable de acero, personal, AGV y obstáculos, cubriendo 12 condiciones de iluminación como día, noche, nublado y contraluz).
Flujo de despliegue de cuantificación: Entrenamiento FP32 → Conjunto de calibración (500 imágenes de escenas típicas) → Cuantificación PTQ INT8 con TensorRT → Serialización del motor de inferencia (archivo .plan). Parámetros clave: resolución de entrada 640×640, umbral de confianza 0,5, umbral IoU de NMS 0,45. Tras la cuantificación, el modelo se reduce de 12,5 MB (FP32) a 4,2 MB (INT8), una compresión del 66%; la latencia de inferencia pasa de 8~12 ms (FP16) a 5~8 ms (INT8). Los archivos de despliegue se distribuyen por OTA al equipo de computación en el borde (paquete de actualización incremental de aproximadamente 5 MB por envío).
Pipeline de inferencia (proceso por fotograma): ① Captura de imagen de la cámara (30 fps, 1920×1080 → resize a 640×640) ② Inferencia TensorRT (YOLOv8n INT8, 5~8 ms) ③ Postprocesado NMS (1~2 ms) ④ Seguimiento de objetos ByteTrack (2~3 ms, basado en filtro de Kalman + emparejamiento húngaro) ⑤ Cálculo de distancia de colisión (1 ms) ⑥ Escritura de resultados en memoria compartida para lectura por el PLC. La latencia total por fotograma es de 10~14 ms, cumpliendo el requisito de detección en tiempo real a 30 fps (intervalo entre fotogramas de 33 ms, quedando 19~23 ms para la lógica de nivel superior).
Seguimiento multiobjeto ByteTrack y cálculo de distancia de colisión
YOLOv8n solo proporciona detección de objetos por fotograma (bounding box + clase + confianza), sin capacidad de seguir la trayectoria continua de los objetos. El algoritmo ByteTrack, partiendo de los resultados de detección, predice la posición de cada objeto en el siguiente fotograma mediante un filtro de Kalman y empareja las detecciones con las trayectorias existentes usando el algoritmo húngaro. La ventaja de ByteTrack frente a DeepSORT: no requiere extracción de características ReID (eliminando la carga adicional de inferencia CNN), lo que lo hace adecuado para despliegue en el borde con recursos computacionales limitados.
Cálculo de distancia de colisión: Tras obtener la posición y el vector de velocidad en tiempo real de cada equipo (gancho de puente grúa, AGV, personal) mediante el seguimiento de trayectorias, se calcula la distancia de máximo acercamiento (DCPA, Closest Point of Approach) y el tiempo de máximo acercamiento (TCPA) entre cada par. Fórmula: DCPA = |d × (v_rel)| / |v_rel|, donde d es el vector de diferencia de posición entre dos objetos y v_rel es el vector de velocidad relativa. Se activa una alerta cuando DCPA < umbral de seguridad (puente grúa-puente grúa: 1,5 m; puente grúa-personal: 2,0 m) o TCPA < 2 segundos. El cálculo de colisión se ejecuta en cada fotograma y los resultados se escriben en el bloque de datos de memoria compartida (64 bytes, incluyendo ID del objeto, distancia, velocidad y grado de riesgo) entre el equipo de borde y el PLC.
Configuración del protocolo de comunicación entre el equipo de borde y el PLC
El equipo de computación en el borde intercambia datos con el PLC del puente grúa (S7-1200/1500) mediante Profinet o Modbus TCP. Configuración recomendada: el equipo de borde (Jetson Orin NX) ejecuta la pila de protocolo Profinet como esclavo (Siemens PROFINET Stack for Linux + tarjeta de red configurada como RT Class 1, ciclo de comunicación de 4 ms); en el lado del PLC, el equipo de borde se añade como dispositivo IO Profinet en la configuración de hardware. Bloque de intercambio de datos (Input/Output de 64 bytes cada uno): Input (equipo de borde → PLC) incluye grado de riesgo de colisión (0~3), distancia al objeto (mm), velocidad recomendada (% de la nominal) y estado del sistema; Output (PLC → equipo de borde) incluye coordenadas actuales del puente grúa, velocidad y modo de trabajo. Redundancia de comunicación: si la conexión Profinet se interrumpe durante más de 3 ciclos (12 ms), el PLC cambia automáticamente al modo de enclavamiento básico sin asistencia de IA; una falla del equipo de borde no afecta las operaciones básicas del puente grúa.
Verificación del despliegue e indicadores de rendimiento
Kelude Industrias Pesadas completó el despliegue de equipos de computación en el borde en 12 puentes grúa en el tramo de colada continua de una acería. Antes del despliegue, la alerta de colisión dependía de la inspección visual manual, con una latencia de respuesta de 3~5 segundos. Tras el despliegue, los indicadores clave son: mAP@0.5 de detección de objetos = 0,953 (promedio de cinco clases), latencia media de inferencia por fotograma de 6,8 ms (INT8), latencia de alerta de colisión de extremo a extremo ≤ 50 ms (desde la captura de imagen hasta la activación de la alerta en el PLC), y MTBF ≥ 10.000 horas (aproximadamente 14 meses) de funcionamiento continuo sin fallos. En los 6 meses posteriores al despliegue, los eventos de riesgo de colisión se redujeron de 23 a 0,4 por día (los restantes corresponden a maniobras evasivas de emergencia por entrada repentina de personal), y la puntuación de satisfacción del operador aumentó de 62 a 91 puntos. Kelude Industrias Pesadas ofrece un servicio integral que abarca desde la selección de hardware, el entrenamiento del modelo hasta el despliegue en campo; la reforma de computación en el borde por puente grúa tiene un coste aproximado de 1,5~2,5 millones de CNY (incluyendo equipo de borde + cámaras + instalación y puesta en marcha).
Comparativa de rendimiento de inferencia IA: FP16 vs cuantificación INT8
FP32 Bruto Precisión 12.5MB Latencia de inferencia 18~25ms m AP 0.953(Máximo) puente grúa No recomendado para este escenario | FP16 Semi Precisión 6.3MB Latencia de inferencia 8~12ms m AP 0.951(-0.2%) Nano Recomendación de versión | INT8 Cuantificación 4.2MB Latencia de inferencia 5~8ms m AP 0.948(-0.5%) NXRecomendación de versión |
Preguntas frecuentes (FAQ)
P: ¿Por qué no es suficiente la potencia de cálculo del RK3588 para visión por IA?
R: La NPU del RK3588 ofrece solo 6 TOPS, y la inferencia de YOLOv8n en FP16 presenta una latencia de 80~150 ms, insuficiente para detección en tiempo real a 30 fps (intervalo de 33 ms por fotograma). Si se reduce la tasa a 10 fps (latencia de 100 ms aceptable), el intervalo de detección para objetivos en movimiento rápido (p. ej., un AGV a 1 m/s se desplaza 100 mm por fotograma) es demasiado grande, lo que degrada significativamente la precisión del sistema de alerta de colisión. Por tanto, el RK3588 solo es adecuado como pasarela de adquisición de datos, no para inferencia de IA en tiempo real. Kelude recomienda como mínimo el Jetson Orin Nano (40 TOPS), que ofrece la mejor relación calidad-precio.
P: ¿Qué configuración se requiere para la comunicación Profinet entre el edge box y el PLC?
R: Se requieren tres pasos: ① instalar la pila de protocolo Profinet en el sistema Linux del edge box (se recomienda el SDK PROFINET IO-Device de Siemens o la pila de código abierto pnio_stack) y configurar el nombre del dispositivo y la dirección IP; ② en el PLC (TIA Portal), añadir el edge box como dispositivo IO de Profinet en "Dispositivos y redes" y asignar las direcciones IO (64 bytes de entrada y 64 bytes de salida); ③ implementar en la aplicación del edge box las funciones de lectura/escritura de datos IO, escribiendo los resultados de inferencia de IA en el área de entrada y leyendo el estado del PLC desde el área de salida. La configuración inicial requiere aproximadamente 1 día. Kelude ofrece una imagen de comunicación Profinet preconfigurada que permite omitir la configuración e iniciar el despliegue directamente.
P: ¿Cuántos datos se necesitan para el entrenamiento del modelo y qué precisión se puede alcanzar?
R: Kelude recomienda un primer entrenamiento con un mínimo de 20 000 imágenes etiquetadas (≥4 000 por clase), que cubran condiciones típicas de operación como día/noche, deslumbramiento y condiciones climáticas variadas. El mAP@0.5 puede alcanzar 0.93~0.96. Para el etiquetado se utiliza la herramienta LabelImg (anotación con cuadros delimitadores, aproximadamente 30 segundos por imagen). Kelude dispone de un conjunto de datos base de 120 000 imágenes anotadas de escenarios de puente grúa. Los nuevos clientes pueden realizar un ajuste fino (fine-tune) con 500~1 000 imágenes de su propio escenario sobre el modelo base, completando la adaptación en 2~3 días, con un mAP estable superior a 0.90.
P: ¿Puede el edge box funcionar de forma estable en acerías y plantas de cemento con altas temperaturas y polvo?
R: La versión industrial del Jetson Orin NX (Jetson Orin NX Industrial) soporta un rango de temperatura de -40 °C a 85 °C e incluye disipador y ventilador activo de serie. En naves de colada continua de acerías (temperatura ambiente de 45~55 °C, concentración de polvo de ~5 mg/m³) se han desplegado más de 50 unidades con 12 meses de funcionamiento continuo sin apagados por sobrecalentamiento. El edge box se instala en un armario de protección IP54 (con ventilador de refrigeración y filtro antipolvo), y la temperatura de la GPU se mantiene estable entre 65 y 72 °C. Kelude ofrece como opción un armario antipolvo y resistente a altas temperaturas (con enfriamiento por aire forzado y monitoreo de temperatura) a un precio de 800 yuanes por unidad.