Sistema de posicionamiento y mapeo SLAM visual para puente grúa
Sistema de mapeo y posicionamiento SLAM visual para puente grúa. El SLAM visual se ha consolidado como una tecnología clave para lograr un posicionamiento global preciso y fiable en entornos industriales donde la señal GPS no está disponible.
Posicionamiento de puente grúa con SLAM visual en nave industrial
Uno de los principales desafíos en la automatización de puentes grúa es lograr un posicionamiento global de alta precisión y fiabilidad en el interior de la nave industrial, donde la señal GPS no está disponible. Las soluciones de posicionamiento más extendidas actualmente —Sensor de Distancia Láser, bus de código Gray, encoder absoluto— ofrecen una Precisión de Posicionamiento milimétrica, pero presentan Defectos inherentes: el Sensor de Distancia Láser se ve gravemente afectado por la obstrucción del polvo; el bus de código Gray implica un alto coste de instalación y mantenimiento; y el Encoder sufre errores acumulativos y deriva de Posicionamiento por deslizamiento de las ruedas. Además, estas soluciones solo proporcionan información de posición en una o dos dimensiones, sin capacidad para percibir el ángulo de rumbo (guiñada) ni la actitud tridimensional de la grúa. Sin embargo, en aplicaciones como el Izaje flexible, el control de Antibalanceo y la evitación de obstáculos, la grúa requiere información espacial de seis grados de libertad.
El SLAM visual (Simultaneous Localization and Mapping) ofrece una nueva vía tecnológica para el Posicionamiento de grúas. Este sistema utiliza cámaras monoculares o estéreo montadas en el puente grúa para capturar continuamente imágenes del entorno de la nave. Mediante la extracción y correspondencia de puntos característicos ORB entre fotogramas, junto con una optimización de acoplamiento estrecho con datos inerciales IMU, el sistema estima simultáneamente la pose de seis grados de libertad de la grúa y construye un mapa disperso/denso del entorno, todo ello sin conocimiento previo del mismo. Las ventajas principales de esta tecnología son: primero, no requiere infraestructura de riel adicional —la cámara es el único Sensor, por lo que el coste de implementación es muy inferior al del bus de código Gray o la placa reflectante láser—; segundo, proporciona información de pose completa en seis grados de libertad (posiciones X, Y, Z y ángulos de balanceo, cabeceo y guiñada), lo que resulta determinante para el control de Antibalanceo y la Planificación de Trayectoria; tercero, la información de Posicionamiento es globalmente coherente por naturaleza, sin los problemas de deriva acumulativa del Encoder. En entornos de gran luz (vano de 30~50 m), la Precisión del SLAM visual puede alcanzar ±10 cm. Aunque no llega a la precisión milimétrica de la Medición láser de distancia, su inmunidad a la obstrucción puntual lo convierte en una solución de redundancia ideal frente a los sistemas láser o de Encoder, mejorando significativamente la fiabilidad general del sistema de posicionamiento.
▲ Sistema de mapeo SLAM visual para puente grúa — extracción de puntos característicos ORB · mapeo SLAM en tiempo real · pipeline de fusión multi-sensor VINS-Mono
Adaptación de ORB-SLAM3 y optimización de extracción de características
ORB-SLAM3 es uno de los frameworks de SLAM visual más maduros disponibles, compatible con modos de cámara monocular, estéreo y RGB-D. Integra cuatro Módulos principales: front-end de acoplamiento estrecho visual/visual-inercial con detección de puntos de confianza, optimización de back-end con ajuste de haces local (Bundle Adjustment, BA), detección de bucles y reutilización de mapas. Sin embargo, el uso directo de ORB-SLAM3 nativo en aplicaciones de puente grúa presenta tres problemas de ingeniería: la escasez de textura en el entorno de la nave industrial provoca un número insuficiente de puntos característicos; las vibraciones del puente grúa en movimiento causan inestabilidad en la correspondencia entre fotogramas; y los entornos de gran Luz provocan un crecimiento excesivo del mapa.
Estrategia de extracción de características adaptada a la nave industrial
El entorno de una nave industrial difiere significativamente del de una oficina: las paredes suelen ser de paneles metálicos lisos u hormigón, con alta repetición de textura y poca información de alta frecuencia; el suelo es de cemento, con textura extremadamente escasa. No obstante, la estructura del tejado (cerchas de acero, correas, lucernarios), el Carril de Grúa (Viga en I, Sujetador de Carril) y las Columnas de pórtico ofrecen una gran riqueza de bordes y esquinas como puntos característicos. Dada esta distribución de características, los Parámetros de extracción de características ORB nativos de ORB-SLAM3 requieren el siguiente ajuste:
| Parámetro | valor por defecto | valor adaptado para puente grúa | justificación del ajuste |
|---|---|---|---|
| nFeatures(número de extracciones por fotograma) | 1200 | 2000 | Textura escasa en nave industrial,aumentar el número de extracciones para garantizar pares de coincidencia suficientes |
| nScaleLevels(número de niveles de escala) | 8 | 5 | altura de funcionamiento fija del puente grúaión,cambio de escala pequeño,reducir el número de niveles para disminuir la carga computacional |
| scaleFactor(factor de escala) | 1.2 | 1.15 | reducir el factor de escala para aumentar la sensibilidad de las características de bajo nivel al movimiento |
| iniThFAST(umbral inicial) | 20 | 12 | reducir el umbral para extraer más puntos característicos en entornos de bajo contraste |
| minThFAST(mínimoumbral inicial) | 7 | 5 | relajar aún más la extracción en zonas de textura escasalímite inferior |
| pirámidePatchdimensión | 31x31 | 21x21 | reducir el Patch para mejorar la precisión de coincidencia de características de componentes de acero a larga distanciaaracterísticas de componentes de acero a larga distanciaPrecisión |
Además, para abordar las numerosas aristas rectilíneas presentes en la nave industrial (bordes de carril, diagonales de la estructura del tejado, aristas de columnas), se añade una capa de asistencia de emparejamiento basada en segmentos de línea tras la extracción de características ORB. Se emplea el algoritmo LSD (Line Segment Detector) para extraer segmentos rectos en la imagen, que posteriormente se describen y emparejan mediante el descriptor LBD (Line Band Descriptor). La incorporación de características de línea eleva la tasa de emparejamiento de aproximadamente el 35% (con la solución ORB pura) a cerca del 52%, mejorando significativamente la estabilidad de posicionamiento durante el movimiento a lo largo del carril.
2.2 Adaptación del front-end con acoplamiento estrecho visual-inercial
Las vibraciones mecánicas durante el funcionamiento del puente grúa (especialmente la resonancia de baja frecuencia provocada por el arranque/parada del mecanismo de elevación y el balanceo de la carga) interfieren gravemente en el front-end de SLAM visual. El modo puramente visual de ORB-SLAM3 sufre pérdidas de seguimiento entre fotogramas cuando la amplitud de la vibración supera ±50 píxeles. La solución adoptada es activar el modo de acoplamiento estrecho visual-inercial (VI) de ORB-SLAM3, incorporando los datos de medición de velocidad angular y aceleración del IMU (Unidad de Medición Inercial):
- Preintegración del IMU: En el intervalo de tiempo entre dos fotogramas (típicamente 33~50 ms, correspondiente a 20~30 fps), se integran numéricamente la velocidad angular ω y la aceleración a del IMU para obtener la rotación relativa ΔR, la velocidad Δv y el desplazamiento Δp entre fotogramas. El modelo de preintegración incluye el sesgo (bias) del IMU como variable de optimización en el vector de estado, optimizándolo conjuntamente con el error de reproyección visual, evitando así la dependencia de una calibración previa del sesgo del IMU.
- Inicialización conjunta visual-inercial: Durante la fase de arranque del SLAM, se realiza primero una estimación de pose en modo puramente visual durante 5~15 fotogramas, mientras se utilizan las mediciones del IMU para estimar la dirección de la gravedad, el sesgo del acelerómetro y la velocidad inicial. Cuando el error de alineación entre la visión y la inercia converge por debajo del umbral (típicamente un residual de aceleración <0,5 m/s²), se cambia al modo de acoplamiento estrecho VI.
- Mejora de la robustez ante vibraciones: En modo VI, el IMU proporciona una predicción de alta frecuencia del movimiento entre fotogramas (frecuencia de muestreo del IMU de 200~400 Hz, muy superior a los 20~30 fps de la cámara). Cuando la vibración provoca fallos en el emparejamiento de características visuales, la pose predicha por el IMU actúa como una restricción previa fuerte que reduce el área de búsqueda de características, reduciendo la tasa de pérdida de seguimiento de aproximadamente el 8% en modo puramente visual a aproximadamente el 0,5% en modo VI.
2.3 Estrategia de gestión de mapas para naves de gran luz
El rango de operación del puente grúa en naves de gran luz (longitud de 100~300 m) provoca una expansión drástica del tamaño del mapa en ORB-SLAM3. Tras una hora de funcionamiento continuo, el número de fotogramas clave (KeyFrame) en el mapa disperso puede alcanzar los 3000~5000, y el número de puntos del mapa (MapPoint) es de 150 000 a 250 000, superando la capacidad de procesamiento en tiempo real del dispositivo periférico Jetson. Para abordar este cuello de botella de ingeniería, se adoptan las siguientes tres medidas de optimización:
- Poda del grafo de covisibilidad (Covisibility Graph): Cuando el número de fotogramas clave en el mapa supera el umbral máximo (establecido en 1000 fotogramas), se activa la operación de poda: se eliminan los fotogramas clave redundantes que comparten menos de 15 puntos del mapa con el fotograma actual. La poda del grafo de covisibilidad se activa cada 50 fotogramas procesados, eliminando aproximadamente el 5~10% de los fotogramas redundantes en cada operación, manteniendo el tamaño del mapa establemente dentro de un consumo de memoria <2 GB.
- Gestión activa del mapa local: El área de operación del puente grúa se divide en celdas de cuadrícula de 50 m × 30 m, manteniendo cada celda un submapa. Al cruzar el límite de una celda, se activa el cambio de submapa, cargando solo los submaps de la celda actual y las 8 celdas adyacentes en el optimizador para el cálculo de BA local. Los submaps de áreas remotas se almacenan en disco en formato comprimido y se cargan bajo demanda (por ejemplo, cuando la detección de bucle cerrado coincide con un fotograma clave remoto).
- Detección de bucle cerrado incremental: Se utiliza el modelo de bolsa de palabras DBoW2 para generar un vector de palabras visuales para cada nuevo fotograma clave, que se compara con los fotogramas clave históricos. Cuando se detecta un candidato a bucle cerrado y se supera la verificación geométrica, se activa la optimización del grafo de poses (Pose Graph Optimization) en lugar de la optimización BA global: la optimización del grafo de poses solo optimiza las poses de los fotogramas clave sin ajustar las posiciones de los puntos del mapa, con un coste computacional de aproximadamente 1/10 del BA global, completando la optimización de una escala de 3000 fotogramas en 500 ms.
3. Despliegue del sistema de posicionamiento VINS-Mono
VINS-Mono (Visual-Inertial System - Monocular) es un sistema SLAM visual-inercial de código abierto desarrollado por el equipo de Shaojie Shen en la Universidad de Ciencia y Tecnología de Hong Kong, que emplea un esquema de acoplamiento estrecho con cámara monocular e IMU de seis ejes. En comparación con ORB-SLAM3, el diseño de optimización no lineal de ventana deslizante de VINS-Mono ofrece una mayor ventaja en tiempo real, lo que lo hace más adecuado para escenarios de despliegue periférico en puentes grúa con recursos computacionales limitados.
3.1 Arquitectura de adaptación de VINS-Mono para puente grúa
El flujo de procesamiento completo de VINS-Mono se divide en cuatro módulos: seguimiento visual frontal, preintegración del IMU, optimización de ventana deslizante y detección de bucle cerrado. Los puntos clave de adaptación en el escenario del puente grúa son el ajuste de parámetros y la calibración de los parámetros extrínsecos de los sensores:
| Módulo | nativoParámetro | puente grúavalor adaptado | descripción |
|---|---|---|---|
| tamaño de ventana | 10fotograma | 15fotograma | puente grúaVelocidad de Traslación<1m/s,aumentar la ventana para mejorar la suavidad de la estimación de estado |
| número de puntos característicos rastreados | 150 | 250 | Nave industrialtextura escasa,aumentar los puntos de seguimiento para mejorar la robustez |
| mínimoparalaje(píxel) | 10 | 5 | puente grúaparalaje pequeño a baja velocidad de funcionamiento,reducir el umbral para activar la optimización entre fotogramas |
| IMUintegraciónFrecuencia(Hz) | 200 | 400 | aumentarIMUaumentar la frecuencia de muestreo para mejorar la predicción de movimiento en escenarios de vibraciónPrecisión |
| acelerómetroruidoDensidad | 0.01 | 0.02 | puente grúarelajar el ruido en entornos de vibraciónvelocidadsuposición de ruido |
| giróscoporuidoDensidad | 0.001 | 0.002 | puente grúamovimiento de guiñada reducido,ángulo de relajaciónvelocidadsuposición de ruido |
3.2 Calibración extrínseca cámara-IMU y sincronización temporal
La precisión de un sistema de fusión visual-inercial depende en gran medida de la calibración precisa de los parámetros extrínsecos entre la cámara y la IMU (matriz de rotación R y vector de traslación t), así como del desfase temporal t_offset. En el dispositivo de computación en el borde del puente grúa (NVIDIA Jetson Orin NX), se implementa el siguiente proceso de calibración en tres etapas:
- Calibración gruesa fuera de línea: En el entorno de laboratorio, se utiliza un patrón de tablero de ajedrez para la calibración de los parámetros intrínsecos de la cámara (fx, fy, cx, cy, k1, k2, p1, p2), mientras que la IMU se calibra mediante el método de seis posiciones (sesgo del acelerómetro y factor de escala). Requisitos de precisión: error de reproyección de la cámara <0,3 píxeles; estabilidad del sesgo del acelerómetro de la IMU <0,1 mg.
- Calibración fina en línea: Tras la instalación del equipo en el puente grúa, se desplaza el puente a lo largo del carril siguiendo una trayectoria en forma de S. Aprovechando la función de calibración en línea integrada en VINS-Mono, se optimizan continuamente los parámetros extrínsecos cámara-IMU durante la ejecución del SLAM. Los valores extrínsecos iniciales se obtienen de los planos de diseño mecánico (precisión de ±2 mm/±0,5°), y la calibración en línea converge a valores con una precisión de ±0,1 mm/±0,02° tras 1000 fotogramas.
- Sincronización temporal por hardware: La alineación de las marcas de tiempo de la cámara y la IMU es un requisito fundamental para la precisión del sistema. Se adopta un esquema de sincronización por disparo de hardware: la señal 1PPS (pulso por segundo) de la IMU se utiliza como señal de disparo externo para la cámara, alineando estrictamente el instante de exposición de la cámara con el instante de muestreo de la IMU. Cuando no se dispone de sincronización por hardware (p. ej., cámara USB de bajo coste con IMU independiente), se emplea un algoritmo de alineación de marcas de tiempo por software: se aplica interpolación lineal y spline cúbico a las secuencias de mensajes de la IMU y de la cámara, respectivamente, buscando dentro de una ventana deslizante el desfase temporal t_offset que minimiza el error de reproyección visual. La precisión de sincronización del esquema por software es de ±2 ms, mientras que el esquema por hardware alcanza ±50 μs.
3.3 Evaluación comparativa de la precisión de posicionamiento
Se realizaron pruebas comparativas de VINS-Mono en una nave industrial estándar de 36 m de luz y 120 m de longitud. Condiciones de prueba: cámara Basler acA2040-25gm (resolución 2048×1536, 25 fps, obturador global), IMU ADIS16470 de grado táctico (estabilidad del sesgo del acelerómetro 0,1 mg, caminata aleatoria del ángulo del giróscopo 0,2°/√h), y dispositivo de computación en el borde NVIDIA Jetson Orin NX (25 W de consumo). La verdad de referencia se obtuvo mediante el sensor de distancia láser Leuze AMS 308i (precisión ±1 mm) y el SLAM con el escáner láser SICK LMS111:
| evaluaciónIndicador | solo visiónORB-SLAM3 | VI-ORB-SLAM3 | VINS-Mono |
|---|---|---|---|
| XejePosicionamientoerrorRMS(mm) | 185 | 82 | 65 |
| YejePosicionamientoerrorRMS(mm) | 210 | 96 | 78 |
| error de ángulo de guiñadaRMS(°) | 3.2 | 1.8 | 1.5 |
| transitorio máximoDesviación(mm) | 580 | 210 | 185 |
| tasa de pérdida de seguimiento(%) | 8.2 | 1.3 | 0.5 |
| tiempo de inferencia por fotograma(ms) | 68 | 95 | 42 |
| estado estacionarioCPUtasa de ocupación(%) | 62 | 78 | 55 |
Los resultados de las pruebas demuestran que VINS-Mono ofrece el mejor rendimiento integral en aplicaciones de puente grúa: error de posicionamiento de aproximadamente ±8 cm, tasa de pérdida de seguimiento de solo 0,5 %, tiempo de inferencia de 42 ms por fotograma (por debajo del umbral de tiempo real de 50 ms) y uso de CPU estable del 55 %, lo que lo convierte en la opción más adecuada para el despliegue en el borde. La ventaja de VINS-Mono radica en su mecanismo de optimización por ventana deslizante: optimiza únicamente el estado de los 15 fotogramas dentro de la ventana en cada iteración, evitando así la explosión computacional asociada a la optimización global.
Diseño del sistema de posicionamiento por fusión multisensor
La implementación independiente de SLAM visual presenta dos limitaciones inherentes: en primer lugar, en condiciones extremas como contraluz, polvo o baja iluminación nocturna, la extracción de características visuales puede fallar por completo; en segundo lugar, la frecuencia de salida del SLAM visual está limitada por la tasa de fotogramas de la cámara (típicamente 25–30 Hz), lo que impide satisfacer los requisitos de control en tiempo real en escenarios de movimiento a alta velocidad. Por lo tanto, en la práctica de ingeniería, el SLAM visual debe fusionarse con sensores como encoders y Sensores de Distancia Láser para construir un sistema de posicionamiento redundante y fiable.
Marco de fusión con filtro de Kalman extendido
El núcleo del sistema de posicionamiento por fusión es el Filtro de Kalman Extendido (EKF), que integra a una frecuencia de 25 Hz las estimaciones de estado procedentes de cuatro fuentes de sensor:
- SLAM visual (VINS-Mono, 25 Hz): proporciona posición tridimensional (x, y, z), orientación tridimensional (roll, pitch, yaw) y su correspondiente matriz de covarianza. El SLAM visual presenta alta confianza en áreas con textura rica, mientras que la covarianza aumenta automáticamente en zonas con iluminación insuficiente o textura escasa.
- Encoder absoluto (Heidenhain ECN1313, 1 kHz): proporciona medición de posición unidimensional para el Carro Puente y el Carro, con una precisión de ±0,1 mm. El encoder ofrece una confianza muy alta en ausencia de deslizamiento, pero puede generar errores acumulativos en caso de deslizamiento o giro en vacío de las ruedas.
- Sensor de Distancia Láser (Leuze AMS 308i, 100 Hz): proporciona medición de posición absoluta unidimensional en la dirección del Carro Puente, con una precisión de ±1 mm. El Sensor de Distancia Láser ofrece una precisión muy alta sin obstrucciones, pero falla por completo cuando el reflector o el retrorreflector queda obstruido.
- Datos inerciales de seis ejes del IMU (ADIS16470, 400 Hz): proporcionan predicción de movimiento de alta frecuencia para interpolación entre fotogramas y estimación de pose durante breves pérdidas de señal visual.
| variable de estado | significado | fuente de observación | ruido de observación típicoσ |
|---|---|---|---|
| x, y | posición en el sistema de coordenadas terrestre | solo visiónSLAM+láser+Encoder | 0.08m / 0.001m / 0.0001m |
| z | Altura de Elevación | soloEncoder | 0.0001m |
| vx, vy | movimientovelocidad | Encoderdiferencial+solo visión | 0.005m/s |
| θ (yaw) | ángulo de guiñada | solo visiónSLAM+IMUintegración | 1.5° |
| enc_bias_x | EncoderacumulaciónDesviación | con visión/estimación de diferencia con láser | adaptativo |
La fase de predicción del EKF utiliza el modelo cinemático de diferencial de dos ruedas del puente grúa, tomando la velocidad del encoder y la velocidad angular del IMU como entradas de control; la fase de actualización se ejecuta secuencialmente según el orden de llegada de los sensores: Sensor de Distancia Láser (100 Hz) > encoder (1 kHz diezmado a 200 Hz) > SLAM visual (25 Hz) > corrección de velocidad cero del IMU (entrada a 400 Hz, pero utilizada únicamente para la estimación de movimiento en la fase de predicción). En la implementación práctica, es fundamental prestar especial atención a la alineación temporal de los sensores: las marcas de tiempo de todos los sensores deben convertirse al dominio de reloj maestro del controlador del puente grúa (sincronización mediante protocolo NTP o PTP). Cuando el EKF recibe una nueva observación, consulta automáticamente el estado de predicción correspondiente a ese instante para realizar la actualización.
4.2 Detección de fallos de sensores y asignación dinámica de pesos
Un sensor único puede fallar en cualquier momento en entornos industriales; por lo tanto, el sistema de posicionamiento por fusión debe incorporar capacidad de detección automática de fallos y operación degradada. Cada sensor mantiene una puntuación de salud H_i, con un rango de valores [0, 1], calculada a partir de los siguientes indicadores:
- Indicador de calidad de señal: la intensidad de la señal reflejada (RSSI) del Sensor de Distancia Láser; si cae por debajo del umbral, su peso se reduce automáticamente. El número de puntos de seguimiento interno del SLAM visual; si es inferior a 20 puntos, la confianza visual se establece en cero.
- Prueba de consistencia: el residual normalizado (distancia de Mahalanobis) entre las observaciones de cada sensor y la predicción del EKF se compara con un umbral. Si se supera el umbral en 3 ocasiones consecutivas, se activa la marca de fallo del sensor.
- Validez temporal: la diferencia entre la marca de tiempo de la observación más reciente del sensor y el tiempo actual; si supera el retardo máximo permitido (láser 50 ms, visual 100 ms, encoder 10 ms), el peso se reduce automáticamente.
La puntuación de salud ajusta dinámicamente la matriz de covarianza del ruido de observación correspondiente al sensor en el EKF: R_i = R_base / H_i. Cuando H_i cae por debajo de 0.1, el sensor se excluye por completo de la actualización del EKF, y los sensores restantes continúan con la fusión. En caso de fallo total del sistema visual (por ejemplo, durante el mantenimiento nocturno con el sistema apagado), el sistema de fusión se degrada a un modo de tres sensores (láser + encoder + IMU), manteniendo una Precisión de Posicionamiento de ±3 mm. Cuando el sistema visual se recupera, el mecanismo de monitoreo de residuales del EKF restablece el peso visual a su nivel normal en 3 a 5 ciclos de actualización (aproximadamente 0.1 a 0.2 s).
4.3 Unificación del sistema de coordenadas del suelo y alineación con el mapa
- Alineación inicial: durante la primera operación del puente grúa, se obtiene la posición absoluta inicial (x0, y0) mediante el Sensor de Distancia Láser y el encoder, mientras que el SLAM visual proporciona la pose relativa en ese instante (x'_0, y'_0, θ'_0). Se calcula la matriz de transformación homogénea T_map_init = T_abs / T_rel para resolver la Desviación inicial.
- Corrección en línea: durante la operación, se recopilan continuamente pares de datos de la pose del SLAM visual y la posición absoluta del láser/encoder. Se ajusta la matriz de transformación óptima mediante el método de mínimos cuadrados. Cuando el sistema visual se reinicializa (por ejemplo, tras una pérdida de visión), se utiliza la matriz de transformación más reciente para realinear el sistema de coordenadas, evitando cambios bruscos de pose que puedan afectar al sistema de control del puente grúa.
- Anclaje con hitos semánticos: se colocan etiquetas AprilTag (de 200 mm de lado) en posiciones fijas dentro de la Nave industrial (como numeración de Columnas o posiciones de Junta de Carril). Cuando el SLAM visual detecta una AprilTag durante la operación, asocia automáticamente el ID de la etiqueta con su coordenada prealmacenada en la Nave industrial, utilizándola como punto de anclaje de coordenadas absolutas para corregir la deriva acumulativa. La frecuencia típica de corrección por anclaje AprilTag es de una vez cada 50 a 100 m de longitud de Carril, con una corrección máxima de <5 cm.
5. Despliegue en obra y optimización del rendimiento
5.1 Selección de hardware y esquema de instalación
| Componente | recomendadoModelo | críticoParámetro | posición de montaje |
|---|---|---|---|
| cámara industrial | Basler acA2040-25gm | 2048x1536, 25fps, obturador global | Estructura del carromontaje frontal,ángulo de elevación15° |
| IMU | ADIS16470 | aceleración triaxial±40g, giroscopio de tres ejes±2000°/s | parte posterior de la cámara,conexión rígida |
| lente | Kowa LM12HC | 12mmdistancia focal, F1.8-F16, Cinterfaz | con filtro polarizador para reducir reflejos |
| luz de relleno | IRluz de relleno en matriz 850nm | Potencia30W, distancia de iluminación≥15m | montaje coaxial con la cámara |
| Computación en el Borde | NVIDIA Jetson Orin NX | 100TOPS AIpotencia de cómputo, consumo de energía25W | armario eléctrico del puente grúainterno, montaje con amortiguación de vibraciones |
| Encoder | Heidenhain ECN1313 | 23bit, EnDat 2.2interfaz | Carro Puente/CarroRueda motrizextremo del eje |
5.2 Proceso de implementación y puntos de control clave
- Instalación y calibración de la cámara: La cámara se fija en la posición frontal de la Estructura del carro, con un ángulo de elevación de 15° para captar simultáneamente las texturas de la vía cercana y del techo de la Nave industrial en la distancia. Se utiliza un patrón de calibración de tablero de ajedrez plano (12×9 casillas, separación de 30 mm) para calibrar los parámetros intrínsecos de la cámara, exigiendo un error de reproyección <0,3 píxeles. Tras la calibración, se fija la distancia focal con un objetivo de focal fija para evitar que las vibraciones aflojen el enfoque y provoquen una desviación de los parámetros intrínsecos.
- Calibración del IMU y compensación térmica: El módulo IMU se introduce en una cámara climática y se registran las curvas de temperatura del punto cero y del factor de escala del acelerómetro y del giróscopo en un rango de -20 °C a 70 °C, con incrementos de 10 °C. Se establece un modelo de compensación térmica (interpolación lineal por segmentos, paso de compensación de 1 °C). Los coeficientes de compensación térmica del IMU se escriben en el archivo de configuración del dispositivo periférico y, durante el funcionamiento, se consultan en tiempo real según las lecturas del Sensor de Temperatura interno del IMU.
- Creación del mapa de detección de bucles: Antes de la primera operación automatizada del puente grúa, se realizan dos recorridos completos a lo largo del Carril a una velocidad baja de 0,3 m/s (movimiento combinado del Carro Puente y del Carro) para establecer el mapa inicial de detección de bucles del entorno de la Nave industrial. Tras la creación inicial del mapa, se verifica manualmente la cobertura del mapa (comprobando si hay áreas inexploradas que superen el 50 % en los bordes) y la calidad de las restricciones de bucle (verificando que el error de reproyección medio tras la optimización del grafo de poses sea <2 píxeles).
- Verificación del sistema de coordenadas: Con la ayuda de una estación total (precisión ±1 mm, como Leica TS16), se calibran las coordenadas de 10 puntos de control distribuidos uniformemente en la Nave industrial. Se localizan las posiciones visuales de estos puntos de control en el mapa SLAM y se calcula la Desviación respecto a las coordenadas reales. Si la desviación es <8 cm en la zona central y <15 cm en las zonas periféricas, se considera que la alineación del sistema de coordenadas es correcta.
- Prueba de funcionamiento continuo: Se realiza una Prueba de Posicionamiento continuo ininterrumpido durante 24 horas, monitorizando los siguientes Indicadores: Desviación máxima de Posicionamiento <15 cm, pérdidas de seguimiento <3 veces, intervalo de salida de la fusión EKF (tiempo sin observaciones válidas) <200 ms. Si cualquiera de estos parámetros no se cumple, se vuelve al paso correspondiente para su revisión.
5.3 Claves para la optimización del rendimiento
- Aceleración GPU de la extracción de características: La detección de esquinas FAST y el cálculo del descriptor BRIEF de la extracción de características ORB pueden acelerarse mediante CUDA en la GPU del Jetson, reduciendo el tiempo de extracción de características por fotograma de 15 ms a 3 ms. Se utilizan las librerías VisionWorks o VPI (Vision Programming Interface) de NVIDIA para implementar la aceleración por GPU.
- Paralelización de la línea de producción con múltiples núcleos: El seguimiento de características del front-end de VINS-Mono (intensivo en CPU, asignado a CPU2-3), la preintegración del IMU (cálculo ligero, asignado a CPU0) y la optimización de la ventana deslizante del back-end (intensivo en memoria, asignado a CPU4-5) se distribuyen en tres hilos independientes, aprovechando la CPU de 6 núcleos del Jetson Orin NX para lograr un procesamiento en pipeline. La latencia total entre fotogramas del sistema (desde la captura de imagen del front-end hasta la salida de la optimización de la ventana deslizante) se reduce de 42 ms en modo serie a 28 ms en modo pipeline.
- Cuantificación del modelo e inferencia INT8: En escenarios con cambios bruscos de iluminación (día/noche) que provocan una insuficiencia de puntos característicos ORB, se puede emplear la red neuronal ligera de extracción de características SuperPoint en lugar de las características ORB manuales. Los pesos de la red SuperPoint se cuantifican a INT8 (pérdida de Precisión <2 %) y se ejecutan con TensorRT en la GPU del Jetson. La extracción de características y la descripción por fotograma tardan aproximadamente 8 ms, pudiendo generar simultáneamente 300 características de esquina de alta calidad y descriptores de 256 dimensiones.
Casos de aplicación típicos y resultados
6.1 Retroalimentación de pose para el control de Antibalanceo flexible
El control de Antibalanceo de los puente grúa tradicionales depende de un sensor de ángulo para medir directamente el ángulo de desviación de la Elevación, pero su instalación es difícil y su mantenimiento complejo. La pose tridimensional en tiempo real de la Elevación (posición + ángulo de guiñada) proporcionada por el SLAM visual puede utilizarse como retroalimentación de pose para el controlador antisway: el controlador ajusta preventivamente la velocidad del Carro Puente y del Carro (compensación feedforward) según la tasa de cambio del ángulo de guiñada proporcionada por el SLAM, contrarrestando la oscilación de la carga. En una aplicación real en el taller de acabado de una acería, un puente grúa con retroalimentación antibalanceo basada en VINS-Mono, operando a una Velocidad de Traslación de 1,5 m/s y una distancia de recorrido de 25 m, redujo la oscilación residual de la carga tras la parada de 650 mm (sin antibalanceo) a 80 mm, y el tiempo de amortiguación de la oscilación se acortó de 12 s a 3,5 s.
6.2 Redundancia de Posicionamiento global en operaciones no tripuladas
En un almacén automatizado de paneles con una Luz de 30 m y una longitud de 150 m, dos puente grúa realizan operaciones no tripuladas de entrada y salida de paneles. El sistema de posicionamiento utiliza como esquema principal la Medición láser de distancia con Encoder absoluto, y el SLAM visual como respaldo redundante. Durante 3 meses de funcionamiento continuo, el tiempo de indisponibilidad del SLAM visual fue solo del 0,3 % (principalmente durante paradas nocturnas y en condiciones de concentración de polvo extremadamente alta). En los 17 eventos en los que el Sensor de Distancia Láser falló temporalmente debido a la obstrucción de una carretilla elevadora, el SLAM visual asumió con éxito la tarea de Posicionamiento en todos los casos, y las operaciones del puente grúa no se detuvieron por interrupciones en el Posicionamiento.
6.3 Anclaje espacial para el mapeo virtual-físico del Gemelo Digital
El sistema de Gemelo Digital del puente grúa necesita mapear la posición y orientación en tiempo real del puente grúa físico en un escenario virtual tridimensional. La pose de seis grados de libertad proporcionada por el SLAM visual ofrece la entrada de coordenadas directa para este mapeo: una vez calibradas las coordenadas de anclaje de los equipos del modelo 3D de la fábrica en el mapa SLAM, la sincronización entre la visualización del gemelo y las acciones físicas es <30 ms, cumpliendo con los requisitos básicos de Monitoreo en tiempo real. En comparación con el esquema tradicional de mapeo por Encoder + cálculo de modelo (que solo puede mapear la posición, no la guiñada ni la actitud de cabeceo), el esquema SLAM visual permite que el sistema de Gemelo Digital refleje fielmente las micro-variaciones de actitud del puente grúa durante la operación (como la ligera inclinación debida a la carga excéntrica del Carro), ofreciendo al personal de mantenimiento una experiencia de Monitoreo remoto más realista.