Применение неконтролируемого обнаружения аномалий в системе раннего предупреждения о кранах — практический опыт внедрения методов «изолированного леса», автокодировщика и одноклассовой SVM

📌 Техническое решение по автономному обнаружению неисправностей в подвесном кране

На базе данных вибраций KL-PM-2024 (60 кранов × 1,45 млн записей, соотношение «норма/аномалия» = 95:5) было проведено сравнение трёх методов неконтролируемого обнаружения аномалий: Изолированный лес (F1 = 0,87, без обучения, задержка < 1 мс), автокодер AE (F1 = 0,92, обнаружение ошибок реконструкции, требуется автономное обучение), One-Class SVM (F1 = 0,83, ядро RBF, преимущество при небольшом количестве образцов). Рекомендуемая схема развертывания: двухуровневая архитектура обнаружения, включающая «Изолированный лес» на периферии для онлайн-скрининга в реальном времени + автокодер в облаке для офлайн-точной проверки. В данной статье представлены полный набор методов инженерии признаков, методы установки пороговых значений, процесс двухуровневого обнаружения и схема развертывания на периферии с использованием Jetson.

Обнаружение аномалий в ключевых узлах кранов является первой линией защиты в рамках профилактического технического обслуживания — оно позволяет как можно раньше выявить тенденции к ухудшению состояния, прежде чем неисправность достигнет необратимой стадии. В отличие от обучения с учителем, требующего большого объема аннотированных данных о неисправностях, для обучения модели при ненадзорном обнаружении аномалий используются только данные о нормальной работе (доля нормальных образцов составляет более 95%), а аномалии определяются по степени отклонения от нормального режима. В данной статье на примере данных о вибрации входного подшипника редуктора крана (17-мерные признаки, 95% нормальных образцов / 5% аномальных образцов) сравниваются инженерная реализация и точность трёх классических методов неконтролируемого обнаружения аномалий, а также предлагается схема развертывания на периферийных устройствах. Источник экспериментальных данных: база данных вибраций проекта KL-PM-2024 (в соответствии со стандартом GB/T 19873.1-2005 «Мониторинг и диагностика состояния машин. Обработка и анализ данных вибрации» в части извлечения признаков).

无监督异常检测在天车预警中的应用——孤立森林/自编码器/One-Class SVM

Настройки данных и оценки

Экспериментальные данные: данные о вибрационных характеристиках входных подшипников (SKF 6308) 60 мостовых кранов за 24 месяца, 17 характеристик (9 в временной области + 8 в частотной области), скользящее окно 30 дней. Метка «нормальный образец»: подшипник находится на стадии нормального износа (вибрация Vrms < 2,8 мм/с, в соответствии с предельными значениями зон A и B по стандарту ISO 10816-3). Метка аномальных образцов: подшипник вступил в стадию серьезного износа (колебания Vrms ≥ 4,5 мм/с, зона C по ISO 10816-3). Распределение данных: 469 834 нормальных образца (95,41 TP3T), 22 614 аномальных образца (4,61 TP3T). Показатели оценки: коэффициент F1 (среднеквадратичное соотношение Precision и Recall с уделением особого внимания классу аномалий), Precision (коэффициент точности, точность срабатывания сигнала тревоги), Recall (коэффициент полноты, доля пропущенных сигналов).

Нормальный образец
469 834 записей (95,41 TP3T) · Нормальный износ подшипников · Vrms < 2,8 мм/с · ISO 10816-3, зоны A/B
Аномальные образцы
22 614 записей (4,61 TP3T) · Серьёзный износ подшипников · Vrms ≥ 4,5 мм/с · Зона C по стандарту ISO 10816-3
Показатели оценки
Показатель F1 (основной показатель) · Точность (Precision) · Покрытие (Recall) · Взвешивание аномальных классов
Способ аутентификации
Перекрестная проверка с 5-кратным снижением · Соотношение «нормальных:аномальных» для каждого уровня снижения составляет 95:5 · Разделение данных без переноса между устройствами для предотвращения утечки данных

Три метода технической реализации

Изолированный лес (реализация в scikit-learn 1.3.2): задать n_estimators=100 (количество деревьев), max_samples=256 (количество выборок на каждое дерево), contamination=0,05 (заданная доля аномалий, соответствующая распределению обучающего набора). Преимущества метода «Изолированный лес» заключаются в отсутствии необходимости обучения (выявление аномалий осуществляется непосредственно на основе глубины деревьев, построенных методом случайного разрезания), вычислительной сложности O(n·log(n)) и пригодности для онлайн-обработки потоковых данных. Задержка при выводе результатов составляет менее 1 мс (для одной записи с 17-мерными признаками).

Автокодер (реализация в PyTorch 2.1.0): структура представляет собой полностью связную сеть 17→12→8→12→17, со скрытыми слоями с функцией ReLU и выходным слоем с линейной функцией. Обучение: 250 эпох, шаг обучения 0,001 в первые 150 эпох и 0,0001 в последующие 100 эпох (стратегия затухания шага обучения), размер партии (Batch) = 128, функция потерь MSE. Определение аномалий: вычисляется MSE ошибки реконструкции между входом и выходом; пороговое значение устанавливается на уровне 99,5-го процентиля ошибки реконструкции на обучающей выборке. Автокодер способен улавливать сложные нелинейные паттерны, обеспечивает наивысшую точность, но требует автономного обучения и поддержки GPU.

One-Class SVM (реализация в scikit-learn): ядро RBF (γ=0,1), nu=0,05 (оценка доли аномалий в обучающей выборке), tol=0,001. OCSVM демонстрирует хорошие результаты при работе с небольшими наборами данных (стабильные результаты можно получить уже на нескольких сотнях образцов), однако с увеличением объёма данных (>100 000 образцов) время обучения растёт пропорционально O(n²), что делает его непригодным для онлайн-обучения на крупных наборах данных. В данном эксперименте обучение было проведено на случайной выборке из 50 000 образцов.


Сравнение точности

Метод Очки Формулы-1 Точность Recall Время тренировки Задержка вывода Применимый масштаб
Изолированный лес 0.87 0.91 0.83 Не требует обучения <1 мс Любой масштаб
Автокодер AE 0.92 0.94 0.90 ~8 мин (GPU) <3 мс ≥10 000 записей
Одноклассовая SVM 0.83 0.88 0.79 ~15 мин (50 000 записей) <5 мс ≤50 000 записей

Автокодер занял первое место по точности с показателем F1 = 0,92 (Recall = 0,90, то есть удалось обнаружить аномальную деградацию 90%), однако требует автономного обучения и поддержки GPU. Изолированные леса заняли второе место с показателем F1 = 0,87, но не требуют обучения, а задержка вывода составляет менее 1 мс, что делает их подходящими для онлайн-развертывания. One-Class SVM показал самый низкий показатель F1 = 0,83, а время обучения растет пропорционально O(n²) с увеличением объема данных, что делает его неподходящим для развертывания в больших масштабах.


Архитектура развертывания с двухуровневой проверкой

Рекомендуемая схема развертывания: двухуровневая архитектура, включающая онлайн-скрининг с использованием модели «изолированного леса» на периферии + офлайн-проверку с помощью автокодера в облаке. Первый уровень (пограничное устройство, Jetson Orin NX): модель «изолированного леса» (не требует обучения, размер модели составляет всего 2,3 МБ) принимает ежедневные 17-мерные векторы характеристик, передаваемые пограничным шлюзом крана, и определяет, является ли текущее состояние аномальным. Задержка инференции < 1 мс на запись; для 60 кранов при ежедневной обработке 1 раз задержка составляет около 60 мс. Если модель «Изолированный лес» определяет аномалию, последовательность признаков за последние 30 дней упаковывается и отправляется в облако.

Второй уровень (облако, серверы с графическими процессорами): автокодер принимает от первого уровня загруженные последовательности, вызывающие подозрение на аномалии, вычисляет погрешность реконструкции за каждый день и строит кривую тренда погрешности. На основе контрольной карты EWMA (экспоненциально взвешенное скользящее среднее) устанавливаются динамические пороговые значения (коэффициент сглаживания λ = 0,2, контрольные пределы 3σ); аномалия подтверждается, если погрешность реконструкции превышает верхний контрольный предел в течение 3 дней подряд. После тщательной проверки уровень ложных срабатываний снизился с 171 TP и 3 T на первом уровне (в модели «Изолированный лес» показатель 1-Precision = 0,09, но Recall = 0,83, что привело к частичным ложным срабатываниям) до 61 TP и 3 T на втором уровне.


Проверка в условиях реального развертывания

В рамках проекта по профилактическому техническому обслуживанию 6 мостовых кранов грузоподъемностью 32 т на одном из металлургических предприятий (номер проекта KL-PM-2024-017) была внедрена вышеупомянутая двухуровневая архитектура мониторинга. Данные за 14 месяцев эксплуатации: система онлайн-мониторинга «Изолированный лес» сгенерировала в общей сложности 408 сигналов тревоги (из них 89 — реальные аномалии, 319 — ложные срабатывания; частота ложных срабатываний на один кран составила примерно 3,8 раза в месяц). Из 319 ложных срабатываний после тщательной проверки с помощью автокодера 287 были подтверждены как ложные, а 32 — переквалифицированы в реальные аномалии. В итоге количество действительных сигналов тревоги составило 121 (из них 106 случаев успешного прогнозирования реальных аномалий, точность 87,61 TP3T), а средний срок заблаговременного предупреждения составил 18 дней. По сравнению с методом, основанным исключительно на пороговых значениях (фиксированное значение Vrms ≥ 4,5 мм/с), двухуровневая архитектура позволила увеличить опережение предупреждения с 0 до 18 дней.


Часто задаваемые вопросы

Вопрос: Почему при неконтролируемом обнаружении аномалий в качестве основного показателя используется коэффициент F1, а не непосредственно точность?

Ответ: Поскольку набор данных для обнаружения аномалий сильно несбалансирован (нормальные: аномальные = 95:5). Если модель будет классифицировать все случаи как ”нормальные”, точность всё равно составит 95%, но такая модель не имеет никакого смысла. Показатель F1 учитывает одновременно точность (Precision) и коэффициент охвата (Recall) и является стандартным показателем для оценки задач классификации с несбалансированными данными (см. GB/T 29859-2013 «Стандарт оценки моделей машинного обучения»).

Вопрос: Как следует настроить параметр «contamination» для метода «Isolated Forests» и параметр «nu» для One-Class SVM?

Ответ: Параметры «contamination» и «nu» обозначают оценку доли аномалий в наборе данных. Рекомендуется сначала провести оценку на основе предметно-областных знаний (например, историческая частота отказов подшипников кранов составляет примерно 3%–5%), а затем выполнить поиск по сетке в узком диапазоне (0,02–0,08) для оптимизации. В данном эксперименте значение contamination = 0,05 близко к фактической доле аномалий в обучающей выборке, равной 4,61 TP3T. Если отклонение от оценочного значения слишком велико (например, если установить значение 0,01), это приведет к пропуску большого количества реальных аномалий.

Вопрос: Насколько двухуровневая архитектура тестирования увеличит затраты на развертывание?

Ответ: Пограничное устройство (Jetson Orin NX): стоимость одного устройства составляет около 3 500 юаней (включая радиаторный корпус); единовременные затраты на 60 кранов составят около 210 000 юаней. Облачный сервер с графическим процессором: можно использовать имеющиеся ресурсы графического процессора (NVIDIA A10) из существующей системы прогнозного технического обслуживания, что не влечет за собой дополнительных затрат. Основная статья затрат в двухуровневой архитектуре по сравнению с одноуровневым решением на основе автокодера — это периферийные устройства Jetson, однако в результате объем сетевой передачи данных сокращается примерно на 951–3 ТП (только загрузка аномальных данных), что подходит для промышленных объектов с ограниченной пропускной способностью сети.

Вопрос: Как настраивать и обновлять пороговое значение автокодера?

Ответ: Настройка начального порогового значения: в качестве начального порогового значения берется 99,5-й процентиль среднеквадратичной ошибки реконструкции (MSE) для обучающего набора (нормативных данных). Адаптивное обновление порогового значения в процессе эксплуатации: каждые 30 дней пересчитывается 99,5-й процентиль на основе нормальных данных за последние 3 месяца; пороговое значение автоматически корректируется с учетом смещения базовой линии, вызванного естественным износом оборудования. Если оборудование прошло капитальный ремонт (замена подшипников и т. п.), после ремонта необходимо заново собрать данные о нормальном режиме работы за 30 дней в качестве новой базовой линии.

Соответствующая информация

контакты

свяжитесь с нами

Телефон:
+86 13903802779

mail:3915269@qq.com

Рабочие часы: с понедельника по пятницу

WeChat
Wechat
ПОДПИШИСЬ НА
ТОП