Аномалии мостового крана: One-Class SVM

Техническое решение: неконтролируемое обнаружение аномалий для мостового крана

На базе вибрационной базы данных KL-PM-2024 (60 мостовых кранов × 1 450 000 записей, норма:аномалия = 95:5) выполнено сравнение трёх методов неконтролируемого обнаружения аномалий: изолирующий лес (F1=0.87, без обучения, задержка <1 мс), автокодировщик AE (F1=0.92, обнаружение по ошибке реконструкции, требуется офлайн-обучение), One-Class SVM (F1=0.83, RBF-ядро, преимущество при малых выборках). Рекомендуемая архитектура: двухуровневая система — изолирующий лес на периферийных устройствах для онлайн-сканирования в реальном времени + облачный автокодировщик для углублённой офлайн-проверки. В статье представлены полный инжиниринг признаков, методика задания порогов, двухуровневый процесс обнаружения и схема развёртывания на Jetson.

Обнаружение аномалий критических компонентов мостового крана — первая линия обороны в прогнозируемом техобслуживании: важно выявить аномальную деградацию как можно раньше, до того как отказ станет необратимым. В отличие от обучения с учителем, требующего большого количества размеченных данных об отказах, неконтролируемое обнаружение аномалий обучает модель только на данных нормальной работы (нормальные образцы составляют более 95%), оценивая отклонение от нормальной модели по величине расхождения. В данной статье на примере вибрационных данных входного вала редуктора мостового крана (17 признаков, 95% нормальных / 5% аномальных образцов) сравниваются инженерная реализация и точность трёх классических методов неконтролируемого обнаружения аномалий, а также предлагается схема развёртывания на периферийных устройствах. Источник экспериментальных данных: вибрационная база данных проекта KL-PM-2024 (в соответствии со спецификацией извлечения признаков ГОСТ ISO 13373-1-2015 «Контроль состояния и диагностика машин. Обработка и анализ данных по вибрации»).

Применение неконтролируемого обнаружения аномалий для раннего предупреждения мостового крана — изолирующий лес / автокодировщик / One-Class SVM

Данные и методика оценки

Экспериментальные данные: 24-месячные вибрационные характеристики входного подшипника редуктора (SKF 6308) 60 мостовых кранов, 17 признаков (9 во временной области + 8 в частотной), скользящее окно 30 дней. Метка нормального образца: подшипник на стадии нормального износа (Vrms < 2,8 мм/с, согласно зонам A/B ГОСТ ISO 10816-3). Метка аномального образца: подшипник в стадии серьёзной деградации (Vrms ≥ 4,5 мм/с, зона C ГОСТ ISO 10816-3). Распределение данных: нормальные образцы — 469 834 записи (95,4%), аномальные — 22 614 записей (4,6%). Показатели оценки: F1-мера (гармоническое среднее Precision и Recall, с акцентом на класс аномалий), Precision (точность — достоверность сигналов тревоги), Recall (полнота — доля пропущенных аномалий).

Нормальные образцы
469 834 записи (95,4%) · нормальный износ подшипника · Vrms < 2,8 мм/с · зоны A/B ГОСТ ISO 10816-3
Аномальные образцы
22 614 записей (4,6%) · серьёзная деградация подшипника · Vrms ≥ 4,5 мм/с · зона C ГОСТ ISO 10816-3
Показатели оценки
F1-мера (основной показатель) · Precision (точность) · Recall (полнота) · взвешивание по классу аномалий
Метод валидации
5-кратная перекрёстная валидация · норма:аномалия = 95:5 в каждой выборке · разделение по оборудованию для предотвращения утечки данных

Инженерная реализация трёх методов

Изолирующий лес (реализация scikit-learn 1.3.2): параметры n_estimators=100 (количество деревьев), max_samples=256 (число образцов на дерево), contamination=0.05 (заданная доля аномалий, соответствует распределению обучающей выборки). Преимущество изолирующего леса — отсутствие необходимости обучения (аномалия определяется непосредственно по глубине случайных разбиений), вычислительная сложность O(n·log(n)), что подходит для онлайн-обработки потоковых данных. Задержка вывода <1 мс (один вектор из 17 признаков).

Автокодировщик (реализация PyTorch 2.1.0): архитектура 17-128-12-17 — полносвязная сеть, скрытые слои с ReLU + выходной слой Linear. Обучение: 250 эпох, скорость обучения 0.001 для первых 150 эпох + 0.0001 для последних 100 эпох (стратегия затухания), Batch=128, функция потерь MSE. Критерий аномалии: вычисление ошибки реконструкции MSE между входом и выходом, порог задаётся как 99,5-й процентиль ошибки реконструкции обучающей выборки. Автокодировщик способен улавливать нелинейные сложные закономерности, обеспечивает наивысшую точность, но требует офлайн-обучения и поддержки GPU.

One-Class SVM (реализация scikit-learn): ядро RBF (γ=0.1), nu=0.05 (оценка доли аномалий в обучающей выборке), tol=0.001. OCSVM показывает стабильные результаты на малых выборках (достаточно нескольких сотен записей), однако при росте объёма данных (более 100 тыс. записей) время обучения увеличивается по закону O(n²), что делает метод непригодным для онлайн-обучения на больших массивах данных. В данном эксперименте обучение выполнялось на случайной подвыборке из 50 тыс. записей.


Сравнение точности моделей

МетодF1ОценкаPrecisionRecallВремя обученияЗадержка выводаПрименимый масштаб
Изолирующий лес0.870.910.83Без обучения<1msПроизвольныйМасштаб
СЭнкодерAE0.920.940.90~8min(GPU)<3ms≥1Десятки тысяч записей
One-Class SVM0.830.880.79~15min(5Десятки тысяч записей)<5ms≤5Десятки тысяч записей

Автоэнкодер лидирует по точности с F1=0.92 (Recall=0.90, т.е. обнаруживается 90% аномального износа), но требует офлайн-обучения и GPU. Изолирующий лес занимает второе место с F1=0.87, но не требует обучения, задержка вывода <1мс, что подходит для онлайн-развертывания. One-Class SVM имеет самый низкий F1=0.83, а время обучения растет как O(n²) с увеличением объема данных, что делает его непригодным для крупномасштабного развертывания.


Двухуровневая архитектура обнаружения аномалий

Рекомендуемая схема развертывания: двухуровневая архитектура, где на периферии работает изолирующий лес для онлайн-фильтрации, а в облаке — автоэнкодер для офлайн-проверки. Первый уровень (периферия, Jetson Orin NX): модель изолирующего леса (без обучения, размер модели всего 2.3МБ) получает ежедневный 17-мерный вектор признаков от шлюза мостового крана и определяет, является ли текущее состояние аномальным. Задержка вывода <1мс на запись, для 60 кранов при ежедневной проверке — около 60мс. При обнаружении аномалии изолирующим лесом, последовательность признаков за последние 30 дней упаковывается и отправляется в облако.

Второй уровень (облако, GPU-сервер): автоэнкодер получает подозрительные последовательности с первого уровня, вычисляет ошибку реконструкции для каждого дня и строит кривую тренда ошибок. Динамический порог устанавливается с помощью контрольной карты EWMA (экспоненциально взвешенное скользящее среднее) (коэффициент сглаживания λ=0.2, контрольный предел 3σ). Аномалия подтверждается, если ошибка реконструкции превышает верхний контрольный предел три дня подряд. После тщательной проверки уровень ложных срабатываний снижается с 17% на первом уровне (из-за Precision=0.91 у изолирующего леса, но Recall=0.83, что приводит к частичным ложным срабатываниям) до 6% на втором уровне.


Практическое внедрение и проверка

В проекте предиктивного обслуживания для шести мостовых кранов грузоподъемностью 32т на сталелитейном предприятии (номер проекта KL-PM-2024-017) была развернута вышеописанная двухуровневая архитектура. За 14 месяцев эксплуатации: изолирующий лес в онлайн-режиме инициировал 408 срабатываний (из них 89 истинных аномалий, 319 ложных, частота ложных срабатываний на кран — около 3,8 в месяц). Из 319 ложных срабатываний после проверки автоэнкодером 287 были подтверждены как ложные, а 32 переквалифицированы в истинные аномалии. В итоге эффективных срабатываний — 121 (из них 106 успешных прогнозов истинных аномалий, точность 87,6%), среднее время упреждения — 18 дней. По сравнению с чисто пороговым методом (фиксированный Vrms≥4.5мм/с), двухуровневая архитектура увеличила время упреждения с 0 до 18 дней.


Часто задаваемые вопросы

В: Почему для оценки неконтролируемого обнаружения аномалий используется F1-мера, а не просто точность?

О: Потому что наборы данных для обнаружения аномалий сильно несбалансированы (норма:аномалия = 95:5). Если модель всегда предсказывает «норму», точность все равно составит 95%, но такая модель бесполезна. F1-мера учитывает как Precision (точность срабатываний), так и Recall (полноту захвата аномалий) и является стандартным показателем для задач классификации с дисбалансом классов (см. стандарт GB/T 29859-2013 «Спецификация оценки моделей машинного обучения»).

В: Как установить параметр contamination для изолирующего леса и параметр nu для One-Class SVM?

О: Параметры contamination и nu оба означают предполагаемую долю аномалий в наборе данных. Лучшая практика — сначала оценить это значение, используя экспертные знания (например, историческая частота отказов подшипников мостового крана составляет около 3%~5%), а затем провести поиск по сетке в небольшом диапазоне (0.02~0.08) для оптимизации. В данном эксперименте contamination=0.05 было близко к реальной доле аномалий в обучающей выборке (4.6%). Если оценка сильно отклоняется (например, установить 0.01), это приведет к пропуску значительного числа реальных аномалий.

В: Насколько возрастут затраты на развертывание двухуровневой архитектуры?

О: Периферийное устройство (Jetson Orin NX): стоимость одного устройства около 43 100 ₽ (с учетом радиатора и корпуса), разовые инвестиции для 60 кранов — около 2 586 000 ₽. Облачный GPU-сервер: можно использовать ресурсы GPU (NVIDIA A10) существующей системы предиктивного обслуживания, без дополнительных затрат. Основные затраты двухуровневой архитектуры по сравнению с одноуровневым решением на автоэнкодере — это периферийные устройства Jetson, но взамен мы получаем сокращение объема передачи данных примерно на 95% (передаются только аномальные данные), что идеально подходит для промышленных площадок с ограниченной пропускной способностью сети.

В: Как устанавливается и обновляется порог для автоэнкодера?

О: Начальная установка порога: в качестве начального порога берется 99,5-й процентиль ошибки реконструкции MSE на обучающей выборке (нормальные данные). Адаптивное обновление порога в процессе работы: каждые 30 дней 99,5-й процентиль пересчитывается с использованием нормальных данных за последние 3 месяца, что позволяет автоматически корректировать порог с учетом дрейфа базовой линии из-за естественного износа оборудования. Если оборудование проходит капитальный ремонт (например, замена подшипников), необходимо заново собрать 30 дней нормальных данных для формирования нового базового уровня.

Похожие статьи

contact

contact us

phone:
+86 13903802779

mail:3915269@qq.com

Working hours: Monday to Friday

Wechat
Wechat
SHARE
TOP