LSTM или Transformer для прогнозирования крана

📋 Основное резюме

Прогнозирование временных рядов — ключевая функция прогнозируемого технического обслуживания кранов: модель улавливает тенденцию деградации из исторических последовательностей вибрации, тока, температуры и выдает окно раннего предупреждения до наступления отказа. Статья рассматривает два основных подхода — LSTM и Transformer. Сначала определяются граничные условия входной последовательности, затем выводятся основные формулы обоих методов, и в конце приводится проверочный расчет на примере вибрационного ряда. Критерии выбора даются по двум измерениям: вычислительная сложность и стоимость развертывания. Важно понимать: эффективность прогнозирования временных рядов сильно зависит от режима работы и качества данных, поэтому статья не обещает фиксированную точность, а предлагает применимую на практике структуру принятия решений.

Сравнение параметров выбора для прогнозирования временных рядов на основе LSTM и Transformer

Граничные условия входа и выхода прогнозирования временных рядов: длина последовательности, частота дискретизации и объем данных

Сразу к делу: прогнозирование временных рядов — это не просто подача исторических данных в модель. На вход подается многоканальная последовательность, упорядоченная по времени, на выходе — прогнозные значения на несколько шагов вперед или показатель состояния. От того, насколько корректно заданы граничные условия, напрямую зависит, изучит ли модель реальную закономерность деградации или же выучит шум дискретизации.

Что касается источника данных, сбор параметров грузоподъемных машин не проектируется с нуля. GB/T 28264 — система мониторинга и управления безопасностью грузоподъемных машин предъявляет единые требования к составу контролируемых параметров, их сбору и регистрации. Такие ключевые величины, как грузоподъемность, скорость передвижения, высота подъема, имеют четкие спецификации сбора. Компания Келуде Тяжёлая Промышленность при развертывании мониторинга состояния обычно берет эти спецификации за основу сбора данных, добавляя к ним высокочастотные сигналы вибрации и тока в качестве входных каналов для прогнозирования временных рядов.

Частота дискретизации — вторая граница. На примере вибрации редуктора: характерная частота зацепления шестерен обычно составляет сотни герц, поэтому частота дискретизации должна быть как минимум вдвое выше максимальной характерной частоты отказа. В противном случае возникает эффект наложения спектров, высокочастотные признаки отказа сворачиваются в низкочастотную область, и модель видит искаженный спектр. Длина последовательности определяет, какой горизонт исторического контекста видит модель: слишком короткая — не охватывает полный цикл вращения, слишком длинная — добавляет нерелевантный исторический «хвост», мешающий обучению.

Объем данных — третья граница. Обучающий набор должен покрывать различные комбинации режимов: разную грузоподъемность, разный коэффициент нагрузки, разную частоту вращения. Иначе модель теряет точность при смене режима работы. Режим работы крана в стандарте FEM 1.001 — норма проектирования кранов подразделяется на уровни от A1 до A8, и каждому уровню соответствует свой спектр нагрузок. Модель, обученная только на легком режиме A3, неизбежно даст неверный прогноз в тяжелом режиме A6. Этот фактор часто недооценивают, хотя именно он чаще всего становится причиной резкого падения точности после вывода модели в эксплуатацию.

Вывод формул LSTM-гейтинга и Transformer-само-внимания: что именно они вычисляют

Чтобы понять, что выбрать, нужно разобраться, что каждая из этих архитектур делает математически. Ядро LSTM — механизм гейтинга: три управляющих вентиля регулируют сохранение и забывание информации. Ядро Transformer — само-внимание: каждая позиция последовательности напрямую устанавливает связь со всеми остальными позициями.

Один временной шаг LSTM: скрытое состояние предыдущего момента конкатенируется с текущим входом, затем через обучаемую матрицу весов вычисляются три вентиля и кандидат в память:

Вентиль забывания: f_t = σ(W_f·[h_{t-1}, x_t] + b_f)

Входной вентиль: i_t = σ(W_i·[h_{t-1}, x_t] + b_i)

Кандидат в память: c~t = tanh(W_c·[h_{t-1}, x_t] + b_c)

Состояние ячейки: c_t = f_t ⊙ c_{t-1} + i_t ⊙ c~t

Выходной вентиль: o_t = σ(W_o·[h_{t-1}, x_t] + b_o)

Скрытое состояние: h_t = o_t ⊙ tanh(c_t)

Суть трех вентилей — набор сигмоидных выходов со значениями от 0 до 1, которые поэлементно умножаются на вектор состояния, обеспечивая взвешенное сохранение информации. Состояние ячейки c_t — это магистраль, проходящая через всю последовательность; гейтинг выполняет только линейное суммирование, поэтому градиент может стабильно распространяться по этому пути, что смягчает проблему затухания градиента при обучении на длинных последовательностях.

Transformer идет другим путем: само-внимание не полагается на последовательную передачу, а позволяет каждой позиции вычислить степень сходства со всеми остальными и агрегировать информацию с весами, пропорциональными этому сходству. Формула оценки внимания:

Оценка внимания: Attention(Q, K, V) = softmax(QK^T / √d_k) · V

Здесь Q, K, V — матрицы запросов, ключей и значений соответственно. Деление на √d_k предотвращает попадание softmax в зону насыщения из-за слишком больших значений скалярного произведения. Многоголовое внимание разбивает Q, K, V на несколько подпространств, вычисляемых параллельно, что позволяет модели одновременно учитывать зависимости разных масштабов. В инженерной практике Келуде Тяжёлая Промышленность реальная сложность — не сами формулы, а выбор гиперпараметров из таблицы ниже.

← Прокрутите таблицу влево/вправо →
Символ Наименование Типовое значение/Значение Инженерное примечание
nДлина последовательностиЧисло отсчётов входного окна,например512больше — тем шире поле восприятия,вычислительная мощностьтем выше вычислительные затраты
f_sчастота дискретизациинапример2560 Hzдолжно превышать максимальную частоту отказовхарактерная частота2и более раз
dРазмерность признаковна каждом временном шагесистема доступаЧисло отсчётов входного окнавибрация、Ток、температура и др.система доступаКонкатенация
hЧисло голов многоголового вниманияобычно используется8чем больше головПараметрчем больше голов,требуется согласование с объёмом данных
d_kРазмерность одной головыравнаd/hsoftmaxмасштабный коэффициент перед
σsigmoidАктивациядиапазон выхода(0,1)коэффициент удержания вентиля
tanhгиперболический тангенсдиапазон выхода(-1,1)нелинейность кандидата памяти
поэлементное умножениеумножение вентиля на состояниереализация селективной памяти

Расчётный пример проверки вибрационного ряда: всегда ли более длинный ряд означает более точную модель

Свяжем приведённые выше параметры на конкретном примере. Предположим, частота вращения входного вала редуктора крана составляет 1000 об/мин, ведущее колесо одноступенчатой зубчатой пары имеет 21 зуб, а частота дискретизации датчика вибрации равна 2560 Гц. Приведённый расчёт служит лишь для демонстрации количественных взаимосвязей между параметрами; фактические значения определяются режимом работы на объекте.

Сначала вычислим частоту вращения: разделим 1000 об/мин входного вала на 60, получим частоту вращения около 16,7 Гц. Затем рассчитаем частоту зацепления: умножим число зубьев (21) на частоту вращения — получим около 350 Гц. Частота Найквиста, соответствующая частоте дискретизации 2560 Гц, составляет 1280 Гц, что покрывает основную гармонику 350 Гц и её третью гармонику на 1050 Гц — такая конфигурация дискретизации является технически обоснованной.

Теперь рассмотрим длину ряда. Число точек дискретизации, приходящихся на один период частоты вращения, равно 2560, делённым на 16,7, — примерно 153 точки. При длине ряда 512 точек окно покрывает около 3,3 периода частоты вращения, что позволяет полностью наблюдать форму колебаний зубчатой пары за несколько оборотов. Если увеличить ряд до 4096 точек, покрытие составит около 26,7 периода — поле восприятия становится шире, однако вычислительная нагрузка самовнимания возрастает с квадрата 512 до квадрата 4096, т.е. примерно в 64 раза.

В этом и заключается математическая причина того, что более длинный ряд не всегда лучше: рост поля восприятия линеен, тогда как вычислительные затраты самовнимания растут квадратично. Компания Келуде Тяжёлая Промышленность при выборе конфигурации обычно ограничивает длину ряда минимально достаточной для покрытия нескольких полных циклов повреждения, после чего постепенно увеличивает её для сравнительных проверок.

← Прокрутите таблицу влево/вправо →
Параметр Расчётная формула Результат Описание
Частота вращения f_r1000 / 6016.7 HzВходной ВалЧастота вращенияприведение
зацеплениеЧастота f_m21 × 16.7около350 Hzпервая ступеньШестерняпара
число отсчётов за один период2560 / 16.7около153точкаодин период частоты вращения
512точкапокрытиеодин период частоты вращения512 / 153около3.3шт.входное окно
вниманиеКрутящий моментразмер матрицы512 × 512262144параквадратичные затраты

Четыре типичные ошибки в прогнозировании временных рядов: утечка данных, длина последовательности, переобучение и смещение меток

Когда модель временных рядов теряет точность после внедрения, причина часто кроется не в новизне модели, а в ошибках на этапе подготовки данных. Ниже перечислены четыре типа ошибок в порядке убывания степени их опасности.

Ошибка первая: утечка данных. В обучающие признаки попадает информация из будущего, например, при нормализации используется среднее значение по всему набору данных или статистические показатели тестового набора применяются к обучающему. Модель отлично показывает себя на валидационном наборе, но сразу же дает сбои в работе. Данные временных рядов должны строго разделяться по времени: обучающий, валидационный и тестовый наборы не должны пересекаться.

Ошибка вторая: несоответствие длины последовательности и частоты дискретизации. Слишком низкая частота дискретизации приводит к наложению спектров высокочастотных признаков отказов, и модель обучается на искаженном спектре. Либо последовательность слишком коротка и не вмещает даже один полный период вращения. Сначала рассчитайте частоту вращения и частоту зацепления, а затем, исходя из них, определите частоту дискретизации и длину последовательности.

Ошибка третья: переобучение модели. У Transformer большое количество параметров, и при недостаточном объеме данных онвесьма легко переобучается: ошибка на обучающем наборе неуклонно снижается, а на валидационном — растет. В этом случае приоритетнее уменьшить модель и добавить регуляризацию, а не продолжать наращивать данные или увеличивать модель.

Ошибка четвертая: смещение меток. Показаниям датчика в момент времени t сопоставляется метка отказа в момент t+1, либо время срабатывания сигнализации принимается за время начала отказа. Смещение метки на один шаг дискретизации приводит к общему сдвигу цели прогнозирования. Компания Келуде Тяжёлая Промышленность при аннотировании данных временных рядов всегда проводит повторную проверку временного выравнивания меток — это самый недооцениваемый, но и самый критичный этап.

Возвращаясь к вопросу из заголовка: LSTM или Transformer? В таких сценариях, как мониторинг состояния крана, где объем данных ограничен, а последовательности недлинные, LSTM обычно является более надежной отправной точкой: у нее меньше параметров, стабильнее обучение и ниже стоимость развертывания на периферийных устройствах. Когда данных накопится достаточно и возникнет необходимость взахват глобальных долгосрочных зависимостей, стоит рассмотреть внедрение Transformer или его использование для многоканальной интеграции. Универсального ответа на вопрос выбора нет — есть лишь ответ, соответствующий конкретному режиму работы. Сначала определите граничные условия, затем рассчитайте сложность и, наконец, проверьте на небольшом эксперименте — это проверенный на практике порядок действий компании Келуде Тяжёлая Промышленность.

📖 Похожие материалы: Управление состоянием оборудования PHM: инженерная практика предиктивного обслуживания мостовых кранов на основе больших данных и ML | Что реально могут дать большие языковые модели в обслуживании кранов? Практичные сценарии и граница возможностей

Часто задаваемые вопросы

В: Каковы требования системы мониторинга и управления безопасностью грузоподъёмных машин к контролю параметров состояния?

О: Стандарт GB/T 28264 «Система мониторинга и управления безопасностью грузоподъёмных машин» требует осуществлять мониторинг и запись в реальном времени таких ключевых параметров рабочего состояния, как грузоподъемность, скорость передвижения, высота подъёма, что обеспечивает единую базу данных для последующего анализа отказов и прогнозирования временных рядов. При создании платформы мониторинга состояния компания Келуде Тяжёлая Промышленность сначала систематизирует пункты сбора данных согласно классификации параметров из этого стандарта, а затем добавляет высокочастотные сигналы, такие как вибрация и ток. Конкретный перечень параметров и период записи определяются действующей версией стандарта и требованиями к проверке на месте.

В: В каких пределах должна находиться ошибка прогнозирования временных рядов, чтобы модель считалась пригодной?

О: Приемлемость ошибки прогнозирования зависит от компромисса между временем упреждающего предупреждения и частотой ложных срабатываний, и универсального числового значения не существует. При оценке главное — достаточно ли времени оставляет предупреждение для проведения ремонтных работ и находится ли частота ложных тревог в пределах, приемлемых для обслуживающего персонала. Базовые показатели сильно различаются для разных типов машин и режимов работы. Конкретные пороговые значения должны определяться в ходе проверки на месте и основываться на фактических условиях эксплуатации.

В: Почему Transformer теоретически сильнее, но в промышленных сценариях часто сначала используют LSTM?

О: Потому что промышленные данные временных рядов часто ограничены, а последовательности недлинные. Механизм самовнимания Transformer требует больших объемов данных для реализации своих преимуществ в глобальном моделировании; при недостатке данных он склонен к переобучению. LSTM имеет простую структуру и меньше параметров, что делает ее более стабильной на малых выборках. Кроме того, квадратичная сложность Transformer создает значительную нагрузку на вычислительные мощности при развертывании на периферийных устройствах. Поэтому компания Келуде Тяжёлая Промышленность обычно использует LSTM в качестве базовой модели, а решение о внедрении Transformer принимается исходя из объема накопленных данных.

Похожие статьи

contact

contact us

phone:
+86 13903802779

mail:3915269@qq.com

Working hours: Monday to Friday

Wechat
Wechat
SHARE
TOP