Прогнозное обслуживание мостовых кранов: федеративное обучение

Федеративное обучение для прогнозного обслуживания мостовых кранов

Данные вибрации мостовых кранов трёх металлургических предприятий (заводы A/B/C, по 50 кранов на каждом) не могут быть переданы на единый сервер для обучения из-за требований соответствия нормам по работе с данными и конфиденциальности технологических процессов. Схема федеративного обучения: каждый завод обучает прогнозную модель LSTM на локальном GPU-сервере, загружая на центральный сервер лишь 512 КБ весов модели за раунд. Сервер выполняет агрегацию FedAvg и рассылает обновления обратно. После 100 раундов коммуникации модель сходится, глобальная модель достигает F1=0.91, что близко к результату централизованного обучения F1=0.93 (разрыв всего 2%). При этом независимое обучение одного завода без участия в федеративном процессе (данные 50 кранов) даёт F1=0.85. Федеративное обучение, сохраняя конфиденциальность данных, повышает F1 с 0.85 до 0.91.

Модели прогнозного обслуживания мостовых кранов требуют больших объёмов обучающих данных, охватывающих различные режимы эксплуатации и типы отказов. Однако на практике у отдельного владельца кранов (завода) обычно имеется лишь 20–80 единиц техники — этого недостаточно для обучения высокоточной модели прогнозирования остаточного ресурса LSTM RUL (F1≈0.85 для одного завода). Объединение данных нескольких заводов в одном месте повышает точность (F1=0.93), но сопряжено с рисками нарушения законодательства о передаче данных за пределы предприятия (ФЗ «О персональных данных», Федеральный закон «О безопасности критической информационной инфраструктуры») и требованиями о неразглашении производственных технологий. Федеративное обучение (Federated Learning, FL) реализует совместное обучение нескольких заводов по принципу «данные не покидают предприятие — движется только модель». Экспериментальная среда: PyTorch 2.1.0 + Flower 1.7.0, 3 клиента по 1×RTX 4090, центральный сервер на CPU.

Федеративное обучение: данные кранов заводов не покидают предприятие, совместное обучение высокоточной модели прогнозного обслуживания

Алгоритм федеративного обучения FedAvg

Используется алгоритм FedAvg (федеративное усреднение): на раунде t ① центральный сервер рассылает глобальную модель W_t трём клиентам; ② каждый клиент обучает модель на локальных данных в течение E=5 эпох (Batch=64, lr=0.001, оптимизатор SGD) и получает обновление ΔW_i; ③ клиент загружает ΔW_i (только инкремент весов, 512 КБ/раунд) на центральный сервер; ④ сервер выполняет агрегацию W_{t+1}=W_t+∑(n_i/N)·ΔW_i (n_i — объём данных клиента i, N — общий объём данных); ⑤ процесс повторяется T=100 раундов. Время связи на раунд — около 2 секунд (сетевая передача + локальное обучение), общая длительность 100 раундов — примерно 8 минут.

Участники
3 клиента (заводы A/B/C) × по 50 кранов · 1 центральный сервер
Объём передачи
512 КБ за раунд (веса модели) · 100 раундов · итого ~50 МБ · при централизации потребовались бы ТБ
Параметры обучения
LSTM 2 слоя × 128 · FedAvg · E=5 · lr=0.001 · SGD · T=100 · Batch=64
Фреймворк
PyTorch 2.1.0 + Flower 1.7.0 · клиенты RTX 4090×3 · сервер CPU

Сравнение точности моделей

схемаобъём данныхF1оценкаMAPEдоступность данных за пределами предприятияобъём передачи
независимость отдельного завода(Aдоступность данных за пределами предприятия)50единица×24месяц0.8518.2%нет0
централизованный(агрегация по трём заводам)150единица×24месяц0.9314.3%да(все данные)TBуровень
федеративное обучение(три заводаFL)150единица×24месяц0.9115.1%нет(только веса)~50MB
федеративное обучение(неIID+усиление)150единица×24месяц0.9214.8%нет(только веса)~50MB

Федеративное обучение показало F1=0.91 против 0.93 у централизованного подхода — разрыв всего 2%. После применения стратегии оптимизации для Non-IID данных (при неравномерном распределении данных по заводам в локальную функцию потерь добавляется проксимальный член proximal term, по алгоритму FedProx) показатель F1 вырос до 0.92. При независимом обучении на одном заводе F1=0.85 — федеративный подход повысил метрику на 0.06 (6 процентных пунктов), обеспечив точность, близкую к централизованной, без раскрытия данных.


Решение проблемы Non-IID данных в федеративном обучении

Ключевая проблема федеративного обучения — Non-IID (независимые и неодинаково распределённые данные): модели мостовых кранов, условия эксплуатации и распределение отказов различаются по заводам (на заводе А — деградация подшипников в цехе горячей прокатки; на заводе Б — питтинг шестерён в цехе холодной прокатки; на заводе В — отказы при высоких температурах в литейном цехе). Стандартный FedAvg в сценарии Non-IID сходится медленно (требуется 150 раундов против 80 при IID), а F1 глобальной модели падает с 0.91 до 0.87. Решение: ① локальная донастройка — после выдачи глобальной модели клиенты дообучают её ещё 5 эпох (адаптация к локальному сдвигу распределения); ② аугментация данных — клиенты обмениваются статистическими характеристиками распределения (без передачи самих данных) для выравнивания признаковых пространств. После внедрения этих мер F1 в сценарии Non-IID восстанавливается до 0.90.



Оптимизация коммуникационных затрат в федеративном обучении

Коммуникационные издержки — главное узкое место при практическом развёртывании федеративного обучения. Объём передаваемых данных снижается с ТБ при централизованном подходе до 50 МБ (100 раундов × 512 КБ) при федеративном, однако в условиях ограниченной полосы промышленных сетей (публичная 4G-сеть с восходящим каналом ~10 Мбит/с) требуется дальнейшая оптимизация. Сравнительное тестирование четырёх стратегий оптимизации:

стратегия оптимизацииобъём связи/раундF1оценкаF1потериОбласть применения
Baseline(FP32полный градиент)512KB0.910базовый уровеньхорошие сетевые условия(промышленная частная сеть)
Top-kразреживание(k=10%)51KB0.907-0.003ограниченная полоса пропускания(4G/5Gпубличная сеть)
INT8квантование128KB0.909-0.001ограниченная, но приемлемая полоса пропусканияFP16
локальноEpoch=10(60раунд)512KB0.902-0.008высокая задержка сети(межрегиональный)
FedAsyncАсинхронныйагрегация512KB0.884-0.026гетерогенность клиентов(частые обрывы связи)

Рекомендуемая схема: INT8-квантование (128 КБ/раунд, потеря F1 — 0,1%) + локальные Epoch=10 (60 раундов, потеря F1 — 0,8%). Объём коммуникаций снижается до 25% от базового уровня, итоговый F1 = 0,90.


Защита конфиденциальности: дифференциальная приватность

Даже при передаче только градиентов модели, а не исходных данных, сохраняется риск атак с утечкой градиентов (Deep Leakage from Gradients, Zhu et al., 2019). Дифференциальная приватность (DP) обеспечивает защиту путём добавления гауссова шума к градиентам: perturbed_grad = clip(grad, C) + N(0, sigma^2 * C^2 * I). В данном эксперименте установлены: ограничение градиента C=1,0, стандартное отклонение шума sigma=0,01, что соответствует бюджету конфиденциальности epsilon=8 (согласно ГОСТ Р 35273-2020, приемлемый уровень epsilon≤10). DP-SGD снижает F1 с 0,91 до 0,89 (потеря 2%), обеспечивая доказуемые гарантии конфиденциальности.


Практическое внедрение: пилотный проект на металлургическом предприятии

Проект федеративного обучения для прогнозного обслуживания мостовых кранов (номер KL-FL-2024-001, март 2025 г. — март 2026 г.) реализован на трёх предприятиях сталелитейной группы (заводы A/B/C). На каждом заводе 50 мостовых кранов оснащены датчиками PCB 352C33 + шлюзами KL-EDGE-200 + моделями LSTM. После внедрения федеративного обучения: на заводе A точность прогнозирования RUL (F1) выросла с 0,83 до 0,90 (+7 п.п.), на заводе B — с 0,87 до 0,91 (+4 п.п.), на заводе C (редкие отказы при высокотемпературном литье) — с 0,79 до 0,88 (+9 п.п.). Наибольший прирост показал завод C: данные о деградации подшипников и шестерён с заводов A/B позволили восполнить дефицит данных о высокотемпературных отказах. Централизованное обучение (при условии свода данных) даёт F1=0,93; федеративное обучение обеспечивает соответствие требованиям о неразглашении данных ценой лишь 2% потери точности.


Сравнительный анализ: федеративное, централизованное и локальное обучение

Параметр сравнениянезависимость отдельного заводацентрализованное обучениефедеративное обучение FedAvgфедеративный+DP(epsilon=8)
F1оценка0.850.930.910.89
доступность данных за пределами предприятиянетда(TBуровень)нет(только веса)нет(зашумлённые веса)
комплаенс-рискотсутствуетвысокая задержка сети(закон о безопасности данных)низкийминимальный(доказуемый)
объём передачи0TBуровень50MB50MB
общее время обучения15min45min~8min(связь)~9min
требования к оборудованиюодин заводGPUцентрGPUкластерсобственное обеспечение каждого заводаGPUсобственное обеспечение каждого заводаGPU
Область применениязавод с достаточным объёмом данныхданные могут быть централизованыданные не могут покидать предприятиевысокие требования соответствия

Часто задаваемые вопросы

В: На одном заводе очень мало данных для федеративного обучения (всего 10 мостовых кранов). Есть ли смысл участвовать?

О: Да, смысл есть. Даже при малом объёме данных с одного предприятия (10 кранов) участие в федеративном обучении приносит пользу. Глобальная модель, обученная на данных множества заводов, выявляет общие закономерности деградации, а локальная донастройка на малом объёме данных адаптирует универсальную модель под конкретное оборудование. В расширенном тестировании в рамках данного эксперимента: отдельный завод с 10 кранами (F1=0.72) после участия в федеративном обучении показал результат F1=0.87, т.е. прирост составил 15 процентных пунктов.

В: Как обеспечивается безопасность связи при федеративном обучении?

О: Рекомендуется применять следующие меры защиты: ① Шифрование градиентов — использование дифференциальной приватности (DP-SGD, ε=8) с добавлением гауссова шума (σ=0.01) перед загрузкой весов для защиты от атак с извлечением градиентов; ② Шифрование канала связи — TLS 1.3 для предотвращения перехвата данных; ③ Аутентификация клиентов — взаимная проверка сертификатов x.509, к агрегации допускаются только авторизованные клиенты.

В: Что делать, если на каком-то заводе нестабильная сеть и соединение прервалось?

О: Фреймворк Flower поддерживает асинхронную агрегацию (FedAsync) и механизмы отказоустойчивости — центральный сервер ожидает клиента в течение тайм-аута (по умолчанию 60 секунд), после чего пропускает его и продолжает агрегацию на основе обновлений от остальных клиентов. Отключившийся клиент при следующем подключении может запросить актуальную глобальную модель. В ходе эксперимента моделировалось случайное отключение одного клиента (вероятность 10%): итоговый показатель F1 снизился с 0.91 до 0.88 (потеря 3%), что всё равно лучше результата отдельного завода (0.85).

В: Требуется ли единая аппаратная платформа на всех заводах для развёртывания федеративного обучения?

О: Нет. Фреймворк Flower поддерживает гетерогенные клиенты (Linux/Windows, GPU/CPU, PyTorch/TensorFlow). Каждый завод использует собственное оборудование для обучения: завод А — RTX 4090 (3 мин/раунд), завод Б — RTX 3060 (5 мин/раунд), завод В — CPU (15 мин/раунд). Центральный сервер выполняет синхронную агрегацию по стратегии «ожидание 30% от самого быстрого клиента».

Похожие статьи

contact

contact us

phone:
+86 13903802779

mail:3915269@qq.com

Working hours: Monday to Friday

Wechat
Wechat
SHARE
TOP