Федеративное обучение: данные с кранов нескольких заводов не покидают пределы завода; совместное обучение для построения высокоточной модели прогнозного технического обслуживания
📌 План технического обслуживания системы прогнозирования «Тяньче» на основе федеративного обучения
Данные о вибрации кранов на трёх металлургических предприятиях (заводы A/B/C, по 50 кранов на каждом) не могут быть централизовано собраны на одном сервере для обучения из-за требований к соответствию данных нормативным требованиям и конфиденциальности технологических процессов. Решение на основе федеративного обучения: каждый завод обучает прогнозирующую модель LSTM на локальном сервере с графическим процессором (GPU), при этом в каждом раунде на центральный сервер загружается только 512 КБ весов модели; после выполнения агрегирования FedAvg сервер рассылает обновления. Сходимость достигается после 100 раундов обмена данными, при этом F1 глобальной модели составляет 0,91, что близко к показателю F1 централизованного обучения (0,93) (разница составляет всего 21 TP и 3 T). При этом показатель F1 для независимой обучения одного завода (на основе данных 50 кранов), не участвующего в федеральном обучении, составляет 0,85. Федеральное обучение позволяет повысить показатель F1 с 0,85 до 0,91 при одновременном обеспечении конфиденциальности данных.
Модель прогнозного технического обслуживания кранов зависит от большого объема обучающих данных, охватывающих различные условия эксплуатации и типы неисправностей. Однако в реальных условиях у отдельного пользователя кранов (завода) обычно имеется лишь 20–80 кранов, и этого объема данных недостаточно для обучения высокоточной модели прогнозирования RUL на основе LSTM (показатель F1 для одного завода ≈ 0,85). Объединение данных нескольких заводов для обучения в одном месте позволяет повысить точность (F1 = 0,93), но сопряжено с рисками, связанными с соблюдением нормативных требований при передаче данных за пределы завода (”Закон о безопасности данных”, «Закон о защите персональных данных»), а также с требованиями конфиденциальности производственных процессов. Федеративное обучение (Federated Learning, FL) позволяет осуществлять совместное обучение нескольких заводов по принципу «данные остаются на месте, а модели перемещаются». Экспериментальная среда: фреймворки PyTorch 2.1.0 + Flower 1.7.0, 3 клиентских узла, каждый с 1 видеокартой RTX 4090, и 1 центральный сервер с процессором.
Процесс федеративного обучения
Используется алгоритм FedAvg (федеральное усреднение): t-й раунд → ① Центральный сервер распределяет глобальную модель W_t между тремя клиентами; ② Каждый клиент обучает модель на локальных данных в течение E = 5 эпох (Batch = 64, lr = 0,001, оптимизатор SGD) и получает обновление ΔW_i; ③ Клиенты загружают ΔW_i (только инкременты весов, 512 КБ за раз) на центральный сервер; ④ Сервер выполняет вычисление W_{t+1}=W_t+∑(n_i/N)·ΔW_i (где n_i — объем данных клиента i, N — общий объем данных); ⑤ Повторяется T = 100 раундов. Время каждого раунда связи составляет примерно 2 секунды (включая сетевую передачу и локальное обучение), общее время выполнения 100 раундов составляет примерно 8 минут.
Сравнение точности
| План | Объем данных | Очки Формулы-1 | MAPE | Данные предоставлены производителем? | Объем передачи данных |
|---|---|---|---|---|---|
| Отдельное производство (завод А) | 50 единиц × 24 месяца | 0.85 | 18.2% | 否 | 0 |
| Агрегированные данные (по трём заводам) | 150 единиц × 24 месяца | 0.93 | 14.3% | Да (все данные) | ТБ-класс |
| Федеративное обучение (Третий завод, FL) | 150 единиц × 24 месяца | 0.91 | 15.1% | Нет (только вес) | ~50 МБ |
| Федеративное обучение (без IID + с усилением) | 150 единиц × 24 месяца | 0.92 | 14.8% | Нет (только вес) | ~50 МБ |
Федеративное обучение: F1 = 0,91 против централизованного: 0,93; разница составляет всего 21 TP3T. После применения стратегии оптимизации для не-IID-распределений (когда распределения данных на разных заводах несовпадают, в локальную функцию потерь добавляется проксимальный член, см. алгоритм FedProx) показатель F1 повысился до 0,92. При независимом обучении отдельного завода показатель F1 составил 0,85, а федеративное обучение позволило повысить F1 на 0,06 (6 процентных пунктов), обеспечив точность, близкую к централизованной, при одновременном соблюдении конфиденциальности данных.
Проблемы, связанные с данными, не являющимися независимыми и идентично распределенными (IID), и их решение
Основной проблемой федеративного обучения является отсутствие независимости и одинакового распределения (Non-IID) — модели погрузчиков, условия эксплуатации и распределение типов отказов на разных заводах различаются (завод А — преимущественно цех горячей прокатки → износ подшипников; завод Б — преимущественно цех холодной прокатки → точечная коррозия зубчатых колес; завод В — преимущественно литейный цех → отказы, связанные с высокими температурами). Стандартный алгоритм FedAvg в условиях Non-IID сходится медленно (требуется 150 итераций против 80 итераций в случае IID), а показатель F1 глобальной модели снижается с 0,91 до 0,87. Решение: ① Локальная настройка — после передачи глобальной модели на клиентском устройстве проводится локальное переобучение в течение 5 эпох (адаптивное смещение распределения); ② Усиление данных — клиенты совместно используют распределение статистических характеристик (не обмениваясь данными) для выравнивания пространства признаков. После применения вышеуказанного решения показатель F1 в сценарии Non-IID восстановился до 0,90.
Оптимизация эффективности связи
Затраты на передачу данных при федеративном обучении являются основным узким местом при реальном внедрении. Объем передаваемых данных сократился с терабайтов в централизованной модели до 50 МБ при федеративном обучении (100 итераций × 512 КБ), однако на промышленных объектах с ограниченной пропускной способностью (общедоступная сеть 4G с скоростью восходящего канала около 10 Мбит/с) по-прежнему требуется оптимизация. Сравнение результатов тестирования четырёх стратегий оптимизации:
| Стратегия оптимизации | Объем трафика / цикл | Очки Формулы-1 | Убытки в Формуле-1 | Сферы применения |
|---|---|---|---|---|
| Базовая линия (FP32, полный градиент) | 512 КБ | 0.910 | Базовый показатель | Хорошие условия подключения к сети (специализированная промышленная сеть) |
| Разрежение Top-k (k=10%) | 51 КБ | 0.907 | -0.003 | Ограниченная пропускная способность (общедоступная сеть 4G/5G) |
| Квантование INT8 | 128 КБ | 0.909 | -0.001 | Пропускная способность ограничена, но поддерживает FP16 |
| Локальная эпоха = 10 (60 раундов) | 512 КБ | 0.902 | -0.008 | Высокая задержка в сети (межпровинциальная) |
| Асинхронная агрегация FedAsync | 512 КБ | 0.884 | -0.026 | Неоднородность клиентских устройств (частые обрывы соединения) |
Рекомендуемый вариант: комбинация квантования INT8 (128 КБ/итерация, F1-потеря 0,11 TP3T) и локальной эпохи = 10 (60 итераций, F1-потеря 0,81 TP3T), при этом объем трафика снизился до 251 TP3T по сравнению с базовым вариантом, а общий показатель F1 составил 0,90.
Защита с дифференциальной конфиденциальностью
Даже при передаче только градиентов модели, а не исходных данных, сохраняется риск атак, связанных с утечкой градиентов (Deep Leakage from Gradients, Zhu et al., 2019). Дифференциальная конфиденциальность (DP) обеспечивает защиту за счёт добавления гауссового шума к градиентам: perturbed_grad = clip(grad, C) + N(0, sigma^2 * C^2 * I). В данном эксперименте установлены следующие параметры: ограничение градиента C = 1,0, стандартное отклонение шума sigma = 0,01, что соответствует бюджету конфиденциальности epsilon = 8 (см. GB/T 35273-2020, epsilon(<=10 считается приемлемым уровнем). Использование DP-SGD привело к снижению показателя F1 с 0,91 до 0,89 (снижение на 21 TP и 3 T), что обеспечило доказательную гарантию конфиденциальности.
Проверка в условиях реального развертывания
Проект федеративного обучения по прогнозному техническому обслуживанию подвесных кранов на трёх дочерних предприятиях (заводы A, B и C) одного из металлургических концернов (№ KL-FL-2024-001, март 2025 г. — март 2026 г.). На каждом из трех заводов на 50 кранах установлены датчики PCB 352C33 + шлюзы KL-EDGE-200 + модель LSTM. После запуска федерального обучения: показатель F1 прогнозирования RUL на заводе A вырос с 0,83 до 0,90 (+7 п.п.), на заводе B — с 0,87 до 0,91 (+4 п.п.), на заводе C (где случаи отказов из-за высоких температур в литейном производстве редки) — с 0,79 до 0,88 (+9 п.п.). Наиболее заметный рост показал завод C: благодаря данным об износе подшипников и шестерен с заводов A и B удалось дополнить модель сбоев при высоких температурах. При централизованном обучении (при условии, что данные можно агрегировать) показатель F1 составил 0,93, тогда как федеративное обучение обеспечило соблюдение требований по неразглашению данных за пределы завода, уступив всего 21 TP и 3 T в точности.
Полное сравнение федеративного обучения, централизованного обучения и обучения в одной модели
| Критерии сравнения | Автономный завод | Централизованное обучение | Федеративное обучение FedAvg | Федеральный + DP (эпсилон = 8) |
|---|---|---|---|---|
| Очки Формулы-1 | 0.85 | 0.93 | 0.91 | 0.89 |
| Данные предоставлены производителем? | 否 | Да (в терабайтах) | Нет (только вес) | Нет (с учетом веса шума) |
| Риски несоблюдения нормативных требований | 无 | Гао (Закон о безопасности данных) | 低 | Минимальный (поддающийся подтверждению) |
| Объем передачи данных | 0 | ТБ-класс | 50 МБ | 50 МБ |
| Общая продолжительность тренировки | 15 мин | 45 минут | ~8 мин (связь) | ~9 мин |
| Требования к оборудованию | GPU одного завода | Центральный кластер графических процессоров | Каждый завод имеет собственные графические процессоры | Каждый завод имеет собственные графические процессоры |
| Сферы применения | Достаточный объем данных по отдельному заводу | Данные могут быть централизованы | Данные не подлежат передаче за пределы предприятия | Высокие требования к соблюдению нормативных требований |
Часто задаваемые вопросы
Вопрос: Объем данных одного завода в рамках федеративного обучения очень невелик (всего 10 кранов). Имеет ли это еще какой-то смысл?
Ответ: Да. Даже если объем данных одного завода невелик (10 единиц), участие в федеративном обучении все равно принесет пользу. Глобальная модель использует данные от нескольких заводов для обучения универсальным деградационным моделям, а локальная настройка на клиентах с небольшим объёмом данных адаптирует универсальную модель к конкретному оборудованию. В расширенных тестах данного эксперимента: 10 единиц на одном заводе (F1 = 0,72) → после добавления федеративного обучения (F1 = 0,87) — повышение на 15 процентных пунктов.
Вопрос: Как обеспечивается безопасность обмена данными при федеративном обучении?
Ответ: Рекомендуется применять следующие меры безопасности: ① Шифрование градиента — использование дифференциальной конфиденциальности (DP-SGD, ε=8) с добавлением гауссового шума (σ=0,01) перед отправкой весов для защиты от атак с утечкой градиента; ② Шифрование связи — шифрование передачи данных по протоколу TLS 1.3 для предотвращения перехвата данных «человеком посередине»; ③ Аутентификация клиентов — взаимное признание сертификатов x.509, при этом только авторизованные клиенты могут участвовать в агрегации.
Вопрос: Что делать, если сеть на каком-либо заводе нестабильна и соединение прерывается?
Ответ: Фреймворк Flower поддерживает асинхронную агрегацию (FedAsync) и механизм отказоустойчивости — центральный сервер ожидает истечения таймаута (по умолчанию 60 секунд); по истечении таймаута этот клиент пропускается, и агрегация обновлений продолжается с использованием данных от других клиентов. Клиент, потерявший соединение, при следующем подключении может запросить последнюю версию глобальной модели. В данном эксперименте было смоделировано случайное отключение одного клиента (вероятность 10%), в результате чего показатель F1 снизился с 0,91 до 0,88 (потеря 3%), что по-прежнему превосходит результат отдельного сервера — 0,85.
Вопрос: Требуется ли для развертывания федеративного обучения использование единой аппаратной платформы на всех заводах?
Ответ: Нет, не требуется. Фреймворк Flower поддерживает гетерогенные клиенты (Linux/Windows, GPU/CPU, PyTorch/TensorFlow). Каждое предприятие использует для обучения собственное оборудование: предприятие A — RTX 4090 (3 минуты на цикл обучения), предприятие B — RTX 3060 (5 минут на цикл), предприятие C — CPU (15 минут на цикл). Центральный сервер осуществляет синхронную агрегацию данных в соответствии со стратегией ”самый быстрый клиент ожидает 30%”.