ИИ-зрение для обнаружения дефектов кранов: старт с малой выборкой

📋 Основное резюме

Разметка промышленных дефектов — процесс дорогой и медленный: дефекты встречаются редко, требуют квалифицированных разметчиков, а ручной труд стоит дорого. При этом универсальные модели на промышленных дефектах часто дают сбой. Четыре метода обучения с малым количеством размеченных данных — аугментация данных, трансферное обучение, синтетические данные и активное обучение — позволяют запустить ИИ-диагностику уже с минимальной разметкой. В статье разбираются корневые причины проблемы дефицита размеченных данных и предлагается прагматичный путь внедрения: старт с трансферного обучения и постепенное накопление данных в процессе эксплуатации.

Парадокс, который идёт вразрез со здравым смыслом: в ИИ-диагностике кранов самое сложное — не алгоритмы, а разметка данных. Открытых алгоритмов предостаточно, но реальный тормоз проекта — тысячи и десятки тысяч дефектных образцов, требующих ручной разметки. Дефекты сами по себе редки, а размечать их должны инженеры, разбирающиеся в оборудовании.

Чтобы накопить размеченный набор данных по таким дефектам, как обрыв проволоки стального каната, трещины в сварных швах или перекос груза, уходят месяцы, а затраты превышают стоимость разработки алгоритмов. Это и есть «проблема малого количества размеченных данных» в промышленном ИИ.

К счастью, для обучения с малым количеством данных уже существуют отработанные методы, позволяющие запустить проект с минимальной разметкой. Разберём их подробнее.

Почему разметка промышленных дефектов дорога и медлительна

Дороговизна и медлительность разметки промышленных дефектов обусловлены тремя факторами. Первый — редкость дефектов: нормальных образцов много, а по-настоящему дефектных — крайне мало, и чтобы набрать достаточный объём данных для обучения, приходится подолгу ждать на производственной линии.

Второй фактор — высокий порог входа для разметчиков. Промышленные дефекты не похожи на фотографии кошек и собак, которые может разметить любой. Обрыв проволоки в стальном канате или непровар сварного шва способен точно определить только инженер, понимающий оборудование и технологию. Такие специалисты редки и стоят дорого.

Третий фактор — дисбаланс классов. Типов дефектов много, но объём выборки по каждому типу крайне неравномерен: редких дефектов может быть всего несколько десятков или даже единичные экземпляры. При стандартных методах обучения модель просто игнорирует такие редкие классы.

Совокупность этих трёх причин приводит к тому, что затраты на разметку в промышленной ИИ-диагностике высоки, а сроки велики — это самый существенный скрытый барьер для внедрения проектов. Компания Келуде при запуске проектов ИИ-диагностики всегда выносит оценку стоимости и сроков разметки в отдельный пункт планирования.

Метод обнаружения крана с помощью ИИ: схема старта с малым количеством образцов

Четыре метода малой выборки: аугментация, трансферное обучение, синтетические данные, активное обучение

Первый метод — аугментация данных. Имеющиеся немногочисленные образцы подвергаются отражению, вращению, масштабированию, добавлению шума и изменению яркости — так удаётся с минимальными затратами расширить выборку в несколько раз. Это самый простой и быстрый способ, решающий проблему «недостаточного объёма выборки».

Второй метод — трансферное обучение. Модель, предварительно обученная на крупномасштабных наборах данных, берётся за отправную точку для обнаружения промышленных дефектов. Для получения рабочего результата достаточно небольшой разметки и тонкой настройки. ISO 24621 «Диагностика неисправностей кранов с помощью ИИ» задаёт структуру внедрения диагностической модели. Это ключевой приём для старта с малой выборкой — он радикально снижает зависимость от объёма размеченных данных.

Третий метод — синтетические данные. С помощью имитационного рендеринга или генеративных моделей искусственно создаются образцы с дефектами, восполняющие нехватку реальных данных. Этот подход особенно подходит для редких дефектов, которые в реальных условиях зафиксировать крайне сложно.

Четвёртый метод — активное обучение. Вместо разметки всех образцов подряд модель сама отбирает «самые неоднозначные» экземпляры и передаёт их инженеру в первую очередь. При том же бюджете на разметку активное обучение позволяет направить усилия на те данные, которые максимально повышают качество модели.

Анализ корневых причин: почему универсальные модели не работают на промышленных дефектах

Универсальные модели компьютерного зрения отлично справляются с естественными изображениями — кошками, собаками, пешеходами, — но при переносе на промышленные дефекты часто дают сбой. Причины две.

Первая — различие в распределении данных. Форма, текстура и освещение промышленных дефектов кардинально отличаются от естественных изображений. Общие признаки, которые усваивает предобученная модель, оказываются недостаточно чувствительными к тонким обрывам проволоки и слабым трещинам, поэтому прямое применение даёт плохие результаты.

Вторая — дефицит размеченных данных. Универсальные модели строятся на огромных объёмах размеченных данных, а промышленные дефекты как раз страдают от их нехватки. Разрыв в масштабах данных составляет порядки величин, поэтому прямой перенос парадигмы обучения на естественных изображениях невозможен.

Именно поэтому промышленная ИИ-диагностика обязана идти по пути обучения с малой выборкой: дело не в нежелании использовать больше данных, а в том, что данные объективно дефицитны, и методы должны адаптироваться к этой реальности. В проектах ИИ-диагностики компания Келуде по умолчанию стартует с трансферного обучения и аугментации данных, а не с обучения с нуля.

Практический путь внедрения: трансферное обучение на старте и накопление данных в процессе

Старт с малой выборки имеет чёткую последовательность шагов, и главное — не рассчитывать на мгновенный результат.

Шаг первый — построить каркас на трансферном обучении. Выбирается предобученная модель, на небольшой разметке она тонко настраивается до первой рабочей версии системы обнаружения — и система запускается. Цель этого этапа — «работает», а не «идеально».

Шаг второй — запуск в эксплуатацию с параллельным накоплением данных. После ввода системы в строй ошибочно классифицированные образцы и новые типы дефектов непрерывно возвращаются в контур разметки, и объём данных естественным образом растёт по мере использования. ISO 24619 «Спецификация интерфейса Интернета вещей для кранов» определяет систему доступа для сбора данных и их обратной подачи. Этот шаг — долгосрочный двигатель проекта с малой выборкой.

Шаг третий — повышение эффективности за счёт активного обучения. При ограниченном бюджете на разметку модель отбирает самые сложные образцы для приоритетной разметки, и каждый рубль, вложенный в разметку, приносит максимальную отдачу. Проекты ИИ-диагностики компании Келуде идут именно по этому пути: старт с трансферного обучения, накопление данных в процессе эксплуатации и повышение эффективности через активное обучение.

Методы малой выборки и область применения

← Прокрутите таблицу влево/вправо →
Метод Решаемая проблема Начальные затраты Потолок эффективности Область применения
аугментация данныхНедостаточный объём выборкиКрайне низкийСреднийУниверсальный для всех сценариев
Трансферное обучениеНедостаточный объём разметкиКрайне низкийВысокийОптимальный выбор при малом количестве образцов
Синтетические данныеРедкийДефектНевозможно зафиксироватьСреднийСредне-высокийРедкийДефектДополнение
Активное обучениеОграниченный бюджет на разметкуСреднийВысокийОптимизация бюджета на разметку

Быстрая справка по пунктам стандартов для обнаружения с малым количеством образцов

← Прокрутите таблицу влево/вправо →
Стандарт Ключевые положения Связь с малым количеством образцов
ISO 24621крандиагностика неисправностей с помощью ИИФреймворкдиагностическая модельФреймворк внедрения
ISO 24619кранинтерфейс Интернета вещейСпецификациясбор данныхи обратная закачкасистема доступа
GB/T 28264 — система мониторинга и управления безопасностьюконтроль безопасностиФиксация следовтребованияэксплуатационные данныеНакопление данных на основе фиксации следов

Часто задаваемые вопросы по малообразцовому ИИ-обнаружению

В: Чем малообразцовое обучение отличается от традиционного глубокого обучения?

О: Традиционное глубокое обучение опирается на огромные объёмы размеченных данных для обучения модели с нуля — чем больше данных, тем выше точность. Малообразцовое обучение признаёт дефицит данных и использует аугментацию данных, трансферное обучение, синтетические данные и активное обучение, чтобы модель достигала приемлемого уровня точности даже при ограниченной разметке. Основное отличие — в подходе к данным: один управляется данными и наращивает их объём, другой управляется методами и компенсирует их недостаток. Малообразцовый подход лучше подходит для промышленных дефектов, где разметка дорога и медленна.

В: Размеченных данных по дефектам не хватает — с чего начать?

О: Сначала — аугментация данных: перевороты, шум, масштабирование уже имеющихся образцов позволяют расширить выборку без дополнительных затрат. Затем — трансферное обучение: выбираете предобученную модель и дообучаете её на минимальной разметке. Для редких дефектов используйте синтетические данные. Если бюджет на разметку ограничен — применяйте активное обучение, чтобы модель сама выбирала самые сложные образцы для приоритетной разметки. Порядок такой: аугментация — фундамент, трансферное обучение — каркас, синтетика — для редких случаев, активное обучение — для повышения эффективности.

В: Бюджет ограничен — как начать с малообразцовым ИИ-обнаружением?

О: Начните с трансферного обучения и аугментации данных — это самые дешёвые и быстрые методы, которые позволяют запустить первую версию модели на небольшой разметке. Сначала внедрите систему, накапливайте данные в процессе эксплуатации, а затем постепенно подключайте синтетические данные и активное обучение. Не стремитесь сразу к полному покрытию и высокой точности — сначала минимальными затратами добейтесь работающего обнаружения, а затем уже повышайте точность за счёт времени и данных.

Инженерную практику малообразцового старта можно сопоставить с подходом к накоплению данных, описанным в статье «Создана платформа для обучения и тестирования алгоритмов ИИ-зрения для кранов, накоплено более 500 000 размеченных изображений промышленных дефектов».

Узкое место промышленного ИИ-обнаружения — в разметке, а не в алгоритмах. Келуде Тяжёлая Промышленность начинает с трансферного обучения, накапливает данные в процессе эксплуатации и повышает эффективность за счёт активного обучения — это позволяет запускать малообразцовые проекты, а не упираться в стоимость разметки.

Похожие статьи

contact

contact us

phone:
+86 13903802779

mail:3915269@qq.com

Working hours: Monday to Friday

Wechat
Wechat
SHARE
TOP