Как сэкономить на разметке дефектов для кранов с ИИ-зрением
📋 Основное резюме
Бюджет на разметку ограничен, но объекты разметки можно выбирать. Активное обучение позволяет модели самостоятельно отбирать образцы с наибольшей неопределённостью и передавать их инженерам в первую очередь. При том же бюджете это даёт более высокую точность, чем случайная разметка. В статье разбираются три стратегии — выборка по неопределённости, выборка по разнообразию и комитетный запрос, — и показывается, как активное обучение позволяет расходовать бюджет с максимальной эффективностью.
🧮 Основная логика статьи
Случайная разметка: из большого массива образцов выбирается случайная партия. Объём полезной информации для модели непредсказуем, бюджет расходуется вслепую.
Активное обучение: модель отбирает образцы, наиболее ценные для повышения точности. Бюджет тратится на то, что действительно улучшает результат.
Факт, который часто упускают из виду: бюджет на разметку так же важен, как и её качество. Но вопрос о том, как именно расходовать этот бюджет, обычно решается по принципу «взяли случайную выборку и разметили». Компания «Келуде Тяжёлая Промышленность» накопила более 500 000 размеченных изображений промышленных дефектов, и главный вывод из этого опыта — размечать как попало хуже, чем не размечать вовсе, а размечать вслепую хуже, чем размечать осознанно.
Активное обучение как раз и решает задачу «осознанной» разметки: модель сама указывает, какие образцы нужно разметить в первую очередь. Ниже — подробный расчёт.
Граничные условия активного обучения: фиксированный бюджет и максимум информации
Предпосылка активного обучения — фиксированный бюджет. Количество инженеров по разметке и их время ограничены, поэтому объём размеченных образцов заранее определён. В таких условиях вопрос смещается с «сколько размечать» на «что именно размечать».
Проблема случайной разметки — непредсказуемый объём полезной информации. В большом массиве данных значительная часть образцов либо уже известна модели, либо дублирует друг друга. Если случайно выбрать именно такие образцы, деньги на разметку будут потрачены впустую.
Логика активного обучения — модель сама выбирает образцы: те, в которых она наименее уверена, и те, которые сильнее всего отличаются от уже размеченных. Именно такие образцы несут максимум информации для повышения точности. При том же бюджете активное обучение направляет средства на самое важное, и точность растёт быстрее. В проектах с ограниченным бюджетом на разметку «Келуде Тяжёлая Промышленность» использует активное обучение как стандартную практику: ISO 24621 «Диагностика неисправностей кранов с помощью ИИ» требует непрерывной оптимизации диагностической модели.
Три стратегии выборки: неопределённость, разнообразие, комитет
У активного обучения есть три основных подхода к отбору образцов.
Выборка по неопределённости — модель отбирает образцы, в которых она наименее уверена. Низкая уверенность в прогнозе, близость к границе принятия решения — значит, модель ещё не усвоила этот материал, и разметка такого образца даст максимальный эффект. Это самый базовый и распространённый приём.
Выборка по разнообразию — отбираются образцы, максимально отличающиеся от уже размеченных. Это позволяет избежать разметки множества похожих экземпляров, обеспечивает более широкое покрытие распределения данных, и модель обучается разносторонне.
Комитетный запрос — обучается несколько моделей, и отбираются образцы, по которым между ними наибольшие расхождения. Если несколько моделей не могут прийти к единому мнению, такой образец, скорее всего, наиболее ценен для разметки. Стратегии можно комбинировать: неопределённость как основа, разнообразие для покрытия, комитет для выявления сложных случаев.
Расчёт эффективности: выше точность при том же бюджете
Ценность активного обучения оценивается в сравнении при одинаковом бюджете.
Случайная разметка при тех же затратах даёт множество образцов, которые модель «уже знает», — это резервирование. Точность растёт медленно, бюджет используется неэффективно.
Активное обучение размечает «самые неясные» образцы — каждая единица разметки бьёт точно в слабое место модели. Точность растёт быстрее, и при том же бюджете можно приблизиться к более высокому пределу точности.
Суть расчёта — информационная плотность разметки: активное обучение повышает информативность каждой единицы разметки, и бюджет тратится с большей отдачей. Опыт «Келуде Тяжёлая Промышленность» показывает: чем жёстче ограничен бюджет на разметку, тем выше относительная ценность активного обучения. Когда бюджет настолько велик, что можно разметить всё, значимость стратегии снижается.
Самые частые ошибки при внедрении активного обучения
Ошибка первая — игнорирование разнообразия образцов. Если отбирать только неопределённые образцы, можно размереть множество похожих экземпляров: модель хорошо обучится на локальном участке, но не получит глобального покрытия, и обобщающая способность пострадает. Неопределённость нужно сочетать с разнообразием.
Ошибка вторая — восприятие активного обучения как способа сэкономить усилия. Активное обучение — это лишь стратегия отбора образцов. Качество разметки и вовлечённость инженеров остаются такими же важными: даже идеально отобранные образцы при небрежной разметке не дадут результата.
Ошибка третья — разметить всё за один раз и не возвращаться к итерациям. Активное обучение — это цикл: разметили партию, обучили модель, отобрали следующую партию. Ценность раскрывается только при непрерывной итерации. «Келуде Тяжёлая Промышленность» выстроила активное обучение как замкнутый цикл «разметка — обучение — отбор», а не как разовое действие: GB/T 28264 — система мониторинга и управления безопасностью требует прослеживаемости размеченных данных.
Сравнение трёх стратегий выборки
| Стратегия | Выбор образцов | Источник информативности | Сложность реализации | Область применения |
|---|---|---|---|---|
| Выборка по неопределённости | Низкая предсказательная уверенность | Слабые места модели | Низкая | Оптимально для старта |
| Выборка по разнообразию | Значительное отличие от размеченных | покрытиеОхват | Средняя | Дополнение общей картиныпокрытие |
| Запрос к комитету | Значительное расхождение моделей | Сложные случаиПозиционирование | Высокая | Обработка сложных образцов |
Быстрая справка по пунктам стандартов для активного обучения
| Стандарт | Ключевые положения | иактивное обучениевзаимосвязь |
|---|---|---|
| ISO 24621 | крандиагностика неисправностей с помощью ИИСтруктура | диагностическая модельНепрерывная оптимизация |
| GB/T 28264 — система мониторинга и управления безопасностью | контроль безопасностиФиксация следовтребования | размеченные данныепрослеживаемый |
| ISO 24619 | кранинтерфейс Интернета вещейСпецификация | Обратная подача данныхсистема доступа |
Часто задаваемые вопросы об активном обучении
В: В чём принципиальная разница между активным обучением и случайной разметкой?
О: Разница в том, «кто решает, что размечать». При случайной разметке выборка делается вслепую, информативность данных неопределённа — можно размечать множество примеров, которые модель уже знает, то есть дублировать. Активное обучение заставляет модель отбирать те примеры, в которых она наименее уверена, и каждая единица разметки бьёт точно в слабое место модели, повышая плотность информации. При том же бюджете активное обучение даёт более быстрый рост точности. По сути, решение о том, что размечать, становится не случайным, а стратегическим.
В: При ограниченном бюджете на аннотацию, с какой стратегии активного обучения начинать?
О: Начните с выборки по неопределённости — это самый простой и быстрый способ получить результат: модель сама предлагает разметить примеры, в которых она наименее уверена. Когда процесс отлажен, добавьте выборку по разнообразию, чтобы не размечать похожие примеры и обеспечить глобальное покрытие. При более жёстком бюджете и сложных примерах используйте комитетный метод для поиска трудных случаев. Логика такая: неопределённость — база, разнообразие — покрытие, комитет — сложные точки.
В: Может ли активное обучение исключить стоимость аннотации?
О: Исключить саму аннотацию оно не может — оно лишь позволяет тому же бюджету принести больше пользы. Активное обучение отвечает на вопрос «какие примеры размечать выгоднее всего», но отобранные примеры всё равно требуют тщательной работы инженера, и качество разметки не может быть снижено. Его ценность — в повышении эффективности использования бюджета: достижение более высокой точности с меньшим числом примеров, а не в том, чтобы сделать разметку необязательной.
Подход к накоплению данных с помощью активного обучения можно сопоставить с практикой, описанной в статье «Создана платформа для обучения и тестирования алгоритмов ИИ-зрения для кранов, накоплено более 500 000 размеченных изображений промышленных дефектов».
При ограниченном бюджете на аннотацию важно тратить средства точечно. Келуде Тяжёлая Промышленность использует неопределённость как основу, разнообразие для покрытия и комитетный метод для сложных случаев, чтобы каждая единица разметки попадала в слабое место модели и повышала точность при том же бюджете.