Сначала физика изображения, потом нейросеть

В проектах компьютерного зрения легко начать с выбора модели: сравнить архитектуры, посчитать GPU и заказать разметку. Но камера не видит «дефект» как бизнес-понятие. Она фиксирует свет, отражённый от поверхности. Если царапина, вмятина или неправильная фактура не отделяются от нормального изделия в пикселях, более сложная нейросеть лишь дороже обработает плохой сигнал.

Кейс чешской компании 24 Vision показывает более прагматичный порядок. Это малое предприятие на 10–49 сотрудников, которое разрабатывает системы машинного зрения для производственного контроля. Для перехода от правил обработки изображений к классификации дефектов на основе ИИ компании требовались не только алгоритмы. Не было подтверждённого ответа на два исходных вопроса: какой свет стабильно проявляет дефекты на разных материалах и какая конфигурация съёмки даст репрезентативный набор данных.

Вместо немедленной закупки лаборатории и обучения модели компания воспользовалась форматом Test Before Invest в центре EDIH-DIGIMAT. Результатом стал не «готовый ИИ под ключ», а проверенный тракт получения изображения, набор данных и документированная методика. Для малого бизнеса именно такой промежуточный результат часто ценнее раннего демо с высокой точностью на удобных фотографиях.

Что именно проверяли в лаборатории

Экспериментальная установка позволяла менять держатели образцов, положение камеры, поляризационный фильтр, геометрию и тип освещения. Использовались линейные, плоские, сферические и точечные источники в радиальных и тангенциальных конфигурациях. Образцы снимали в ультрафиолетовом, видимом и ближнем инфракрасном диапазонах.

По данным опубликованного кейса, только видимый диапазон надёжно показывал дефекты на всех исследованных типах образцов. Это не универсальный закон для любого производства. Это проверенный вывод для конкретного набора материалов, покрытий и цветовых вариантов. Его ценность в том, что команда сузила пространство решений до закупки промышленной системы и отказалась от лишнего исследования UV- и NIR-трактов.

Также был сформирован репрезентативный набор изображений и зафиксирован рабочий тракт: CCD/CMOS-сенсор, преобразование в Mono8 или Mono12 и целевая теоретическая ошибка обнаружения менее одного пикселя. Последняя величина описывает технический ориентир полученной методики, а не подтверждённый процент безошибочной сортировки в реальном производстве.

Поставщик на своём сайте отдельно заявляет надёжность серийной системы свыше 99%. Это заявление компании о её продукте, и его нельзя автоматически переносить на новый материал, линию или тип дефекта. В проекте заказчика нужны собственные критерии приёмки и испытания на его потоке.

Почему обычные фотографии не становятся датасетом автоматически

Набор данных для промышленного зрения должен описывать не только детали, но и допустимые условия процесса. В него входят:

  • материалы, цвета, покрытия и геометрические варианты изделий;
  • нормальная технологическая вариативность без дефекта;
  • реальные дефекты разных размеров, мест и степени выраженности;
  • смены, партии сырья, загрязнение оптики и старение источников света;
  • положение детали, вибрации, скорость конвейера и выдержка;
  • эталонное решение контролёра и причина брака;
  • версия камеры, объектива, света и параметров экспозиции.

Популярный исследовательский набор MVTec AD содержит более 5 000 изображений пятнадцати категорий, включая нормальные объекты и более семидесяти типов аномалий с попиксельной разметкой. Он полезен для сравнения методов. Но его лицензия ограничивает коммерческое использование, а лабораторный бенчмарк не заменяет данные конкретной линии.

Независимый разбор практики промышленного распознавания на CVPR 2025 также указывает на разрыв между академическими тестами и производством: контролируемые наборы с искусственными дефектами не передают всё разнообразие реальных условий, а сильный результат на бенчмарке может ухудшиться после внедрения. Для руководителя вывод прост: собственный тестовый набор важнее красивой таблицы точности модели.

Минимальная архитектура пилота

Пилот удобно разделить на физический и программный контуры.

Физический контур:

  • деталь фиксируется или проходит через воспроизводимую зону контроля;
  • кожух и выбранная схема света подавляют внешнее освещение;
  • камера, объектив, расстояние и выдержка закреплены;
  • триггер связывает кадр с изделием, партией и временем;
  • контрольный образец позволяет заметить уход фокуса, света или экспозиции.

Программный контур:

  • неизменённый исходный кадр сохраняется вместе с метаданными;
  • модель возвращает класс, область дефекта и уверенность;
  • бизнес-правила сравнивают результат с порогами для конкретного изделия;
  • пограничные случаи попадают человеку, а не автоматически в брак;
  • решение контролёра записывается как обратная связь;
  • мониторинг следит за долей пересмотров, ложным браком и пропусками.

Локальный контур особенно уместен, когда кадры раскрывают геометрию изделия, параметры процесса или дефекты поставщиков, а задержка зависит от такта линии. Камера и вычислитель могут работать в цеховой сети без передачи изображений во внешний API. При этом локальность сама по себе не решает управление доступами: исходные кадры, решения контролёров и отчёты о браке остаются чувствительными производственными данными.

Как принять пилот без самообмана

Одной «accuracy 99%» недостаточно. Если нормальных изделий гораздо больше, система может показать высокий общий процент и всё равно пропускать редкий критичный дефект. До начала эксперимента стоит согласовать как минимум:

  • recall отдельно для каждого критичного типа дефекта;
  • долю ложного брака по изделию, партии и смене;
  • долю кадров, отправленных на ручной пересмотр;
  • время от триггера до решения на p95;
  • устойчивость на новых партиях, цветах и после обслуживания линии;
  • стоимость одного принятого решения, а не одного кадра;
  • процедуру остановки автоматического отбраковывания при дрейфе.

Тестовый набор следует отделить по партиям или периодам, а не случайно перемешивать соседние кадры. Иначе почти одинаковые изображения одной серии окажутся и в обучении, и в проверке, создавая завышенную оценку. Финальный прогон нужно проводить на данных, которых команда не использовала для настройки света, порога или модели.

Экономика: покупать результат эксперимента, а не весь стек

Кейс 24 Vision не публикует стоимость работ или фактическую окупаемость. Поэтому корректно говорить только о структуре решения. На ранней стадии компании нужен бюджет на образцы, стенд, инженерное время, разметку и испытания — не обязательно собственная мультиспектральная лаборатория.

Модельный расчёт пилота можно построить так:

  • стоимость пропущенного дефекта = число пропусков × средний ущерб;
  • стоимость ложного брака = число ошибочно отбракованных изделий × маржинальная стоимость;
  • стоимость ручной проверки = минуты контролёров × полная ставка;
  • стоимость решения = пилот, оборудование, интеграция, эксплуатация и повторная валидация;
  • эффект = сокращение первых трёх статей минус стоимость решения.

В расчёт обязательно входят переналадка при новом изделии, замена света, очистка защитного стекла, хранение кадров и время технолога на спорные случаи. Если эти статьи не учесть, демонстрационный стенд выглядит выгоднее производственной системы.

Практический следующий шаг

Выберите один участок, один тип изделия и два-три экономически значимых дефекта. За две недели соберите матрицу «материал — поверхность — дефект — свет — положение камеры», не обучая сложную модель. Цель первого этапа — доказать, что дефект воспроизводимо виден и измерим.

После этого зафиксируйте тракт съёмки, соберите отдельные обучающую и тестовую партии и запустите простую базовую модель. Только если физический сигнал и контрольная выборка устойчивы, имеет смысл сравнивать более тяжёлые архитектуры, GPU и варианты локального развёртывания.

Управленческий вывод из кейса прост: в компьютерном зрении качество данных начинается не с разметчика, а с света, оптики и воспроизводимого процесса. Нейросеть должна стать последним усилителем уже видимого сигнала, а не дорогой попыткой угадать то, чего камера не показала.