Загрузка 0
ПОДЕЛИТЬСЯ

Мой блог

Листай вниз

TAPe+ML v3: компактная архитектура компьютерного зрения с числом параметров менее 100 тыс.

TAPe+ML v3: компактная архитектура компьютерного зрения с числом параметров менее 100 тыс.

Я подготовил подробный разбор нашей новой научной публикации TAPe+ML: A Compact Structured Representation for Multi-Task Computer Vision, которая недавно появилась на arXiv. В материале собраны ключевые результаты третьей версии модели, демонстрирующие её высокую эффективность в классификации, детекции, сегментации и видеоаналитике.

Если вы впервые сталкиваюсь с этой разработкой, перед чтением рекомендуется ознакомиться с ранними материалами проекта: базовой концепцией универсальной архитектуры компьютерного зрения, экспериментами по детекции на COCO, а также релизом второй версии модели с минимальным количеством параметров.

Ключевые результаты TAPe+ML v3

В новой версии архитектуры удалось объединить задачи классификации, детекции и сегментации в рамках единого компактного ядра. При размере модели менее 100 тысяч параметров показатели точности существенно превосходят многие популярные крупные решения. Например, на ImageNet-1k модель демонстрирует 88,1% Top-1 точности, в детекции COCO показатели достигают 65,3 mAP50–95, а в задаче instance segmentation на том же датасете — 58,4 Mask mAP50–95. При этом покрытие объектов масками на LVIS составляет рекордные 98,2%.

Реклама

Благодаря такому подходу ядро успешно конкурирует с известными крупными SOTA-моделями, превосходя семейства RF-DETR и YOLO в детекции и сегментации, а по классификации приближаясь к гигантским foundation-моделям при колоссальной разнице в числе параметров.

Что проверяли в научной статье

В рамках исследования мы провели масштабное тестирование архитектуры на различных наборах данных и сценариях применения:

  • классификационные тесты на ImageNet-1k, ImageNet-ReaL, ImageNet-v2, ImageNet-R, ImageNet-Sketch, ObjectNet, Imagenette и MNIST;
  • задачи объектной детекции на COCO и RF100-VL;
  • посегментное выделение объектов (instance segmentation) на LVIS и COCO;
  • индексирование видеопотоков и смысловой поиск сцен;
  • промышленный OOD-тест на распознавание засорений руды на конвейерной ленте;
  • эксперименты по самообучению с использованием подходов DINO/iBOT;
  • автоматическую аннотацию данных и адаптацию под новые домены;
  • возможности локального и edge-развёртывания компактного контура компьютерного зрения.

Отдельное внимание в исследовании уделено прямому сопоставлению эффективности работы модели на TAPe-данных и классических сырых пикселях при абсолютно идентичной архитектуре и равных условиях обучения.

Реклама

Классификация: TAPe+ML v3 обходит SOTA-модели с миллиардами параметров

На датасете ImageNet-1k архитектура получила 88,1% Top-1 accuracy, имея менее 100 тысяч параметров. Тестирование на датасетах со сдвигом распределения также показало отличную стабильность: на ImageNet-ReaL результат составил 89,9%, на ImageNet-R — 90,3%, на ImageNet-Sketch — 75,8%, на ObjectNet — 78,6%, а на ImageNet-v2 — 80,2%.

В эксперименте с Imagenette я сравнил работу на TAPe-данных и сырых пикселях, используя трёхслойную свёрточную сеть с 516 тысячами параметров без аугментаций на 10% выборки за 25 эпох. Модель на TAPe-данных показала 92% точности против 47% у сырых пикселей. В тестах iBOT стандартная DINO на 9 тысячах и 120 тысячах изображений сойтись не смогла (loss держался около 2,7 и 2,46), тогда как аналогичная архитектура на TAPe-данных снизила loss до 0,406 всего на 9 тысячах примеров.

Детекция: выше RF-DETR и YOLO на COCO при <100 тыс. параметров

Для проверки детекционных возможностей я использовал стандартный набор COCO train2017 / val2017, содержащий 80 классов. Итоговая конфигурация модели продемонстрировала mAP50 на уровне 84,7% и mAP50–95 на уровне 65,3%.

При тестировании скорости inference на видеокарте NVIDIA GTX 1070 Ti (8 GB) время обработки одного кадра составило 10,8 мс. Для сравнения, YOLO26s показала 12,3 мс, а RF-DETR-Small потребовала 41,0 мс на кадр. Сравнение с внешними крупными моделями подтверждает преимущество нашего подхода в компактности и эффективности.

Сегментация: выше специализированных SOTA-сегментаторов в едином ядре

В новой версии сегментация встроена прямо в общий контур обработки. Сначала модель находит потенциальные контурные границы, собирает их в замкнутые контуры, а затем объединяет внутренние области в готовые сегменты.

На COCO instance segmentation решение показало 80,7 Mask mAP50 и 58,4 Mask mAP50–95, обогнав RF-DETR-Seg-2XL и YOLO26-X-Seg. Для оценки качества на LVIS применялись специфические метрики: покрытие объектов масками и точность AP@75. Итоговый показатель TAPe+ML по методологии LVIS после дополнительного обучения достиг 82,5 AP.

Реклама

Видео и поиск сцен: TAPe разгромила DINOv2, HOG и optical flow по скорости, памяти и стабильности

Я провёл отдельный эксперимент по нарезке видео на смысловые сцены с использованием одинакового кластеризатора HDBSCAN и неизменных параметров, меняя только представление данных. Модель индексирует один час видео всего за 10–11 секунд, занимая менее 1 МБ в индексе, а сама кластеризация выполняется примерно за 1 секунду.

Для сравнения, альтернативные методы потребовали значительно больше ресурсов. Так, DINOv2 ViT-B/14 индексировала час видео около 5220 секунд (примерно в 475 раз медленнее), а её кластеризация длилась 21,5 секунды. HOG формировал индекс 530 секунд с размером файла около 1,7 ГБ, а optical flow тратил до 2959 секунд на индексацию и до 8739 секунд на кластеризацию, создавая индекс объёмом до 3,2 МБ. При этом TAPe обеспечила наиболее стабильное разбиение с минимальным количеством шумовых кластеров.

SOTA на каждой камере: TAPe+ML переносит компьютерное зрение на edge

Архитектура создавалась не только для серверных бенчмарков, но и для внедрения непосредственно на устройства. Малый размер весов (менее 32 КБ) и компактный исполняемый on-premise-пакет размером около 10 МБ позволяют разворачивать систему на локальных серверах, камерах, дронах и роботах.

Пиковое потребление памяти всего пайплайна при обработке кадра составляет около 20 МБ, а полный цикл обработки изображения (включая детекцию, классификацию, сегментацию и постпроцессинг) занимает всего около 12 мс. Это избавляет от необходимости передавать весь видеопоток в облако, минимизирует задержки и позволяет масштабировать видеоаналитику на любые удалённые точки.

Промышленный пилот: TAPe+ML более чем вдвое превзошла YOLO

В статье описан отдельный кейс по распознаванию засорений руды на конвейерной ленте — сложный OOD-сценарий с отличающимся освещением и структурой данных. Базовая YOLO26s на выборке из 30 изображений показала около 28% точности.

Применение TAPe+ML с адаптацией backbone на тех же 30 изображениях подняло точность до 65% — более чем в два раза выше результата конкурента. Увеличение выборки до 85 изображений повысило точность до 85%, а добавление NMS на 500 изображениях позволило достичь 85,7–96% accuracy.

Автоаннотация: от 20 кадров к рабочему датасету

Для сокращения времени ручной разметки в ML-стенд встроен режим автоаннотации. После первичной разметки небольшой партии данных модель дообучается, а затем самостоятельно обрабатывает неразмеченный массив, предлагая варианты детекций.

Пользователь может подтверждать объекты, корректировать границы, менять классы или удалять ошибки. Эти исправления отправляются в следующий цикл обучения, что особенно ценно в промышленности, где разметка требует привлечения профильных экспертов и позволяет быстро запустить пилот без долгого формирования датасета.

Где TAPe+ML заменяет тяжелый computer vision

Разработка применима во множестве отраслей, где требуется анализ изображений и видеопотоков:

  • робототехника (навигация, захват, инспекция);
  • БПЛА и спутниковый мониторинг инфраструктуры;
  • промышленность (контроль качества, дефекты конвейеров);
  • логистика и транспорт (учет грузов, парковки, сортировка);
  • видеоаналитика безопасности и периметров;
  • ритейл (контроль полок, выкладка товаров);
  • агропромышленный комплекс и мониторинг полей;
  • медицинская диагностика и сегментация структур;
  • городская инфраструктура и контроль строительных площадок.

Если ваши задачи связаны с классификацией, детекцией, сегментацией или edge-развертыванием, вы можете связаться со мной через комментарии или почту.

01.