Мой блог
TAPe+ML v3: компактная архитектура компьютерного зрения с числом параметров менее 100 тыс.
Я подготовил подробный разбор нашей новой научной публикации TAPe+ML: A Compact Structured Representation for Multi-Task Computer Vision, которая недавно появилась на arXiv. В материале собраны ключевые результаты третьей версии модели, демонстрирующие её высокую эффективность в классификации, детекции, сегментации и видеоаналитике.
Если вы впервые сталкиваюсь с этой разработкой, перед чтением рекомендуется ознакомиться с ранними материалами проекта: базовой концепцией универсальной архитектуры компьютерного зрения, экспериментами по детекции на COCO, а также релизом второй версии модели с минимальным количеством параметров.
Ключевые результаты TAPe+ML v3
В новой версии архитектуры удалось объединить задачи классификации, детекции и сегментации в рамках единого компактного ядра. При размере модели менее 100 тысяч параметров показатели точности существенно превосходят многие популярные крупные решения. Например, на ImageNet-1k модель демонстрирует 88,1% Top-1 точности, в детекции COCO показатели достигают 65,3 mAP50–95, а в задаче instance segmentation на том же датасете — 58,4 Mask mAP50–95. При этом покрытие объектов масками на LVIS составляет рекордные 98,2%.
Благодаря такому подходу ядро успешно конкурирует с известными крупными SOTA-моделями, превосходя семейства RF-DETR и YOLO в детекции и сегментации, а по классификации приближаясь к гигантским foundation-моделям при колоссальной разнице в числе параметров.
Что проверяли в научной статье
В рамках исследования мы провели масштабное тестирование архитектуры на различных наборах данных и сценариях применения:
- классификационные тесты на ImageNet-1k, ImageNet-ReaL, ImageNet-v2, ImageNet-R, ImageNet-Sketch, ObjectNet, Imagenette и MNIST;
- задачи объектной детекции на COCO и RF100-VL;
- посегментное выделение объектов (instance segmentation) на LVIS и COCO;
- индексирование видеопотоков и смысловой поиск сцен;
- промышленный OOD-тест на распознавание засорений руды на конвейерной ленте;
- эксперименты по самообучению с использованием подходов DINO/iBOT;
- автоматическую аннотацию данных и адаптацию под новые домены;
- возможности локального и edge-развёртывания компактного контура компьютерного зрения.
Отдельное внимание в исследовании уделено прямому сопоставлению эффективности работы модели на TAPe-данных и классических сырых пикселях при абсолютно идентичной архитектуре и равных условиях обучения.
Классификация: TAPe+ML v3 обходит SOTA-модели с миллиардами параметров
На датасете ImageNet-1k архитектура получила 88,1% Top-1 accuracy, имея менее 100 тысяч параметров. Тестирование на датасетах со сдвигом распределения также показало отличную стабильность: на ImageNet-ReaL результат составил 89,9%, на ImageNet-R — 90,3%, на ImageNet-Sketch — 75,8%, на ObjectNet — 78,6%, а на ImageNet-v2 — 80,2%.
В эксперименте с Imagenette я сравнил работу на TAPe-данных и сырых пикселях, используя трёхслойную свёрточную сеть с 516 тысячами параметров без аугментаций на 10% выборки за 25 эпох. Модель на TAPe-данных показала 92% точности против 47% у сырых пикселей. В тестах iBOT стандартная DINO на 9 тысячах и 120 тысячах изображений сойтись не смогла (loss держался около 2,7 и 2,46), тогда как аналогичная архитектура на TAPe-данных снизила loss до 0,406 всего на 9 тысячах примеров.
Детекция: выше RF-DETR и YOLO на COCO при <100 тыс. параметров
Для проверки детекционных возможностей я использовал стандартный набор COCO train2017 / val2017, содержащий 80 классов. Итоговая конфигурация модели продемонстрировала mAP50 на уровне 84,7% и mAP50–95 на уровне 65,3%.
При тестировании скорости inference на видеокарте NVIDIA GTX 1070 Ti (8 GB) время обработки одного кадра составило 10,8 мс. Для сравнения, YOLO26s показала 12,3 мс, а RF-DETR-Small потребовала 41,0 мс на кадр. Сравнение с внешними крупными моделями подтверждает преимущество нашего подхода в компактности и эффективности.
Сегментация: выше специализированных SOTA-сегментаторов в едином ядре
В новой версии сегментация встроена прямо в общий контур обработки. Сначала модель находит потенциальные контурные границы, собирает их в замкнутые контуры, а затем объединяет внутренние области в готовые сегменты.
На COCO instance segmentation решение показало 80,7 Mask mAP50 и 58,4 Mask mAP50–95, обогнав RF-DETR-Seg-2XL и YOLO26-X-Seg. Для оценки качества на LVIS применялись специфические метрики: покрытие объектов масками и точность AP@75. Итоговый показатель TAPe+ML по методологии LVIS после дополнительного обучения достиг 82,5 AP.
Видео и поиск сцен: TAPe разгромила DINOv2, HOG и optical flow по скорости, памяти и стабильности
Я провёл отдельный эксперимент по нарезке видео на смысловые сцены с использованием одинакового кластеризатора HDBSCAN и неизменных параметров, меняя только представление данных. Модель индексирует один час видео всего за 10–11 секунд, занимая менее 1 МБ в индексе, а сама кластеризация выполняется примерно за 1 секунду.
Для сравнения, альтернативные методы потребовали значительно больше ресурсов. Так, DINOv2 ViT-B/14 индексировала час видео около 5220 секунд (примерно в 475 раз медленнее), а её кластеризация длилась 21,5 секунды. HOG формировал индекс 530 секунд с размером файла около 1,7 ГБ, а optical flow тратил до 2959 секунд на индексацию и до 8739 секунд на кластеризацию, создавая индекс объёмом до 3,2 МБ. При этом TAPe обеспечила наиболее стабильное разбиение с минимальным количеством шумовых кластеров.
SOTA на каждой камере: TAPe+ML переносит компьютерное зрение на edge
Архитектура создавалась не только для серверных бенчмарков, но и для внедрения непосредственно на устройства. Малый размер весов (менее 32 КБ) и компактный исполняемый on-premise-пакет размером около 10 МБ позволяют разворачивать систему на локальных серверах, камерах, дронах и роботах.
Пиковое потребление памяти всего пайплайна при обработке кадра составляет около 20 МБ, а полный цикл обработки изображения (включая детекцию, классификацию, сегментацию и постпроцессинг) занимает всего около 12 мс. Это избавляет от необходимости передавать весь видеопоток в облако, минимизирует задержки и позволяет масштабировать видеоаналитику на любые удалённые точки.
Промышленный пилот: TAPe+ML более чем вдвое превзошла YOLO
В статье описан отдельный кейс по распознаванию засорений руды на конвейерной ленте — сложный OOD-сценарий с отличающимся освещением и структурой данных. Базовая YOLO26s на выборке из 30 изображений показала около 28% точности.
Применение TAPe+ML с адаптацией backbone на тех же 30 изображениях подняло точность до 65% — более чем в два раза выше результата конкурента. Увеличение выборки до 85 изображений повысило точность до 85%, а добавление NMS на 500 изображениях позволило достичь 85,7–96% accuracy.
Автоаннотация: от 20 кадров к рабочему датасету
Для сокращения времени ручной разметки в ML-стенд встроен режим автоаннотации. После первичной разметки небольшой партии данных модель дообучается, а затем самостоятельно обрабатывает неразмеченный массив, предлагая варианты детекций.
Пользователь может подтверждать объекты, корректировать границы, менять классы или удалять ошибки. Эти исправления отправляются в следующий цикл обучения, что особенно ценно в промышленности, где разметка требует привлечения профильных экспертов и позволяет быстро запустить пилот без долгого формирования датасета.
Где TAPe+ML заменяет тяжелый computer vision
Разработка применима во множестве отраслей, где требуется анализ изображений и видеопотоков:
- робототехника (навигация, захват, инспекция);
- БПЛА и спутниковый мониторинг инфраструктуры;
- промышленность (контроль качества, дефекты конвейеров);
- логистика и транспорт (учет грузов, парковки, сортировка);
- видеоаналитика безопасности и периметров;
- ритейл (контроль полок, выкладка товаров);
- агропромышленный комплекс и мониторинг полей;
- медицинская диагностика и сегментация структур;
- городская инфраструктура и контроль строительных площадок.
Если ваши задачи связаны с классификацией, детекцией, сегментацией или edge-развертыванием, вы можете связаться со мной через комментарии или почту.
