Загрузка 0
ПОДЕЛИТЬСЯ

Мой блог

Листай вниз

Perplexity представила мультимодальные модели pplx-embed-v2-late в версиях 0.6B и 9B

Perplexity представила мультимодальные модели pplx-embed-v2-late в версиях 0.6B и 9B

Компания Perplexity анонсировала выход двух новых мультимодальных моделей эмбеддингов, работающих по принципу архитектуры ColBERT. Новинки получили название pplx-embed-v2-late и доступны в двух вариантах: компактная версия с 0.6 млрд параметров для быстрых запросов и более производительная модификация на 9 млрд параметров для максимального качества поиска.

Обе модели способны обрабатывать текстовую информацию, изображения и отрендеренные страницы в формате PDF, используя единое общее пространство эмбеддингов. На текущий момент веса опубликованы на платформе Hugging Face под лицензией MIT, однако запуск официального облачного API-эндпоинта от Perplexity только планируется.

Ключевые характеристики и требования к железу

Младшая модель с 0.6 млрд параметров проектировалась как легковесный энкодер запросов, способный работать даже на периферийных устройствах. Согласно техническим карточкам, обе версии задействуют графические процессоры с поддержкой CUDA и требуют установленных библиотек sentence-transformers версии не ниже 6.0.0 и transformers версии 5.4.0 и выше.

Реклама

Приблизительный объем памяти для хранения весов в формате bf16 составляет около 1.2 ГБ для младшей модели и в пределах 16–18 ГБ для старшей. Заявленные показатели памяти рассчитываются из соотношения 2 байта на один параметр исключительно для весов, тогда как официально опубликованные чекпоинты сохранены в формате F32, что увеличивает объем скачиваемых файлов вдвое.

Результаты тестирования и бенчмарки

Наивысший результат девятимиллиардной модели зафиксирован на бенчмарке MADQA, где она набрала 92.4% точности в задачах агентных ответов на вопросы по PDF-документам. Младшая модификация на 0.6B показала там же 90.1%. В специализированных текстовых тестах вариант на 9B опережает ближайшие сопоставимые аналоги на 1.6 процентных пункта, тогда как вариант на 0.6B отстает от решения от Google всего на 0.3 пункта.

Слабейшим результатом для легкой версии стали 61.2% на бенчмарке ViDoRe v3 Markdown, хотя этот показатель все равно удерживает за ней вторую позицию среди всех проверенных сторонних аналогов. В задачах поиска по изображениям лидерство остается за другими решениями, например, Gemini Embedding 2 превосходит модель на 9B в тестах MIRACL-Vision.

Комбинирование размеров индексов и запросов

Интересной особенностью архитектуры является возможность смешивания размеров. Запрос, поданный через легкую модель на 0.6B к базе данных, проиндексированной мощной моделью 9B, показал результат 63.5% на задаче поиска изображений ViDoRe v3. Такой подход превосходит показатель в 62.3%, получаемый при использовании версии 0.6B для обоих этапов, при сохранении прежней стоимости выполнения запроса.

Принцип работы и архитектура

Традиционные плотные модели компрессируют весь документ в единый вектор. В свою очередь, pplx-embed-v2-late сохраняет 128-мерный вектор для каждого отдельного токена. Оценка релевантности происходит по алгоритму MaxSim: каждый токен поискового запроса сопоставляется с наиболее подходящим токеном документа, после чего полученные максимальные значения суммируются. Страницы документов кодируются напрямую как изображения, что полностью исключает необходимость предварительного этапа OCR (распознавания текста).

Основные сценарии применения

Модели оптимально подходят для визуального поиска по документам, включая PDF-файлы, презентации и сканированные отчеты. Разделение ролей позволяет реализовать низкозадержковый поиск: индексацию документов выполняют в облаке с помощью модели 9B, а обработку самих запросов переносят на локальное устройство пользователя, используя модель 0.6B. Также архитектура эффективна для построения систем агентного RAG поверх крупных баз документов.

Сравнение с аналогами

Помимо решения от Perplexity, на рынке присутствуют конкурентные мультимодальные модели со своими особенностями архитектуры. Например, решение NVIDIA nemotron-colembed-vl-8b-v2 использует векторы шириной 4096 элементов на токен и запускается на мощных серверных видеокартах уровня A100 или H100. Модель TopK от энтузиастов оперирует 2048 измерениями в небольшой версии, а Google Gemini Embedding 2 работает как проприетарный API-сервис с поддержкой текста, изображений, видео, аудио и PDF.

01.