Загрузка 0
ПОДЕЛИТЬСЯ

Мой блог

Листай вниз

Perplexity представила pplx-embed-v2-context-9b-preview: контекстную модель эмбеддингов для RAG

Perplexity представила pplx-embed-v2-context-9b-preview: контекстную модель эмбеддингов для RAG

Команды Perplexity Research и turbopuffer выпустили модель pplx-embed-v2-context-9b-preview. Это продвинутое решение для RAG-пайплайнов, созданное для поиска ответов вместе с подтверждающими доказательствами.

Я, Сергей Багров, детально изучил этот релиз. Новинка интересна тем, что каждый фрагмент текста в ней эмбедится с учетом всего документа, а ключевое изменение кроется в обучающем сигнале, который кардинально меняет подход к извлечению информации.

Развертывание и доступность

Эту модель уже можно развернуть самостоятельно: веса опубликованы на платформе Hugging Face под свободной лицензией MIT. Для корректной загрузки потребуется библиотека transformers версии не ниже 5.4.0 и обязательный параметр trust_remote_code=True. В официальном API Perplexity новинка пока не представлена, а в карточке модели прямо указано, что интерфейс и веса могут измениться без сохранения обратной совместимости.

Реклама

Почему традиционные золотые пассажы не работают

Классические RAG-системы делят массивные документы на отдельные кусочки. Однако конкретный фрагмент часто зависит от сущности, заголовка или определения, описанного в другой части текста. Современные контекстные модели решают эту проблему с помощью метода позднего батчинга (late chunking), когда весь документ кодируется за один проход, а затем пулится по частям.

Тем не менее, классический процесс обучения обычно размечает лишь один «золотой» фрагмент под конкретный запрос. Все остальные участки текста автоматически становятся негативными, включая те предложения, которые содержат проверяемые доказательства. Perplexity выделяет еще три системные проблемы такого подхода: бинарные метки дают слишком грубый сигнал, затраты на разметку с помощью языковых моделей растут линейно с увеличением датасета, а сами метки жестко привязаны к выбранной стратегии деления на чанки.

Как устроено обучение модели

В роли учителя выступает специальная модель контекстного сжатия от Perplexity, которая учитывает конкретный запрос. Она одновременно анализирует запрос и документ, оценивая каждый отдельный токен. Релевантность чанка определяется как среднее значение для топ-n токенов внутри него, а мягкая целевая метка формируется через temperature-scaled softmax по чанкам в позитивном документе, тогда как фрагменты из других документов получают нулевое значение.

Функция потерь дистилляции рассчитывается через прямую дивергенцию Кульбака — Лейблера между распределениями учителя и студента. Потери на уровне документа вычисляются по формуле InfoNCE, где документ оценивается по своему лучшему чанку, что вдохновлено подходом MaxSim в архитектуре ColBERT. В ходе обучения в каждом батче случайно выбирается стратегия разбиения на фрагменты, которые разделяются специальным токеном <|chunk_sep|> и усредняются (mean-pooled).

Учитель задействован исключительно на этапе обучения, поэтому при инференсе задержки и требования к хранению не возрастают. Сама модель создана на базе внутренней 9B ColBERT-модели поиска. Линейная проекция выдает 2048 измерений, а обучение по методу Матрешки (Matryoshka training) поддерживает и 1024 измерения. Обучение с учетом квантования (quantization-aware training) позволяет получать нативные int8-эмбеддинги, а итоговый релиз представляет собой «модельный суп» (model soup) из нескольких чекпоинтов, обученных примерно на 430 датасетах для более чем 50 языков.

Бенчмарк context-bench и результаты

Специально для независимой оценки был создан закрытый бенчмарк context-bench, разработанный компанией turbopuffer для исключения утечек из обучающих данных. Он включает 2099 запросов по 38 894 документам из 21 предметной области. После разбиения на предложения получилось 2 458 072 чанка, а медианная длина целевого документа составляет около 6100 токенов. Запросы проверяют 12 контекстных возможностей моделей — от разрешения местоимений до работы со сложными таблицами.

Метрики оцениваются в рамках Document@K, Answer@K, Evidence Recall@K и All-Evidence@K при исчерпывающем ранжировании без привязки к настройкам поискового индекса. По результатам тестов новинка демонстрирует 45.5% отклика по ответам, 40.6% по доказательствам и 31.1% по всем доказательствам при K = 10. Документный отклик составляет 15.2% при K = 1 и 61.6% при K = 10. По сравнению с конкурентом voyage-context-4 новинка опережает его на 14.4 пункта по ответу и на 5.0 пунктов по доказательствам.

Главные итоги релиза

Главный технологический сдвиг заключается в отказе от жесткой разметки единственного золотого фрагмента в пользу токен-уровневого учителя. Новая модель эффективно находит не только сам ответ, но и сопутствующие доказательства в рамках единого индекса чанков. Открытые веса под лицензией MIT уже доступны для скачивания, так что разработчики могут тестировать передовые RAG-архитектуры на базе решений от Perplexity.

01.