Мой блог
Cohere представила семейство моделей Embed 5: возможности, цены и сравнение с конкурентами
Компания Cohere официально выпустила новое семейство эмбеддинг-моделей Embed 5, ориентированное на корпоративный поиск, задачи RAG и агентный поиск. Модельный ряд включает две версии: Pro для максимального качества извлечения и Fast, оптимизированную под задержки и стоимость запросов.
Обе редакции поддерживают работу с текстом, изображениями и их комбинациями, обрабатывают свыше 100 языков и контекст до 128 тысяч токенов. Главной архитектурной особенностью стало то, что Pro и Fast делят единое векторное пространство, позволяя индексировать базу одной версией, а запрашивать — другой.
Что вошло в релиз Embed 5
Согласно документации разработчика, модели имеют идентификаторы embed-v5.0-pro и embed-v5.0-fast. На выходе они могут формировать векторы размерностью 2048, 1536, 1024, 768, 512 или 256, причем стандартным значением по умолчанию является 2048. Доступные форматы эмбеддингов включают float, int8 и binary. Стоимость текстовых токенов составляет $0.12 за 1 млн для версии Pro и $0.08 для версии Fast, тогда как обработка изображений обойдется в $0.40 за 1 млн токенов для обеих модификаций.
Модель Embed 5 способна напрямую встраивать изображения страниц или объединять графический контент с метаданными в единый вектор. Это критически важно при работе со сканированными документами, презентациями, схемами и графиками, где простое извлечение текста приводит к потере важной информации.
Pro и Fast: один индекс и два пути запросов
Специалисты Cohere протестировали различные комбинации корпусов и запросов на 40 наборах данных. Если принять результат связки Pro + Pro за 100 баллов, то индекс, созданный версией Pro и опрошенный через Fast, набирает 98.4 балла. Полностью ускоренная конфигурация all-Fast показывает 96.6 балла. Рекомендуемый разработчиками паттерн — индексировать данные с помощью Pro, а выполнять запросы через Fast. Единственное условие заключается в том, что обе стороны должны использовать одинаковую размерность выходных данных.
Такой подход особенно важен для агентских рабочих нагрузок, где автономный агент за одну задачу может совершать десятки поисковых вызовов, из-за чего задержка начинает играть ключевую роль. По внутренней статистике компании, версия Fast обрабатывает 377.3 документа в секунду, в то время как Pro справляется со 159.7 документа.
Результаты бенчмарков
В тесте ViDoRe V3 модель Embed 5 Pro в среднем набирает 85.8 балла, что на 8.8 пункта выше показателей Embed 4, а версия Fast демонстрирует 84.5 балла. Для сравнения, Voyage 4 Large получает 83.7 балла, Gemini Embedding 2 — 83.2, а OpenAI text-embedding-3-large ограничивается 75.5 баллами. В наборе тестов Cohere для парсинга PDF-файлов версия Pro лидирует с результатом 84.8 против 83.6 у конкурента от Voyage.
Лучшие результаты семейство показывает в финансовой сфере. Версия Pro занимает первые места в тестах FinanceBench (80.1), FinQA (90.0) и ViDoRe V3 Finance (85.0), а вариант Fast располагается на вторых позициях во всех трех категориях. Мультиязычные показатели выглядят более сбалансированными: Pro лидирует по среднему значению для европейских языков (77 баллов), однако Gemini Embedding 2 превосходит ее еще по 10 языкам из внутренней таблицы Cohere, включая японский, арабский, хинди и телугу.
Стоит отметить, что большинство метрик рассчитывается с использованием нового показателя RCP-nDCG@10 от Cohere. Он переупорядочивает фиксированный набор кандидатов, измеряя качество реранкинга сильнее, чем первичное извлечение. Хотя код оценки был опубликован, независимая репликация результатов все еще продолжается.
Затраты на хранение данных в больших масштабах
В Embed 5 реализовано обучение на основе представлений Матрешки (Matryoshka representation learning) и поддержка вывода с пониженной точностью. Вектор float32 размерностью 2048 занимает 8 КБ, тогда как 1024-мерный int8 требует всего 1 КБ, а 256-мерный бинарный вектор — 32 байта. При работе со 150 миллионами фрагментов сырой объем хранения сокращается с примерно 819 ГБ до 3.2 ГБ. В качестве оптимального баланса компания рекомендует использовать 1024-мерный формат int8.
Развертывание моделей в инфраструктуре
Обе версии доступны для развертывания через официальный API Cohere, Model Vault, Microsoft Foundry и Amazon SageMaker. Для работы в защищенном частном VPC или на собственных серверах on-premise предусмотрена поддержка инструмента vLLM.
Заключение
Новое поколение эмбеддинг-моделей от Cohere предлагает гибкую многоуровневую архитектуру, объединяющую высокую точность Pro-версии с производительностью Fast-решения. Благодаря поддержке мультимодальных данных, огромному контекстному окну и эффективным методам сжатия векторов, Embed 5 становится мощным инструментом для построения современных корпоративных поисковых систем и агентских приложений.
