Мой блог
Google DeepMind представила EmbeddingGemma 2: мультимодальная нейросеть для локальных устройств
Компания Google DeepMind объявила о выпуске модели EmbeddingGemma 2, насчитывающей 740 миллионов параметров. Эта открытая разработка объединяет текст, программный код, изображения, видеоматериалы и звук в единое векторное пространство размерностью 768 измерений. Продукт распространяется на условиях лицензии Apache 2.0 и ориентирован на эффективное выполнение непосредственно на потребительском «железе».

Новинка пришла на смену оригинальному решению EmbeddingGemma, которое было представлено в прошлом году в качестве легковесного инструмента для работы с текстовыми эмбеддингами. По данным создателей, первая версия преодолела отметку в 20 миллионов загрузок, найдя применение в локальных поисковых утилитах и конфиденциальных конвейерах дополненной генерации. Свежий релиз существенно расширяет эти возможности за счет полноценной мультимодальности.
Модульные энкодеры на базе архитектуры Gemma 4
В основе EmbeddingGemma 2 лежит технологический фундамент Gemma 4. Как отмечается в официальной документации модели, ее суммарный объем в 740 миллионов параметров распределен между несколькими компонентами: текстовая часть занимает 270 миллионов (130 миллионов приходятся на трансформерный каркас и 140 миллионов на сам эмбеддер), 170 миллионов отведены под визуальный энкодер, а 300 миллионов задействованы в аудиомодуле. Все они проецируют информацию в общее пространство.
Благодаря независимой структуре энкодеров разработчики могут гибко настраивать конфигурацию под конкретные задачи, загружая лишь нужные веса — например, только для текста и кода, либо задействуя полный набор модальностей. Все варианты используют единое контекстное окно размером 8192 токена, что в четыре раза превосходит показатели первой версии. Расход бюджета токенов зависит от типа данных: изображение требует 280 токенов, отдельный видеокадр — 140, а секунда звуковой дорожки — 25. Это позволяет обрабатывать в рамках одного запроса десятки картинок и кадров или несколько минут аудио.
Результаты бенчмарков и усечение векторов
Тестирование демонстрирует, что EmbeddingGemma 2 полностью сохраняет показатели предшественницы в задачах мультиязычной текстовой обработки, при этом значительно превосходя ее в программировании: оценка MTEB Code выросла на 9,92 балла и достигла 78,68. В официальных таблицах полноточных результатов значатся высокие баллы для зрительного поиска, работы с документами, видеоматериалами и звуковыми фрагментами. Модель демонстрирует лидирующие позиции среди аналогов с количеством параметров менее миллиарда.
Важной технологической особенностью стало применение метода Matryoshka Representation Learning. Он дает возможность уменьшать исходную размерность векторов с 740 (до 768) до 512, 256 или 128 единиц. Подобный подход сокращает требования к дисковому пространству и оперативной памяти до шести раз. Согласно руководствам для разработчиков, веса размерностью 256 сохраняют примерно 95% точности при мультимодальном поиске, тогда как формат 128 оптимален для чисто текстовых сценариев, позволяя хранить миллион векторов всего в 250 мегабайтах памяти.
Особенности безопасности и ограничения модели
Создатели классифицируют EmbeddingGemma 2 как предварительно обученную модель эмбеддингов, которая не проходила этап финальной доработки на предмет безопасности или модерации вывода. Все защитные меры были сосредоточены исключительно на фильтрации исходного тренировочного массива. В процессе подготовки данные очищались от материалов с изображением насилия над детьми, а также от конфиденциальной личной информации. Общий корпус данных включал веб-документы на более чем 140 языках с отсечкой по времени до января 2025 года.
В спецификациях подчеркивается, что качество работы на разных языках может различаться, а пропуск специальных инструктивных префиксов для текстовых запросов снижает общую точность. Кроме того, разработчики предупреждают об особенностях динамического диапазона активаций: использование стандартного формата float16 может приводить к появлению некорректных значений (NaN), поэтому для инференса рекомендуется применять bfloat16 или float32. Конечные приложения должны строго соответствовать политике использования технологий Gemma.
Производительность на устройствах и доступность
Запуск квантованной версии модели на смартфоне Pixel 11 Pro требует около 191 мегабайта оперативной памяти для текстового варианта и порядка 567 мегабайт для полноценного мультимодального режима. Вес модели уже опубликован на платформах Hugging Face и Kaggle, а оптимизированные варианты доступны через сообщество LiteRT. Продукт совместим с популярными фреймворками и средами вроде transformers, llama.cpp, Ollama, MLX и LMStudio, поддерживая развертывание в браузере через WebGPU.
Инструменты экосистемы Google AI Edge, включая MediaPipe и LiteRT, обеспечивают кроссплатформенную интеграцию. Специальный API позволяет осуществлять маршрутизацию контекста в реальном времени. В официальных галереях приложений уже представлены демонстрационные проекты для мгновенного медиапоиска и поиска моментов в видео, а связка EmbeddingGemma 2 с языковой моделью Gemma 4 открывает новые перспективы для локальной работы с файлами на потребительских гаджетах.
