Загрузка 0
ПОДЕЛИТЬСЯ

Мой блог

Листай вниз

Liquid AI представила модели d1-3B и d1-omni-600M с нулевым числом токенов на выходе

Liquid AI представила модели d1-3B и d1-omni-600M с нулевым числом токенов на выходе

Компания Liquid AI анонсировала семейство специализированных моделей принятия решений Open d1, в которое вошли две мультимодальные новинки: d1-3B и d1-omni-600M. Главной особенностью архитектуры является то, что эти мультимодальные модели принятия решений не генерируют текст токен за токеном, а выдают откалиброванные типизированные ответы за один прямой проход.

Новые чекпоинты уже опубликованы на платформе Hugging Face, интегрированы с библиотекой Transformers и поддерживают работу через llama.cpp. Лицензия LFM Open License v1.0 разрешает свободное коммерческое использование разработок компаниям с годовой выручкой менее 10 миллионов долларов.

Что представляет собой модель принятия решений

Традиционные генеративные языковые модели выводят ответ по одному токену, после чего сторонний код вынужден парсить полученную строку. Модель принятия решений функционирует иначе: она принимает единое состояние и набор поименованных вопросов, считывает их за один раз и возвращает вероятности для каждого допустимого варианта ответа.

Реклама

В рамках архитектуры выделяется три типа вопросов:

  • noul — бинарный вопрос (да или нет), возвращаемый как вероятность P(yes).
  • choice — выбор одной метки из заданного списка с построением полного распределения вероятностей.
  • score — взвешенная по вероятности позиция на упорядоченной шкале от 2 до 10 уровней.

Несколько подобных вопросов могут разделять одно состояние в рамках единого вызова, при этом каждый ответ содержит нулевое количество выходных токенов. Разработчики рекомендуют использовать такие решения для маршрутизации трафика, модерации контента, классификации намерений, ранжирования, оценки LLM-as-a-judge, защитных барьеров для агентов и визуального контроля. Ни одна из версий не является чат-ботом.

Особенности архитектуры d1-3B и d1-omni-600M

Модель d1-3B насчитывает 3,12 миллиарда параметров и базируется на LFM2.5-VL-3B — визуально-языковой архитектуре с декодером. При ее создании специалисты усреднили веса базовой версии LFM2.5-2.6B с текстовым бэкбоном исходной модели, после чего провели дообучение на нескольких чекпоинтах с различными случайными сидами и микшами данных с последующим слиянием. В качестве визуального энкодера задействован компонент SigLIP2 NaFlex на 400 млн параметров, а поддерживаемый контекст составляет 32 768 токенов. Основное внимание уделялось работе с длинными входными данными, перемешиванию вариантов ответов и устранению необоснованных уловок в данных.

Младшая версия d1-omni-600M содержит 587 миллионов параметров и создана на базе двунаправленного энкодера LFM2.5-Encoder-350M. Конфигурация включает общий ствол и голову принятия решений на 381 млн параметров, визуальный энкодер на 94 млн и аудиоэнкодер на 112 млн параметров. В роли аудиоэнкодера выступает 17-слойный FastConformer. Контекст ограничен 16 384 токенами, а длительность аудиоклипов не превышает 30 секунд. Запрос может содержать либо изображения, либо аудио, но не оба типа модальностей одновременно. Обучение на звуковых данных охватывало исключительно англоязычные запросы пользователей к ассистенту.

Сферы применения Open d1

Благодаря своей специфике новые архитектуры находят применение в различных сценариях. В службе поддержки и при первичной обработке тикетов один вызов d1-3B способен одновременно проверить условие возврата средств, определить профильный отдел и оценить степень срочности по одному сообщению без необходимости парсить текстовый вывод.

Реклама

В задачах визуального контроля и модерации на периферийных устройствах d1-3B обрабатывает изображение с разрешением 384 пикселя за 35 миллисекунд на плате Jetson AGX Thor. Дополнительно демонстрационная среда Open d1 Arcade позволяет запускать модель покадрово на видеопотоке с камеры для жестикуляционного управления и фильтрации контента.

Для голосовой маршрутизации на компактных устройствах модель d1-omni-600M принимает до 30 секунд речи вместе с текстом, напрямую определяя намерение или тему высказывания. Подобные возможности также подробно рассматриваются в материале про модель принятия решений d1 от Liquid AI.

Результаты тестирования на бенчмарках

В тесте Decision Index версии v0.2.1 модель d1-3B набирает 48,57 балла, опережая все аналоги с количеством параметров менее 10 миллиардов и незначительно превосходя Decider 35B-A3B с результатом 47,11 балла. Более высокий показатель демонстрирует лишь Winnow-12B (50,02 балла). Измерения проводились создателями модели самостоятельно. Лидирующие позиции d1-3B занимает в категориях Tools (74,5 балла) и Arts (36,3 балла), уступая в направлении Knowledge (23,8 балла).

Среди семи публичных текстовых бенчмарков модель d1-3B показывает средний результат 82,9 против 81,1 у Decider 4B. Модель d1-omni-600M демонстрирует средний показатель 78,4, показывая лучшие результаты в тестах Civil Comments (95,8) и PAWS-X (79.5). На 11 визуальных тестах d1-3B набирает в среднем 74,1 балла против 73,9 у базовой модификации.

Производительность на оборудовании NVIDIA

Замеры сквозной задержки для одного запроса в прогретом состоянии показали следующие результаты. Обработка одного вопроса на видеокарте RTX 4090 занимает 8 миллисекунд, а на ускорителе AMD MI325X — 9 миллисекунд. На аппаратных модулях Jetson показатели составляют 16 мс для AGX Thor, 26 мс для AGX Orin и 50 мс для Orin Nano.

При подаче трех вопросов в рамках одного состояния на Jetson AGX Thor задержка возрастает до 20 миллисекунд по сравнению с 16 мс для одиночного вопроса. Показатель для RTX 4090 достигается при использовании параметра компиляции с оптимизациейoverhead. Без него обработка одного вопроса занимает 16 миллисекунд. Кроме того, лаборатория Jetson AI Lab предоставляет собственные руководства по работе с d1-3B.

Локальный запуск и интеграция

Для запуска d1-3B требуется библиотека transformers версии 5.14 или выше с установленным флагом trust_remote_code=True, тогда как d1-omni-600M требует наличия transformers версии 5.15 и новее. Обе модели предоставляют методы system_one(state, questions) для одиночных запросов и system_one_batch для пакетной обработки. Для d1-omni-600M на графических процессорах рекомендуется использовать половинную точность float16, поскольку формат bfloat16 в некоторых случаях меняет приоритетные ответы.

01.