Загрузка 0
ПОДЕЛИТЬСЯ

Мой блог

Листай вниз

FRIDA Decisions: быстрая открытая модель быстрого мышления для русского языка

FRIDA Decisions: быстрая открытая модель быстрого мышления для русского языка

FRIDA Decisions — Современные сценарии обработки текста часто требуют быстрого принятия небольших логических решений без генерации объемного контента. Специализированная открытая модель быстрого мышления позволяет выполнять классификацию, маршрутизацию и оценку данных за считанные миллисекунды без привлечения тяжеловесных генеративных сетей. Подробнее по теме: Практическое руководство по движку Laya: нулевая точность, калибровка и принятие решений.

Инструмент обрабатывает входной текст и закрытый набор вопросов за один проход энкодера, выдавая структурированные результаты по заданным критериям.

FRIDA Decisions: быстрая открытая модель быстрого мышления для русского языка
FRIDA Decisions: быстрая открытая модель быстрого мышления для русского языка
FRIDA Decisions: быстрая открытая модель быстрого мышления для русского языка
FRIDA Decisions: быстрая открытая модель быстрого мышления для русского языка
FRIDA Decisions: быстрая открытая модель быстрого мышления для русского языка

Зачем нужны специализированные модели без генерации текста?

В большинстве продуктовых систем на базе искусственного интеллекта регулярно возникают рутинные задачи, которые не требуют генерации смыслового текста на выходе. К таким операциям относятся маршрутизация запросов к конкретной модели или агенту, фильтрация контента на предмет токсичности, выбор подходящего инструмента из каталога функций, комплексный разбор входящих тикетов по срочности и тональности, а также первичное ранжирование документов для систем поиска и извлечения информации (RAG). Подробнее по теме: Векторный поиск: деплой моделей без GPU на Triton Inference Server.

Реклама
Сравнение результатов моделей на бенчмарке razvilka
Сравнение метрик качества различных моделей на бенчмарке razvilka

Традиционно подобные проверки перекладываются на универсальные большие языковые модели через составление объемных промптов и парсинг JSON-ответов. Такой подход сопровождается избыточными расходами вычислительных ресурсов и высокой сетевой задержкой. Для решения подобных проблем применяются специализированные модели принятия решений, получающие на входе исходный документ и перечень вариантов, а на выходе возвращающие наиболее вероятный выбор вместе с числовыми распределениями.

Реклама
Попарное сравнение моделей по группам задач в razvilka
Распределение ошибок и правильных ответов по группам задач
Схема наивной раскладки, упаковки и кеширования состояний
Сравнение наивной раскладки с упакованной структурой и кешем состояний

Архитектура и типы поддерживаемых вопросов

В основу рассматриваемого решения легла русскоязычная эмбеддинг-модель FRIDA, построенная на базе архитектуры энкодера FRED-T5 и насчитывающая 823 миллиона параметров. Исходный эмбеддер был переобучен в кросс-энкодер, который анализирует каждого предложенного кандидата в контексте исходного текста и инструкции. Декодер в архитектуре отсутствует, что полностью исключает генерацию лишних токенов и гарантирует выбор ответа исключительно из заданного списка.

Доли обучающих примеров и виды вопросов финальной версии
Распределение долей обучающих примеров и типов вопросов

Модель обрабатывает запросы четырех основных типов. Категория выбора варианта из списка возвращает ключ и вероятности для всех позиций. Оценка по шкале выдает числовое значение в заданном диапазоне. Бинарные вопросы отвечают вероятностью утвердительного исхода. Задачи ранжирования выстраивают кандидатов в определенном порядке с расчетом маржинальности.

FRIDA Decisions: быстрая открытая модель быстрого мышления для русского языка
Числа z и p иллюстративные, не выход модели

Качество работы и бенчмарк razvilka

Для объективной оценки эффективности был сформирован открытый бенчмарк razvilka, включающий 735 тестовых примеров по 15 различным категориям задач. Проверка показала результаты, сопоставимые с коммерческими облачными аналогами. Так, на указанном наборе данных открытая разработка демонстрирует точность 0,893 против 0,897 у проприетарного интерфейса TypeSafe Jev. Преимущество сохраняется и при сравнении с открытыми аналогами большего объема.

Среди отдельных категорий наибольшую точность модель показывает в задачах выбора из списка, охватывающих маршрутизацию и определение интентов. В задачах ранжирования для RAG решение превосходит многие популярные энкодеры и реранкеры аналогичного класса, обеспечивая высокую надежность классификации.

Производственная производительность и экономика запуска

Тестирование на потребительской видеокарте RTX 5060 Ti показывает высокую скорость работы. Типичный запрос, содержащий текст объемом около 400 токенов и три проверочных вопроса, обрабатывается за 34 миллисекунды. Пиковое потребление видеопамяти не превышает 1,8 ГБ, что позволяет развернуть систему на любом современном персональном компьютере или доступном серверном оборудовании. Подробнее по теме: Южная Корея предоставит всем гражданам бесплатный доступ к ИИ без ограничений по токенам.

Экономические показатели локального развертывания превосходят облачные аналоги при интенсивном использовании. Аренда графического ускорителя на российском рынке при полной загрузке обходится существенно дешевле поштучной тарификации коммерческих API, не создавая ограничений по количеству запросов и обеспечивая конфиденциальность обрабатываемых данных.

Особенности внутренней оптимизации и обучения

Для предотвращения избыточных вычислений при проверке множества вариантов применяется специальная упакованная последовательность. Текст и все кандидаты передаются в рамках одного прохода, а многоуровневая блочная маска изолирует элементы друг от друга. Дополнительный кеш состояний позволяет обрабатывать повторные запросы к тому же документу без повторного кодирования самого текста.

FRIDA Decisions: быстрая открытая модель быстрого мышления для русского языка
Числа z и p иллюстративные, правильные ответы заданы нами

Обучение модели проводилось на массиве из 1,42 миллиона примеров с использованием метода LoRA на всех слоях внимания. Функция потерь адаптирована под конкретные типы задач, включая кросс-энтропию для категориального выбора и списочный softmax для ранжирования.

Варианты развертывания и интеграции

Программный пакет распространяется с поддержкой нескольких бэкендов. Основным вариантом выступает экосистема PyTorch с поддержкой кеширования на GPU. Для централизованных серверных конфигураций под Linux предусмотрен интеграционный сервер vLLM, поддерживающий пакетную обработку и эффективное кеширование префиксов.

Пользователи оборудования Apple Silicon могут использовать бэкенд MLX для запуска на графических процессорах Mac. Для централизованного использования на центральных процессорах подготовлена квантованная версия ONNX Runtime в формате int8, обеспечивающая высокую скорость вычислений на стандартных процессорных ядрах без необходимости задействовать дискретную графику.

01.