Загрузка 0
ПОДЕЛИТЬСЯ

Мой блог

Листай вниз

Fastino выпустила GLiNER2.5-Decide: модель принятия решений на 340 млн параметров для CPU

Fastino выпустила GLiNER2.5-Decide: модель принятия решений на 340 млн параметров для CPU

Лаборатория Fastino представила GLiNER2.5-Decide — открытую модель принятия решений с 340 миллионами параметров. Она принимает на вход текст и схему типизированных вопросов, после чего выдает структурированные ответы вместе с вероятностным распределением, оценкой уверенности и метаданными о выполнимости ограничений.

Инструмент создан для автоматизации рутинных операций в агентских пайплайнах: маршрутизации, триажа, выбора инструментов и настройки защитных барьеров. Веса распространяются по лицензии Apache 2.0, легко устанавливаются через pip и могут работать как на CPU или GPU, так и в полностью изолированных средах без доступа к интернету.

Что делает модель GLiNER2.5-Decide

Эта архитектура представляет собой негенеративный классификатор на базе энкодера DeBERTa-v3-large, дообученный из gliner2-large-v1. Новинка не создает токены и не требует классических промпт-шаблонов. Наборы меток передаются непосредственно в момент вызова функции, а каждый вопрос в схеме определяет допустимые варианты ответов и количество ожидаемых значений.

Реклама

Конвейер обработки состоит из двух этапов. Сначала энкодер считывает текст совместно со схемой и оценивает каждый разрешенный ответ, а затем специализированный декодер с учетом ограничений подбирает оптимальную комбинацию. Важно отметить, что модель не занимается рассуждениями или ответами на открытые вопросы, а выступает узкоспециализированным инструментом для оперативных решений.

Реклама

Зачем важен совместный декодинг

Разработчики демонстрируют ценность подхода на примере защитных фильтров (guardrails). При независимом декодировании модель могла оценить вероятность промпт-инъекции в 0.82 и одновременно пометить этот же запрос как безопасный с вероятностью 0.52, создавая конфликт выводов.

Совместный декодинг применяет жесткое правило: обнаружение любой угрозы переводит вердикт в категорию опасных. В результате система возвращает согласованные данные, которые downstream-код может безопасно использовать для блокировки или эскалации инцидента. Кроме того, один проход энкодера позволяет извлекать сущности и связи с символьными смещениями.

Результаты тестов на наборе Fast Decisions

Команда протестировала разработку на собственном изолированном бенчмарке Fast Decisions, состоящем из 5100 примеров по 17 датасетам. Задачи охватывали клиентские операции, банковскую сферу, медицину и туризм, а метрикой выступало точное совпадение меток.

GLiNER2.5-Decide показала среднюю точность в 60.1%, опередив ряд более тяжелых декодерных систем, и заняла первое место в 9 из 17 датасетов. Особенно сильных результатов модель достигла в определении интентов пользователей, продемонстрировав значительный отрыв от аналогов.

Производительность и задержка на процессорах

Замеры производительности при батче, равном единице, показали отличную пригодность модели для запуска на центральных процессорах. На коротких запросах разницу в скорости между CPU и GPU нивелируют накладные расходы на предобработку, однако на длинных контекстах ускорители начинают демонстрировать преимущества.

При работе с короткими текстами на 48-ядерном Intel Xeon Platinum время отклика составляет около 167 миллисекунд, тогда как графические ускорители обрабатывают запрос быстрее. Это делает модель гибким решением для серверов без мощных видеокарт.

Практическое применение в коде

Для интеграции используется библиотека gliner2 и класс AutoExtractor. Вызов метода classify_text позволяет передать текст и словарь со списком проверяемых параметров, таких как намерение, срочность и категория маршрутизации.

Однозначные головы возвращают текстовую строку, а многозначные выдают все метки, превышающие заданный порог уверенности. Поддерживаются описания меток и числовые шкалы, что упрощает тонкую настройку логики под конкретные бизнес-задачи.

Варианты использования и экосистема моделей

Технология находит применение в маршрутизации запросов, вызове функций, фильтрации контекста и оценке ответов через LLM-судей. Для локального дообучения доступен специальный трейнер с поддержкой LoRA.

Помимо базовой версии, создатели опубликовали вариант GLiNER2.5-Decide-1B на базе энкодера Ettin с точностью 59.6%, а также многоязычную версию GLiNER2.5-multi-Decide на 287 млн параметров, охватывающую глобальные сценарии использования.

01.