Загрузка 0
ПОДЕЛИТЬСЯ

Мой блог

Листай вниз

AWS Strands Labs выпустила Strands Decider 2B: модель для быстрого выбора вариантов

AWS Strands Labs выпустила Strands Decider 2B: модель для быстрого выбора вариантов

Подразделение AWS Strands Labs представило Strands Decider 2B — открытую модель принятия решений, которая принципиально не генерирует произвольный текст. Вместо генерации ответов устройство считывает текущий контекст вместе с набором типизированных вопросов и возвращает конкретный выбор, вероятность для ответов да/нет либо числовую оценку с откалиброванным уровнем уверенности.

Новинка содержит 1,9 миллиарда параметров и спроектирована для локального запуска на обычных процессорах, потребительских видеокартах или компьютерах Mac с процессорами Apple Silicon. Веса модели опубликованы на Hugging Face под свободной лицензией Apache-2.0. С помощью простой команды pip install strands-decider разработчики могут развернуть инструмент через интерфейс командной строки или запустить встроенный HTTP-сервер. По умолчанию сервер привязан к локальному адресу 127.0.0.1 без встроенной аутентификации, поэтому для промышленного использования потребуется самостоятельно настроить защитный слой.

Что представляет собой модель принятия решений

Класс так называемых моделей «Системы первого уровня» (System One) появился после того, как в прошлом месяце компания TypeSafe AI выпустила решение Jev. Обычные большие языковые модели способны выдавать непредсказуемый и произвольный текст, тогда как специализированный инструмент принятия решений строго выбирает один из предложенных вариантов или оценивает ситуацию по шкале.

Реклама

Архитектура Strands Decider поддерживает три основных типа вопросов:

  • choice: выбор одного варианта из N доступных;
  • noul: вычисление вероятности да/нет в диапазоне от 0 до 1;
  • score: определение уровня по упорядоченной рубрике.

Каждый сформированный ответ выбирается строго из разрешенного перечня вариантов и сопровождается метрикой уверенности. Разработчики честно предупреждают, что новинка уступает полноценным рассуждающим моделям при решении сложных логических задач и совершенно не подходит для написания программного кода, поддержания диалога или создания текстовых выжимок.

Архитектура: языковая модель без речевого аппарата

За основу специалисты взяли базу Qwen3.5-2B-Base, полностью удалив стандартную языковую голову для генерации текста. Вместо нее разработчики внедрили компактную указательную голову («pointer head») размером примерно в 1 миллион параметров. Этот компонент сопоставляет скрытое состояние в позиции маркера ответа со скрытым состоянием на последнем токене каждого из возможных вариантов. В результате весь процесс выполняется за один прямой проход без какого-либо цикла декодирования.

В качестве торса используется адаптация rank-16 LoRA, а вспомогательная голова функционирует в точности fp32. Наборы меток передаются динамически в каждом запросе, благодаря чему количество возможных вариантов ничем не ограничивается. На момент релиза актуальной версией является чекпоинт v19. Обработка нескольких вопросов для одного текстового блока обходится крайне дешево: состояние считывается единожды, а каждый дополнительный вопрос добавляет нагрузку только за счет собственных токенов.

Тестирование, производительность и задержка

Команда разработчиков оценивала точность и качество калибровки на открытом бенчмарке JevBench, созданном сторонними авторами для тестирования моделей класса Jev. Опубликованные показатели версии v19 демонстрируют базовую точность на публичном наборе JevBench v1 на уровне 0,723 (успешно пройдено 167 задач из 231). Показатель Brier score составил 0,342, а ожидаемая ошибка калибровки (ECE) зафиксирована на отметке 0,052. Точность по уровням сложности распределилась следующим образом: простые задания — 1,000, стандартные — 0,875, сложные — 0,505.

Замеренная задержка на видеокарте RTX 3090 составила 115 миллисекунд в медианном значении и 299 миллисекунд для p95. На процессоре M3 Pro теплый медианный показатель уложился в 153 миллисекунды при длине контекста менее 300 токенов. В рейтинге комплексной таблицы от 25 сентября версия v19 заняла 3-е место среди 33 решений в категории 2B, а без учета трех моделей, слегка превышающих порог в 2B параметров, закрепилась на 1-й строчке из 30 возможных. Авторы репозитория также отмечают оговорку: более свежая модель decider-2b v11 от Mapika набирает 175 баллов из 231 на тестовой платформе Strands, опережая новинку на 8 задач.

Главным практическим преимуществом стала качественная калибровка вероятностей. На ранее не встречавшихся коротких классификационных задачах ответы с уровнем уверенности 0.9 и выше оказывались верными примерно в 95% случаев. Для показателей ниже этого порога команда рекомендует задействовать дополнительные механизмы проверки или эскалации.

Сценарии применения и пример защитных барьеров

Создатели сообщают об успешном применении модели в задачах маршрутизации запросов к разным ИИ, подбора инструментов, проверки аргументации, первичной сортировки обращений, настройки защитных фильтров, оценки качества и создания гибридных агентов. В гибридных схемах сложную логику выполняет мощная языковая модель, а рутинные операции берет на себя компактный инструмент принятия решений.

В качестве демонстрации репозиторий содержит пример ограничения вызова функции погоды внутри агента Strands. Защитная проверка перед вызовом инструмента задает два вопроса в формате да/нет: опираются ли переданные аргументы на слова пользователя и не преждевремен ли вызов? Если агент ошибочно угадал город самостоятельно, система принудительно переспросит пользователя. Через интерфейс командной строки можно эффективно маршрутизировать сложные клиентские обращения — например, запрос о неработающих выплатах успешно направляется в отдел выставления счетов с уверенностью 0.768.

01.