Мой блог
Saluki 27B: двухбитная модель превосходит оригинал Qwen в работе с инструментами
Исследователи представили модель Underdog Saluki 27B — компактную версию языковой архитектуры, которая оптимизирована для локального использования. Новинка весит всего 7,89 ГБ благодаря двухбитному сжатию, но при этом превосходит полноразмерный базовый вариант в задачах вызова внешних инструментов.
Проект распространяется по лицензии Apache 2.0 и ориентирован на разработчиков, которым необходим производительный агент прямо на устройстве. Ниже подробно рассмотрены технические особенности сжатия, результаты бенчмарков и ключевые отличия от аналогов.
Краткая сводка характеристик
Плотная модель с 27 миллиардами параметров поставляется в виде файла GGUF размером 7,89 ГБ, тогда как исходная версия в формате BF16 требует 54 ГБ свободного пространства. Программное обеспечение запускается на стандартном движке llama.cpp и совместимо со сторонними приложениями, поддерживающими полный перенос на графический процессор. Дополнительно предлагается опциональный модуль компьютерного зрения размером 629 МБ или 928 МБ.
Средняя производительность модели сохраняется на уровне 96% от оригинальной Qwen3.8-27B по результатам девяти тестов. Наилучшие показатели зафиксированы в параллельных вызовах инструментов: зафиксировано значение 42 против 35 у базовой версии, что составляет 120% эффективности. Наибольшее падение отмечено в олимпиадной математике: в тесте AIME 2025 результат составил 79,2 балла против 96,7 у оригинала.
Архитектурные особенности Underdog Saluki 27B
Рассматриваемая модель представляет собой двухбитный гибридный квантованный файл GGUF, созданный для автономных локальных агентов. Процесс создания включает три последовательных технологических этапа.
Слои и принципы построения
Фундаментом выступает базовая плотная архитектура Qwen3.8-27B от команды Qwen, содержащая 64 слоя, комбинирующая линейное внимание Gated DeltaNet со стандартным вниманием и поддерживающая контекст до 262 144 токенов. На втором этапе применяется методика ISTA-DASLab для расчета скалярных сетчатых квантований на каждый тензор с распределением типов сжатия под жесткий лимит памяти. Третьим шагом разработчики из Conway Research уменьшили размер до 7,89 ГБ, целенаправленно защитив способности к вызову инструментов. Новый формат получил название IQ2-mix и снабжен тегом imatrix.
Результаты сравнительных тестов
Разработчики разделили тестовые испытания на две категории для объективной оценки возможностей сжатой нейросети.
Сравнение в единой тестовой среде
Первая группа тестов запускала обе модели в одинаковых условиях. Во внутреннем бенчмарке Underdog, состоящем из 120 задач из набора BFCL v4 с отключенным режимом размышлений и нулевой температурой, Saluki набрала 88 баллов, оригинальная модель — 84, а вариант Bonsai 2 от PrismML — 70. В испытании с параллельными вызовами инструментов из 100 задач Saluki показала результат 42, а исходная модель — 35. В бенчмарке SWE-bench Verified с фиксацией 50 проблем сжатая версия исправила 30 задач, в то время как оригинал справился с 33.
Сравнение с публичными результатами
Вторая группа сопоставляет показатели Saluki 27B с общедоступными данными полноразмерных моделей. В тесте IFEval показатель составил 93,5 против 91,5 у оригинала, в IFBench — 72,7 против 71,0. В задачах программирования MBPP+ зафиксировано 78,0 баллов против 83,9. В логическом тесте MuSR модель набрала 67,5 против 79,6. В математических испытаниях AIME 2025 года средний результат составил 79,2 против 96,7, а в AIME 2026 года — 80,0 против 94,6.
Сравнение с другими компактными версиями
На рынке существуют и другие модификации той же базовой архитектуры со своими преимуществами и недостатками.
Конкурирующие сборки
Версия Bonsai 2 отличается еще меньшим размером и демонстрирует 98,2% сохранения точности по результатам 14 бенчмарков с активным режимом размышлений, а также набирает 95,00 баллов в AIME25. Однако для ее работы требуется специальный форк llama.cpp от PrismML, так как стандартный движок не поддерживает используемые форматы упаковки. В отличие от нее, Saluki функционирует на базовом стоковом llama.cpp. Различные авторы используют собственные тестовые окружения, поэтому прямая сопоставимость результатов между разными разработчиками ограничена.
Основные выводы
Новая языковая модель успешно сжимает тяжелую архитектуру до 7,89 ГБ и превосходит базовый вариант по эффективности вызова функций агентов. Несмотря на снижение точности в сложных математических и логических расчетах до 82-85%, решение сохраняет работоспособность на стандартном оборудовании и доступно под свободной лицензией для практического применения.
