Мой блог
Модель Qwen 3.8 27B: возможности локального запуска, избыточные рассуждения и методы ускорения

Релиз большой языковой модели Qwen 3.8 27B состоялся 16 августа 2026 года. Эта мультимодальная нейросеть с 27 миллиардами параметров распространяется под лицензией Apache 2 исследовательской лабораторией Qwen компании Alibaba. К моменту выхода модель вызывала большой интерес: формат 27B отлично подходит для локального запуска на производительном ноутбуке, а ее предшественница Qwen 3.6 27B в свое время произвела сильное впечатление. Собственные бенчмарки разработчиков демонстрируют впечатляющий прирост производительности по сравнению не только с Qwen 3.6 27B, но и с закрытой моделью Qwen 3.7-Plus, которая еще в мае этого года считалась одним из сильнейших решений линейки. Экспертам еще предстоит оценить независимые тесты новинки.
Практическое тестирование проводилось на двух конфигурациях: MacBook Pro с 128 ГБ памяти и чипом M5 Max, а также на системе NVIDIA DGX Spark. На обеих машинах использовалась среда LM Studio и квантованная сборка Q4_K_M размером 17 ГБ. Дополнительно запуск осуществлялся напрямую через llama-server на аппаратной платформе Spark.
Влияние настроек рассуждения по умолчанию
В официальной документации указано, что для параметра глубины размышлений reasoning_effort по умолчанию выставлено значение xhigh. Загруженный через LM Studio файл GGUF полностью сохраняет эту особенность. Архитектура Qwen 3.8 официально поддерживает регулировку глубины анализа, что позволяет контролировать затраты ресурсов:
- xhigh (по умолчанию) — рассчитано на сложные задачи, требующие детального разбора;
- medium — нацелено на баланс между точностью и скоростью;
- low — оптимизировано для быстрого получения результата с минимальными затратами.
Такой выбор разработчиков по умолчанию выглядит забавно и совершенно не подходит для повседневной работы модели, особенно на потребительском «железе». Первые тесты столкнулись с ограничением контекста LM Studio в 8192 токена — модель расходовала весь лимит на размышления даже над самыми простыми задачами. Проблема решилась после увеличения контекста до максимальных 262 144 токенов.
Первый сгенерированный SVG-файл с пеликаном на велосипеде при повышенном контексте потребовал 21 минуты ожидания. Нейросеть задействовала 22 276 токенов на рассуждения и выдала 3223 токена итогового кода. Трассировку этого процесса можно изучить отдельно. Для локальной модели скромного размера (файл весит всего 17 ГБ) это выдающийся результат:
- рама велосипеда имеет правильные геометрические пропорции;
- ноги пеликана расположены по обе стороны от рамы — крайне редкое достижение для ИИ;
- убедительно прорисован характерный мешок на клюве;
- крылья достают до руля;
- линии движения размещены позади объекта, а не спереди;
- добавлен гармоничный фон с солнцем, облаками, холмом, цветами и травой.
Стоило ли это 21 минуты ожидания? Однозначно нет. Тот же запрос с полностью отключенными рассуждениями выполнился за 137 секунд (чуть больше двух минут) и сгенерировал 3715 токенов. Для сравнения через OpenRouter был запущен гораздо более крупный флагман Qwen 3.8 2.4T-A95B, который выдал анимированный SVG-рисунок.
Склонность модели излишне усложнять задачи в режиме xhigh хорошо иллюстрирует минималистичный запрос на создание SVG-изображения обычного круга. Логика размышлений модели выглядела следующим образом: пользователь просит нарисовать круг, но хочется сделать это детально, выйти за рамки простого тега <circle>, добавив характер через концентрические направляющие линии, штрихи, мягкий градиент и еле заметную фоновую анимацию с пульсирующим свечением, не забывая про поддержку prefers-reduced-motion.
Рассуждения модели уходят в сторону стилистики: выбор палитры — глубокие чернила тил на теплой бумаге или смелый круг киновари на белом с синими вспомогательными линиями в духе Баухауза. В итоге выбирается «геометрическое исследование» на холодном грифельном или ярком белом фоне. Несколько минут спустя нейросеть выдает потрясающе красивый анимированный круг, который абсолютно не соответствовал первоначальному запросу. Настоятельная рекомендация автора: игнорировать этот дефолтный режим. Запускайте Qwen 3.8 27B на низком уровне рассуждений или вообще без него. Это отличная модель, но стандартная настройка — худшая отправная точка для работы.

Эффективная работа с ограничивающими рамками
Один из увлекательных способов протестировать визуальную модель — проверить, насколько точно она умеет возвращать координаты ограничивающих рамок (bounding boxes) для объектов на фотографии. Предыдущие версии справлялись с этим хорошо, поэтому испытание провели на снимке с пеликанами. Запрос с требованием использовать шкалу от 0 до 1000 для каждого измерения выглядит следующим образом: llm -a https://static.inaturalist.org/photos/714731804/large.jpg -m lmstudio/qwen/qwen3.8-27b 'Return JSON bounding boxes for the pelicans in this photo, 0-1000 scale for each dimension'.
Трассировка рассуждений приводит к генерации JSON с точными координатами рамки и меткой «pelicans». Совпадение оказывается исключительно точным, а визуализация рамок поверх оригинального изображения демонстрирует безупречный результат.
Создание инструмента для разметки
Упомянутая визуализация рамок была получена с помощью нового кастомного инструмента, который модель Qwen 3.8 27B создала по запросу локально на ноутбуке. Поскольку автор забыл снизить уровень мыслительной активности, код получился избыточно усложненным, однако модель все же смогла собрать полноценный интерфейс на основе единственной инструкции.
Интерфейс представляет собой HTML-страницу с полем ввода URL изображения и текстовой областью для JSON. Скрипт добавляет картинку, измеряет ее размеры, масштабирует координаты из диапазона 0–1000 в реальные пиксели и отрисовывает рамки. На скриншотах видна функция, о которой никто не просил — демонстрационная сцена для случаев, когда под рукой нет тестовой фотографии.
В ходе рассуждений модель решила добавить кнопку загрузки примера. Рассуждая о том, что нельзя зависеть от внешних картинок, ИИ решает нарисовать простую сцену прямо на canvas, экспортировать ее как data URL и загрузить в качестве изображения. Модель самостоятельно генерирует плейсхолдер размером 1000х1000 с градиентом воды и силуэтами пеликанов на позициях из переданного JSON, чтобы наглядно показать правильность масштабирования.
Конечно, возникает вопрос: был ли нужен весь этот избыточный анализ? Возможно, лишь отчасти, но такой подход демонстрирует глубокие возможности автономной генерации интерфейсов.
При отключенном режиме рассуждений мне удалось получить другую версию кода. Она почти работает, но рамки выводятся в неверных местах. Без механизма рассуждений модель не смогла с первого раза создать полностью рабочий инструмент. Наверное, этого результата можно было добиться дополнительными запросами, однако данный пример отлично иллюстрирует, какую разницу привносят рассуждения.

Управление агентами программирования
Один из главных вопросов касательно локальных моделей заключается в том, хватает ли им производительности для полноценного запуска цикла агентов кодинга. Подобные задачи требуют длинного контекста, качественной генерации кода и надежного вызова инструментов. На бумаге модель Qwen 3.8 27B обладает всеми тремя характеристиками, поэтому возникает закономерный вопрос: справляется ли она с этой задачей?
Мои первоначальные эксперименты с агентом Pi оказались весьма многообещающими. Я выбрал Pi, поскольку у него более короткий системный промпт по сравнению с большинством альтернатив, что делает его оптимальным выбором для тестирования компактных моделей. Я настроил Pi на использование Qwen 3.8 27B, запущенной в LM Studio на компьютере Spark и доступной через Tailscale Serve. Для этого я добавил в конфигурационный файл ~/.pi/agent/models.json следующие параметры:
{
"providers": {
"spark": {
"baseUrl": "https://spark-18b3.tail68a31.ts.net/v1",
"api": "openai-responses",
"apiKey": "dummy",
"models": [
{
"id": "qwen3.8-27b",
"reasoning": true
}
]
}
}
}Затем я выполнил команду pi --provider spark --model qwen3.8-27b в каталоге ~/dev/datasette и задал вопрос: «Как работает аутентификация?». Последовательность логических рассуждений и обращений к инструментам позволила обратиться к множеству различных файлов, после чего был выдан весьма надежный ответ.
Возникла лишь одна небольшая сложность: мне требовалось опубликовать этот транскрипт. Поэтому я направил Pi и Qwen 3.8 27B к файлу стенограммы в формате JSONL, расположенному по пути ~/.pi/agent/sessions/--Users-simon-Dropbox-dev-datasette--, с запросом написать код на Python для конвертации этого JSONL в Markdown.
Ассистент самостоятельно написал и протестировал скрипт pi_jsonl_to_md.py, который выполнил задачу в точном соответствии с моими требованиями. Полученная стенограмма сеанса была опубликована с помощью созданного самой моделью инструмента.
В поисках высокой скорости
Пока что все выглядит крайне перспективно. Перед нами модель весом 17 ГБ, которая функционирует на потребительском «железе» верхнего уровня, умеет писать код, управлять инструментами, размечать изображения и в целом выполнять любые задачи, необходимые для реальной работы с LLM.
Однако здесь кроется существенный нюанс: система кажется медленной. Особенно сильные задержки заметны на этапе избыточных рассуждений, но даже без них скорость трудно назвать высокой. LM Studio выдает мне порядка 15–30 токенов в секунду. Это неплохой показатель, но его недостаточно, чтобы заставить меня отказаться от облачных API-моделей, возвращающих результаты гораздо быстрее.

Сервис Artificial Analysis отслеживает скорость токенов и фиксирует у OpenAI 5.6 Sol значение на уровне 74 токенов в секунду, а у 5.6 Luna — впечатляющие 184 токена в секунду.
Хорошая новость заключается в том, что с момента релиза модели прошло всего два дня, и сообщество разработчиков уже вовсю изучает способы ускорения ее работы. Одно из наиболее перспективных решений встроено непосредственно в саму архитектуру. Qwen поддерживает метод предсказания нескольких токенов (Multi-Token Prediction). Этот архитектурный прием заключается в том, что более дешевый вспомогательный механизм угадывает несколько токенов наперед, а основная модель затем быстро проверяет правильность этих догадок. Подобный подход способен существенно повысить производительность инференса.
Опираясь на публикацию создателя llama.cpp Георгия Герганова в социальной сети X, я попробовал запустить модель с поддержкой MTP на сервере Spark следующим образом:
llama serve \
-hf ggml-org/Qwen3.8-27B-GGUF:Q4_K_M \
-hfd ggml-org/Qwen3.8-27B-GGUF:Q4_0 \
--spec-default \
--spec-type draft-mtp \
--reasoning-preserveРезультат не заставил себя ждать и обеспечил ощутимый прирост. Я запустил сравнительный бенчмарк с помощью модели GPT-5.6 в Codex, и сервер с параметром --spec-type draft-mtp продемонстрировал производительность примерно на 72% выше стандартного варианта GGUF из LM Studio. Ожидается, что в ближайшие недели появится еще больше инновационных решений для оптимизации скорости работы этой модели. Наверняка свои наработки готовит и сообщество MLX.
Некоторые наблюдения
Тот факт, что файл размером 17 ГБ способен решать столь широкий спектр задач на домашних компьютерах, можно назвать настоящим чудом.
Успехи, которых локальные модели достигли за текущий год, вызывают искреннее восхищение. Еще двенадцать месяцев назад подобная разработка могла на равных конкурировать с ведущими коммерческими системами высокой стоимости, а сегодня ее удается запускать на мощном ноутбуке. Главным препятствием для повседневного использования остается производительность: модель работает довольно медленно как на Mac с чипом M5, так и на системе DGX Spark. В этом заключается особенность плотных архитектур без разреженной структуры Mixture-of-Experts. Им требуется огромная пропускная способность памяти для эффективной работы, однако имеющиеся в распоряжении аппаратные конфигурации не лидируют по этому показателю.
При этом ключевое значение данной разработки заключается в ее демонстрационном потенциале. Пользователи получают открытую универсальную модель с поддержкой длинного контекста, эффективным вызовом инструментов, сильными возможностями компьютерного зрения и уверенной генерацией кода, причем весь массив данных умещается в файл объемом всего 17 гигабайт. Подобные системы продолжают демонстрировать впечатляющие темпы качественного роста. Для запуска функциональной языковой модели больше не требуются затраты на датацентры и оборудование стоимостью в полмиллиона долларов.

Источник: simonwillison.net

