Мой блог
Нейросеть Qwen 3.8 27B: обзор возможностей, проблемы с логикой и оптимизация скорости

Релиз модели Qwen 3.8 27B, состоявшийся в пятницу, привлек большое внимание как мультимодальная языковая модель с открытыми весами (лицензия Apache 2) и параметрами в 27 миллиардов от исследовательской лаборатории Alibaba Qwen. Форм-фактор в 27 млрд параметров оптимален для запуска на производительном ноутбуке, а предыдущая версия Qwen 3.6 27B зарекомендовала себя отлично. Собственные бенчмарки разработчиков демонстрируют впечатляющий прирост производительности по сравнению как с Qwen 3.6 27B, так и с проприетарной Qwen 3.7-Plus, которая еще в мае оставалась одной из сильнейших систем линейки. Теперь предстоит оценить независимые тесты. Модель тестировалась на двух конфигурациях: MacBook Pro с чипом M5 Max и 128 ГБ памяти, а также на системе NVIDIA DGX Spark. В обоих случаях применялись LM Studio и квантованная сборка Q4_K_M объемом 17 ГБ, а на Spark также задействовался llama-server напрямую.
Особенности работы Qwen 3.8 27B и избыточные размышления
Согласно документации, модель по умолчанию использует параметр reasoning_effort на уровне xhigh, и используемые GGUF-сборки сохраняют эту настройку. Официальная поддержка параметров рассуждения позволяет гибко управлять глубиной анализа:
- xhigh (по умолчанию): для сложных задач, требующих глубокого погружения;
- medium: баланс между точностью и скоростью;
- low: оптимизация на скорость и экономию ресурсов.
Использование режима xhigh по умолчанию на потребительском железе приводит к чрезмерным размышлениям модели. При стандартном лимите контекста LM Studio в 8192 токена Qwen исчерпывал весь объем на простейшие задачи. После расширения контекста до максимальных 262 144 токенов эта проблема исчезла. Первый тестовый запрос на генерацию SVG-изображения пеликана на велосипеде занял 21 минуту, потребовав 22 276 токенов на рассуждения для создания 3223 токенов полезного результата. Полученная графика оказалась лучшей среди созданных локальными моделями:
- Рама велосипеда имеет правильную геометрическую форму.
- Ноги птицы расположены с обеих сторон транспорта, что встречается крайне редко.
- Детализирован и корректно прорисован горловой мешок пеликана.
- Крылья визуально достают до руля.
- Линии движения размещены позади, а не перед объектом.
- Присутствует аккуратный фон с солнцем, облаками, холмом, цветами и травой.
Стоил ли результат 21 минуты ожидания? Очевидно, нет. Тот же запрос с отключенными рассуждениями выполнился за 137 секунд (чуть больше двух минут) и выдал 3715 токенов. Для сравнения через OpenRouter был запущен запрос к гораздо более крупной модели Qwen 3.8 2.4T-A95B, выдавшей анимированный SVG. Но даже на простых задачах склонность к гипертрофированному анализу в режиме xhigh проявляется ярко: запрос на прорисовку обычной окружности в формате SVG запускал внутренний монолог о создании сложного геометрического исследования с градиентами, анимацией и концентрическими направляющими вместо простого тега <circle>.
Можно задействовать CSS, SVG SMIL или стили внутри самого SVG. Среди вариантов палитры выделяются глубокие чернила цвета морской волны на теплой бумаге либо выразительный киноварный круг на почти белом фоне с синими вспомогательными линиями в духе Баухауса и чертежей циркулем. Возникает мысль остановиться на геометрическом этюде: подойдет прохладный грифельный фон или чистый белый цвет бумаги. Белый бумага уместна, если избегать сочетания кремового и терракотового оттенков.
Спустя несколько минут модель выдала потрясающе красивую анимированную окружность, которая абсолютно не соответствовала изначальному запросу. Главная рекомендация заключается в том, чтобы игнорировать настройки по умолчанию. На старте работы с Qwen 3.8 27B имеет смысл переводить уровень рассуждений в низкое положение или вовсе отключать его. Платформа заслуживает высоких оценок, однако дефолтные параметры явно не подходят для оптимального старта.
Точность в работе с ограничивающими рамками
Удобным способом тестирования визуальных моделей служит проверка их способности определять ограничивающие рамки (bounding boxes) для объектов на снимке. Предыдущие версии семейства Qwen справлялись с подобными задачами успешно, поэтому возникла идея проверить модель на изображении пеликанов, запросив шкалу от 0 до 1000 для каждой размерности.
Запрос выглядел следующим образом: llm -a https://static.inaturalist.org/photos/714731804/large.jpg -m lmstudio/qwen/qwen3.8-27b 'Return JSON bounding boxes for the pelicans in this photo, 0-1000 scale for each dimension'.
В ходе рассуждений модель сгенерировала следующий результат в формате JSON:

[
{"bbox_2d": [195, 290, 370, 780], "label": "pelicans"},
{"bbox_2d": [445, 320, 675, 850], "label": "pelicans"}
]Совпадение оказалось безупречным. Полученные рамки идеально легли поверх фотографии.
Создание утилиты для разметки рамок
Визуализация ограничивающих рамок была получена с помощью нового пользовательского инструмента, который Qwen 3.8 27B разработала по индивидуальному заказу в автономном режиме на ноутбуке. Параметр глубины мышления снизить не удалось, из-за чего утилита получилась избыточно сложной, однако модель сумела собрать полноценный интерфейс на основе единственного запроса.
Текст запроса требовал создать HTML-страницу с полем ввода URL изображения и текстовой областью для JSON-структуры. Страница должна загружать картинку, определять ее ширину и высоту, масштабировать координаты bbox_2d относительно реальных размеров и выводить размеченные прямоугольники поверх изображения.
На полученном склеине проявилась функция, о которой никто не просил — демонстрационная сцена на случай отсутствия тестовой фотографии. В логике рассуждений модель решила самостоятельно нарисовать пеликанов исключительно потому, что это слово использовалось в качестве метки в предоставленном примере JSON.
Внутренний монолог модели пришел к следующему решению: добавить кнопку загрузки примеров, использующую локальный генератор. Поскольку внешние изображения недоступны, можно нарисовать простую сцену на canvas, экспортировать ее как data URL и внедрить в качестве картинки. Координаты пользователя соответствуют реальному каникулярному кадру, но сгенерированный шаблон позволяет продемонстрировать масштабирование. Модель решила создать холст размером 1000×1000 пикселей с градиентом воды и силуэтами двух пеликанов, размещенными по центрам рамок.
Возникает закономерный вопрос: насколько оправдан столь сложный и избыточный ход мыслей? По всей вероятности, определенная доля подобных размышлений все же имеет практический смысл.
Если отключить режим рассуждений, итоговый результат меняется: сгенерированный вариант почти работает, однако рамки отображаются некорректно. Без цепочки размышлений инструмент не удалось создать с первой попытки, хотя дополнительных запросов, вероятнее всего, хватило бы для исправления ситуации. Этот пример наглядно демонстрирует, какую роль играют рассуждения модели.

Управление агентами для написания кода
Один из главных вопросов при использовании локальных моделей заключается в том, обладают ли они достаточной мощностью для полноценной работы в цикле кодинг-агентов. Подобные задачи требуют длинного контекста, качественной генерации кода и стабильного вызова инструментов. Судя по характеристикам на бумаге, модель Qwen 3.8 27B отвечает всем трем критериям, поэтому было решено проверить её в деле.
Первые эксперименты с агентом Pi принесли многообещающие результаты. Выбор пал именно на Pi из-за относительно короткого системного промпта, что делает его оптимальным для тестирования небольших моделей. Конфигурация для запуска Qwen 3.8 27B через LM Studio на компьютере Spark с доступом по Tailscale была добавлена в файл конфигурации следующим образом:
{ "providers": { "spark": { "baseUrl": "https://spark-18b3.tail68a31.ts.net/v1", "api": "openai-responses", "apiKey": "dummy", "models": [ { "id": "qwen3.8-27b", "reasoning": true } ] } } }
После запуска команды pi --provider spark --model qwen3.8-27b в каталоге с проектом datasette и отправки запроса о принципах работы авторизации система выполнила последовательность логических рассуждений и обращений к инструментам, задействовав множество файлов. В результате получился очень качественный ответ. Единственной трудностью оказалось желание поделиться получившейся историей сессии.
Для решения этой задачи агенту и Qwen 3.8 27B был передан файл журнала JSONL, расположенный в системной директории сессий, с формулировкой задания: написать код на Python для конвертации этого файла в формат Markdown. Модель успешно создала и протестировала скрипт pi_jsonl_to_md.py, выполнивший задачу в точном соответствии с требованиями. Сам опубликованный отчет сессии был подготовлен с помощью созданного же утилитарного скрипта.
Поиски высокой производительности
Достигнутые результаты выглядят впечатляюще: модель размером 17 ГБ успешно функционирует на производительном потребительском железе, способна писать программный код, управлять инструментами, размечать изображения и справляться с широким спектром повседневных задач, требующих применения языковой модели.
Тем не менее здесь кроется существенный нюанс: работа кажется медленной. Особенно сильные задержки заметны при избыточных рассуждениях модели, но даже в стандартном режиме скорость не поражает воображение. Локальный запуск через LM Studio выдавал около 15–30 токенов в секунду. Такой показатель нельзя назвать критическим, однако его недостаточно для конкуренции с облачными API-моделями, возвращающими ответы значительно быстрее.

Статистика платформы Artificial Analysis показывает скорость токенов для моделей OpenAI: версия 5.6 Sol выдает 74 токена в секунду, а 5.6 Luna демонстрирует впечатляющие 184 токена в секунду. При этом радостной новостью стало активное изучение сообществом способов ускорения работы модели с момента ее релиза.
Одно из наиболее перспективных решений изначально заложено в архитектуру самой модели. Qwen поддерживает технологию Multi-Token Prediction (MTP). Суть этого метода заключается в том, что более дешевый вспомогательный механизм прогнозирует несколько токенов вперед, после чего основная модель быстро проверяет корректность таких предположений. Подобный подход способен существенно повысить производительность инференса.
Опираясь на публикацию создателя llama.cpp Георгия Герганова (Georgi Gerganov), удалось протестировать запуск модели с задействованием MTP на сервере Spark с помощью команды:
llama serve -hf ggml-org/Qwen3.8-27B-GGUF:Q4_K_M -hfd ggml-org/Qwen3.8-27B-GGUF:Q4_0 --spec-default --spec-type draft-mtp --reasoning-preserve
Данная манипуляция обеспечила заметный прирост скорости. Сравнительный бенчмарк, запущенный через модель GPT-5.6 в Codex на сервере Spark, показал, что сервер с флагом --spec-type draft-mtp опережает стандартный GGUF-вариант из LM Studio примерно на 72%. Ожидается, что в ближайшие недели появится еще больше инновационных оптимизаций для быстрого запуска модели, а разработчики из экосистемы MLX наверняка готовят собственные эффективные решения.
Некоторые наблюдения
Тот факт, что файл весом 17 ГБ способен решать столь сложные задачи на домашнем оборудовании, воспринимается как технологическое чудо.
Успехи локальных моделей за последний год вызывают искреннее восхищение. Еще год назад подобное решение могло на равных конкурировать с лучшими и самыми дорогими проприетарными системами, а теперь оно способно работать на обычном мощном ноутбуке. Единственным препятствием для использования в качестве основного рабочего инструмента остается скорость работы. Модель функционирует довольно неспешно как на M5 Mac, так и на системе DGX Spark. В этом заключается особенность подобных плотных архитектур, не использующих смесь экспертов: для высокой производительности им требуется значительная пропускная способность памяти, а имеющееся оборудование не относится к лидерам по этому параметру.
Главная ценность модели заключается в ее показательных возможностях. Появилась открытая универсальная система с большой длиной контекста, поддержкой вызова внешних инструментов, сильным визуальным функционалом и качественной генерацией кода, которая помещается в файл размером всего 17 ГБ. Решения такого класса продолжают стремительно развиваться, освобождая от необходимости приобретать дорогостоящее серверное железо ради запуска эффективного ИИ.

Источник: simonwillison.net

