Мой блог
Обзор Claude Fable 5.1: тестирование уровней рассуждений на генерации SVG
Релиз Claude Fable 5.1 и тестирование на пеликан-бенчмарке
Компания Anthropic выпустила очередное обновление своей флагманской линейки — модель Claude Fable 5.1 (а также Mythos 5.1). По заявлениям разработчиков, свежий релиз задает новый отраслевой стандарт в задачах написания кода, аналитической работы и решения сложных многоэтапных проблем. В официальном анонсе особый акцент сделан на научных исследованиях: модель набрала 52,6% в свежем бенчмарке Terminal-Bench-Science 0.1, продемонстрировав внушительный разрыв по сравнению с прошлыми поколениями (Fable 5 показала 24,7%, Opus 5 — 29,0%, а GPT-5.6 Sol — 22,4%).
Однако для практической оценки того, как нейросеть справляется с пространственным мышлением, геометрией и написанием структурированного кода, идеальной проверкой остается классический стресс-тест генерации SVG-графики по запросу «пеликан на велосипеде». Этот тест позволяет наглядно сопоставить работу модели при разной глубине рассуждений.
В Fable 5.1 инженеры Anthropic реализовали пять фиксированных режимов мышления (reasoning effort): low, medium, high, xhigh и max. Возможность полностью отключить этап рассуждений в этой версии отсутствует. Чтобы провести полноценное исследование, я предварительно устранил проблему в утилите llm-anthropic, из-за которой цепочки рассуждений (reasoning traces) сохранялись не полностью, и зафиксировал подробные метрики для каждого уровня.
Тестирование уровней рассуждений: от Low до Max
Я запустил одинаковый текстовый промпт — «Generate an SVG of a pelican riding a bicycle» — на каждом из пяти доступных уровней нагрузки. Результаты показали колоссальную разницу как по затраченным ресурсам, так и по итоговой детализации векторного изображения.
Уровни Low и Medium: работа без явных рассуждений
На минимальном уровне low генерация SVG заняла 23,8 секунды, израсходовав 1998 выходных токенов (у моделей Claude этот показатель суммирует токены ответа и токены внутреннего мышления). Суммарная стоимость одного запроса составила примерно 10 центов ($0,10017). При этом в логах не зафиксировалось никакого текстового саммари рассуждений.

При повышении настройки до medium результат оказался еще более любопытным: процесс занял 23 секунды при расходе 1977 токенов (на 21 токен меньше, чем в режиме low) и стоимости $0,09912. Текстовый след мыслей снова отсутствовал. Таким образом, для данной задачи Fable 5.1 фактически пропустила явную фазу пошагового планирования на обоих младших уровнях.
Уровень High: появление базового плана
Переключение на режим high потребовало 29,6 секунды работы и 2612 выходных токенов, а стоимость составила $0,13087. В этом режиме модель впервые сгенерировала краткую цепочку рассуждений:
«Я планирую макет SVG с пеликаном на велосипеде, включающий фон с небом и землей, велосипед с двумя спицованными колесами, рамой, седлом и рулем, а также пеликана с белым туловищем, длинной шеей и оранжевым клювом наверху».
Несмотря на появление текстового плана, итоговый векторный файл визуально практически не отличался от результатов, полученных на режимах low и medium.

Уровень Extra High: кардинальное усложнение и рост расходов
На уровне xhigh характер генерации изменился принципиально. Время выполнения выросло до 7 минут 51 секунды, количество выходных токенов подскочило до 36 767, а стоимость одного запроса составила $1,83.
В развернутом трейсе рассуждений модель анализировала каждый компонент сцены:
«Добавляю глаз, крылья, тянущиеся к грипсам руля, оранжевые ноги, доходящие до педалей, и небольшой хвостовой чехол. При этом я намеренно делаю пеликана гиперболизированно большим по сравнению с велосипедом для комического эффекта… Я приму легкую массивность как шарм, а не буду переусложнять форму».
Уровень Max: лучший векторный пеликан от Anthropic
Максимальная настройка max выдала наилучшую SVG-иллюстрацию среди всех моделей семейства Anthropic. Для генерации потребовалось 13 минут 54 секунды, 65 927 выходных токенов и $3,30 бюджетных средств.
Итоговое изображение отличается высокой проработкой: гармоничный фон, правильно позиционированные ноги по обе стороны рамы, ступни точно на педалях, крыло держит руль, на голове у птицы сидит аккуратная синяя шапочка, а в передней корзине лежит рыба. Хотя по художественной выразительности результат уступает Gemini 3.7 Flash, задаче чистого SVG-моделирования он отвечает идеально.

В процессе рассуждений на уровне Max нейросеть решала сложнейшие микрозадачи:
- Позиционирование ног и педалей: проработка формы педалей около обеих ступней с учетом частичной видимости дальней ноги за рамой.
- Геометрия головного убора: модель подбирала баланс между велосипедным шлемом и хохолком пеликана. Заметив, что шлем в координатах (484,84) пересекается с очертаниями клюва, модель уменьшила купол шлема и сместила его дуги выше, избежав визуального наложения.
- Текстура оперения: добавление темных тонов на кончиках маховых перьев и замена прямой линии крыла на фестончатые изгибы.
- Коррекция вилки велосипеда: нейросеть перепроверила вылет передней вилки и сместила контрольную точку вправо, чтобы вилка правильным образом наклонялась вперед, а не заваливалась назад.
Анимация полученной SVG-графики
После публикации результатов сообщество из Hacker News задалось вопросом: можно ли превратить этот статичный вектор в полноценную анимацию? Чтобы не расходовать повторно $3,30 на режим Max, я взял полученный ранее SVG-код и передал его на обработку с промптом «animate this», задействовав стандартный уровень рассуждений high через утилиту командной строки:
llm logs -cx | llm -m claude-fable-5.1 -s 'animate this'

Обработка потребовала 6121 входной токен и 26 201 выходной токен, что обошлось в $1,37. Модель успешно внедрила в SVG элементы анимации. При экспорте результата в видеоформат MP4 возник иллюзорный эффект вращения колес в обратную сторону (артефакт стробоскопического эффекта при рендере кадров), однако в исходном векторе код вращения прописан полностью корректно.
Источник: simonwillison.net
