Загрузка 0
ПОДЕЛИТЬСЯ

Мой блог

Листай вниз

Оцениваем нейросети Opus 5.5, Fable 5.1, GPT-6, DeepSeek и Grok: цены, реальная скорость и тесты

Оцениваем нейросети Opus 5.5, Fable 5.1, GPT-6, DeepSeek и Grok: цены, реальная скорость и тесты

Осень 2026 года принесла масштабные релизы: компании представили новые языковые модели вроде Claude Fable 5.1 и GPT-6 Astra, заставив пользователей тщательно взвешивать цифры производителей. Чтобы разобраться в этом потоке данных и не переплачивать, важно понимать методику замеров и рассчитывать стоимость реальной работы.

Тестирование современных языковых моделей
Процесс сравнительного анализа производительности нейросетей.
Анализ производительности нейросетей в терминале
Оценка работы ИИ-агентов в специализированных программных средах.
Сравнение стоимости генерации токенов
Экономические показатели использования различных языковых моделей.

Информационный поток пестрит противоречивыми метриками, поэтому я детально проанализировал подходы к тестированию, реальную стоимость задач и актуальные бенчмарки искусственного интеллекта.

Методология оценки: разделяем рекламу и независимые тесты

Пытаясь сориентироваться в возможностях современных ИИ-систем, я сразу отсеиваю маркетинговые материалы. Разбор показал, что вся доступная статистика делится на три принципиально разных типа, смешивать которые категорически нельзя.

Реклама

Три сорта ИИ-статистики и ловушки агрегаторов

Первый тип — внутренние таблицы разработчиков. Фирмы самостоятельно подбирают уровни рассуждения, тестовые сценарии и программную обвязку, из-за чего один и тот же бенчмарк (например, Terminal-Bench 4.0) может показывать у создателей и независимых экспертов разные результаты. Второй тип — независимые замеры вроде Artificial Analysis, где все модели тестируются в равных условиях по сводному индексу, включающему десятку проверок, скорость вывода и цену задачи. Третий тип — частные экспертные сравнения на паре задач, которые хороши для иллюстрации, но не дают статистической точности.

Главная ловушка кроется в том, что агрегаторы часто путают показатели, а цены отдельных конфигураций могут сильно разниться в официальных прейскурантах. Кроме того, огромное значение имеет глубина рассуждений: переключение с базового режима (low) на максимальный (max) способно поднять индекс модели на 16 баллов, а стоимость выполнения задачи — вырасти в одиннадцать раз.

Пересчет прайсов: во сколько обходится реальная задача

Обычный прайс-лист отражает лишь стоимость одного токена, но пользователи платят за полностью решенный рабочий кейс. Учитывая разный объем генерации и затраты на токены размышлений, итоговая картина затрат меняется кардинально.

Самыми дорогими в расчете на один прогон оказались модели линейки Claude: Sonnet 5.5 требует около $7,67, Fable 5.1 — $7,63, а Opus 5.5 обходится в $5,98. При этом базовый токен Sonnet дешевле конкурентов, но модель генерирует огромный объем текста (около 420 миллионов выходных токенов), что и накручивает финальный счет.

Совсем иначе выглядит экономика у GPT-6.1 Sol: при 52 баллах индекса задача стоит всего 72 цента, что обеспечивает идеальный баланс производительности и затрат среди топовых решений. Популярный Grok 4.7 при дешевом входном токене требует уже $3,74 за задачу из-за длинных ответов. В бюджетном сегменте выделяются GPT-6 Luna за 7 центов и DeepSeek V4.1 Flash за 27 центов, тогда как старшая DeepSeek Pro при цене в 67 центов уступает младшей версии по ряду параметров.

Сравнение индексов и отраслевых бенчмарков

Сопоставление сводного индекса Artificial Analysis с профильными тестами позволяет точнее определить специализацию каждой нейросети.

Лидерство удерживают американские разработчики: вершину сводного рейтинга занимает Claude Opus 5.5 с 58 баллами, за ним следуют Sonnet 5.5, Fable 5.1, GPT-6 Astra и GPT-6.1 Sol. В специализированном тестировании агентов Terminal-Bench 4.0 лидируют модели от Anthropic, показывая результаты свыше 70% правильных ответов в терминале.

В комплексных средах вроде OSWorld флагманы от Anthropic также удерживают верхние строчки (более 80%), тогда как в AutomationBench модель GPT-6.1 Sol незначительно опережает Opus 5.5. В итоге программирование и сложные агентные цепочки остаются сильной стороной Claude, экономичные задачи выигрывают за счет GPT, а открытые модели во главе с DeepSeek занимают собственную нишу с оговоркой на то, что их реальные показатели скромнее рекламных заявлений.

График индекса Artificial Analysis и стоимости одной задачи
Соотношение сводного индекса Artificial Analysis и средней стоимости решения задачи.
01.