Мой блог
Оцениваем нейросети Opus 5.5, Fable 5.1, GPT-6, DeepSeek и Grok: цены, реальная скорость и тесты
Осень 2026 года принесла масштабные релизы: компании представили новые языковые модели вроде Claude Fable 5.1 и GPT-6 Astra, заставив пользователей тщательно взвешивать цифры производителей. Чтобы разобраться в этом потоке данных и не переплачивать, важно понимать методику замеров и рассчитывать стоимость реальной работы.


Информационный поток пестрит противоречивыми метриками, поэтому я детально проанализировал подходы к тестированию, реальную стоимость задач и актуальные бенчмарки искусственного интеллекта.
Методология оценки: разделяем рекламу и независимые тесты
Пытаясь сориентироваться в возможностях современных ИИ-систем, я сразу отсеиваю маркетинговые материалы. Разбор показал, что вся доступная статистика делится на три принципиально разных типа, смешивать которые категорически нельзя.
Три сорта ИИ-статистики и ловушки агрегаторов
Первый тип — внутренние таблицы разработчиков. Фирмы самостоятельно подбирают уровни рассуждения, тестовые сценарии и программную обвязку, из-за чего один и тот же бенчмарк (например, Terminal-Bench 4.0) может показывать у создателей и независимых экспертов разные результаты. Второй тип — независимые замеры вроде Artificial Analysis, где все модели тестируются в равных условиях по сводному индексу, включающему десятку проверок, скорость вывода и цену задачи. Третий тип — частные экспертные сравнения на паре задач, которые хороши для иллюстрации, но не дают статистической точности.
Главная ловушка кроется в том, что агрегаторы часто путают показатели, а цены отдельных конфигураций могут сильно разниться в официальных прейскурантах. Кроме того, огромное значение имеет глубина рассуждений: переключение с базового режима (low) на максимальный (max) способно поднять индекс модели на 16 баллов, а стоимость выполнения задачи — вырасти в одиннадцать раз.
Пересчет прайсов: во сколько обходится реальная задача
Обычный прайс-лист отражает лишь стоимость одного токена, но пользователи платят за полностью решенный рабочий кейс. Учитывая разный объем генерации и затраты на токены размышлений, итоговая картина затрат меняется кардинально.
Самыми дорогими в расчете на один прогон оказались модели линейки Claude: Sonnet 5.5 требует около $7,67, Fable 5.1 — $7,63, а Opus 5.5 обходится в $5,98. При этом базовый токен Sonnet дешевле конкурентов, но модель генерирует огромный объем текста (около 420 миллионов выходных токенов), что и накручивает финальный счет.
Совсем иначе выглядит экономика у GPT-6.1 Sol: при 52 баллах индекса задача стоит всего 72 цента, что обеспечивает идеальный баланс производительности и затрат среди топовых решений. Популярный Grok 4.7 при дешевом входном токене требует уже $3,74 за задачу из-за длинных ответов. В бюджетном сегменте выделяются GPT-6 Luna за 7 центов и DeepSeek V4.1 Flash за 27 центов, тогда как старшая DeepSeek Pro при цене в 67 центов уступает младшей версии по ряду параметров.
Сравнение индексов и отраслевых бенчмарков
Сопоставление сводного индекса Artificial Analysis с профильными тестами позволяет точнее определить специализацию каждой нейросети.
Лидерство удерживают американские разработчики: вершину сводного рейтинга занимает Claude Opus 5.5 с 58 баллами, за ним следуют Sonnet 5.5, Fable 5.1, GPT-6 Astra и GPT-6.1 Sol. В специализированном тестировании агентов Terminal-Bench 4.0 лидируют модели от Anthropic, показывая результаты свыше 70% правильных ответов в терминале.
В комплексных средах вроде OSWorld флагманы от Anthropic также удерживают верхние строчки (более 80%), тогда как в AutomationBench модель GPT-6.1 Sol незначительно опережает Opus 5.5. В итоге программирование и сложные агентные цепочки остаются сильной стороной Claude, экономичные задачи выигрывают за счет GPT, а открытые модели во главе с DeepSeek занимают собственную нишу с оговоркой на то, что их реальные показатели скромнее рекламных заявлений.

