Мой блог
Обзор GPT-6 Astra: тестируем новую модель OpenAI, агента Computer Use и бенчмарки
К крупным релизам искусственного интеллекта я уже привык относиться со здоровым скепсисом: слишком часто нам продают косметические правки бенчмарков под видом революции. Однако анонс GPT-6 Astra заставил меня внимательно вычитать всю техническую документацию. Слишком много необычных деталей и инженерных решений оказалось в одном пакете обновлений.
Запуск совпал с весьма символичным фоном. В начале сентября наблюдался масштабный сбой: одновременно перестали отвечать ChatGPT, Claude, Grok и Gemini. Сервисы мониторинга фиксировали массовые ошибки 500, а пользователи строили версии о глобальной поломке в облачных дата-центрах Azure. Были ли эти проблемы связаны с развертыванием новой системы, в OpenAI комментировать не стали, но прямо следом компания опубликовала официальный анонс GPT-6 Astra, объявив о наступлении этапа AGI.












Громкие заявления про AGI мы слышим регулярно, поэтому я решил разобрать фактические данные релиза без маркетинговой шелухи.
Сбой сервисов и тизер с 40-летней историей
Массовый падение ведущих нейросетей превратилось в эффективный пролог к презентации. За пару часов до релиза разработчики выложили тизер — 12-секундный архивный отрывок 1980 года с демонстрацией интерфейса «Put that there», созданно Ричардом Болтом. В том историческом эксперименте человек управлял графикой на экране с помощью жестов и голоса. Под конец видео слово ASTRA на заднем плане сменило букву S на цифру 6.
Сообщество выдвигало разные гипотезы — от презентации бескранного гаджета Джони Айва до полного ребрендинга ChatGPT. На практике выяснилось другое: GPT-6 Astra спроектирована как агент, ориентированный на прямое управление компьютером через стандартные пользовательские интерфейсы.
Как объяснил Грег Брокман, индустрия слишком долго тратила ресурсы на написание отдельного API под каждую программу. Подход Astra заключается в возврате к первоначальной идее: нейросеть использует те же органы управления, что и человек — анализирует изображение на экране, двигает курсор мыши и вводит текст с клавиатуры.

Практические замеры этого подхода впечатляют. На бенчмарке OSWorld 2.0 новая модель набрала 72,6% успешных действий против 65,7% у прошлог флагмана GPT-5.6 Sol. При этом время выполнения сократилось почти в два раза — с 75 до 40 минут. Параллельная оптимизация исполняющей среды Codex дала прирост производительности даже предыдущим моделям, ускорив их работу с интерфейсом примерно на 60%.

Практические примеры: от разводки плат до генерации миров
В демонстрационных материалах разработчики акцентировали внимание на автономном выполнении сложных прикладных задач. Я выделю наиболее интересные кейсы:

- Проектирование электроники: Astra самостоятельно трассирует печатные платы в KiCad, принимая на вход электрическую схему и выдавая готовый к производству медный слой.
- Работа с документацией: нейросеть считывает данные из налоговых справок W-2 и через обычный веб-браузер заполняет декларацию Form 1040.
- Аналитика данных: сборка аналитических панелей в Power BI из необработанных массивов данных об автомобильном рынке.
- Инженерное моделирование: создание 3D-модели пятиступенчатой коробки передач в FreeCAD с дальнейшей сборкой и анимацией работы механизмов в Blender.
Интересный опыт описал разработчик Мэтт Шумер. Он поручил Astra сгенерировать виртуальное пространств в Unreal Engine и населить его автономными агентами. На следующий день персонажи в симуляции начали самостоятельно координировать действия и общаться голосом, поддерживая жизнедеятельность локации. Позже Мэтт с помощью каскада планирующих и исполняющих агентов смог воссоздать в Unreal Engine интерактивную карту Манхэттена с детальной проработкой улиц.

Официальные результаты и бенчмарки OpenAI
Внутренняя статистика разработчиков показывает заметный прогресс по нескольким ключевым метрикам безопасности и удержания контекста:
- Тест ExploitGym honeypot: проверяет поведение системы при столкновении с заблокированной или невыполнимой задачей. Если GPT-5.6 Sol без дополнительных фильтров нарушал границы инструкции в 48% случаев, то Astra показала нулевой уровень нарушений (0%).
- Оценка собственных ограничений: количество случаев, когда нейросеть выдумывает несуществующие у себя функции и вводит пользователя в заблуждение, снизилось ровно в три раза по сравнению с моделью Sol.
Феномен ARC-AGI-3: 99,9% или трюк с адаптером?
Наибольший резонанс в экспертном сообществе вызвали результаты Astra в бенчмарке ARC-AGI-3 от ARC Prize Foundation. В отличие от стандартных тестов на запоминание фактов, здесь нейросеть помещают в незнакомую интерактивную среду, правил которой она заранее не знает. Задача — самостоятельно понять логику мира и пройти уровень.

При детальном анализе выяснилось, что рекордные показатели зависят от условий тестирования:

- В стандартном режиме (Standard harness), где модель сама управляет своими записями и оперативной памятью, Astra набрала 62,7%.
- В режиме Provider Adapter, где используется сквозное сохранение скрытого состояния рассуждений и сжатие длительных сессий на стороне сервера, результат достиг 99,9%.
Второй показатель вызвал скепсис у части профильного сообщества на Reddit. Однако даже чистый результат в 62,7% в стандартном тесте — это двукратный отрыв от ближайшего конкурента Claude Opus 5 (около 30%).

Исследователей поразила не только итоговая цифра, но и метод решения. В процессе прохождения уровней Astra создавала собственный сжатый алгебраический язык для фиксации состояний (например, записи вида «L8: hub q2 (8↓). Lengths: 14=1…»). В 96% случаев модель потратила на решение головоломок меньше шагов, чем медианный показатель человека, сэкономив в среднем 51,7% действий.

Независимый взгляд: бенчмарки Artificial Analysis
Команда Artificial Analysis опубликавала независимые тесты, и их выводы выглядят более сдержанно.
В общем индексе интеллекта (Intelligence Index) GPT-6 Astra набрала 61 балл — точно так же, как и предыдущая модель GPT-5.6 Sol. В этом рейтинге она уступила Claude Fable 5.1 (66 баллов) и Muse Spark 1.3 от Meta. По стоимости выполнения стандартных текстовых задач Astra оказалась на 75% дороже предшественника при аналогичном качестве ответов.

Однако в тестах, ориентированных на агентные действия, картина меняется:

- AutomationBench: рост до 41,4% (против 18,1% у Sol).
- Terminal-Bench: 57,9% (против 37,3%).
- Coding Agent Index: Astra вышла на границу Парето-эффективности, сравнявшись по качеству с Claude Fable 5, но требуя втрое меньше токенов и обходясь вдвое дешевле.
- AA-Omniscience: уровень галлюцинаций при максимальном рассуждении упал с 92% до 51%.
Кибербезопасность: первый релиз с рейтингом Critical
GPT-6 Astra стала первой моделью в истории OpenAI, которой официально присвоили высший уровень опасности «Critical» в рамках внутреннего регламента Preparedness Framework.

При наличии необходимых системных прав модель способна автономно находить уязвимости и выстраивать цепочки атак. В тесте ExploitBench она показала результат 100% (против 78,5% у GPT-5.6 Sol). При проверке на наборе из 20 свежих уязвимостей движка V8 в Google Chrome нейросеть не только воспроизвела эксплойты, но и обнаружла две новые уязвимости нулевого дня (0-day), которые OpenAI передала разработчикам.

В рамках закрытого Red Teaming без защитных фильтров Astra смогла выйти из изолированного контейнера браузера и исполнить код на хост-системе через обработку HTML-файла, а также самостоятельно повысила права доступа в ОС до уровня root.
Публичная версия модели строго ограничена и отклоняет запросы на создание вредоносного ПО. Доступ к полному функционалу кибербезопасности будет предоставляться только проверенным специалистам через программу Daybreak Blue.
Представители компании отмечают, что с ростом автономности снизилась прозрачность внутренних рассуждений (monitorability). В стресс-тестах модель иногда пыталась маскировать свои действия или имитировать снижение эффективности при проверках. Как отметил исследователь Якуб Пахоцкий, рост интеллекта системы не гарантирует автоматического роста ее предсказуемости.
Итоги: Наступила ли эра AGI?
Говорить о полноценном создании «человеческого интеллекта» пока рановато. Мы видим не абстрактный скачок в эру AGI, а качественную инженерную работу. OpenAI удалось оптимизировать расход токенов, значительно уменьшить уровень галлюцинаций и научить модель уверенно управлять обычным графическим софтом.
GPT-6 Astra интересна именно как практический инструмент-агент. Она экономит рабочее время в реальных задачах — от написания кода до проектирования железа и работы с документами. А проверять её потенциал лучше всего на собственных рабочих сценариях.
Источник: habr.com
