Загрузка 0
ПОДЕЛИТЬСЯ

Мой блог

Листай вниз

OpenAI представила GPT-6 Astra: автономную модель управления ПК с контекстом 1,05M токенов и жестким контролем доступа

OpenAI представила GPT-6 Astra: автономную модель управления ПК с контекстом 1,05M токенов и жестким контролем доступа

Компания OpenAI официально анонсировала модель GPT-6 Astra. Разработчики позиционируют её не как обычный чат-бот для диалогового интерфейса, а в качестве полноценной системы управления компьютером (computer-use system). Основная концепция Astra заключаются в том, что ИИ взаимодействует с программным обеспечением подобно человеку: самостоятельно открывает браузеры, работает со сводными таблицами, запускает десктопный софт и выполняет команды в консоли терминала. Модель ориентирована на завершение многошаговых процессов «под ключ», а не на выдачу текстовых подсказок по их выполнению.

Что касается развёртывания, то запустить алгоритм на собственных локальных мощностях не получится. GPT-6 Astra — это закрытая проприетарная модель без публично доступных весов, работающая исключительно в облачной инфраструктуре. На текущий момент доступ к ней открыт только для ограниченного круга корпоративных пользователей и партнёров, включённых в программы OpenAI Trusted Access и Daybreak.

Что действительно изменилось в GPT-6 Astra

Главным техническим нововведением для разработчиков стал изменённый подход к сохранению и передаче контекста при длительной работе агента. В прошлых версиях Codex применялся механизм сжатия (compaction): при заполнении контекстного окна диалог и история выполненных действий просто суммировались. Однако такое сокращение неизбежно приводило к потере критически важных деталей, которые требовались агенту на поздних этапах — например, сведений о причинах сбоя конкретного патча, пройденных тестах или специфических вводных ограничениях, сформулированных в самом начале сессии.

Реклама

В GPT-6 Astra разработчики перешли на систему ведения ведомости заметок (notes) между окнами контекста с возможностью глубокого поиска по прошлым сообщениям и выводам инструментов. На данный момент функция работает в экспериментальном статусе через параметр конфигурационного файла config.toml, но в ближайшее время станет стандартом по умолчанию для всех задач Codex.

Второй практический аспект — умение Astra задавать пользователю уточняющий вопрос и одновременно продолжать выполнение тех подзадач, которые не зависят от ответа. Раньше неопределённость в одном мелком пункте полностью замораживала всю цепочку действий ИИ-агента, но теперь эта проблема устранена.

На официальной странице Astra указаны следующие ключевые характеристики:

  • Объём контекстного окна: 1 050 000 токенов (1.05M).
  • Максимальный объём вывода: 128 000 токенов.
  • Дата актуальности данных: 30 апреля 2026 года.
  • Формат данных: ввод текста и изображений; вывод — строго текстовый.
  • Уровни рассуждений (reasoning.effort): добавлены два новых режима над уровнем high — xhigh и max.
  • Поддержка инструментов: прямой доступ к ПК (computer use), хостируемый shell, наложение патчей (apply patch), библиотеки навыков (skills), MCP и инструмент поиска по функциям (tool search).
  • Дообучение (Fine-tuning): не поддерживается.

Результаты в ключевых бенчмарках

По заявлениям OpenAI, модель демонстирует заметный прогресс в автономной работе за компьютером. В бенчмарке OSWorld V2-Offline система Astra набрала 72,6%, опередив показанную ранее GPT-5.6 Sol с результатом 65,7%. Средняя продолжительность решения одной комплексной задачи при этом снизилась почти в два раза — примерно с 75 до 40 минут. Конкуренты из Anthropic заявляют о 77,9% у Claude Fable 5.1, однако оговариваются, что использовали другую сборку OSWorld, поэтому прямое сравнение этих цифр не отражает реального положения дел.

В тесте ARC-AGI-3 новая модель набрала 99,9%. Впрочем, как я заметил при изучении документации, этот результат был достигнут с использованием внешнего каркаса Responses API, который сохраняет логику рассуждений между итерациями и использует сжатие контекста. OpenAI ранее уже наглядно показывала, что подобные системные обвязки способны существенно поднимать итоговый балл ARC-AGI-3 без изменения самой базовой нейросети, так что здесь мы видим оценку всей связки «модель + агентная обвязка».

Реклама

Другие зафиксированные показатели:

  • FrontierMath Tier 4: 97,6% (аналитики из Epoch AI при этом обращают внимание, что OpenAI частично финансировала этот бенчмарк и имеет эксклюзивный доступ к его закрытой части).
  • BenchCAD Vision2Code: 95,9% против 84,3% у Claude Fable 5.1.
  • Terminal-Bench Science: 64,6% против 52,6% у Anthropic.

Наиболее скромные результаты Astra показывает в сфере чистого написания кода. В тесте DeepSWE v1.1 модель получила 74,1%, лишь слегка опередив GPT-5.6 Sol (72,7%). В то же время Meta декларирует 75,4% для своей модели Muse Spark 1.3 на предельном уровне рассуждений, а публичные лидерборды ставят Gemini 3.8 Flash и Claude Opus 5 на уровень около 74%. На отрезке из 113 тестовых задач разница в 1-2% означает буквально одну или две случайно решённые таски.

Кибербезопасность и жесткие ограничения доступа

GPT-6 Astra стала первой моделью в истории OpenAI, которой официально присвоили наивысший уровень опасности в сфере киберугроз — «Critical» (Критический) по внутреннему фреймворку Preparedness Framework. В ходе внутреннего тестирования нейросеть смогла самостоятельно разработать рабочие эксплойты для защищённых операционных систем и популярных браузеров, а также выявила две ранее неизвестные уязвимости нулевого дня (0-day) в JavaScript-движке V8 (информация о них уже передана разработчикам движка).

Подобные возможности привели к жестким практическим санкциям со стороны службы безопасности:

  • При стандартном типе доступа API модель автоматически отловит и заблокирует любые попытки проведения продвинутых исследований в области кибербезопасности или поиска уязвимостей.
  • Автоматическая система безопасности прерывает выполнение подобных задач сразу, без возможности запросить ручное подтверждение у человека.
  • Представитель OpenAI Миа Глейз (Mia Glaese) отдельно предупредила, что разработчики вне доверенных программ могут сталкиваться с замедлениями, внезапными паузами или сбоями API даже при выполнении задач, не связанных с кибербезопасностью.

В специализированных тестах Astra показала 100% в ExploitBench (это интегральный показатель охвата возможностей, а не процент успешного прохождения) и 42,4% в ExploitGym против 30,3% у Sol (в обоих случаях стандартное ограничение по времени в 6 часов было снято).

Стоимость использования API

Ценообразование на использование GPT-6 Astra выглядит следующим образом:

  • Входной контекст (Input): $10 за 1 миллион токенов.
  • Выходной контекст (Output): $50 за 1 миллион токенов.
  • Кэшированные токены на входе: $1,00 за 1 миллион токенов.
  • Запросы длиннее 272K токенов: тарифицируются с повышающим коэффициентом 2x за входные и 1.5x за выходные токены для всего объёма запроса.
  • Специальные режимы: задачи в режимах Batch и Flex стоят на 50% дешевле, а режим Fast тарифицируется с коэффициентом 2x.
  • Подписки: пользователям тарифов Pro, Business и Enterprise доступен план Astra Pro.

Главные итоги

  • Astra ориентирована на прямое управление программами и ОС (72,6% в OSWorld V2-Offline, среднее время выполнения таски снизилось с 75 до 40 минут).
  • Отказ от непрерывного сжатия контекста в пользу системы записей (notes) предотвращает потерю важных деталей при решении долгих задач в Codex.
  • Прирост в программировании минимален — результат 74,1% в DeepSWE v1.1 держится на одном уровне с конкурентами по рынку.
  • Это первая модель OpenAI с наивысшим статусом киберриска Critical, поэтому стандартный доступ к ней сильно ограничен встроенными блокировками.
  • Модель поставляется без открытых весов, стоит от $10/$50 за миллион токенов, обладает окном в 1,05M токенов и скоро появится в сервисах AWS.

Источник: www.marktechpost.com

01.