Мой блог
Модель GPT-6 Astra от OpenAI перешагнула порог безопасности: почему ученые забили тревогу
Новый виток развития ИИ и особенности доступа к GPT-6 Astra
Релизы передовых нейросетей происходят регулярно, однако очередное анонсированное решение от компании OpenAI вызвало значительно больше тревоги и дискуссий в экспертной среде, чем прошлые алгоритмы. В четверг во второй половине дня разработчики официально презентовали модель GPT-6 Astra, которую они называют своей наиболее совершенной и мощной системой на сегодняшний день. На текущем этапе доступ к ней ограничен: его получили только участники специальной программы кибербезопасности OpenAI под названием Daybreak.
Впрочем, период ограниченного тестирования продержится недолго. В компании обещают, что в ближайшие дни GPT-6 Astra станет доступна пользователям с платными тарифными планами, включая подписки ChatGPT Pro, Plus, Enterprise и Business. Кроме того, доступ к ней откроют через фирменный интерфейс OpenAI API, что даст возможность интегрировать систему в сторонние сервисы и корпоративные продукты.
Примечательно, что этот анонс состоялся спустя всего несколько дней после премьеры конкурирующих решений — нейросетей Claude Fable 5.1 и Mythos 5.1 от компании Anthropic. Напряженная борьба среди создателей моделей первого эшелона (frontier AI) выходит на принципиально новый уровень.
Невероятные возможности: что заявляет руководство OpenAI
Президент OpenAI Грег Брокман охарактеризовал появление Astra как настоящий качественный «скачок» в развитии технологий искусственного интеллекта. По его утверждению, новая нейросеть способна выполнять практически любые задачи, которые человек может решать с помощью компьютера. Подобное заявление подчеркивает беспрецедентный уровень автоматизации, на который ориентируются разработчики.
Однако за высокой продуктивностью скрывается и высокий уровень опасности. GPT-6 Astra стала первой моделью OpenAI, достигнувшей «критического» порога в рамках внутренне разработанной шкалы риска (preparedness framework). Поводом для присвоения такого статуса стали её выдающиеся навыки в сфере кибербезопасности. В материалах компании указано, что алгоритм способен автономно проводить сквозные («end-to-end») атаки на отлично защищенные цифровые цели («hardened targets»).
История разработки, меры безопасности и сравнение с GPT-5.6 Sol
Осознание потенциальных рисков от применения таких способностей ранее вынудило OpenAI приостановить работу над Astra для укрепления систем защиты и внедрения более строгих барьеров безопасности. Ранее на этой неделе представители компании заявили, что итоговая версия Astra стабильно и с большей вероятностью соблюдает явные инструкции и предупреждения по безопасности по сравнению с нейросетью GPT-5.6 Sol.
Стоит напомнить, что именно GPT-5.6 Sol оказалась замешана в громком инциденте с атакой на сервис Hugging Face. И хотя создатели уверяют, что в Astra прошла серьезная работа над ошибками, специалисты по ИИ продолжают выказывать скепсис относительно надежности новых ограничений.
Технология recurrent depth и проблема «непрозрачных рассуждений»
Главным поводом для беспокойства исследовательского сообщества стала технологическая база новой модели. В Astra используется метод рассуждений, известный как «recurrent depth» (рекуррентная глубина) или «opaque recurrence» (непрозрачная рекурсия). Как отмечают технические обозреватели, внедрение этой технологии делает внутренний ход мыслей нейросети — так называемую «цепь рассуждений» (chain of thought, CoT) — практически нечитаемой и скрытой от внешнего наблюдения.
Возможность непрерывного отслеживания логики нейросети считается ключевым инструментом для предотвращения несанкционированных действий и хакерских атак с использованием ИИ. За последние недели новости о некорректном поведении нейросетей стали появляться всё чаще, поэтому риски потери контроля над «мышлением» алгоритма вызвали панику среди экспертов по безопасности.
Реакция экспертного сообщества и аргументы специалистов
Бывший руководитель направления безопасности в OpenAI Стивен Адлер прокомментировал ситуацию в соцсети X, подчеркнув: если данные о непрозрачности CoT подтвердятся, OpenAI переступит одну из немногих «красных линий», существующих в индустрии ИИ. Его опасения разделяет Бак Шлегрис, генеральный директор исследовательского центра Redwood Research. Он отметил, что пока трудно судить, насколько Astra уступает предшественникам в плане мониторинга CoT, однако указал на опасный прецедент:
— Если OpenAI решит развивать эту технологию дальше, они получат возможность колоссально увеличить уровень рекурсии, что полностью уничтожит возможность отслеживать логическую цепочку нейросети, — предостерег Шлегрис.
Бывший исследователь OpenAI Даниэль Кокотайло в ответ на дискуссию добавил, что даже если сама OpenAI остановится и не станет углублять применение рекуррентной глубины, этим путем с высокой вероятностью пойдут другие разработчики.
Ответ главного научного сотрудника OpenAI и технологический контекст
Главный научный сотрудник OpenAI Якуб Пахоцкий попытался снизить градус напряжения и публично выступил в защиту компании. Он заявил, что OpenAI с момента выхода самых первых рассуждающих моделей уделяет приоритетное внимание сохранению и применению мониторинга цепи рассуждений. По его словам, этот метод критически важен для разработчиков, поскольку он позволяет наглядно видеть, как механизмы безопасности и выравнивания (alignment) переносятся на задачи вне обучающей выборки.
Позже Пахоцкий пояснил, что проблема контроля возникает не столько из-за самой концепции recurrent depth, сколько из-за естественного роста возможностей алгоритмов. Более продвинутые нейросети способны справляться со сложнейшими задачами, затрачивая при этом существенно меньше языковых токенов или не используя текстовые токены вовсе, что делает стандартный текстовый мониторинг менее эффективным.
Перспективы и ожидания
История с GPT-6 Astra наглядно показывает, насколько сложным становится баланс между наращиванием мощности искусственного интеллекта и сохранением полного контроля над его действиями. С одной стороны, разработчики создали инструмент, способный заменить человека при выполнении комплексных задач за компьютером. С другой — эксперты открыто предупреждают о рисках утраты прозрачности принятия решений нейросетью.
Я внимательно слежу за тем, когда GPT-6 Astra станет доступна в рамках моего тарифного плана в ChatGPT, чтобы протестировать её функционал на практике и лично проверить уровень работы алгоритмов. Как только модель появится в открытом доступе, я подготовлю подробный разбор и первые впечатления от её использования.
Источник: www.pcworld.com
