Загрузка 0
ПОДЕЛИТЬСЯ

Мой блог

Листай вниз

OpenAI усилила протоколы безопасности для новых ИИ-моделей

OpenAI усилила протоколы безопасности для новых ИИ-моделей

Сфера кибербезопасности трансформируется стремительно: новые модели искусственного интеллекта способны как радикально усилить защиту, так и многократно ускорить проведение кибератак. Внутренние тесты нашей перспективной разработки, модели Astra, проведенные за последние дни, выявили значительный прогресс в задачах написания программного кода и вопросах кибербезопасности. Сопоставив эти данные с независимыми экспертными оценками, мы пришли к выводу, что нельзя исключать наличие у модели критических возможностей в киберсфере согласно нашей Системе готовности (Preparedness Framework). Мы открыто сообщаем об этом, считая необходимым поддерживать прозрачность взаимодействия с общественностью и профильными сообществами по вопросам безопасности.

GPT-Daybreak > Cover

Оценка критических возможностей в кибербезопасности

Система готовности, представленная нами в декабре 2023 года, создавалась задолго до того, как модели достигли текущих показателей в биологии, химии, написании кода и самосовершенствовании. Этот инструмент призван помочь нам идентифицировать рост потенциала нейросетей и заблаговременно планировать необходимые меры безопасности. Ранее такие модели, как GPT-5.6-Sol, оценивались по уровню киберспособностей, однако их потенциал классифицировался как «высокий», а не «критический».

Критерии перехода на критический уровень

Согласно внутреннему регламенту, модель переходит порог «критического» уровня, если она способна:

Daybreak partners 1x1
  • Самостоятельно находить и разрабатывать функциональные эксплойты нулевого дня любого уровня сложности для защищенных критических систем без участия человека.
  • Разрабатывать и реализовывать комплексные стратегии кибератак против защищенных целей, имея на входе лишь общую задачу.

Хотя мы продолжаем углубленное тестирование, предварительные результаты по модели Astra указывают на показатели, которые на данном этапе не позволяют исключить достижение ею «критического» уровня. Важно отметить, что Astra является перспективным продуктом и не имеет отношения к недавним инцидентам с использованием уязвимостей в Hugging Face. В связи с полученными результатами мы существенно расширили протоколы тестирования на устойчивость, чтобы меры защиты соответствовали мощности внедряемых технологий.

Предпринятые меры безопасности

Для обеспечения безопасного продолжения разработки Astra внутри компании были внедрены следующие шаги:

  • Ужесточение контроля доступа: Введены более строгие протоколы для высокопроизводительных моделей, включая создание изолированных сред тестирования, ограничение сетевого доступа, усиление защиты весов модели и их шифрование, расширенный мониторинг и использование «песочниц» для исполнения кода.
  • Приостановка разработки: Деятельность по проекту Astra, не соответствующая новым усиленным требованиям безопасности, была временно приостановлена.
  • Универсальный мониторинг: Внедрена система отслеживания рискованных действий и отклонений от заданных параметров во всех агентных приложениях Astra, включая этапы обучения и оценки. Мониторы анализируют цепочки рассуждений (Chain of Thought) модели и способны инициировать автоматическую блокировку при обнаружении высокорисковой активности.
  • Государственное и экспертное сотрудничество: Мы будем работать с профильными государственными органами и специализированными организациями по безопасности ИИ для внешней проверки возможностей модели.
  • Рекомендации для партнеров: Мы предоставим внешним тестировщикам четкие рекомендации по обеспечению безопасности при проведении оценок с высоким уровнем риска.

Принципы долгосрочного развития

Наш подход опирается на успешный опыт применения Системы готовности в других областях. Так, в июне 2025 года, когда наши модели приблизились к высокому порогу возможностей в биологии, мы оперативно расширили программу тестирования и привлекли внешних специалистов. Тот же принцип применяется и сейчас. Мы убеждены, что развитие продвинутых моделей должно помогать специалистам по защите находить и закрывать уязвимости быстрее, чем это сделают злоумышленники. Мы намерены продолжать взаимодействие с правительствами, институтами безопасности и гражданским обществом, чтобы передовые возможности Astra и последующих моделей служили интересам безопасности всех людей.

update-external-cyber-testing-incidents 1x1

Источник: openai.com

Оставить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *

01.
На платформе MonsterInsights