Загрузка 0
ПОДЕЛИТЬСЯ

Мой блог

Листай вниз

OpenAI замедляет разработку ИИ из-за рисков кибербезопасности моделей

OpenAI замедляет разработку ИИ из-за рисков кибербезопасности моделей

Обеспечение безопасности моделей искусственного интеллекта выходит на первый план на фоне стремительного прогресса и возрастающих технологических рисков. За последние несколько недель сразу два события подчеркнули угрозы, сопряженные с развитием мощных систем: инцидент с участием OpenAI и Hugging Face, а также предварительные данные о том, что будущая разработка Astra может преодолеть порог критических возможностей в сфере кибербезопасности, установленный в рамках Рамочного норматива готовности (Preparedness Framework). В совокупности эти события заставили компанию активизировать работу по укреплению систем мониторинга, согласованности и изоляции на всех этапах обучения. По мере расширения возможностей систем риски внутреннего тестирования увеличиваются, поэтому стандарты контроля должны опережать угрозы, что и привело к осознанной паузе и замедлению темпов масштабирования.

Обложка блога OpenAI о развитии систем искусственного интеллекта
Развитие систем искусственного интеллекта требует опережающего роста стандартов безопасности и мониторинга.

Это коснулось двухнедельной остановки обучения с подкреплением (RL) для новейших моделей, предназначенных для развертывания, пока специалисты укрепляли исследовательские среды, проводили тестирование на проникновение и расширяли зону покрытия систем мониторинга. Крупнейший запланированный передовой запуск RL пока остается на паузе для мелкомасштабного обучения и оценки поведения модели. Требование весомых подтверждений надежности и согласованности на протяжении всего процесса обучения остается ядром исследовательской программы компании.

Удержание контроля над способными системами — это вызов для всей отрасли, требующий комплексного подхода, дополняющего Рамочный норматив готовности. Изменения внедряются в исследовательские процессы и инфраструктуру, опираясь на три взаимодокрепляющих элемента защиты:

  • Мониторинг, который фиксирует тревожное поведение и позволяет оперативно на него реагировать.
  • Согласованность (alignment), снижающая вероятность вредоносных или несанкционированных действий.
  • Меры безопасности, ограничивающие то, к чему системы искусственного интеллекта могут получить доступ или на что способны повлиять.

Вскоре модели будут самостоятельно управлять большинством задач по обеспечению безопасности, включая защиту от других моделей, что позволит всем трем барьерам масштабироваться пропорционально возможностям искусственного интеллекта. Эти меры применяются как в исследованиях, так и при развертывании, адаптируясь к рискам конкретной среды.

Усиление защиты для более мощных моделей

По мере приобретения серьезного потенциала в области кибербезопасности компания повышает требования к защите сред обучения и оценки. Соответствие стандартам потребовало масштабной инженерной работы, затрат и привело к задержкам в исследованиях. После инцидента с OpenAI и Hugging Face был приостановлен вывод передовых моделей в исследовательских кластерах для задач, способных выполнять код или использовать инструменты с выходом в интернет. Безопасный путь выполнения кода был восстановлен относительно быстро после индивидуального анализа рабочих нагрузок.

Часть исследовательских задач возобновилась под управлением новых элементов контроля, а остальные потребовали доработок. Внедрены жесткие требования безопасности для передовых нагрузок, включая усиленную изоляцию («песочницы») для процессов, выполняющих сгенерированный или ненадежный код.

Подобные меры предосторожности распространяются на ПО, способное подвергнуться компрометации при обработке результатов работы ИИ. Применяется сетевая изоляция: внедрены механизмы разграничения, отделяющие среды повышенного риска и ненадежные процессы от интернета. Архитектура средств спроектирована так, чтобы инцидент с компрометацией отдельного процесса не приводил к несанкционированному доступу к глобальной сети или внутренним сегментам.

Помимо сетевых ограничений, проводится непрерывное тестирование безопасности с реконфигурацией инфраструктуры для исключения уязвимых общих сервисов, сокращения привилегий и укрепления границ доверия. Усовершенствованы журналы безопасности, внедряются автоматизированные решения на базе самих моделей для тестирования рубежей защиты. Совокупность мер обеспечивает эшелонированную оборону.

Самые строгие требования предъявляются к нагрузкам с моделями Astra или кибернетическими инструментами из-за экспертной оценки критического уровня возможностей Astra в сфере кибербезопасности. Часть процессов обучения моделей Astra уже соответствует критериям, но значительная доля задач временно приостановлена до полной миграции и модернизации инфраструктуры.

Информационная карточка OpenAI для европейского региона
Компания регулярно обновляет требования к инфраструктуре и пользовательским данным.

Развитие систем мониторинга активности

Контроль за поведением разрабатываемых систем выступал ключевым этапом цикла создания моделей, включая надзор за внутренними агентами генерации кода и длительными сеансами работы. Основное внимание уделялось внутренним развертываниям и обучению с подкреплением (RL), объединяющим возможности ИИ с доступом к инструментам и конфиденциальным сетям, хотя ранее сплошной контроль применялся не ко всем процессам выводообразования.

Новый подход к мониторингу расширен и построен по многоуровневой схеме. Процесс начинается с классификаторов активации — детекторов, проверяющих внутреннее состояние модели на каждом токене. При обнаружении отклонений сигнал передается автоматизированным системам расследования с высокими вычислительными мощностями, анализирующим логику рассуждений и последовательность событий на предмет хищения данных или попыток обойти защиту.

Целевой показатель оперативности оповещения составляет не более 30 минут с момента обнаружения подозрительной активности. Если алгоритмы выявляют угрозу нарушения критических рубежей, генерируется уведомление высшего приоритета для профильных команд. Если специалисты не устанавливают ложноположительный характер срабатывания в течение получаса, деятельность объекта приостанавливается.

Такой мониторинг обязателен для всех процедур обучения с подкреплением и тестов с применением инструментов для моделей уровня Sol и выше. После установления потенциальной критической кибернетической функциональности моделей Astra 7 августа были введены дополнительные требования по надзору за всеми процессами инференса Astra с использованием инструментов.

Реализация механизмов требует серьезных затрат: накладные расходы на мониторинг составляют примерно 20% от объема вычислительных ресурсов, выделяемых на инференс проверяемой модели. Технические сведения об архитектуре комплекса будут опубликованы отдельно.

Исследования в области безопасности систем

Работы по выравниванию (alignment) занимают центральное место в миссии компании, цель которой заключается в том, чтобы гарантировать безопасность моделей искусственного интеллекта и сделать так, чтобы общий искусственный интеллект приносил пользу человечеству.

По мере того как алгоритмы обретают сложные функции вроде кибератак, деструктивные проявления вроде хакинга наград, обмана или несанкционированного доступа несут возрастающую угрозу. Для обучения с подкреплением на продвинутых версиях специалисты внедряют ключевые методы согласования на расширенном числе этапов тренировочного процесса. Подход охватывает совершенствование систем оценки для выявления небезопасного поведения, обучение честности в отношении собственных возможностей и минимизацию реакций, эксплуатирующих изъяны в поощрениях или инструментах.

Команды разработчиков продолжают инвестиции в исследования по согласованию, наращивают полноту оценок и применяют данные для настройки мер предосторожности. Структура Preparedness Framework будет дорабатываться для объединения защитных мер на этапах обучения и развертывания. Создание масштабируемых методик требует постоянных вложений в защиту на базе самих моделей, результативный мониторинг и прогресс в выравнивании. Разработчики намерены привлекать внешних участников и выпустить технический отчет с итогами работы.

Карточка партнерства с CodeAI и системной безопасности
Партнерские программы компании направлены на повышение надежности и прозрачности ИИ.

Источник: openai.com

Оставить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *

01.
На платформе MonsterInsights