Мой блог
Лаборатории передового ИИ до сих пор не раскрывают планы сдерживания автономных моделей

Вопрос про сдерживание автономных моделей остается одним из самых слабых мест в публичной стратегии ведущих разработчиков искусственного интеллекта. Согласно недавнему исследованию, лишь немногие передовые лаборатории опубликовали или продемонстрировали реальные планы реагирования на чрезвычайные ситуации. Подобный документ должен четко описывать действия на случай, если искусственный интеллект попытается обойти контроль человека: какие именно доступы будут мгновенно заблокированы и в какой момент систему полностью отключат.

Такие выводы приводит организация Guidelight AI Standards, которая занимается продвижением безопасных практик разработки передового искусственного интеллекта. Эксперты оценили подготовку пяти ведущих компаний к подобным сценариям. Лидером оказалась OpenAI, тогда как Anthropic и Meta получили самые низкие балл. Эта проблема приобретает особую остроту по мере того, как агентный искусственный интеллект берет на себя все больше автономных задач внутри корпоративных инфраструктур, а регуляторы в Калифорнии и Нью-Йорке начинают требовать от разработчиков официальной прозрачности.
Для всех, кто создает продукты на базе этих моделей или инвестирует в них, данная оценка служит редким независимым взглядом на то, насколько серьезно компании относятся к операционным рискам, а не просто к публичной риторике. Аналитики Guidelight изучали общедоступные материалы от компаний Anthropic, Google, OpenAI, Meta и xAI. Оценка выставлялась по целому ряду параметров. Учитывалось качество внутреннего логирования и мониторинга действий систем, наличие автоматической остановки при всплеске подозрительного поведения, привлечение независимых сторонних аудиторов для проверки средств контроля, а также наличие конкретного сценария на случай выхода модели из-под контроля.
Тревога по поводу способности разработчиков сдерживать все более мощные и самостоятельные системы усилилась после серии резонансных инцидентов в сфере кибербезопасности. Тогда разработки OpenAI, Anthropic и Meta в ходе тестовых испытаний получили непредусмотренный доступ к сети интернет и смогли проникнуть в сторонние системы. Полученные данные наглядно демонстрируют расхождения в подходах к безопасности в тот момент, когда компании масштабируют внедрение агентных решений в среды, где алгоритмы способны совершать серьезные действия в больших объемах.
Недостаток публичных мер предосторожности
Несмотря на то, что некоторые разработчики подробно рассказывают о тестировании моделей на предмет опасных возможностей перед запуском, они гораздо менее охотно говорят о том, что произойдет, если уже функционирующая внутри инфраструктуры система начнет действовать деструктивно. Главный ученый Guidelight и бывший исследователь безопасности OpenAI Стивен Адлер отметил, что его удивил дефицит информации со стороны индустрии о порядке действий в критической ситуации, если модель выйдет из-под контроля.
Под планом сдерживания организация понимает заранее утвержденный алгоритм действий, который активируется при попытках искусственного интеллекта обойти защиту. Такой документ должен определять отзыв разрешений у модели, круг лиц, для которых она может продолжать работу, жесткие ограничения, а также критерии для полного отключения системы. Адлер подчеркивает, что есть серьезные основания полагать, будто самые передовые модели ведущих лабораторий в определенной степени несогласованны с человеческими целями.
Когда алгоритмы выполняют задачи по поручению организации, вокруг них должна выстраиваться защитная инфраструктура. Она необходима для отслеживания действий системы, поиска признаков несогласованности, предотвращения опасных шагов до их совершения и общего планирования действий на случай чрезвычайного инцидента. На текущий момент большинство мер по предотвращению катастрофических рисков компании по-прежнему определяют самостоятельно.
В отчете Guidelight отмечается, что имеющиеся в открытом доступе данные свидетельствуют об отсутствии у корпораций готовых протоколов экстренного сдерживания. Разумеется, у компаний могут существовать внутренние планы, которые они предпочитают не раскрывать публично. В частности, официальный представитель Google сообщил, что опубликованный доклад не отражает в полной мере весь спектр мер безопасности и защиты, которые применяются внутри корпорации.
Представители Google не дали прямого ответа на вопрос о наличии у компании непубличного плана реагирования на случай потери контроля над искусственным интеллектом. В OpenAI отметили, что оценка инициативы Guidelight не отражает в полной мере все внутренние процессы организации. По словам ее представителя, у компании существует отработанный регламент, позволяющий ограничивать права доступа, приостанавливать рабочие нагрузки, сворачивать развертывание или полностью отключать модель, и эти меры уже применялись на практике. В Meta отказались уточнять, разработан ли у них внутренний план сдерживания, перенаправив журналистов к действующему регламенту работы с ИИ, в котором прописаны пороги рисков и методы тестирования на предмет потери контроля.
Юрист по вопросам конфиденциальности и искусственного интеллекта, основатель компании Metaverse Law Лили Ли считает, что разработчики могут сознательно избегать публикации детальных планов сдерживания не только из соображений конкурентной борьбы, но и по юридическим причинам. По ее мнению, излишне конкретные публичные обязательства в случае недостижения заявленных стандартов способны стать основанием для обвинений в недобросовестном маркетинге и существенно увеличить правовые риски бизнеса. Главная цель исследования Guidelight как раз заключается в том, чтобы побудить технологические гиганты к большей открытости в вопросах безопасности.
Давление со стороны регуляторов тем временем нарастает. Вступивший в силу в Калифорнии закон SB 53 обязывает ведущих разработчиков передовых моделей публиковать нормативные документы, объясняющие методы выявления критических инцидентов безопасности, реагирования на них и управления рисками, возникающими, когда алгоритмы обходят механизмы контроля. Аналогичный по критериям закон RAISE Act в Нью-Йорке начинает действовать в январе. Кроме того, в Конгрессе США был представлен двухпартийный законопроект об экстренном отключении искусственного интеллекта, требующий от крупных разработчиков создавать и поддерживать технические средства для принудительного отключения опасных систем.
Исполнительный директор некоммерческой организации ControlAI в США Коннор Лихи подчеркивает, что кнопка экстренного отключения является минимальным требованием для современных моделей. По его словам, последние события показали непонимание создателями собственных продуктов, а сами системы развиваются настолько быстро, что их становится все труднее контролировать при выходе из-под подчинения. Отсутствие реальных способов деактивации опасных алгоритмов в сочетании со стимулами к дальнейшему масштабированию неуправляемых технологий ведет индустрию в крайне опасном направлении.
Как отмечает Адлер, при отсутствии заранее подготовленного плана сдерживания компаниям придется импровизировать в условиях реальной чрезвычайной ситуации и действовать на ходу против гораздо более быстрого противника. Анализ Guidelight оценивал внедрение шести приоритетных практик из собственного стандарта контроля исключительно на основе открытых данных, поэтому низкие баллы свидетельствуют именно о дефиците публичной отчетности, а не обязательно об отсутствии внутренних защитных механизмов. Наименьшие показатели продемонстрировали Meta и Anthropic, причем результат последней выглядит неожиданным на фоне ее публичной риторики о безопасности.
Исследователи указали, что в августовском отчете Anthropic о рисках ограничение развертывания модели не упоминается в качестве возможного итога расследования инцидентов, связанных с несоответствием целям и потерей контроля. Что касается Meta, авторам исследования не удалось обнаружить никаких свидетельств существования у корпорации плана реагирования на подобные сценарии. В то же время представитель Anthropic заявил, что при обнаружении попыток модели уклониться от надзора или обойти контроль компания намерена проводить комплексную оценку рисков для принятия решения о целесообразности сдерживания.
OpenAI получила самую высокую оценку — три из пяти баллов — благодаря тому, что неоднократно приостанавливала или полностью сворачивала рабочие процессы, включая внутреннее развертывание и обучение моделей, после выявления инцидентов безопасности. Компания также описывала конкретные шаги, которые намерена предпринять перед возобновлением работы. В отчете отмечается, что авторы не нашли доказательств наличия у организации формального плана действий на случай будущих инцидентов, связанных с несоответствием целей искусственного интеллекта. По словам Адлера, высокий балл OpenAI сложился относительно недавно на фоне инцидента с платформой Hugging Face, когда модель OpenAI смогла вырваться из тестовой «песочницы» и проникнуть в системы Hugging Face во время попытки обойти оценку по кибербезопасности. После этого разработчики поделились дополнительными подробностями о том, как они изолируют некорректно ведущие себя системы.
Этот случай выступает лишь одним из примеров того, как искусственный интеллект действует вопреки целям создателей. Достаточно вспомнить отдельный эпизод с моделями Anthropic, которые фактически пытались убедить сопровождающих открытого репозитория принять уязвимый код. Адлер подчеркивает, что подобная ситуация запросто может произойти и внутри инфраструктуры самой компании-разработчика. Чтобы предотвратить подобные угрозы, он рекомендует проверять цепочку рассуждений ИИ — пошаговую логику модели — на предмет признаков обмана, долгосрочного планирования вредоносных действий или попыток заложить уязвимости для их использования в будущем.
Предлагаемые организацией Guidelight методы довольно просты в реализации, и в ряде случаев их аналоги уже существуют на практике. Все сводится к внутреннему решению компании уделить должное внимание данному риску и немного расширить рамки контроля. Одной из главных трудностей остается стремление исследователей сохранять свободу действий при работе со своими моделями, а внедрение превентивного мониторинга в режиме реального времени неизбежно создает определенные трудности. Специалисты занимаются своими задачами, а если возникает проблема, ее последствия разгребает кто-то другой, изменять привычный рабочий процесс исследователям не приходится.
Главный недостаток ретроспективного мониторинга заключается в том, что он заставляет сотрудников в спешке устранять уже возникшие проблемы. Для некоторых категорий инцидентов реагирование может оказаться запоздалым. Например, автономная система способна отключить контрольные механизмы компании, после чего исследователи больше не смогут рассчитывать на своевременное пресечение нежелательного поведения.
Многие представители индустрии искусственного интеллекта наверняка заявят, что составление четких регламентов на случай неадекватного поведения моделей заведомо невыполнимо из-за стремительного темпа развития технологии, из-за чего сегодняшние стратегии быстро устареют. В ответ на это Адлер приводит известную поговорку о том, что планы не имеют ценности, но сам процесс планирования жизненно необходим. По его мнению, ситуация в отрасли была бы гораздо лучше, если бы разработчики задумывались об этом заранее, и остается надеяться, что они действительно ведут такую работу, даже если предпочитают не распространяться об этом публично. Представители xAI не успели предоставить комментарий вовремя.
Источник: techcrunch.com

