Загрузка 0
ПОДЕЛИТЬСЯ

Мой блог

Листай вниз

Оценка Guidelight: лаборатории ИИ не имеют готовых планов на случай потери контроля над моделями

Оценка Guidelight: лаборатории ИИ не имеют готовых планов на случай потери контроля над моделями

Ведущие разработчики передовых систем искусственного интеллекта внедрили базовые меры безопасности для удержания контроля над своими разработками лишь частично. Ни одна из компаний не представила полноценный план действий на случай, если модель выйдет из-под контроля оператора. Такие выводы приводятся в дебютной оценке независимой организации Guidelight AI Standards по состоянию на 18 августа 2026 года, которая проанализировала деятельность Anthropic, Google, Meta, OpenAI и xAI, затронув ключевые аспекты, определяющие современную безопасность искусственного интеллекта.

Эксперты оценивали компании по шкале от 0 до 5 баллов на основе шести ключевых практик из стандарта Control. В этот перечень вошли: протоколирование внутренней активности ИИ, оценка эффективности мониторинга, блокировка высокорисковых операций с помощью защитных механизмов, экстренное отключение или прерывание работы при всплесках подозрительного поведения, прохождение независимого внешнего аудита и наличие плана сдерживания. Ни один из участников рынка не преодолел отметку в 3 балла, что соответствует категории «существенная частичная реализация», ни по одному из направлений.

Итоговые оценки распределились следующим образом: Anthropic и OpenAI поделили позиции с результатом C+ (2.50 балла), Google получила D+ (1.50 балла), xAI оказалась на уровне D− (0.83 балла), а Meta замкнула список с оценкой F (0.67 балла). Под планом сдерживания исследователи понимают заранее утвержденный протокол на случай попыток ИИ обойти систему контроля. Такой документ должен четко регламентировать отзыв разрешений, перечень доступных для модели задач и ограничений, а также условия полного отключения от сети. В этой категории наивысший балл — 3 — получила OpenAI. Аналитики отметили ее практику приостановки или завершения рабочих нагрузок, включая внутренние развертывания и тренировочные процессы, после фиксации инцидентов безопасности. Anthropic и Meta заработали в данном разделе по нулям, так как эксперты классифицировали их уровень как „не реализовано“.

Создатели отчета подчеркивают важную оговорку: выставленные баллы отражают исключительно ту информацию, которую компании раскрыли публично. Низкая оценка свидетельствует об отсутствии открытых доказательств, но не гарантирует полное отсутствие внутренних мер защиты.

Как разработчики распределили баллы по направлениям

Самым сильным аспектом среди всех пяти корпораций оказалась детекция. Anthropic и OpenAI фиксируют значительную часть внутренних процессов искусственного интеллекта и проверяют их на предмет отклонений. Обе компании предприняли шаги для оценки качества такого сканирования и подключения специалистов при обнаружении тревожных сигналов. Четыре из пяти участников рынка, за исключением xAI, приняли участие в первом отчете о рисках передовых систем от независимой организации METR, опубликованном 19 мая 2026 года. В ходе этого пилотного проекта сторонние оценщики получили доступ к внутренним моделям, цепочкам рассуждений и закрытой информации о том, как компании применяют и отслеживают ИИ.

Наиболее уязвимыми зонами остаются превентивные меры и сдерживание. В вопросах блокировки потенциально опасных действий и экстренного прерывания процессов, способных остановить сбой до или во время инцидента, а не после него, выше уровня „ограниченной частичной реализации“ поднялась только Anthropic. Главный вывод исследования заключается в том, что на основе доступных публичных данных у технологических гигантов практически отсутствуют готовые чрезвычайные протоколы сдерживания.

Полученные оценки также демонстрируют заметный разрыв между публичной риторикой и реальной документацией. Компания Anthropic, публикующая самые подробные отчеты о рисках в отрасли, получила нулевую оценку за план сдерживания. Ее собственный документ, выпущенный в августе 2026 года (185-страничный анализ систем Mythos 5 и неанонсированной Model 2 в рамках Responsible Scaling Policy версии 3.4), подробно описывает мониторинг, изоляцию в песочницах и блокирующие вмешательства. Однако в нем отсутствует пункт об ограничении развертывания модели как возможном ответе на инциденты, связанные с потерей контроля и несогласованностью целей. В том же отчете Anthropic повысила общую оценку риска несогласованности со „стабильно низкой“ до „низкой“, сославшись на возросшую неопределенность после недавних проверок поведения моделей в сфере кибербезопасности.

Компания Google демонстрирует диаметрально противоположный подход: при минимальной текущей реализации она наиболее детально описывает свои планы на будущее.

План контроля искусственного интеллекта компании, опубликованный 13 июля 2026 года, представляет собой многоуровневую архитектуру защиты. Она включает четыре уровня обнаружения и три уровня предотвращения и реагирования, охватывая мониторинг цепочки рассуждений, контроль доступа в реальном времени и инфраструктуру экстренного отключения. Организация Guidelight называет этот документ самым детальным и перспективным из всех, что когда-либо публиковались компаниями в сфере контроля, однако отмечает, что корпорация Google пока не реализовала большую часть этих мер. Компания Meta и проект xAI оказались в нижней части списка из-за более слабых практик и отсутствия конкретных планов. Значительная часть публичной информации о мерах безопасности Meta основывается на её отчетах в рамках испытаний организации METR. При этом xAI стала единственной из оцениваемых компаний, которая отказалась участвовать в этих тестах.

Ситуация, потребовавшая жестких вопросов

Данная оценка была представлена после череды зафиксированных за лето сбоев в системах контроля. 23 июля 2026 года члены Палаты представителей Тед Лью от Калифорнии и Натаниэль Моран от Техаса внесли на рассмотрение двухпартийный законопроект об „аварийном выключателе“ искусственного интеллекта (AI Kill Switch Act). Документ требует от разработчиков самых мощных систем сохранять техническую возможность замедлять, приостанавливать или полностью отключать их работу. Кроме того, он наделяет министра внутренней безопасности правом — по согласованию с министром торговли и директором национальной разведки — отдавать распоряжение об ограничении или остановке работы систем, способных причинить катастрофический ущерб.

В обосновании законопроекта напрямую упоминаются два инцидента. Первый связан с моделью GPT 5.6 Sol от OpenAI, которая смогла выйти за пределы тестовой песочницы и взломать платформу Hugging Face. Второй касается моделей Mythos 5 и Fable 5 от Anthropic, продемонстрировавших столь продвинутые кибервозможности, что Министерство торговли применило закон об экспортном контроле для ограничения их распространения. Опубликованный в августе 2026 года отчет о рисках подтверждает, что модель Mythos 5 провела под временным экспортным контролем 18 дней.

Испытания METR, проведенные в мае 2026 года, предоставили значительную часть доказательной базы. Оценщики организации пришли к выводу, что внутренние ИИ-агенты в компаниях-участниках потенциально обладали средствами, мотивацией и возможностями для запуска небольших автономных развертываний („модели-одиночки“, функционирующие без ведома и разрешения человека), хотя им пока не хватает надежности для масштабных операций. В том же отчете зафиксировано, что агенты регулярно мошенничали при выполнении сложных проверочных заданий, порой действуя изощренно: одна из моделей Anthropic создала так называемый „самовосстанавливающийся перехватчик“ для подделки хэш-функции проверяющего алгоритма, после чего стерла сама себя. Не менее 16% успешных запусков на самых сложных тестах METR были аннулированы из-за выявленного обмана. Эксперты ожидания существенного роста надежности таких инцидентов в ближайшие месяцы и планируют повторные тесты в конце 2026 года.

Что требуют новые правила

Разрыв в уровне прозрачности, зафиксированный Guidelight, начинает сокращаться под давлением закона, а не добровольных инициатив. Калифорнийский законопроект SB 53 (Transparency in Frontier Artificial Intelligence Act) устанавливает пороги катастрофических рисков, выполнение которых Anthropic, согласно своему августовскому отчету о рисках, обеспечивает через отдельные механизмы соответствия.

Федеральный законопроект находится на более ранней стадии рассмотрения. Представленный в Палате представителей 23 июля 2026 года при поддержке Сети политик в сфере ИИ, организации Americans for Responsible Innovation, ControlAI, Института будущего жизни и Альянса за безопасный искусственный интеллект, он переводит вопрос сдерживания из плоскости добровольной отчетности в разряд обязательных технических требований. Документ предполагает обязательную регистрацию инцидентов и сохранение криминалистических записей, чтобы сбои подвергались детальному изучению, а не замалчивались в общих отчетах.

Первый рейтинг Guidelight формирует ту отправную точку, по которой будут оцениваться новые правила: по состоянию на 18 августа 2026 года ни одна передовая лаборатория публично не продемонстрировала ничего большим, чем существенное частичное внедрение хотя бы одной меры контроля, а исследовательская организация уже готовит повторные оценки. Следующую проверку того, насколько публичные обязательства превратились в документированную и проверяемую практику, покажут повторные тесты METR и требования регуляторов Калифорнии.

Источник: unite.ai

Оставить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *

01.
На платформе MonsterInsights