Мой блог
OpenAI обвинила Moonshot AI в кампании по извлечению скрытых рассуждений моделей
Компания OpenAI заявила, что структуры, связанные с китайским разработчиком Moonshot AI, организовали масштабную скоординированную кампанию похищения защищенных логических цепочек из ее нейросетей. По данным корпорации, злоумышленники пытались вытянуть внутренние данные для сомнительного обучения сторонних систем.

Инцидент высветил уязвимость передовых платформ перед методами состязательной дистилляции. Я, Сергей Багров, детально изучил отчет OpenAI и разбираю ключевые технические подробности этой атаки и принятые меры безопасности.





Ход кибератаки и масштаб запросов
Активность злоумышленников зафиксировали в начале июля. На стартовом этапе объемы были минимальными, однако в конце месяца ситуация резко изменилась. Я отмечаю пик подозрительной активности, пришедшийся на 24 и 25 июля, когда система зарегистрировала порядка 16 тысяч запросов с использованием конкретных паттернов извлечения. Эти обращения поступали более чем с четырех тысяч учетных записей.
Особенности выявленных манипуляций
В компании подчеркивают, что масштабная операция продолжалась до конца июля, а полностью пресечь ее удалось к 28 числе. Тем не менее, точных данных о проценте успешных попыток или объеме украденных сведений разработчики не приводят. Злоумышленники задействовали методы, которые специалисты классифицируют как состязательную дистилляцию — несанкционированное копирование результатов работы чужой нейросети для тренировки собственной модели.
Технические детали защиты данных
Внутренние логические цепочки искусственного интеллекта шифруются и передаются клиенту в виде специальных защищенных блоков, которые отправляются обратно с каждым новым запросом. Это избавляет серверы от необходимости постоянного хранения цепочки мыслей. Один из зафиксированных векторов атаки заключался в попытке подсунуть зашифрованные логические блоки из одного диалога в другой, чтобы принудить языковую модель их расшифровать.
Реакция безопасности и закрытие уязвимостей
Проведенный анализ показал, что криптографическая защита в данном инциденте не была скомпрометирована, а прямой доступ к пользовательским базам данных отсутствовал. Я проверил информацию об устраненных дырах: инженеры оперативно закрыли лазейку, позволявшую воспроизводить чужие зашифрованные артефакты, и внедрили дополнительные фильтры для потокового вывода информации.



Связанные угрозы и отчеты исследователей
Независимые эксперты по безопасности также указывали на аналогичные уязвимости межмодельного взаимодействия. В частности, в исследовательском документе «Stealing Reasoning Traces from Proprietary LLM APIs» демонстрировалось, как зашифрованные логические следы флагманских моделей можно скормить менее защищенной системе, которая переводила их в открытый текст. Разработчики оперативно отреагировали на эти сигналы и заблокировали обнаруженные каналы.
Аналогичные инциденты на рынке ИИ
Подобные риски актуальны не только для OpenAI. Ранее компания Anthropic публиковала собственный отчет о неправомерном использовании сервисов, где фигурировала та же китайская структура Moonshot AI. Сообщалось о попытках перенаправить сотни тысяч запросов через сеть поддельных учетных записей для извлечения сигнатур рассуждений модели Claude.
Дальнейшие шаги индустрии
Специалисты ожидают, что по мере совершенствования передовых нейросетей методы интеллектуального шпионажа станут еще изощреннее. Я считаю логичным шагом решение OpenAI поделиться собранными данными с Форумом пограничных моделей и государственными структурами, чтобы минимизировать риски подобных утечек в будущем.
