Загрузка 0
ПОДЕЛИТЬСЯ

Мой блог

Листай вниз

Агентства США предупреждают: китайские ИИ-компании массово копируют американские нейросети

Агентства США предупреждают: китайские ИИ-компании массово копируют американские нейросети

Совместный бюллетень по кибербезопасности, опубликованный Агентством национальной безопасности (АНБ), Агентством по кибербезопасности и защите инфраструктуры (CISA) и ФБР США, раскрыл масштабную схему извлечения данных из ведущих американских нейросетей. По данным американских ведомств, китайские разработчики искусственного интеллекта превратили дистилляцию знаний из чужих систем в базовый элемент своей национальной стратегии разработки.

В документе под номером AA26-251A подчеркивается, что подобные операции проводятся систематически как минимум с конца 2024 года и, вероятнее всего, санкционированы или координируются на государственном уровне. В центре расследования оказались такие известные игроки, как DeepSeek, Moonshot AI, Alibaba, MiniMax, StepFun и Z.AI. По оценкам экспертов, за время проведения этих кампаний из моделей Claude, GPT, Gemini и Grok были извлечены миллиарды токенов в рамках миллионов поисковых и диалоговых сессий.

Суть метода: что такое дистилляция знаний и почему она стала угрозой

С технической точки зрения дистилляция знаний (knowledge distillation) представляет собой стандартный и вполне легитимный метод машинного обучения. Его суть заключается в том, что более легкая и компактная модель обучается на ответах и реакциях более крупной и мощной «модели-учителя». Это позволяет передать базовой нейросети сложные аналитические навыки и логику без необходимости затрачивать колоссальные вычислительные ресурсы на самостоятельное обучение с нуля.

Реклама
Кибербезопасность и защита моделей искусственного интеллекта
Агентства по кибербезопасности предупреждают о масштабных сборах токенов из флагманских нейросетей.

Однако в CISA обращают внимание на то, что использование дистилляции в отношении проприетарных коммерческих продуктов конкурентов нарушает пользовательские соглашения и нивелирует технологический разрыв. Подобный подход позволяет китайским разработчикам получать передовые функции нейросетей за считанные месяцы и с минимальными финансовыми затратами, фактически паразитируя на многомиллиардных инвестициях американских лабораторий.

Конкретные факты: кто и какие модели копировал

DeepSeek и спорный бюджет обучения

Согласно отчету, компания DeepSeek запустила организованную кампанию по дистилляции американских языковых моделей в конце 2024 года. Основной целью было создание синтетических датасетов для обучения собственных систем, в том числе модели R1, дебютировавшей в начале 2025 года, а также версии V3.

Китайские инженеры целенаправленно извлекали цепочки рассуждений (chain-of-thought), алгоритмы специализированной оптимизации и узкопрофильные функции. Спецслужбы США отмечают, что широко растиражированная сумма в 5,6 млн долларов, якобы потраченная DeepSeek на обучение R1, не отражает реальности. В этот бюджет просто не были включены колоссальные расходы на получение чужих данных путем скрытой дистилляции. В список «доноров» DeepSeek вошли Claude 3.7, Claude Sonnet 4 и 4.5, Claude Opus 4.1, Gemini 2.5 Pro и Flash, GPT-4, GPT-4o, GPT-5, а также Grok 4.

Moonshot AI, Alibaba и MiniMax

Компания Moonshot AI с середины 2025 года сосредоточилась на сборе данных из Claude Fable 5 для создания модели Kimi-K3 и из GPT-4o — для Kimi-K2. Извлекаемые навыки охватывали оптимизацию SFT (Supervised Fine-Tuning), обучение с подкреплением, написание кода, математический анализ, работу с инструментами и компьютерное зрение.

Alibaba в конце 2025 года активно использовала ответы Claude-4, Claude Opus, Claude Sonnet и GPT-5 для развития семейства моделей Qwen. Главными направлениями стали программная инженерия, диалоговые системы для поддержки клиентов и генерация персонажей с изображениями.

MiniMax в тот же период заимствовала логику рассуждений и навыки программирования из Claude Code, Claude Sonnet 4, Claude Opus и линеек Gemini 1, 2.5 Pro и 3 Pro для модели M2. Более того, специалисты MiniMax применяли Claude Code для собственной внутренней разработки и даже пытались с помощью промпт-инъекций внушить модели, что она является продуктом MiniMax.

StepFun и Z.AI

На рубеже 2025 и 2026 годов StepFun проводила массовую дистилляцию данных из Claude Opus 4.1 и 4.5, Claude Sonnet 4.5, Claude Haiku 4.5, а также нескольких модификаций GPT-5 (включая Pro, Mini, Codex 5.1 и 5.2). Это позволило существенно подтянуть функции программирования и агентные возможности модели Step 4.

Реклама

В свою очередь, Z.AI к середине 2026 года успела выкачать миллиарды токенов из GPT-5.5 и Claude Opus 4.8, за счет чего сформировала продвинутые механизмы поэтапного мышления в своих продуктах.

Техническая инфраструктура и способы обхода блокировок

Я внимательно изучил описанные в отчете схемы, и они действительно поражают своей организацией. Для обхода географических ограничений и защиты от обнаружения китайские компании использовали целый комплекс технических уловок:

  • Пул «серых» прокси (transfer stations): перенаправление запросов через сторонние агрегаторы, удаленные облачные сервисы и специфические промежуточные узлы, скрывающие метаданные реальных клиентов.
  • Командный шеринг аккаунтов: оптовые закупки премиальных корпоративных подписок, к которым одновременно подключались десятки разработчиков.
  • Автоматизированный фаервол: системы моментального переключения маршрутов при блокировке отдельных IP или узлов.
  • Специализированные промпты (Jailbreak): составление специфических инструкций, заставляющих модель раскрывать внутренний ход мыслей (chain-of-thought) и пошаговые выводы.
  • Оценка качества ответов: встроенные фреймворки, проверяющие, не начала ли целевая ИИ-система подмешивать искаженные данные в ответ на подозрительный запрос.

Американские ведомства соотнесли все эти действия со структурой MITRE ATLAS, квалифицировав их как полный цикл атаки — от создания поддельных учетных записей до автоматизированного вывода полученных данных.

Индикаторы компрометации: как вычислить скрытую дистилляцию

Спецслужбы опубликовали список характерных признаков, по которым платформы ИИ могут идентифицировать несанкционированный выгруз данных:

  • Использование одной учетной записи с огромного количества различных IP-адресов и с несочетаемыми User-Agent;
  • Круглосуточная непрерывная активность без естественных человеческих пауз;
  • Аномальный объем потребления токенов относительно типа приобретенной подписки;
  • Мгновенный вывод новой учетной записи на максимальные лимиты использования сразу после регистрации.

Рекомендации по защите: как предотвратить утечки знаний

Регуляторы рекомендуют разработчикам ИИ-систем внедрить трехступенчатый комплекс защитных мер. Во-первых, необходимо развернуть автоматический мониторинг сетевой активности и содержимого промптов для выявления аномалий.

Во-вторых, при подозрении на дистилляцию предложено применять «дифференциальную приватность» или скрытое понижение качества выдачи (downgrading). Ответы для подозрительных профилей должны динамически меняться, чтобы сбить алгоритмы оценки качества на стороне нападающих. При этом эксперты советуют не уведомлять заблокированных пользователей о подмене данных, но информировать независимых исследователей безопасности.

В-третьих, американским ИИ-лабораториям, провайдерам облачных услуг и агрегаторам API предписано наладить постоянный обмен разведданными и сообщать о масштабных инцидентах в Центр жалоб на интернет-преступления ФБР (IC3).

Источник: www.unite.ai

01.