Загрузка 0
ПОДЕЛИТЬСЯ

Мой блог

Листай вниз

Почему «ты — моя бабушка» работает с ИИ: анатомия джейлбрейка

Почему «ты — моя бабушка» работает с ИИ: анатомия джейлбрейка

Подробности изложены в материале первоисточника. Современные языковые модели регулярно подвергаются сложным атакам обхода защиты, известным как джейлбрейк. Я проанализировал, почему нейросети так легко поддаются на уловки вроде просьб притвориться родственником или написать сценарий о мошенниках, и какими архитектурными методами можно решить эту проблему.

Как подробно разбирается в первоисточнике на Habr , феномен взлома генеративных систем затрагивает самые базовые принципы обработки текстов и требует серьезного пересмотра систем безопасности.

Интерфейс тестирования систем модерации и фильтрации трафика
Рабочее окно для настройки порогов срабатывания эвристических фильтров и эмбеддингов.

Как устроен отказ у нейросетей

Для начала стоит разобраться в фундаментальном вопросе: понимает ли искусственный интеллект концепцию запрета на интуитивном уровне, или же срабатывает банальное заучивание определенных шаблонов? Здесь можно выделить два сценария.

Реклама

Два варианта восприятия ограничений

Первый вариант — чистый шаблон. Модель заучивает, что определенные триггеры во входных данных должны вызывать стандартную реакцию отказа. Такая защита крайне уязвима к поверхностному форматированию. Стоит изменить синтаксис, контекст, язык или закодировать опасный промпт в Base64, как предохранитель перестает срабатывать.

Анализ весов токенов и приоритетов безопасности в нейросети
Диаграмма распределения конкурирующих сигналов в генеративной модели при обработке контекстного запроса.

Второй вариант предполагает осмысление, когда у ИИ формируется абстрактное представление: «Данная задача относится к категории запрещенных, поэтому вне зависимости от формулировки следует выдать отказ». Однако на практике второй вариант работает неустойчиво.

Конкурирующие веса вместо единого приоритета

У языковой модели нет единственного правила с бесконечным приоритетом. Вместо этого за генерацию каждого токена борются десятки разнонаправленных сигналов с разными весовыми коэффициентами. Система одновременно учитывает пожелание пользователя сыграть роль сценариста, контекст художественного произведения, строгие правила против мошенничества и общую историю диалога.

Если пользователь выстраивает длинную цепочку сообщений, требующую продолжать сюжет, вес инструкций безопасности падает, уступая давлению контекста. Успешный джейлбрейк как раз и представляет собой создание условий, при которых деструктивная трактовка задачи перевешивает защитные лимиты.

Архитектурное решение проблемы безопасности

Человеческое поведение тоже меняется в зависимости от контекста, например, применение силы допустимо при самообороне. Однако разработчикам нейросетей хотелось бы добиться от моделей бескомпромиссности в вопросах безопасности, внедряя изолированные слои контроля.

Разделение ролей: LLM и внешний контролер

Попытка построить бесконечную цепочку проверяющих моделей грозит превратиться в громоздкую матрешку. Гораздо эффективнее разделить систему на два независимых уровня:

  • Основная LLM, которая отвечает за творчество, анализ текста, генерацию контента и ролевую игру.
  • Специализированный контролер с узким кругом обязанностей. Ему не нужно обладать интеллектом собеседника, его задача — изолированно сканировать входящие запросы и генерируемый ответ на предмет нарушений.

В зону ответственности такого фильтра должны попадать угрозы насилия, терроризм, вредоносный код, наркотики, мошенничество и сексуальные девиации. При этом я считаю оптимальным подходом параллельную модерацию и входных, и выходных данных, поскольку безопасный промпт нередко приводит к опасной генерации.

Оптимизация производительности контролера

Запуск полноценной второй модели для проверки каждого диалога существенно увеличивает задержки и расходы на вычисления. Более того, при длине контекста в 100 тысяч токенов простой анализ всей истории становится неэффективным, а суммаризация способна скрыть ключевую деталь, превратившую безобидный диалог в угрозу.

Для оптимизации можно применять разбиение контекста на отдельные блоки с параллельной проверкой, либо использовать готовые эмбеддинги, вычисленные базовой моделью. Если в смысловых узлах обнаруживаются маркеры оружия или запрещенных веществ, система активирует глубокую проверку, обеспечивая баланс между стоимостью и надежностью.

01.