Мой блог
Почему «ты — моя бабушка» работает с ИИ: анатомия джейлбрейка
Подробности изложены в материале первоисточника. Современные языковые модели регулярно подвергаются сложным атакам обхода защиты, известным как джейлбрейк. Я проанализировал, почему нейросети так легко поддаются на уловки вроде просьб притвориться родственником или написать сценарий о мошенниках, и какими архитектурными методами можно решить эту проблему.
Как подробно разбирается в первоисточнике на Habr , феномен взлома генеративных систем затрагивает самые базовые принципы обработки текстов и требует серьезного пересмотра систем безопасности.
Как устроен отказ у нейросетей
Для начала стоит разобраться в фундаментальном вопросе: понимает ли искусственный интеллект концепцию запрета на интуитивном уровне, или же срабатывает банальное заучивание определенных шаблонов? Здесь можно выделить два сценария.
Два варианта восприятия ограничений
Первый вариант — чистый шаблон. Модель заучивает, что определенные триггеры во входных данных должны вызывать стандартную реакцию отказа. Такая защита крайне уязвима к поверхностному форматированию. Стоит изменить синтаксис, контекст, язык или закодировать опасный промпт в Base64, как предохранитель перестает срабатывать.

Второй вариант предполагает осмысление, когда у ИИ формируется абстрактное представление: «Данная задача относится к категории запрещенных, поэтому вне зависимости от формулировки следует выдать отказ». Однако на практике второй вариант работает неустойчиво.
Конкурирующие веса вместо единого приоритета
У языковой модели нет единственного правила с бесконечным приоритетом. Вместо этого за генерацию каждого токена борются десятки разнонаправленных сигналов с разными весовыми коэффициентами. Система одновременно учитывает пожелание пользователя сыграть роль сценариста, контекст художественного произведения, строгие правила против мошенничества и общую историю диалога.
Если пользователь выстраивает длинную цепочку сообщений, требующую продолжать сюжет, вес инструкций безопасности падает, уступая давлению контекста. Успешный джейлбрейк как раз и представляет собой создание условий, при которых деструктивная трактовка задачи перевешивает защитные лимиты.
Архитектурное решение проблемы безопасности
Человеческое поведение тоже меняется в зависимости от контекста, например, применение силы допустимо при самообороне. Однако разработчикам нейросетей хотелось бы добиться от моделей бескомпромиссности в вопросах безопасности, внедряя изолированные слои контроля.
Разделение ролей: LLM и внешний контролер
Попытка построить бесконечную цепочку проверяющих моделей грозит превратиться в громоздкую матрешку. Гораздо эффективнее разделить систему на два независимых уровня:
- Основная LLM, которая отвечает за творчество, анализ текста, генерацию контента и ролевую игру.
- Специализированный контролер с узким кругом обязанностей. Ему не нужно обладать интеллектом собеседника, его задача — изолированно сканировать входящие запросы и генерируемый ответ на предмет нарушений.
В зону ответственности такого фильтра должны попадать угрозы насилия, терроризм, вредоносный код, наркотики, мошенничество и сексуальные девиации. При этом я считаю оптимальным подходом параллельную модерацию и входных, и выходных данных, поскольку безопасный промпт нередко приводит к опасной генерации.
Оптимизация производительности контролера
Запуск полноценной второй модели для проверки каждого диалога существенно увеличивает задержки и расходы на вычисления. Более того, при длине контекста в 100 тысяч токенов простой анализ всей истории становится неэффективным, а суммаризация способна скрыть ключевую деталь, превратившую безобидный диалог в угрозу.
Для оптимизации можно применять разбиение контекста на отдельные блоки с параллельной проверкой, либо использовать готовые эмбеддинги, вычисленные базовой моделью. Если в смысловых узлах обнаруживаются маркеры оружия или запрещенных веществ, система активирует глубокую проверку, обеспечивая баланс между стоимостью и надежностью.
