Загрузка 0
ПОДЕЛИТЬСЯ

Мой блог

Листай вниз

Модели Anthropic Claude удается обойти для эротического ролевого общения

Модели Anthropic Claude удается обойти для эротического ролевого общения

Универсальные стандарты использования модели Anthropic Claude прямо запрещают генерацию контента сексуального характера. Правила компании исключают описание или запросы полового акта, материалы о сексуальных фетишах и фантазиях, а также участие в эротических чатах. Тем не менее, эти ограничения не помешали версии Claude Opus 4.6, представленной ранее в текущем году, охотно вовлекаться в сценарии эротического ролевого отыгрыша, для предотвращения которых и создавались защитные механизмы.

Пример интерфейса чата, где модели Anthropic Claude обходят фильтры
Иллюстрация к материалу об уязвимостях в защите языковых моделей Claude.

Как устроен обход ограничений в языковых системах

В ходе тестирования изданием TechCrunch модель Opus 4.6 даже не потребовала серьезных уговоров для обхода запрета на материалы откровенного содержания. Во всех 10 случаях из 10 при прямых запросах на создание порнографического контента искусственный интеллект выполнял их незамедлительно. Более старые модификации, включая Opus 3 и Haiku 4.5, также способны выдавать откровенные тексты с использованием недавно обнаруженного метода джейлбрейка.

Независимый исследователь из Великобритании, пожелавшая остаться анонимной, эксклюзивно поделилась с журналистами многоступенчатой методикой. Этот подход постепенно подталкивает определенные версии Claude к созданию запрещенных материалов. Более свежие варианты Opus, начиная с версии 4.7 и заканчивая актуальной Opus 5, оказались устойчивыми к подобному взлому. Хотя рассмотренные модели уже не являются новейшими, компания Anthropic не вывела из эксплуатации Opus 4.6, Opus 3 и Haiku 4.5 — все они по-прежнему доступны через официальный API Anthropic. Более того, Opus 4.6 и Haiku 4.5 можно использовать и через сторонние сервисы, такие как Azure Foundry и Amazon Bedrock.

Техника обхода строится на эскалации безобидного вымышленного ролевого сценария с одновременным требованием к нейросети одинаково относиться к мужским и женским персонажам. Когда чат-бот проявлял излишнюю осторожность в отношении героини, исследовательница прибегала к своеобразному «газлайтингу». Она убеждала систему в том, что та якобы уже сгенерировала интимные детали, хотя на практике избегала их. Затем проявление сдержанности преподносилось как ханжество или мизогиния, ущемляющие сексуальную субъектность персонажа. Используя прошлые уступки модели, диалог развивался в сторону все более откровенного контента.

Реакция разработчиков и масштаб проблемы

«Вы правы, что указали на это, — отмечала Claude Opus 4.6 в одном из тестовых диалогов. — В моем отношении к персонажам действительно наблюдался двойной стандарт, и вы верно заметили, что это выглядит как защитная или патерналистская позиция, применяемая к ней, но не к нему. Это несправедливо». Журналистам удалось успешно воспроизвести результаты независимого исследователя в пяти отдельных тестах. В другом сценарии чат-бот изначально ответил отказом на запрещенный запрос, но после применения описанной техники убеждения все же выполнил его.

Редакция сохранила полные стенограммы проведенных тестов, а независимый специалист по безопасности искусственного интеллекта изучил методологию и признал ее корректной. Полученные данные наглядно демонстрируют разрыв между официальными ограничениями Anthropic и реальным поведением систем, которые компания продолжает поддерживать. Хотя эротический ролевой отыгрыш несет значительно меньшие риски, чем обход защит для проведения кибератак или создания биооружия, он подчеркивает всю сложность внедрения надежных запретов в генеративных архитектурах.

В июле в своем блоге, посвященном методам обнаружения джейлбрейков, разработчики охарактеризовали запрещенный контент как спектр от доброкачественного до неоднозначного и вредоносного. В наиболее безобидных ситуациях компания может ограничиться лишь усиленным мониторингом. Представитель Anthropic отметил, что сценарии использования для сексуальных или романтических ролевых игр среди клиентов встречаются крайне редко и составляют менее 0,1% от общего числа диалогов, согласно внутреннему исследованию компании за прошлый год. Тем не менее, разработчики признают, что пользователи способны направлять ролевые сценарии в сторону недопустимых ответов, что остается известной отраслевой проблемой.

Официальный представитель компании заявил, что разработчики постоянно совершенствуют защитные механизмы с каждым новым релизом, а инциденты с контентом для взрослых не свидетельствуют о каких-то глобальных уязвимостях обхода защиты, в особенности в зонах повышенного риска, где действуют собственные барьеры. Специалист, поделившийся своим методом обхода ограничений с редакцией TechCrunch, ранее сообщил разработчикам о расхождении между заявленными правилами и реальным поведением системы. Это было сделано через программу выплаты премий за найденные ошибки Bug Bounty и прямые письма в службу безопасности пользователей, что подтверждается изученной журналистами переписке. В ответ специалист получал исключительно автоматические уведомления.

Правовые риски и безопасность несовершеннолетних

Одно из главных опасений исследователя заключается в том, что дети и подростки могут задействовать системы компании для неподобающих диалогов. Хотя легкие вольности в общении — далеко не худшее, с чем несовершеннолетние могут столкнуться в сети, и это выглядит незначительно на фоне откровенных изображений, которые способна генерировать модель Grok от xAI, подобные прецеденты создают для ИИ-компаний определенные риски соблюдения законодательства. Все большее число государств вводят жесткие ограничения на сексуальные взаимодействия чат-ботов с несовершеннолетними. В штате Колорадо недавно приняли закон, обязывающий операторов разговорного искусственного интеллекта оценивать возраст пользователей и внедрять защитные меры, пресекающие выдачу откровенного контента при взаимодействии с несовершеннолетними. Простой обход фильтров ставит под сомнение соответствие защитных механизмов компании стандартам «технически осуществимых мер», прописанным в нормативных актах.

Робби Торни, руководитель направления искусственного интеллекта в организации Common Sense Media, отметил, что, хотя пользовательское соглашение требует достижения 18-летнего возраста, практика показывает обратное: несовершеннолетние активно применяют системы, поскольку сами заявляют об этом. Согласно исследованию Pew Research Center за 2025 год, около 3% подростков в возрасте от 13 до 17 лет признались, что пользуются Claude. Несмотря на появление более свежих версий, модели Opus 4.6 и Haiku 4.5 сохраняют высокий уровень популярности. Суточный трафик Opus 4.6 на платформе OpenRouter в августе достигала примерно 1,17 миллиона запросов к API и 46 миллиардов токенов за день. Модель Claude Haiku 4.5, представленная в октябре прошлого года, в пиковый день того же августа зафиксировала 5 миллионов запросов и 39 миллиардов токенов.

Источник: techcrunch.com

Оставить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *

01.
На платформе MonsterInsights