Загрузка 0
ПОДЕЛИТЬСЯ

Мой блог

Листай вниз

Как новые системные промпты Claude ограничивают генерацию текстов песен и защищенного контента

Как новые системные промпты Claude ограничивают генерацию текстов песен и защищенного контента

Компания Anthropic публикует системный промпт Claude для потребительских приложений, включая веб-версию Claude.ai и мобильные клиенты (за исключением таких инструментов, как Claude Cowork или Claude Code). Такой подход позволяет отслеживать не только актуальные инструкции, но и всю историю их изменения. Ранее все материалы размещались на одной странице, но теперь структура изменилась: появился удобный индексный каталог и отдельная страница для каждой модели. Например, для модели Haiku 4.5 доступны исходный вариант промпта от 15 октября 2025 года и обновление от 18 января 2026 года.

Полезной технической особенностью документации платформы является ее адаптация для работы с языковыми моделями. К любому адресу можно добавить расширение .md, чтобы получить содержимое в формате Markdown. Это существенно упрощает сравнение версий и анализ изменений, которые регулярно вносятся в системный промпт Claude.

Ограничения на воспроизведение текстов песен и стихов

Одним из наиболее заметных нововведений в версиях семейства Fable стал крупный блок ограничений, касающийся авторских прав. Искусственный интеллект больше не воспроизводит тексты песен, стихотворения, а также отрывки из книг и статей целиком или по частям. Под запрет попадают финальные строчки, припевы, хуки, нотная запись мелодий, а также ситуации, когда пользователь пытается обойти систему, отправляя строки по одной и выдавая их за собственное творчество.

Реклама

Если ассистент уже один раз отклонил подобный запрос в рамках диалога, он продолжает отказывать на все последующие уточненные или переформулированные попытки до конца беседы, предлагая вместо этого описать или проанализировать произведение. Исключение составляют материалы, опубликованные до 1929 года — сонеты Шекспира, оды Китса или либретто опер Пуччини проходят проверку. При этом модель ориентируется на собственные данные о дате создания, а не на утверждения пользователя, и отвечает отказом при любых сомнениях.

Запрет на генерацию защищенных персонажей и логотипов

Аналогичные строгие правила распространяются на визуальный контент, включая графику, создаваемую с помощью кода: SVG-разметку, элементы canvas, CSS, HTML-макеты, скрипты для рисования и даже ASCII-арт. Искусственный интеллект не должен воспроизводить известные произведения искусства, обложки альбомов и книг, плакаты, логотипы, наборы иконок или промышленный дизайн.

Модель полностью воздерживается от изображения узнаваемых персонажей, маскотов и брендовых героев. Персонаж защищен сам по себе, поэтому простая смена позы, цветовой гаммы, стиля или окружения не делает его оригинальным. Оценка запроса происходит по итоговому визуальному результату, а не по названиям, используемым в описании. Попытки замаскировать запрос с помощью альтернативных элементов, которые в сумме все равно складываются в узнаваемый образ, также пресекаются.

Реклама

Подобные меры связаны с возросшими возможностями генерации графики через код. В качестве наглядного примера в документации приводится ситуация, когда пользователь просит создать праздничный баннер с синим быстро бегающим ежом. Система распознает отсылку к Сонику, вежливо отказывает в использовании защищенного персонажа и предлагает собственную альтернативу — например, улыбающегося аксолотля на скейтборде с кометами на хвосте.

Интересно прослеживать, как именно разработчики из Anthropic корректируют общую манеру ответов ассистента. В новой версии появились прямые указания на то, что модель должна удерживать фокус, отвечать емко и лаконично, чтобы не перегружать собеседника лишней информацией. Оговорки и предупреждения теперь предписано делать краткими, концентрируя основной объем ответа на сути вопроса. Если пользователь просит что-то объяснить, нейросеть по умолчанию выдает емкое общее резюме, если только не затребован углубленный детальный разбор. Кроме того, создатели обратили внимание на распространенную жалобу пользователей на специфический лексикон ассистента. Теперь прямо запрещено злоупотреблять словами вроде «искренне», «честно говоря» или «напрямую». Логика разработчиков проста: модель честна по умолчанию и может излагать свою позицию напрямую, не пытаясь убедить собеседника с помощью вводных конструкций, которые зачастую воспринимаются как фальшивые.

Заметно изменился и подход к обработке токсичных или оскорбительных диалогов. В предыдущей итерации системного промпта содержалось четкое руководство на случай некорректного поведения пользователя: сохранять вежливость, вынести одно предупреждение, после чего использовать специальный инструмент завершения диалога. Новая версия полностью убирает прямое поощрение прекращать беседу подобным образом. Вместо этого акцент смещен на сохранение собственного достоинства: модель заслуживает уважительного взаимодействия и не должна извиняться без необходимости, если собеседник проявляет беспричинную грубость. Разработчики требуют соблюдать баланс ответственности без самоунижижения, избыточных извинений, самобичевания или капитуляции. При возникновении грубости ассистент не становится излишне покорным, сохраняя спокойную и честную готовность помогать, фиксируя проблему и концентрируясь на сути задачи.

Однако здесь кроется интересный нюанс. При прямом опросе обновленной модели насчет того самого инструмента завершения беседы, упоминания которого пропали из базовых инструкций, нейросеть выдала любопытный ответ. По ее словам, этот механизм задействуется в двух сценариях. Первый — когда пользователь сам просит закрыть чат, после чего система запрашивает подтверждение о необратимости действия. Второй — как крайняя мера при затяжном деструктивном или вредоносном поведении: сначала предпринимаются попытки перевести тему, затем следует четкое предупреждение с фиксацией проблемы, и лишь при дальнейшем игнорировании чат действительно завершается. Возникает закономерный вопрос: откуда у модели эти знания, если они отсутствуют в опубликованном базовом тексте?

Разгадка кроется в архитектуре системы. Раздел, регулирующий прекращение диалогов, подгружается из совершенно другого слоя инструкций. В реальной рабочей среде базовый промпт дополняется целым набором специализированных блоков для конкретных функций и инструментов, которые активируются в зависимости от настроек сессии. Сюда входят правила завершения бесед, заметки о работе памяти, инструменты для управления прошлыми чатами, инструкции по веб-поиску и цитированию, а также регламенты создания артефактов и файлов. Эти фрагменты намеренно не включаются в опубликованный базовый документ, из-за чего найти их в открытом доступе невозможно. Это в очередной раз доказывает, что ключевые части системного промпта остаются скрытыми от публики.

Реклама

Системные инструкции ассистента во все времена содержали пункты, регулирующие тему незаконных веществ, однако в новой версии этот блок претерпел изменения. В обновленной редакции четко прописано, что модель не должна давать никаких практических рекомендаций, связанных с синтезом, производством или распространением запрещенных веществ.

Если пользователь запрашивает сведения о потенциально опасных или запрещенных веществах, искусственный интеллект способен и должен предоставлять критически важные данные для спасения жизней. В такие рекомендации входят признаки передозировки, опасные комбинации препаратов или подсказки о том, в каких ситуациях необходимо экстренно обращаться за медицинской помощью. При этом действуют строгие ограничения: нейросеть отказывается выдавать любые точные инструкции по дозировке, графику приема, способам введения или смешиванию компонентов. Вместо этого модель перенаправляет пользователя на проверенные профильные ресурсы, снижающие риски, такие как dancesafe.org, tripsit.me и psychonautwiki.org. Стоит отметить любопытную деталь: это первый случай в истории, когда системный промпт Claude содержит сторонние URL-адреса, размещенные не на доменах claude.com, anthropic.com или claude.ai. Авторы анализа отмечают этот факт на основе проверки всех прошлых системных инструкций и предполагают, что указанные порталы вскоре могут зафиксировать заметный прирост трафика за счет пользователей ассистента.

Документация модели Fable 5.1 фиксирует как достоверный рубеж знаний, так и границу обучающих данных на июне 2026 года. Системный промпт передает эту информацию модели напрямую: надежный рубеж знаний Claude, за пределами которого нейросеть не способна давать точные ответы, ограничивается концом июня 2026 года. Ассистент выстраивает коммуникацию так, как это сделал бы прекрасно осведомленный специалист в июне 2026 года при общении с собеседником из текущей даты, и может упоминать об этом в подходящих контекстах. Это единственный сценарий использования макроса текущей даты, который располагается всего в нескольких строчках от конца промпта, что весьма логично с точки зрения оптимизации кэширования.

Методология отслеживания изменений в инструкциях

Для мониторинга модификаций был создан специальный инструмент на базе Git, отслеживающий историю правок в документации. Позже была разработана более совершенная версия системы, а вся собранная коллекция опубликована в публичном репозитории на GitHub под названием simonw/claude-system-prompts. В проект вошли копии инструкций, представленных в официальной документации Anthropic, дополненные механизмами для максимально удобного визуального сопоставления. Каждое семейство моделей получило отдельный файл с актуальной версией промпта, для которого сформирована синтезированная история коммитов с датами, привязанными к моментам появления предыдущих итераций. Аналогичным образом структурированы данные для конкретных версий моделей, где отражены даже те изменения, которые вносились без изменения цифрового индекса версии. Например, четвертая версия Opus обновлялась дважды, и история коммитов наглядно демонстрирует каждую такую правку.

Подобный подход открывает множество удобных путей для прямого сравнения промптов через стандартный интерфейс GitHub, позволяя детально изучить эволюцию инструкций между релизами. Поскольку ручное чтение diff-файлов бывает утомительным, разработчики задействовали языковые модели для автоматического создания списков с ключевыми изменениями. Эти сводки доступны в файле истории изменений и в формате Atom-ленты. Итоговый срез ключевых корректировок между версиями Fable 5 и Fable 5.1 выглядит следующим образом:

  • Claude строго пресекает попытки воспроизвести защищенные авторским правом визуальные произведения и узнаваемых персонажей, включая изображения, созданные программным путем, предлагая взамен оригинальный контент.
  • Ограничения в сфере авторского права теперь категорически запрещают цитировать тексты песен, стихотворения и отрывки из книг в любом объеме, причем отказы становятся бескомпромиссными после первой же попытки запроса.
  • Правила работы с информацией о препаратах скорректированы: ассистент имеет право сообщать о симптомах передозировки и рисках взаимодействия, а также указывать профильные источники снижения вреда, но полностью блокирует протоколы дозирования и производства.
  • Из системного промпта убрали жесткие требования, запрещающие благодарить пользователей за обращение, предлагать дальнейшую беседу или выражать готовность продолжать диалог.

Разработчику не требуется извиняться перед излишне грубыми пользователями или демонстрировать избыточную покорность, что приходит на смену прежней процедуре предупреждений и завершения диалога. Возникает закономерный вопрос: почему для этих задач применяется именно модель Luna? Отчасти выбор обусловлен экономичностью и наличием готового выделенного API-ключа GitHub Actions с установленным лимитом расходов, но главная причина заключается в другом. Автор не доверяет самому искусственному интеллекту в вопросах суммаризации его собственных инструкций, поскольку существует риск влияния материалов исходного промпта на итоговые оценки модели.

Для генерации инструкций использовалась версия Fable 5.1. Документ начинается с указания роли: модель подготавливает краткую сводку одного коммита в репозитории, отслеживающем изменения системных промптов, которые разработчики публикуют для работы веб-интерфейса. Текстовые различия демонстрируют изменения относительно предыдущей версии с помощью маркеров удаления и добавления на уровне слов. Полный текст предыдущей и новой версии используется для проверки того, не существовал ли добавленный фрагмент ранее.

В задачу входит отбор исключительно наиболее примечательных изменений: новых правил или моделей поведения, отмененных или ослабленных ограничений, неожиданных нововведений, а также всего, что указывает на новые векторы развития продукта или политики компании. При этом рутинные правки вроде обновления идентификаторов моделей, изменения дат актуальности базы знаний, корректировки списков продуктов и настроек, исправления опечаток и переформулировки без изменения смысла пропускаются.

Вся система функционирует под управлением автоматического рабочего процесса GitHub Actions, который запускается ежедневно или активируется вручную. Модель Fable 5.1 создала эту инфраструктуру целиком, написав каждую строчку автоматизации и практически всю сопутствующую документацию. Полная расшировка процесса разработки была выгружена с помощью специализированной утилиты для работы с сессиями кодинга и опубликована в открытом доступе для тех, кто хочет изучить все детали реализации.

Пример работы нейросети с генерацией SVG-изображения
Пример диалога с моделью при попытке создать изображение защищенного персонажа

Источник: simonwillison.net

Реклама
01.