Мой блог
Как обновились правила доступа ИИ-ботов к сайтам через Cloudflare
доступ ИИ-ботов к сайтам — Недавнее обновление платформ защиты веб-ресурсов затронуло правила доступа ИИ-краулеров к сайтам. В материале рассматривается изменение доступа ИИ-ботов к сайтам после введения новых категорий трафика, а также результаты проверки поведения поисковых и обучающих алгоритмов.
Корректировки защитных механизмов показывают, что попытки ограничить сбор контента для обучения моделей нередко влияют и на поисковую индексацию. Рассмотрим подробнее специфику разделения трафика и способы проверки конфигураций безопасности. Подробнее по теме: Как я создал ИИ-сайт на 2000 страниц: опыт и ошибки.
Разделение трафика и новые категории
Инфраструктура защиты распределяет входящие запросы от систем искусственного интеллекта на три отдельные группы. Первая категория, Search, отвечает за индексирование содержимого страниц, чтобы поисковые системы и ассистенты могли отвечать на вопросы пользователей. Вторая группа, Agent, охватывает запросы, выполняемые в режиме реального времени от имени конкретного пользователя, например при работе интерактивных помощников. Третья категория, Training, предназначена для сбора информации, используемой для тренировки моделей. Подробнее по теме: Разработка платформы координации поисково-спасательных работ.
Для каждой из этих групп предусмотрены гибкие режимы работы, включая полную блокировку, ограничение на страницах с рекламными материалами или разрешение запросов. С середины сентября для вновь подключаемых проектов стал доступен специализированный режим запрета тренировок. При этом устаревшие глобальные переключатели постепенно заменяются детальной фильтрацией по категориям.
Результаты мониторинга и анализ откликов
Сторонние аналитические компании регулярно оценивают поведение веб-ресурсов после изменения параметров фильтрации. Проверки с использованием имитации различных ботов демонстрируют неоднородную динамику откликов со стороны защищенных серверов.

Поведение поисковых и обучающих алгоритмов
Статистика запросов показывает, что после внедрения новых правил доля отказов для обучающих ботов возросла, тогда как для поисковых систем и пользовательских агентов показатели изменились иначе. Часть ботов стала сталкиваться с ограничениями заметно чаще, что расходится с изначальными ожиданиями о неприкосновенности поискового трафика.
Подобные наблюдения носят предварительный характер, поскольку тестовые запросы часто используют подставные идентификаторы, а не аутентифицированные соединения реальных краулеров. Тем не менее, общая тенденция указывает на необходимость ручной ревизии параметров.
Проверка конфигураций безопасности на собственном проекте
Поскольку различные боты и поисковые роботы обрабатываются системой по индивидуальным сценариям, администраторам рекомендуется самостоятельно протестировать отклик страниц. Для этого можно использовать специализированные скрипты автоматической проверки, отправляющие запросы с различными заголовками User-Agent.
Анализ заголовков ответа позволяет определить, срабатывают ли защитные экраны и возвращает ли сервер стандартные коды состояния. Наличие защитных меток свидетельствует о том, что трафик проходит через фильтрующие узлы, однако окончательные выводы о поведении краулеров следует делать на основе детальных серверных логов. Подробнее по теме: Слепая зона EDR: как атаки через браузер обходят защиту конечных точек.
Настройка политик и ограничения robots.txt
В панели управления защитой рекомендуется явно задавать правила для каждой категории трафика. Поисковые компоненты, отвечающие за видимость ресурса в выдаче, обычно оставляют открытыми, если сайту важен поисковый трафик. Для универсальных краулеров следует аккуратно подбирать параметры, чтобы случайно не заблокировать индексацию.
Стоит учитывать, что одних только указаний в стандартных файлах директорий недостаточно. Инструменты автоматизации могут игнорировать текстовые инструкции, поэтому надежная защита обеспечивается только совместной работой конфигураций на уровне сервера и защитных сервисов.
