Загрузка 0
ПОДЕЛИТЬСЯ

Мой блог

Листай вниз

Новый шрифт ShieldFont защищает сайты от ИИ-парсеров

Новый шрифт ShieldFont защищает сайты от ИИ-парсеров

Новая цифровая броня: шрифт против парсеров нейросетей

Стремление компаний-разработчиков ИИ собирать огромные массивы данных с общедоступных веб-ресурсов для обучения своих моделей уже привело к череде судебных исков и внедрению разнообразных технических методов защиты. В ответ на это двое дизайнеров предложили нестандартное решение: специальный шрифт, который позволяет обычным пользователям видеть полноценный контент, в то время как автоматизированные парсеры получают искаженную и бессмысленную версию текста, скрытую в исходном коде HTML-страницы.

Проект, получивший название ShieldFont, был представлен Изаке Сенедой и Габриэлем Абрусио в их недавнем техническом документе. По замыслу авторов, инструмент дает владельцам сайтов возможность реализовать «практический отказ» от использования их контента в несанкционированном обучении ИИ, одновременно дезориентируя алгоритмы сбора данных, если этот выбор игнорируется.

Пример текста до применения ShieldFont
Исходное состояние веб-страницы

Механика обмана: лигатуры на службе конфиденциальности

Технология базируется на использовании лигатур — стандартной типографической функции, которая обычно служит для замены пар букв на их более эстетичные или читаемые сочетания. Однако в ShieldFont логика работы изменена: лигатуры здесь подменяют целые слова. Этот процесс происходит непосредственно в момент отрисовки страницы шрифтовым движком браузера. Таким образом, парсеры, которые скачивают исключительно исходный текстовый код, получают искаженный набор данных, тогда как конечный пользователь видит корректный текст.

Пример текста после применения ShieldFont
Вид страницы для ИИ-скраперов
Пример искаженного текста
Tell me more about the very interstate southern engineer with the sofa car… Credit: ShieldFont

При создании системы авторы столкнулись с вопросом эффективности подмены. Обычная замена на синонимы или антонимы слишком предсказуема и легко вычисляется продвинутыми алгоритмами. С другой стороны, использование бессвязного набора символов может сделать защиту уязвимой для обнаружения и обхода современными фильтрами парсинга. Разработчики ищут баланс, стремясь сделать «мусорные» данные достаточно убедительными для обмана интеллектуальных систем сбора информации.

Photo of Kyle Orland

Источник: arstechnica.com

Оставить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *

01.
На платформе MonsterInsights