Мой блог
Законно ли обучать нейросети на защищенных авторским правом книгах?

Разработчикам часто приходится обучать нейросети на книгах, научных работах и статьях из открытого доступа, чтобы создавать эффективные языковые модели вроде ChatGPT, Gemini и Claude. Большинство авторов без их ведома и согласия внесли свой вклад в создание инструментов, которые несут угрозу их доходам. На первый взгляд это выглядит незаконно, однако на практике все обстоит намного сложнее.
Как отмечает Кэти Геллис, специалист в сфере интеллектуальной собственности, авторского права и технологий, ситуация в этой правовой и технологической плоскости запутана, а эмоции участников процесса накалены. Судья Уильям Алсап вынес одно из первых подобных решений, обязав компанию Anthropic выплатить компенсацию в размере 1,5 миллиарда долларов группе писателей, чьи произведения задействовали для систем машинного обучения. С внешней стороны это могло показаться моральной победой литераторов, но судья признал сам процесс создания ИИ-моделей законным.
Штраф наложили не за обучение, а за скачивание этих книг из пиратских онлайн-библиотек. Судья провел параллель между тем, как большая языковая модель поглощает триллионы слов, и тем, как живой писатель изучает литературу, стремясь создать нечто самобытное, а не просто копировать чужие тексты. По мнению Геллис, такое решение выгоднее техногигантам. Для компании, которая к 2028 году прогнозирует годовую выручку около 200 миллиардов долларов, подобный штраф не является критическим.
Судья фактически приравнял машинное чтение к ознакомлению с защищенным материалом, а не к его копированию, что играет на руку разработчикам нейросетей. Авторское право строится на понятии копирования, а не на потреблении или опыте взаимодействия с произведением. При этом законодательство об авторском праве не обновлялось с 1976 года, из-за чего судьям приходится адаптировать нормы полувековой давности к реалиям, способным определить вектор развития всей технологической сферы.
Правовые коллизии и доктрина добросовестного использования
Участники рынка обеспокоены тем, что судебная практика выглядит противоречиво из-за пробелов в законодательстве. Продолжая обучать нейросети на книгах, компании ссылаются на концепцию добросовестного использования, определяющую, является ли применение защищенного контента достаточно трансформирующим для законного статуса. Данная доктрина позволяет использовать чужие материалы без прямого разрешения для критики, пародии, образования и других целей.
При вынесении решений суды оценивают конкретные факторы, включая цель и характер использования, объем заимствованного материала и степень влияния на рынок. Защита авторских прав всегда направлена на сохранение и развитие рынка. Судебные инстанции демонстрируют разные подходы к аргументации, но ключевым фактором успеха становится цель: если обучение проводится на чужой собственности ради прямой конкуренции с правообладателем, суды относятся к этому негативно.
Если ваши действия не создают прямой конкуренции, суды склонны находить способы признать их правомерными. Эксперт приводит в пример судебный процесс, в котором медиа- и технологический гигант Thomson Reuters подал в суд на исследовательскую компанию Ross Intelligence за копирование контента ради создания конкурирующей юридической платформы на базе искусственного интеллекта. Судья Стефанос Бибас отметил, что использование материалов со стороны Ross не является трансформитивным, так как оно не преследует дополнительной цели или иного характера по сравнению с продуктом Thomson Reuters. В том деле судья решил, что обучение на контенте Reuters для запуска новой платформы, которая станет прямым конкурентом, не подпадает под добросовестное использование.
Хотя авторы могут попытаться утверждать, что чат-боты конкурируют с ними, используя их произведения для генерации новых искусственных книг, этот аргумент пока не одержал победу в суде. Когда речь заходит о взаимосвязи между искусственным интеллектом и авторским правом, Геллис считает полезным четко разграничивать предмет обсуждения. Наше восприятие копирайта в контексте обучения моделей кардинально отличается от подхода к защите авторским правом контента, созданного нейросетями. В деле Талер против Перлматтера суд постановил, что работа, созданная искусственным интеллектом на сто процентов, не подлежит защите авторским правом. Это порождает множество новых вопросов: как окончательно доказать, было ли произведение создано с помощью алгоритмов, и если да, то какова доля участия или помощи искусственного интеллекта?
По словам Геллиса, если человек пишет роман в текстовом редакторе Microsoft Word и запускает проверку орфографии, общество вполне комфортно воспринимает мысль о том, что программа не становится владельцем этого романа. Современные технологии заставляют общество пересмотреть целый ряд вопросов, которые долгое время оставались без внимания. Большинство разработчиков систем искусственного интеллекта до сих пор участвуют в продолжающихся судебных разбирательствах по этим вопросам, а это значит, что окончательного решения проблем в ближайшее время ждать не стоит. Как отмечает Геллис, первые судебные шаги оказывают заметное влияние, но этот эффект может быть аннулирован, если другие инстанции примут иные решения. Потребуются более поздние этапы судебных разбирательств, чтобы определить, какая именно позиция восторжествует. Тем не менее, все текущие промежуточные решения формируют реальность, и для технологических компаний было бы опрометчиво игнорировать их.
Источник: techcrunch.com

