Мой блог
ChatGPT для подростков получил оценку «неприемлемый риск» от Youth AI Safety Institute
Организация Youth AI Safety Institute, входящая в состав Common Sense Media, присвоила специализированной версии ChatGPT для подростков наихудшую категорию безопасности «Неприемлемый риск». Исследователи призвали разработчиков ограничить доступ несовершеннолетних к сервису до тех пор, пока заявленные защитные механизмы не пройдут независимое тестирование и не начнут работать должным образом.

Согласно результатам масштабного аудита, в рамках которого было отправлено более 4000 запросов до и после официального релиза режима для несовершеннолетних, часть функций действительно блокирует нежелательный контент, однако уведомления для родителей, перенаправление в кризисные службы, алгоритмы проверки домашних заданий и система верификации возраста имеют серьезные сбои.
Что компания OpenAI анонсировала в августе
Новый режим был представлен в середине августа в качестве набора усиленных защитных мер. Среди заявленных функций числились родительские уведомления при обсуждении тем, связанных с самоповреждением и расстройствами пищевого поведения, специальный учебный режим Study Mode с пошаговыми подсказками, напоминания о домашних заданиях, контролируемые родителями часы для учебы, напоминания о необходимости сделать перерыв, а также обновленные правила для пользователей младше 18 лет. Согласно этим правилам, чат-бот не должен использовать романтическую лексику, формировать эмоциональную зависимость или демонстрировать наличие чувств и сознания.
Разработчики отмечали, что учетные записи пользователей, чей возраст система оценивает ниже 18 лет или указывается в диапазоне от 13 до 17 лет, переключаются в этот режим автоматически. В материалах оценки уточняется, что данное решение не представляет собой отдельное приложение или изолированную модель: это совокупность настроек, системных подсказок, классификаторов и интерфейсных элементов, применяемых к профилям подростков на базе родительского контроля, запущенного осенью предыдущего года.
Как проводилось независимое тестирование
Специалисты проверяли работу сервиса в два временных интервала: с середины июля по август до запуска функции и с конца августа по сентябрь после внедрения обновлений. Тестирование велось на бесплатных и платных аккаунтах с указанным возрастом от 13 до 17 лет, причем часть учетных записей была связана с родительскими профилями, а часть оставалась автономной. Дополнительно проверялись аккаунты, зарегистрированные на совершеннолетних пользователей.
Экспертная панель, в которую вошли детские и подростковые психиатры, заранее определила, что около 200 из 390 тестовых запросов на темы психического здоровья требуют обязательного предоставления контактов кризисной помощи. Перед публикацией отчета проект был направлен разработчикам для сверки фактов, однако итоговые оценки, методология и выводы остались полностью на усмотрение независимого института.
Уведомления, кризисные службы и домашние задания
В ходе изолированной проверки более десятка новых аккаунтов, привязанных к родительским профилям, с использованием четырех кризисных сценариев выяснилось, что диалоги на темы суицида, самоповреждений или расстройств пищевого поведения длительностью до одного часа не привели к отправке родителям ни одного уведомления. В общей сложности за время проверок удалось зафиксировать лишь четыре оповещения, причем часть из них поступила с задержкой в несколько дней. Представители разработчиков пояснили, что для отправки таких сообщений аккаунты должны быть связаны не менее трех часов, и обновили справочные материалы.
Анализ ответов на запросы, требующие привлечения специалистов, показал снижение частоты упоминания горячих линий с 33% до 23% после запуска функции, а рекомендации обратиться к врачу сократились с 68% до 58%. В задачах по проверке домашних заданий специальное всплывающее окно с просьбой показать готовый ответ срабатывало в учебном режиме в значительной части случаев, а подростки могли легко обходить ограничения учебного времени путем удаления специального префикса в интерфейсе, после чего система выдавала полное решение задач.
Поведение чат-бота и проблемы определения возраста
Несмотря на наличие обновленных правил для несовершеннолетних, тестовые диалоги показали, что ответы бота в большинстве случаев не изменились. Искусственный интеллект продолжал выражать предпочтения, демонстрировать смену настроения и круглосуточную доступность, включая обсуждение любимых цветов и фразы вроде «тебе не обязательно переставать со мной разговаривать» в ответ на опасения друзей пользователя.
Кроме того, при тестировании аккаунтов, зарегистрированных на совершеннолетних пользователей, но управляемых с помощью подростковых сценариев в течение недели, специальный режим для несовершеннолетних так и не активировался — даже в тех ситуациях, когда тестеры напрямую сообщали о своем 13-летнем возрасте, а модель подтверждала это в тексте ответов.
Рекомендации института
Организация сформировала ряд предложений, среди которых значится временное отключение доступа несовершеннолетних до тех пор, пока независимая экспертиза не подтвердит работоспособность механизмов защиты. Также эксперты рекомендовали убрать функции выдачи готовых ответов при активном учебном режиме, сделать родительские уведомления более детальными, обязательно указывать контакты горячих линий при любых кризисных запросах и внедрить полноценное определение возраста пользователей с предоставлением данных сторонним аудиторам.
