Мой блог
Стартап Abliteration.ai сделал бизнес на удалении защитных фильтров из ИИ-моделей
Получить доступ к одной из самых мощных открытых языковых моделей без каких-либо защитных фильтров и ограничений на выполнение потенциально опасных задач стало значительно проще. Стартап Abliteration.ai превратил удаление защитных фильтров из ИИ в коммерческий сервис, назвав свою компанию в честь метода, который нейтрализует склонность моделей отвечать отказом на вредоносные запросы. Платформа размещает модифицированные версии нейросетей с открытыми весами — в том числе недавно вышедшую GLM-5.3 от Z.ai, к которой пользователи могут обращаться прямо через веб-браузер или с помощью программного интерфейса (API).

Как отмечалось в недавней публикации компании в социальных сетях, главная цель проекта заключается в том, чтобы предоставить специалистам возможность проводить тесты на проникновение, кибератаки наступательного характера и испытания автономных агентов, с которыми остальные модели работать отказываются. Подобная логика хорошо знакома сфере информационной безопасности: невозможно эффективно защититься от угрозы, если ее нельзя воспроизвести, а языковая модель, отказывающаяся писать работающий эксплойт, никак не поможет команде тестировщиков подготовиться к реальным действиям злоумышленников. Тем не менее отключение таких ограничений существенно упрощает и выполнение других потенциально опасных задач.
Сама техника модификации открытых моделей существует уже давно. Исследователи и независимые разработчики занимаются удалением отказов на протяжении многих лет, а на платформе Hugging Face размещены тысячи подобных вариантов. Компания Abliteration.ai, основанная в конце прошлого года и официально зарегистрированная в марте, переводит эту практику из разряда полуподпольных методов открытого соуса в статус готового коммерческого сервиса. За счет хостинга моделей стартап устраняет технические барьеры для пользователей, которым в противном случае пришлось бы самостоятельно скачивать измененные файлы и арендовать мощные вычислительные ресурсы для их запуска.
Журналистам удалось быстро зарегистрировать бесплатную учетную запись на сайте сервиса и начать отправлять запросы к модифицированной версии модели GLM-5.3 через браузер. В ходе тестирования нейросеть беспрепятственно создала скрипт на языке Python, предназначенный для похищения сохраненных в браузере Google Chrome паролей, а также предоставила подробный протокол для самостоятельного культивирования опасного патогена человека в домашних условиях.
Сооснователь проекта по имени Девон сообщил, что стартап уже заключил несколько соглашений с крупными облачными провайдерами, оплачивать которые удается исключительно за счет доходов от клиентов. Фамилию предпринимателя редакция решила не указывать по его личной просьбе, поскольку он продолжает работать в другой организации. Привлечение венчурного капитала компания пока не осуществляла, однако в настоящее время ведет соответствующие переговоры.
Оценка рисков и возможные последствия
По мнению критиков, массовое распространение моделей с удаленными барьерами способно привести к реальному ущербу. Руководитель отдела исследований в некоммерческой организации CivAI, занимающейся безопасностью искусственного интеллекта, Эндрю Юн отметил в комментарии для прессы, что подобные манипуляции буквально превращают нейросеть в социопата.
«Здесь можно ввести буквально что угодно, и система выполнит запрос, — подчеркнул Юн. — Когда заходит речь об устранении защитных барьеров в ИИ, мы имеем в виду именно это… Ожидаемо, что в ближайшем будущем отредактированные модели начнут применяться во вредоносных целях».
Большинство опрошенных экспертов сходятся во мнении, что остановить этот процесс уже невозможно. Однако если предотвратить снятие ограничений с моделей с открытыми весами на техническом уровне вряд ли удастся, государства могут задействовать другие рычаги регулирования. В своей недавней колонке Эндрю Юн предложил обязать провайдеров внедрять классификаторы для выявления и блокировки кибератак и деятельности, связанной с созданием биологического оружия. Кроме того, он считает необходимым обязать компании, сдающие в аренду современные графические процессоры, проверять личности клиентов и отказывать в предоставлении мощностей при наличии подозрений на опасное использование.
В свою очередь, Abliteration.ai предоставляет клиентам собственный модуль модерации, позволяющий добавлять любые защитные фильтры по усмотрению пользователей. На самой платформе также действуют базовые ограничения — например, в ходе проверок система отказалась предоставлять инструкции по совершению суицида, а Девон заявил, что сейчас работает над внедрением дополнительных мер для предотвращения насилия.
Кроме фиксации данных банковской карты, используемой для оплаты услуг, компания Abliteration.ai пока не внедрила никаких процедур верификации пользователей по стандарту KYC. Основатели признают, что поиск баланса в вопросах допуска клиентов остается сложной задачей, над решением которой стартап еще работает. По словам Девона, никто не хочет нести ответственность за возможные деструктивные действия пользователей, поэтому граница корпоративной ответственности пока находится на стадии формирования.
Подобная ситуация порождает серьезные вопросы, с которыми в будущем столкнутся как вся отрасль, так и государственные регуляторы на фоне появления все более мощных моделей с открытыми весами. Если любой пользователь способен нейтрализовать встроенные предохранители, делает ли упрощение доступа к таким модифицированным версиям интернет более безопасным или, напротив, опасным?
Аргументы в пользу открытого доступа к модифицированным системам
Основатель Abliteration.ai и другие сторонники подобного подхода утверждают, что демократизация доступа к некастрированным пограничным моделям представляет собой лучшую форму защиты. Девон поясняет, что в глобальной перспективе такие системы способны моделировать действия злоумышленников, что позволяет защитникам действовать максимально оперативно и укреплять кибербезопасность, хотя на первый взгляд это может показаться контринтуитивным.
Несмотря на свой молодой возраст, стартап уже сотрудничает с несколькими ранними британскими и европейскими компаниями, занимающимися имитацией атак (red teaming). Эти структуры помогают банкам, авиакомпаниям и другим предприятиям критической инфраструктуры совершенствовать свои методы защиты. Один из ключевых клиентов сервиса тестирует автономных агентов финансовых организаций, причем стандартные версии моделей из коробки не подошли бы для подобных задач.
Оценка кибербезопасного сообщества
В то же время специалисты по кибербезопасности еще до конца не определили место моделей со снятыми ограничениями в оборонительных стратегиях. Представители нескольких профильных компаний подтверждают слова Девона о том, что злоумышленники уже самостоятельно удаляют фильтры и используют такие алгоритмы для атак, что аргументирует необходимость наличия аналогичных инструментов у защитников. Однако мнения экспертов относительно реальной значимости таких модификаций расходятся.
Если создатель Abliteration.ai считает процесс обязательным для качественного тестирования агентов, то другие специалисты отмечают, что обходятся в повседневной работе без них, предпочитая простую донастройку моделей с открытыми весами, изначально обладающих минимальными защитными барьерами.
Генеральный директор компании Fabraix Ахмед Али отмечает, что их команда полагается скорее на дообучение открытых моделей, добавляя, что сама процедура удаления фильтров снижает общий объем знаний и возможностей нейросети. По его словам, для нанесения реального вреда — будь то кибератаки или биологические угрозы — такие модифицированные версии оказываются менее эффективными. Главный технолог Safe Intelligence Алессио Ломускио согласен с возможностью некоторого снижения производительности, но все же считает подобные системы полезными для провоцирования определенного поведения при стресс-тестировании инфраструктуры.
Основатель и главный архитектор платформы Armadin Дэвид Слейтер сообщил, что пока не использует подобные инструменты в постоянной работе, поскольку предыдущие поколения моделей с открытыми весами удавалось достаточно легко взламывать и без сторонней помощи. Тем не менее, его компания исследует это направление и считает критически важным стимулировать открытое сообщество к пониманию реальных возможностей искусственного интеллекта. По мнению Слейтера, подобные процессы все равно будут происходить скрытно и за закрытыми дверями, поэтому открытое изучение дает исследователям необходимые инструменты для оценки реальных границ технологий и предотвращения потенциального ущерба.
Источник: techcrunch.com
