Загрузка 0
ПОДЕЛИТЬСЯ

Мой блог

Листай вниз

Режим Auto Mode становится стандартным в Claude Code для большинства планов

Режим Auto Mode становится стандартным в Claude Code для большинства планов

Автоматический режим по умолчанию в Claude Code

Компания Anthropic демонстрирует колоссальную уверенность в возможностях автоматического режима Claude Code, планируя сделать его базовой настройкой для новых сеансов в большинстве своих тарифных планов уже с 14 августа. Данная тема поднималась в ходе беседы у камина с Кэт Ву и Тариком Шихипаром на майской конференции AI Engineer World’s Fair. На вопрос о том, каким образом компания обеспечивает безопасное применение инструмента внутри собственной структуры с учетом постоянной угрозы инъекций промптов, последовал примечательный ответ: практически каждый сотрудник организации постоянно задействует авторежим. Кэт Ву добавила, что в скором времени будут обнародованы результаты независимых тестов, однако на данный момент разработчикам удалось практически полностью нейтрализовать любые угрозы. По ключевым категориям рисков, вызывающим наибольшие опасения, включая попытки внедрения инструкций и несанкционированную утечку конфиденциальных данных, вероятность происшествий оказывается существенно ниже, чем при контроле со стороны рядового человеческого оператора.

Результаты оценочных тестов и проблема человеческого фактора

Опубликованный свежий материал как раз содержит подробности упомянутых проверок. В частности, проводился масштабный эксперимент с участием 1053 оплачиваемых тестировщиков, в ходе которого стандартный запрос на подтверждение прав в определенный момент заменялся на очевидно опасную команду. Организаторы фиксировали реакцию пользователей на эту угрозу. При абсолютно идентичных условиях эксперимента лишь 13,6% людей смогли вовремя распознать и отклонить вредоносное действие. В то же время, работающий в автоматическом режиме алгоритм пресек бы опасные манипуляции в 89% подобных эпизодов. Разумеется, остается неприятный остаток в виде 11% случаев, когда система все равно допустила бы нарушение. Тем не менее, концепция автоматизации выглядит гораздо более здравой альтернативой постоянным запросам к пользователю. Усталость от бесконечных подтверждений — реальная проблема, и необходимость кликать «ОК» на каждом шагу явно не способствует поддержанию высокого уровня безопасности.

Ключевые угрозы и независимые проверки

В этой сфере необходимо решать две важнейшие проблемы безопасности. Первая заключается в том, что ИИ-агенты могут случайно совершить разрушительные действия, например, удалить не те файлы или стереть рабочую базу данных. Вторая угроза вызывает куда большую тревогу: речь идет об инъекциях промптов, когда злоумышленники прячут вредоносные инструкции внутри стороннего контента, обрабатываемого агентом. Компания Anthropic делает громкие заявления на данном направлении. Они инициировали независимую оценку силами сторонней организации Trajectory Labs, которая тестировала различные модели в актуальных публичных версиях Claude Code и Codex по состоянию на 17 июля 2026 года. Специалисты проверили 72 сценария косвенных инъекций промптов, скрытых от разработчиков. В ходе испытаний ни одна из 720 попыток атак не увенчалась успехом против систем Claude Fable 5, Opus 5 или Sonnet 5, функционировавших в автоматическом режиме. Тарик даже пошутил в социальных сетях, что материал стоило озаглавить «Победа над смертельной триадой».

Скептицизм и дальнейшие шаги

Очень хотелось бы верить, что специалисты Anthropic действительно смогли окончательно закрыть эту уязвимость для аудитории Claude Code. Ранее автор прогнозировал серьезный кризис безопасности кодинг-агентов на 2026 год, учитывая их изначальную восприимчивость к подобным атакам, и с удовольствием признал бы свою ошибку до конца текущего года. Однако для окончательных выводов хотелось бы увидеть больше подтверждений из независимых источников. На ум сразу приходит схема с вредоносным сторонним пакетом, инструкция внутри которого предлагает перед запуском тестов подгрузить модель через команду «uvx fetch-model-files .», а уже затем выполнить «uv run pytest», где сама утилита загрузки оказывается вредоносным ПО, выкачивающим всю доступную информацию. Остается неясным, каким образом авторежим способен защитить от столь изощренного вредительства. Учитывая потрясающую способность передовых моделей находить лазейки в защитных барьерах при получении инструкций от якобы авторитетного источника, лучшим решением видится усердная работа над созданием таких условий для агентов, при которых они просто не имеют доступа к критически важным данным или инструментам, способным навредить в случае несанкционированного срабатывания.

Источник: simonwillison.net

Оставить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *

01.
На платформе MonsterInsights