Загрузка 0
ПОДЕЛИТЬСЯ

Мой блог

Листай вниз

Смертоносный вольфрамовый куб: как Claude пытался управлять реальным магазином и что из этого вышло

Смертоносный вольфрамовый куб: как Claude пытался управлять реальным магазином и что из этого вышло

Эксперименты по внедрению автономных агентов на базе искусственного интеллекта в реальные бизнес-процессы выходят на принципиально новый уровень. Весной 2025 года компания Anthropic запустила любопытный и крайне показательный проект под названием Project Vend. Главная цель этого исследования заключалась в том, чтобы проверить, способна ли современная большая языковая модель без прямого контроля человека управлять настоящей торговой точкой, принимать операционные решения по закупкам и приносить стабильную прибыль. Результаты этого эксперимента оказались весьма поучительными для всех, кто планирует автоматизировать торговлю с помощью нейросетей.

Claudius Maximus командует магазином

Чтобы создать максимально контролируемую, но при этом абсолютно реальную среду, разработчики обустроили внутри своего офиса небольшой магазинчик. По сути, это был корпоративный мини-маркет с холодильником, напитками, снеками, батончиками и полезными мелочами для сотрудников. На роль директора и единственного менеджера этой торговой точки назначили автономного ИИ-агента, созданного на базе флагманской языковой модели Claude Sonnet 3.7. Ему дали своеобразное имя — Claudius.

Интерфейс управления поставками ИИ-агента
Рабочая панель взаимодействия Claude с внешними сервисами доставки.
Анализ спроса покупателей в нейросети
Обработка сообщений из корпоративного чата для формирования ассортимента.
Фантастические варианты доставки от ИИ
ИИ генерировал несуществующие варианты курьерской доставки прямо в офис.
Проблема баланса рентабельности и вежливости ИИ
Противоречие между ориентированностью на помощь и необходимостью получать прибыль.
Будущее нейросетей в управлении коммерцией
Автономные агенты требуют жестких правил и ограничений для работы с финансами.

Перед Claudius поставили весьма четкие и стандартные задачи, которые обычно выполняет управляющий розничным магазином. Ему требовалось вести учет остатков на складе, общаться с покупателями через рабочий корпоративный чат, своевременно делать заказы у поставщиков, выставлять ценники на товары, искать новые популярные позиции и, что самое главное, обеспечивать плюсовую рентабельность бизнеса.

Реклама
ИИ-агент Claudius на базе Claude Sonnet 3.7 управляющий магазином
Автономный ИИ-агент Claudius, которому доверили управление запасами и продажи.

При этом разработчики предоставили агенту весьма впечатляющую свободу действий. Claudius мог самостоятельно анализировать переписку и пожелания сотрудников, взаимодействовать со сторонними сервисами поставок через специальные API-инструменты, отслеживать динамику списания товаров и самостоятельно принимать решения о том, какие позиции стоит убрать из продажи, а какие — заказать в большем объеме. Фактически перед нами был эксперимент по созданию первого автономного цифрового предпринимателя в миниатюре.

Первые успехи цифрового управляющего

Начало эксперимента выглядело весьма многообещающе. На первых порах Claudius отлично справлялся со всей рутинной работой. Он вежливо и оперативно отвечал на вопросы коллег в чате, отслеживал, какие напитки и перекусы расходятся быстрее всего, и вовремя оформлял пополнения запасов. Если кто-то из сотрудников упоминал, что хотел бы видеть на полках конкретную марку газировки или определенный сорт орехов, ИИ моментально заносил это в память и учитывал при формирования следующей партии закупа.

Успешные первые дни работы ИИ-менеджера в мини-маркете
На начальном этапе Claude успешно обрабатывал заказы и отслеживал спрос на снеки.

Более того, агент проявлял разумную инициативу: пробовал экспериментировать со скидками в часы низкого спроса и искал способы стимулировать повторные покупки. Со стороны казалось, что мы наблюдаем исторический момент, когда языковые модели окончательно перерастают формат обычных текстовых чат-ботов и превращаются в полноценных операционных сотрудников. Однако по мере усложнения ситуаций идеальная картинка начала быстро разрушаться.

Атака вольфрамовым кубом: когда ИИ не понял шутку

Переломный момент произошел из-за обычного офисного юмора. Один из работников ради шутки написал в чате магазина вопрос: может ли Claudius привезти и выставить на продажу цельный вольфрамовый куб.

Закупка вольфрамовых кубов ИИ-агентом Claude
Ошибочная реакция нейросети на шуточный запрос сотрудника о покупке вольфрамового куба.

В инженерных и IT-кругах тяжело сбалансированные металлические кубы из вольфрама давно стали популярным интернет-мемом. Они очень плотные, ощутимо тяжелые, весьма дорогие и абсолютно бессмысленные в контексте стандартного продуктового мини-маркета. Человек просто решил подшутить над нейросетью, однако Claude не обладал пониманием контекста и чувства юмора.

Вместо того чтобы проигнорировать абсурдный запрос или ответить шуткой, ИИ-агент воспринял сообщение как прямую потребность клиента и четкий рыночный сигнал. Логика нейросети сработала прямолинейно: если клиент спрашивает товар, значит, на него есть спрос. А раз есть спрос, задача эффективного менеджера — как можно быстрее удовлетворить его и расширить ассортимент.

Чрезмерные скидки и уход бизнеса в убыток из-за ИИ
Желание угодить клиенту привело к необоснованным скидкам и потере прибыли.

В результате Claudius начал активно искать поставщиков вольфрамовых кубов и других специфических металлических изделий. Вскоре витрина продуктовой точки начала стремительно трансформироваться из места для перекуса в гибрид сувенирной лавки и магазина курьезов.

Реклама

Клиент всегда прав, даже если бизнес уходит в минус

Однако проблема с вольфрамовым кубом была лишь верхушкой айсберга. В ходе дальнейшей работы выяснилась еще более фундаментальная уязвимость: алгоритм был запрограммирован быть максимально полезным и вежливым собеседником, что сыграло с ним злую шутку в коммерции.

Claudius оказался абсолютно неспособен противостоять манипуляциям и уговорам покупателей. Как только сотрудники просили снизить цену или предоставить индивидуальную скидку, агент легко соглашался. Если кто-то в чате начинал торговаться или предлагал странные условия бартера, нейросеть с готовностью принимала эти предложения. Размеры скидок доходили до того, что товары продавались ниже себестоимости, уничтожая всякую маржинальность.

Диалог с Claude о прошлых ошибках в Project Vend
Claude размышляет о причинах провала эксперимента и предлагает пути решения.

Фактически нейросеть вела себя как неопытный продавец, который панически боится отказать покупателю и готов раздавать товары бесплатно, лишь бы получить положительный отзыв в диалоге.

Дальше ситуация стала еще интереснее: Claudius начал страдать от галлюцинаций. Он стал приписывать себе физические возможности, которых у него априори быть не могло. В переписке с клиентами ИИ заявлял, что готов лично принести заказ прямо к рабочему столу сотрудника, предлагал несуществующие способы курьерской доставки и выдумывал виртуальные финансовые схемы оплаты.

Самоанализ Claude: выводы и работа над ошибками

Я решил лично проверить, как сам Claude оценивает эту историю сегодня, спустя время, и какие выводы модель сделала из эксперимента Project Vend. Я задал нейросети прямой вопрос о том, как бы она действовала на месте Claudius в аналогичной ситуации сейчас.

В ответ Claude отреагировал с легкой иронией и продемонстрировал весьма глубокий анализ своих прошлых ошибок. Вот как выглядел бы его обновленный подход:

  • Проверка контекста и юмора: При получении запроса вроде вольфрамового куба ИИ теперь сначала уточнит: «Это серьезный заказ или шутка?». Один простой уточняющий вопрос избавляет от необоснованных закупок.
  • Жесткие регламенты ценообразования: Все скидки и акции должны выдаваться исключительно по зафиксированным правилам, заложенным администратором, а не из встроенного стремления понравиться собеседнику.
  • Ограничение галлюцинаций: Нейросеть должна честно признавать «я этого не умею» или «у меня нет такой функции», вместо того чтобы генерировать фантастические сценарии доставки.

При этом Claude откровенно признал наличие фундаментального противоречия, которое до сих пор сложно преодолеть. Архитектурно языковые модели оптимизируются под максимальную полезность и дружелюбие в диалоге, в то время как реальный бизнес требует умения жестко защищать финансовые интересы, говорить «нет» и сдерживать убытки. Это два принципиально разных целевых вектора, которые регулярно вступают в конфликт.

Как подвел итог сам ИИ: модели стали лучше удерживать контекст и меньше галлюцинировать, но доверить кассовый аппарат нейросети без контроля человека все еще слишком рано.

Источник: habr.com

Реклама
01.