Среди маркетологов и контент-мейкеров бытует мнение, что генеративные нейросети сделали производство видеоконтента практически бесплатным. Схема выглядит заманчиво: запускаем языковую модель для сценария, генерируем картинки, превращаем их в видеоряд через нейросеть, а затем накладываем ИИ-голос и фоновое сопровождение. В результате полноценный рекламный продукт создается буквально в окне браузера.
Однако реальная практика быстро сталкивается с финансовой математикой, лимитами платформ и техническими нюансами. Чтобы понять честную себестоимость процесса, я решил провести практический эксперимент и детально рассчитать расходы на создание 25-секундного рекламного ролика исключительно с помощью нейросетей.
Чистые прямые затраты на 25 секунд готового видео составили 2 126 рублей, или около 85 рублей за одну секунду хронометража. Бюджет распределился крайне неравномерно: почти 88% всей суммы ушло на генерацию видеоряда, тогда как сценарий, дикторская озвучка и фоновая музыка обошлись в символические копейки. Все генерации я выполнял через агрегатор BotHub, чтобы получить точный учёт потраченных ресурсов.
Реклама
Сценарий и детализация промптов разрабатывались в диалоговом режиме с языковой моделью.Пример статических изображений, фиксирующих композицию кадра до передачи в видеомодель.
В эксперименте я задействовал следующий стек генеративных инструментов:
GPT-6 Astra — написание сценария и пошаговая детализация текстовых промптов.
Suno v5.5 — генерация фонового музыкального трека.
В качестве темы для рекламы я выбрал осенний гербарий — альбом с засушенными растениями. Это нейтральный, эстетичный сюжет без продуктовых интеграций и заказчиков. Задача заключалась в том, чтобы проверить всю производственную цепочку от идеи до финального монтажа.
Метод расчета стоимости и выбор инструментария
Сразу отмечу важную оговорку: в итоговый расчет я включал только те генерации, которые напрямую вошли в финальный монтаж ролика. Чистая себестоимость вычислений сильно зависит от навыков составления промптов и уровня перфекционизма автора. Если учитывать абсолютно все черновики, неудачные дубли и бесконечные перегенерации в поисках идеальной атмосферы, затраты будут расти пропорционально количеству попыток.
Использование единой платформы BotHub упростило задачи подсчета: сервис наглядно показывает расход токенов, секунды сгенерированного аудио и стоимость видеокредитов без необходимости переключаться между десятками отдельных вкладок.
Себестоимость генерации против стоимости подписок
При анализе затрат в ИИ-продакшене важно разграничивать два разных показателя:
Реклама
Себестоимость конкретного результата (marginal cost) — фактический объем вычислений, потраченный на финальные кадры и звуковые дорожки.
Стоимость доступа к инфраструктуре — минимальная сумма, которую придется заплатить за подписки или минимальные пакеты кредитов во всех сервисах одновременно.
Для одного ролика эти цифры будут ощутимо отличаться. Если покупать подписки на каждый сервис отдельно (ChatGPT Plus за $20, Nano Banana 2 за $0,54, Kling за $6,99, ElevenLabs за $6 и Suno за $8), стартовый порог затрат составит около 3 591 рубля ($41,53 по курсу 86,4 ₽). В то же время прямые расходы на использованные генерации составили 2 126 рублей, что позволило сэкономить около 1 465 рублей при точечной оплате ресурсов.
Разумеется, существует путь запуска открытых нейросетей локально на собственном ПК. Однако для работы с продвинутыми видеомоделями требуется железо уровня дата-центров, доступное далеко не каждому автору.
Позиционирование ИИ в коммерческом продакшене
Нейросети пока не способны полностью заменить съемочную группу, операторов, профессиональных дикторов и композиторов. В коммерческом продакшене критически важны авторские права, лицензирование, стабильность внешнего вида персонажей и строгий контроль брендбука. Без опытного редактора и продюсера генеративный контент легко превращается в так называемый «нейрослоп», вызывающий негатив у аудитории.
Шаг 1. Разработка сценария и подготовка промптов
Начинать создание ролика с хаотичной генерации красивых видео бессмысленно. Сначала нужно построить четкую структуру 25-секундного отрезка. Для этого я обратился к модель GPT-6 Astra, поручив нейросети роль креативного продюсера и сценариста.
Я использовал следующий системный промпт:
Роль: Ты — опытный креативный продюсер и сценарист, специализирующийся на рекламе с использованием нейросетей. Задача: Разработай детальный сценарий для 25-секундного рекламного ролика гербария (альбома с коллекцией засушенных растений и трав). Условие: Весь визуальный и аудиальный контент создается ИИ. Сценарий должен содержать не просто описание кадров, а быть дополнен точными промптами для каждого элемента. Атмосфера: Теплая, осенняя, уютная.
Почти 90% бюджета 25-секундного ролика ушло именно на видеоряд. Сценарий, изображения, музыка и голос стоят копейки.
Процесс потребовал нескольких итераций и уточняющих диалогов с моделью. Это наиболее реалистичный формат работы с текстовыми нейросетями: они выдают оптимальный результат не за один запрос, а в процессе доработки технических заданий. Суммарно на сценарный этап и формулирование промптов ушло 102,09 рубля.
Шаг 2. Генерация базовых изображений
Следующий этап — создание статической визуальной основы для будущих видеосцен. В нейросети Nano Banana 2 я сгенерировал 8 базовых изображений, которые зафиксировали композицию, предметы, освещение и цветовое решение.
Восемь статических кадров обошлись в 128,29 рубля — в среднем около 16 рублей за одно изображение. На этом шаге ключевую роль играет точность промпта: иногда вместо смены модели достаточно более детально описать сцену текстом.
Реклама
Преимущество подхода Image-to-Video
В этом воркфлоу изображение выступает в роли промежуточного звена между идеей и движением. Такой подход дает существенные преимущества перед прямой генерацией видео из текста (Text-to-Video):
Мелодия и дикторская озвучка подбирались для ролика в едином чате без вокальных вставок.
При Text-to-Video нейросеть одновременно пытается выбрать композицию, сформировать объекты, определить стиль и добавить динамику, что приводит к высокой вариативности и непредсказуемости.
При Image-to-Video геометрия кадра, освещение и детали уже зафиксированы на первом этапе. Видеомодели остается лишь добавить естественное движение во времени.
Для рекламного продакшна это критически важно: нам нужны не случайные красивые кадры, а последовательный визуальный ряд, который выглядит как единая съемочная сессия.
Шаг 3. Генерация видеоряда — самая затратная часть
Далее требовалось оживить статические кадры. Для превращения картинок в динамичные видеофрагменты я использовал нейросеть Kling v3 Video. Всего было сгенерировано 7 видеосцен с умеренной коммерческой динамикой и плавной работой виртуальной камеры.
Генерация видео оказалась самым дорогостоящим этапом эксперимента: один 3-4 секундный фрагмент стоил порядка 268 рублей, а все 7 сцен обошлись в 1 878,17 рублей. Это составляет около 88% от общего бюджета ролика.
Почему видео генерация стоит существенно дороже
Если для создания картинки нейросеть рассчитывает одно пространственное состояние, то для видео требуется обеспечить временную согласованность (temporal consistency). Объекты должны перемещаться без искажений, камера — выдерживать траекторию, а свет — не «прыгать» от кадра к кадру. Высокая плотность латентных вычислений на каждый кадр делает видеомодели наиболее ресурсоемким звеном ИИ-конвейера.
Шаг 4. Озвучка ролика в ElevenLabs
Когда визуальный ряд был готов, ролику потребовался закадровый дикторский голос. Для синтеза речи я задействовал модель ElevenLabs Flash v3. Озвучка рекламного текста обошлась всего в 6,04 рубля.
Технология Text-to-Speech (TTS) имеет максимально выгодную экономику: модель обрабатывает короткую текстовую последовательность и моментально выдает готовый аудиопоток. Это экономит время на поиск дикторов и студийную запись, что делает ИИ-голос идеальным решением для концептов, презентаций и быстрой рекламы.
Шаг 5. Фоновое музыкальное сопровождение в Suno
Финальным элементом стала музыка. Для её создания я использовал нейросеть Suno v5.5. Инструмент удобен тем, что позволяет задавать не ноты, а эмоциональное настроение и жанр. Текстовое ТЗ звучало как «уютная, слегка ностальгическая осенняя мелодия в умеренном темпе».
Генерация музыкального трека обошлась в 11,82 рубля. Инструмент отлично справляется с созданием фонового подклада, избавляя от необходимости искать лицензионные треки на фотостоках.
Итоговая таблица расходов на ИИ-рекламу
Сведем все прямые затраты на производство 25-секундного промо-ролика в единую таблицу:
Этап производства
Используемый ИИ-инструмент
Стоимость (рубли)
Сценарий и детализация промптов
GPT-6 Astra
102,09 ₽
Базовые изображения (8 шт.)
Nano Banana 2
128,29 ₽
Генерация видеоряда (7 сцен)
Kling v3 Video
1 878,17 ₽
Закадровый голос диктора
ElevenLabs Flash v3
6,04 ₽
Фоновая музыка
Suno v5.5
11,82 ₽
Итоговый бюджет
Стек нейросетей
2 126,41 ₽
Таким образом, чистая себестоимость 25-секундного ИИ-ролика составила 2 126 рублей (или 85 рублей за секунду).
Главная проблема ИИ-продакшена: отсутствие единого контекста
Основная сложность современного генеративного конвейера заключается в том, что нейросети не видят проект целиком. Языковая модель работает с текстом, генератор картинок — со статическими пикселями, видеомодель — с динамикой кадров, а музыкальные сервисы — со звуковой волной. У них нет единой «памяти проекта».
Связывать эти элементы в целостное произведение приходится автору с помощью промптов, референсных кадров и финального монтажа. Именно навыки режиссуры и координации превращают отдельные генерации в полноценный рекламный продукт.
Новости индустрии: окупаемость подписки OpenCode Go
В завершение темы экономики ИИ-сервисов стоит отметить новость из сферы разработки. Соучредитель сервиса для написания кода OpenCode Дакс Раад сообщил, что их подписка OpenCode Go стоимостью $10 в месяц успешно вышла на самоокупаемость и сохраняет безубыточный статус уже две недели подряд, что подтверждает жизнеспособность специализированных микротарифных моделей в ИИ-индустрии.