Загрузка 0
ПОДЕЛИТЬСЯ

Мой блог

Листай вниз

Cartesia выпустила потоковую TTS-модель Sonic-3.6, возглавившую рейтинги Artificial Analysis

Cartesia выпустила потоковую TTS-модель Sonic-3.6, возглавившую рейтинги Artificial Analysis

Компания Cartesia представила Sonic-3.6 — новейшую версию своей модели синтеза речи в реальном времени. Релиз состоялся примерно через три месяца после выпуска модификации Sonic-3.5. Главным изменением заявлена естественность звучания, и этот показатель можно проверить независимым образом. На текущий момент Sonic-3.6 занимает первое место сразу в двух голосовых рейтинг-листах независимой платформы Artificial Analysis: модель набрала 1283 пункта Elo в категории Provider Voice и 1123 пункта в категории Controlled Voice.

Второй результат заслуживает особого внимания, поскольку в этой таблице лидерства все модели тестируются на одних и тех же восьми эталонных голосах. Такой подход позволяет изолировать сам движок синтеза речи от общего каталога голосов. Sonic-3.6 уверенно возглавляет этот список, за ним следует Sonic-3.5, а тройку замыкает ElevenLabs Eleven v3. Архитектурно модель базируется на пространствах состояний (state space models), а не на трансформерах. Разработчики заявляют время до получения первого аудиофрагмента менее чем 90 миллисекунд. В настоящее время модель доступна в статусе бета-версии.

Практическая применимость и развертывание

Модель Sonic-3.6 доступна в рамках бета-тестирования исключительно через облачный API, а загружаемые веса для локального развертывания не предоставляются. Продукт является коммерческим и закрытым решением: открытых весов и репозитория на Hugging Face нет, его можно только арендовать.

  • Уровни подписки для компаний: предусмотрены тарифные планы для независимых разработчиков и стартапов (бесплатный и Pro за 5 долларов), для растущих компаний, управляющих контакт-центрами (Startup за 49 долларов и Scale за 299 долларов), а также для регулируемых предприятий, которым требуются соглашения об обработке данных (DPA), соглашения о бизнес-партнерстве (BAA) и поддержка единого входа (SSO).
  • Отрасли применения: финансовые услуги, здравоохранение, розничная торговля и электронная коммерция, логистика, рекрутинг, службы поддержки SaaS, потребительские приложения-компаньоны, а также локализация медиаконтента.
  • Сценарии использования: входящие агенты поддержки, исходящие квалификационные звонки, замена интерактивных голосовых меню (IVR), напоминания о встречах, симуляторы для тренировки продаж, аудио-локализация и голосовые пользовательские интерфейсы внутри продуктов.

Особенности архитектуры

В основе Sonic лежат модели пространств состояний, а не привычные трансформеры. На странице запуска разработчики отмечают, что классические компромиссы — скорость против естественности или точность против стоимости — носят архитектурный, а не неизбежный характер. На практике это выражается в задержке перед генерацией первого аудио. По данным создателей, задержка текстового синтеза (TTS) составляет менее 90 миллисекунд, а задержка распознавания речи для сопутствующей модели Ink-2 достигает 100 миллисекунд. Важно учитывать, что оба показателя отражают внутреннюю латентность моделей, заявленную производителем, а не измеренные конечные круговые задержки (round trip).

Инструменты для производственной среды

Интерфейс управления Sonic предлагает функции, оптимизированные скорее для генерации реплик диалоговых агентов, чем для обычного озвучивания текста:

  • Встроенные теги выражения. Невербальные элементы, такие как [смех], могут прописываться прямо в тексте транскрипции.
  • Мгновенное клонирование голоса по аудиофрагменту продолжительностью около 10 секунд.
  • Пользовательские словари произношения, поддерживающие фонетическую транскрипцию IPA (например, переопределение для слова subpoena через <<s|ə|ˈ|p|i|n|ə>>).
  • Параметры скорости, громкости и эмоциональной окраски, доступные напрямую через API и плагины интеграции вроде LiveKit Agents.
  • Нативная поддержка буквенно-цифровых символов. Номера заказов, телефонов и коды подтверждения воспроизводятся корректно без предварительной обработки текста.

Демонстрационные материалы демонстрируют английскую речь с естественными паузами и словами-паразитами, а также переключение кодов «хинглиш» между хинди и английским языком.

Ценовая политика

Платформа Artificial Analysis приводит к единому знаменателю стоимость Sonic-3.6 на уровне 49 долларов за 1 миллион символов. Это вдвое дешевле ElevenLabs Eleven v3, оценивающегося в 100 долларов, но выше расценок Speechify Simba 3.2, который стоит 10 долларов при показателе Elo 1240. При этом сама Cartesia продает не символы, а кредиты. Пакет Scale стоимостью 299 долларов в месяц включает около 10 667 минут синтеза речи и 15 одновременных запросов. Линейные голосовые агенты тарифицируются отдельно по ставке 0,06 доллара за минуту.

Ключевые выводы

  • Sonic-3.6 занимает лидирующую позицию в обеих голосовых категориях Artificial Analysis: 1283 Elo в Provider Voice и 1123 Elo в Controlled Voice.
  • Первое место в контролируемой категории подтверждает улучшение самого движка, а не расширение каталога доступных голосов.
  • Модель находится в статусе беты исключительно для API Cartesia; в официальной документации стабильной версией по-прежнему числится Sonic-3.5, с которой работают партнеры.
  • Решение доступно только как размещенный в облаке API без возможности скачивания весов; коммерческое использование начинается с тарифного плана Pro за 5 долларов.
  • Заявленные показатели латентности (менее 90 миллисекунд до первого аудио) предоставлены разработчиком, поэтому реальное время отклика рекомендуется замерять самостоятельно.

Источник: marktechpost.com

Оставить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *

01.
На платформе MonsterInsights