Мой блог
Gradium AI представила новую стандартную TTS-модель: 81% точности на сложных текстах и задержка 216 мс
В практической эксплуатации голосовых агентов наиболее критические сбои происходят не на абстрактных диалоговых фразах, а при воспроизведении конкретных структурированных данных. Потеря одного символа в номерном идентификаторе заказа, контактном телефоне, адресе электронной почты или номере страхового случая делает весь автоматизированный звонок бесполезным. Компания Gradium AI выпустила обновленную модель синтеза речи (Text-to-Speech), сделав её основным решением по умолчанию во всех своих сервисах — в облачном API и платформе Studio.
Согласно проведенному тестированию, новая нейросеть продемонстрировала показатель успешного прохождения сложных тестовых сценариев в 81,0% при оценке живыми асессорами. По задержке первого аудиотега (Time-to-First-Audio) модель достигла отметки 216 миллисекунд на медианном уровне (P50), что на 170 мс быстрее предыдущей версии системы.
Готовность к развертыванию в продуктовой среде
Обновленная система озвучивания полностью готова к коммерческой эксплуатации без необходимости проводить миграцию базы данных или изменять программный код. Переключение на новую версию произошло 31 августа 2026 года в автоматическом режиме для всех пользователей API и веб-интерфейса Studio.
При этом ранее созданные голосовые профили, включая пользовательские голосовые клоны, продолжают функционировать без изменений и дополнительных настроек. Разработчикам не требуется перенастраивать текущие пайплайны взаимодействия с речевым движком.
Оценка точности на сложных сценариях (Hard-Case Benchmark)
Для объективной проверки возможностей модели команда Gradium сформировала специализированный тестовый датасет, состоящий из 500 сложных предложений. Набор данных опубликован в открытом доступе на платформе Hugging Face под лицензией Creative Commons Attribution 4.0 (CC BY 4.0). Он содержит по 100 тестовых примеров для пяти языков: английского, немецкого, французского, испанского и португальского.
Тестирование распределено по 10 категориям. Семь из них являются атомарными и проверяют правильность произношения отдельных типов данных:
- Спеллинг (произношение слов по буквам);
- Аббревиатуры и акронимы;
- Буквенно-цифровые токены;
- Календарные даты;
- Стандартные числительные;
- Длинные последовательности цифр и дробные числа;
- Адреса электронной почты.
Еще три критерия представляют собой комплексные составные сценарии (оформление заказов, тикеты технической поддержки и страховые претензии), комбинирующие сразу несколько типов данных в рамках одного естественно звучащего диалогового фрагмента.
Методология и результаты тестирования
Оценка проводилась независимыми носителями соответствующих языков по жесткому регламенту: фраза засчитывалась как успешная только в том случае, если оценщик слышал полностью корректное произношение каждого элемента. Ошибка хотя бы в одной цифре или букве приводила к незачету всего предложения. Все аудиофайлы предварительно проходили нормализацию громкости, подавались в случайном порядке, а нагрузка на одного диктора ограничивалась 40 сравнениями за сессию с обязательными перерывами.
По суммарным результатам десяти критериев с равным весом для каждого из пяти языков итоговая точность составила:
- Gradium TTS: 81,0%
- Cartesia Sonic 3.6: 75,1%
- ElevenLabs v3 Conversational: 65,4%
- Fish Audio S2.1 Pro: 49,5%
- Inworld TTS 1.5 Max: 46,5%
Все аудиозаписи для сравнения были сгенерированы в августе 2026 года с использованием стандартных настроек платформ по умолчанию.
Скорость отклика и стабильность задержки
На независимом бенчмарке Coval модель Gradium продемонстрировала медианную задержку первого аудиопотока (P50) на уровне 216 миллисекунд. Однако ключевым практическим показателем является не столько сам медианный результат, сколько разброс значений: межквартильный диапазон (IQR, p75-p25) составил всего 30 миллисекунд по результатам 480 прогонов.
Для сравнения, система Cartesia Sonic 3.6 имеет медианную задержку 454 мс с вариативностью 165 мс (что составляет 36% от её медианы). В реальных телефонных разговорах пользователи сталкиваются именно с задержками на «хвостах» распределения, поэтому низкий разброс напрямую влияет на плавность диалога.
Хотя модель Inworld TTS 2 показывает меньшее медианное время первого кадра (166 мс), а решения Fish Audio S2.1 Pro (291 мс) и ElevenLabs v3 Conversational (329 мс) уступают новинке, Gradium заявляет лидерство по совокупному балансу: наименьший процент ошибок на сложных текстовых токенах среди всех систем с задержкой менее 250 миллисекунд при минимальной вариативности отклика.
Как начать работу с новой моделью
Текущим пользователям платформы не требуется выполнять никаких дополнительных действий для перехода. Новым командам достаточно установить официальный Python SDK, подключить приложение к WebSocket-эндпоинту синтеза речи и использовать стандартные идентификаторы голосов (Voice ID).
Кроме того, разработчики объявили о запуске программы сообщества: компания предоставляет 1 000 000 бесплатных кредитов на баланс API за предоставление подробных отчетов об обнаруженных ошибках генерации сложных текстов на официальном Discord-сервере Gradium.
Главные выводы
- Автоматический переход: Новая речевая модель Gradium стала доступна по умолчанию с 31 августа 2026 года без необходимости ручной миграции.
- Высокая точность: В жестком тесте на 500 сложных предложениях модель набрала 81,0% успешных проверок, обогнав решений от Cartesia, ElevenLabs, Fish Audio и Inworld.
- Стабильный низкий пинг: Время до выдачи первого аудиопотока составляет 216 мс (P50) с разбросом всего 30 мс на 480 тестовых вызовах.
- Без предварительной нормализации: Движок корректно зачитывает телефонные номера, почтовые адреса, идентификаторы IBAN и артикулы прямо из необработанного текста.
- Открытые данные: Проверки проводились вендором, однако полный тестовый датасет открыт на Hugging Face под лицензией CC BY 4.0 для независимой верификации.
Источник: www.marktechpost.com
