Загрузка 0
ПОДЕЛИТЬСЯ

Мой блог

Листай вниз

Google выпустила Gemini 3.5 Transcribe: модель распознавания речи с точностью WER от 2,6%

Google выпустила Gemini 3.5 Transcribe: модель распознавания речи с точностью WER от 2,6%

Компания Google официально представила нейросетевую модель Gemini 3.5 Transcribe, созданную для распознавания речи (speech-to-text) в реальном времени и обработки готовых аудиозаписей. Вместо единого универсального инструмента разработчикам предложили два специализированных конечных узла (endpoints): gemini-3.5-transcribe для фоновой расшифровки файлов через Interactions API и gemini-3.5-transcribe-live для непрерывной потоковой трансляции через Live API.

По результатам тестов независимой лаборатории Artificial Analysis, средняя частота ошибок в словах (WER) составила 2,6% для записанных файлов и 4,0% в режиме реального времени. По сравнению с решением предыдущего поколения Google Chirp 3 время до получения окончательного текста сократилось на 70%. Модель поддерживает автоматическое определение более 85 языков и локалей, включая мгновенное переключение между несколькими языками прямо в процессе разговора (code-switching).

Особенности развертывания и варианты доступа

Разработчикам, планирующим интеграцию, важно учитывать: развернуть Gemini 3.5 Transcribe на собственных локальных серверах не получится. Нейросеть распространяется исключительно по API-модели (API-only), открытые веса (open weights) и вариант self-hosted отсутствуют. Это управляемый сервисный продукт (Managed Service).

Доступ к Gemini 3.5 Transcribe разделен на три уровня подписки:

  • Бесплатный тариф: индивидуальные разработчики и стартапы могут начать тестирование через Gemini API в консоли Google AI Studio.
  • Коммерческий тариф: средние компании переходят на платный уровень для расширения лимитов частоты запросов (rate limits). Важным преимуществом этого уровня является гарантия того, что Google не использует передаваемые аудиоданные для обучения собственных моделей.
  • Корпоративный уровень: крупные предприятия подключаются через Gemini Enterprise Agent Platform, получая выделенную пропускную способность (provisioned throughput), инструменты соблюдения нормативных требований (compliance controls) и объёмные скидки.

В настоящее время оба направления находятся в статусе публичного предварительного просмотра (public preview). Основные сферы применения модели охватывают контакт-центры, системы медицинской и юридической документации, автоматическое субтитрование, платформы транскрибации встреч и сервисы голосового управления.

Две модификации API: два совершенно разных продукта

Архитектура двух вариантов API кардинально различается, что требует разного подхода к проектированию приложений.

Live API (модель gemini-3.5-transcribe-live) обеспечивает постоянное распознавание с задержкой менее секунды. Во время речи система отправляет промежуточные гипотезы interim_input_transcription, а при завершении фразы выдает итоговый результат input_transcription. Аудиопоток передается в виде сырого 16-битного PCM-сигнала (16 кГц, моно) порциями по 100 миллисекунд. Поддерживаются автоматический, гибридный и ручной варианты определения речевой активности (VAD). Для безопасной работы мобильных и веб-клиентов используются эфемерные токены (ephemeral tokens).

Ограничения Live API: длительность одной потоковой сессии ограничена 10 минутами. Диаризация (разделение реплик по спикерам) и временные метки на уровне отдельных слов в потоке не поддерживаются.

Interactions API (модель gemini-3.5-transcribe) закрывает задачи офлайн-обработки. Здесь доступны диаризация дикторов, точные таймкоды начала и конца каждого слова, а также подключение пользовательского словаря (custom vocabulary biasing) объемом до 1000 специфических терминов (наилучшая точность достигается при списке до 100 слов). Стандартный файл может длиться до одного часа, однако при активации диаризации или временных меток слов максимальная длина аудио сокращается до 30 минут.

Режимы Verbatim и Smart: ключевой выбор при проектировании

Оба конечных узла поддерживают два режима обработки текста:

  • verbatim — дословный режим по умолчанию, который полностью сохраняет паузы, слова-паразиты, оговорки и ложные старты;
  • smart — интеллектуальный режим, удаляющий речевые дефекты, автоматически исправляющий оговорки и форматирующий текст в чистый вид.

В официальной документации Google приводит следующий пример исходной речи: «Um, so for the meeting, I think we should, uh, invite Alice and, wait no, Bob and Carol.»

Режим verbatim сохранит всю структуру и междометия без изменений. Режим smart вернет лаконичный и отредактированный вариант: «For the meeting, I think we should invite Bob and Carol.»

Главный нюанс заключается в том, что режим smart нельзя объединить с временными метками слов или диаризацией. Разработчику придется выбрать, что именно требуется получить в рамках конкретного API-запроса: легкочитаемую сводку или строгий аутентичный стенографический протокол.

Точность и производительность

Тесты компании Artificial Analysis подтверждают высокие характеристики Gemini 3.5 Transcribe. Средний показатель ошибок (WER) равен 4,0% в режиме реального времени и 2,6% при пакетной обработке файлов. На стандартном мультиязычном бенчмарке FLEURS модель продемонстрировала WER 5,50% для потока и 5,04% для файлов.

Скорость получения окончательной расшифровки выросла на 70% по сравнению с предыдущей моделью Chirp 3. Распознавание более 85 языковых локалей и автоматическое переключение между языками в пределах одной фразы работают из коробки и не требуют дополнительной настройки.

Интеграции и экосистема

Потоковый Live API уже поддерживается популярными фреймворками и сервисами разработки голосовых агентов: LiveKit, Pipecat, Agora, Fishjam, Vercel и Vision Agents. В пользовательских экосистемах модель применяется в приложении Rambler на Android, клиенте Gemini для macOS и проекте Google Antigravity. Интеграция в браузер Chrome ожидается в ближайшем будущем.

Главные выводы

  • Два разных эндпоинта: Live API оптимизирован под минимальную задержку за счет отказа от диаризации и меток слов.
  • Высокая точность: показатель WER составляет 2,6% для файлов и 4,0% для потокового аудио.
  • Выбор режима: режим Smart несовместим с временными метками и разделением дикторов.
  • Ориентировочные цены: около $0,005 за минуту пакетной расшифровки и $0,009 за минуту потокового вещания. Открытых весов нет.
  • Технические лимиты: 10 минут на стриминговую сессию, 1 час на аудиофайл (30 минут при включении диаризации).

Источник: www.marktechpost.com

Оставить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *

01.
На платформе MonsterInsights