Google представила Gemini 3.8 Flash TTS и Gemini 3.8 Flash-Lite TTS
2026-09-23 Google представила две модели преобразования текста в речь: Gemini 3.8 Flash TTS и Gemini 3.8 Flash-Lite TTS. По данным вендора, это наиболее выразительные аудиомодели компании на момент выпуска. Flash ориентирована на более высокое качество речи, а Flash-Lite — на сценарии, где важнее стоимость и масштаб обработки. Независимых замеров качества и скорости пока нет.
Новые модели продолжают линию Gemini 3.1 Flash TTS, которая поддерживала управляемую генерацию речи более чем на 70 языках. Для предыдущей версии Google указывала цену API в USD 1 за 1M входных текстовых токенов и USD 20 за 1M выходных аудиотокенов, однако тарифы Gemini 3.8 TTS в доступных материалах пока не опубликованы. Точные идентификаторы API, лимиты, условия коммерческого использования и полный перечень языков также требуют подтверждения в документации.
Релиз представляет интерес для контакт-центров, голосовых помощников, локализации видео и автоматического создания аудиоверсий материалов. Flash-Lite потенциально выгоднее для массовой генерации, тогда как Flash следует оценивать там, где интонация важнее минимальной себестоимости. Рассчитать расходы в рублях пока нельзя: Google не раскрыла цену новых моделей, поэтому бизнесу стоит дождаться тарифа и провести собственное сравнение качества на русскоязычных сценариях.
Мы будем отслеживать появление моделей в Gemini API и Vertex AI, цены за 1M токенов, языковые ограничения и результаты независимых тестов. До их публикации перенос производственных нагрузок с Gemini 3.1 Flash TTS несёт риск непредсказуемой стоимости и качества; практический шаг — ограничить использование пилотным контуром.