Все модели

Gemini 3.1 Flash TTS — озвучка текста нейросетью онлайн без VPN

Gemini 3.1 Flash TTS из России: озвучка текста реалистичным голосом, диалог на два голоса, выбор акцента, стиля и темпа. Фиксированные 10 ₽ за генерацию, без VPN.

Gemini 3.1 Flash TTS — озвучка текста голосом, близким к человеческому. Не просто чтение: у каждого голоса настраиваются акцент, стиль подачи и темп, а в одной генерации могут говорить двое.

Работает без VPN и зарубежной карты, оплата в рублях — фиксированные 10 ₽ за генерацию независимо от длины текста.

Что умеет Gemini 3.1 Flash TTS

  • Озвучка текста до 2000 символов за генерацию.
  • Диалог на два голоса — до двух говорящих и двух реплик.
  • Большой выбор голосов — несколько десятков вариантов тембра.
  • Акценты: нейтральный, американский в нескольких вариантах, британский, трансатлантический, австралийский.
  • Стили подачи: с улыбкой в голосе, новостной, шёпот, эмпатичный, рекламный, намеренно бесстрастный.
  • Темп: естественный, быстрый, с растяжкой, отрывистый.
  • Описание сцены — отдельное поле, задающее общий контекст звучания.
  • Результат в WAV — несжатый звук без потерь.

Настройки голоса

Что настраивается Варианты
Тембр несколько десятков голосов на выбор
Акцент нейтральный, американский, британский, трансатлантический, австралийский
Стиль улыбка, новости, шёпот, эмпатия, реклама, бесстрастно
Темп естественный, быстрый, растянутый, отрывистый

Настраивать можно каждый голос отдельно — в диалоге это позволяет развести персонажей не только тембром, но и манерой речи.

Где доступна

Инструмент Gemini 3.1 Flash TTS
Генератор на сайте да, вкладка «Аудио»
Telegram Mini App нет
Редактор сценариев нет
Плагин для Photoshop нет

Как получить хороший результат

Фиксированная цена меняет стратегию. Раз генерация стоит одинаково при любой длине, невыгодно озвучивать по одной фразе. Собирайте текст в максимально полный блок в пределах 2000 символов.

Знаки препинания — это разметка интонации. Модель читает паузы по запятым, точкам и тире. Текст, написанный «как говорят», звучит естественнее грамматически безупречного.

Стиль сильнее тембра. Один и тот же голос в режимах «новости» и «шёпот» звучит как два разных человека. Начинайте подбор со стиля, а не с перебора голосов.

Длинный материал режьте по смыслу. Разбивая на части, делите по абзацам и смысловым блокам, а не по счётчику символов, — тогда склейка не будет слышна.

Что посмотреть дальше

Нужна песня, а не речь — Suno V6. Нужно видео, где персонаж говорит с синхронной артикуляцией — Gemini Omni 1.1 Flash. Все цены сервиса — в обзоре.

Частые вопросы

Сколько стоит озвучка?

10 ₽ за генерацию, и эта цена не меняется от длины текста. Короткая реплика и целый абзац обойдутся одинаково — поэтому озвучивать по одной фразе невыгодно.

Можно ли сделать диалог двух голосов?

Да. Поддерживается до двух говорящих и до двух реплик — например, короткий обмен фразами между персонажами с разными голосами.

Сколько текста можно озвучить за раз?

До 2000 символов суммарно по всем репликам. Длинный материал разбивается на части и склеивается при монтаже.

Можно ли управлять подачей?

Да. Для каждого голоса вы выбираете акцент, стиль и темп — от нейтрального чтения до новостной подачи, шёпота, рекламного напора или намеренно бесстрастного тона.

В каком формате приходит результат?

WAV — несжатый звук, который можно сразу класть на монтажный стол без потерь на перекодировании.

На каком языке говорит?

На языке исходного текста. Русский отрабатывается уверенно.

Запустить Gemini 3.1 Flash TTS в ETool

Без VPN и зарубежной карты: оплата в рублях, история генераций в облаке.

Открыть генератор