Gemini 3.1 Flash TTS — озвучка текста нейросетью онлайн без VPN
Gemini 3.1 Flash TTS из России: озвучка текста реалистичным голосом, диалог на два голоса, выбор акцента, стиля и темпа. Фиксированные 10 ₽ за генерацию, без VPN.
Gemini 3.1 Flash TTS — озвучка текста голосом, близким к человеческому. Не просто чтение: у каждого голоса настраиваются акцент, стиль подачи и темп, а в одной генерации могут говорить двое.
Работает без VPN и зарубежной карты, оплата в рублях — фиксированные 10 ₽ за генерацию независимо от длины текста.
Что умеет Gemini 3.1 Flash TTS
- Озвучка текста до 2000 символов за генерацию.
- Диалог на два голоса — до двух говорящих и двух реплик.
- Большой выбор голосов — несколько десятков вариантов тембра.
- Акценты: нейтральный, американский в нескольких вариантах, британский, трансатлантический, австралийский.
- Стили подачи: с улыбкой в голосе, новостной, шёпот, эмпатичный, рекламный, намеренно бесстрастный.
- Темп: естественный, быстрый, с растяжкой, отрывистый.
- Описание сцены — отдельное поле, задающее общий контекст звучания.
- Результат в WAV — несжатый звук без потерь.
Настройки голоса
| Что настраивается | Варианты |
|---|---|
| Тембр | несколько десятков голосов на выбор |
| Акцент | нейтральный, американский, британский, трансатлантический, австралийский |
| Стиль | улыбка, новости, шёпот, эмпатия, реклама, бесстрастно |
| Темп | естественный, быстрый, растянутый, отрывистый |
Настраивать можно каждый голос отдельно — в диалоге это позволяет развести персонажей не только тембром, но и манерой речи.
Где доступна
| Инструмент | Gemini 3.1 Flash TTS |
|---|---|
| Генератор на сайте | да, вкладка «Аудио» |
| Telegram Mini App | нет |
| Редактор сценариев | нет |
| Плагин для Photoshop | нет |
Как получить хороший результат
Фиксированная цена меняет стратегию. Раз генерация стоит одинаково при любой длине, невыгодно озвучивать по одной фразе. Собирайте текст в максимально полный блок в пределах 2000 символов.
Знаки препинания — это разметка интонации. Модель читает паузы по запятым, точкам и тире. Текст, написанный «как говорят», звучит естественнее грамматически безупречного.
Стиль сильнее тембра. Один и тот же голос в режимах «новости» и «шёпот» звучит как два разных человека. Начинайте подбор со стиля, а не с перебора голосов.
Длинный материал режьте по смыслу. Разбивая на части, делите по абзацам и смысловым блокам, а не по счётчику символов, — тогда склейка не будет слышна.
Что посмотреть дальше
Нужна песня, а не речь — Suno V6. Нужно видео, где персонаж говорит с синхронной артикуляцией — Gemini Omni 1.1 Flash. Все цены сервиса — в обзоре.
Частые вопросы
10 ₽ за генерацию, и эта цена не меняется от длины текста. Короткая реплика и целый абзац обойдутся одинаково — поэтому озвучивать по одной фразе невыгодно.
Да. Поддерживается до двух говорящих и до двух реплик — например, короткий обмен фразами между персонажами с разными голосами.
До 2000 символов суммарно по всем репликам. Длинный материал разбивается на части и склеивается при монтаже.
Да. Для каждого голоса вы выбираете акцент, стиль и темп — от нейтрального чтения до новостной подачи, шёпота, рекламного напора или намеренно бесстрастного тона.
WAV — несжатый звук, который можно сразу класть на монтажный стол без потерь на перекодировании.
На языке исходного текста. Русский отрабатывается уверенно.