Гайды

Многоголосая озвучка нейросетью: диалог разными голосами

Как сделать многоголосую озвучку нейросетью: диалог до 6 персонажей одним файлом. Разметка «Имя: реплика», паузы и смех тегами, подбор голосов, цена и два примера.

Редакция Music Labs11 мин чтения
Многоголосая озвучка нейросетью: несколько студийных микрофонов и сплетающиеся звуковые волны — иллюстрация Music Labs
Содержание

Многоголосая озвучка — это когда текст читает не один диктор, а несколько: у каждого персонажа свой голос, а на выходе — один аудиофайл. Раньше такую сцену собирали вручную: озвучивали реплики по одной и склеивали в монтажной программе. В студии озвучки Music Labs это один запрос: размечаете текст как сценарий, выбираете голос каждому персонажу — и меньше чем через минуту получаете готовый диалог до шести голосов.

Вот как это звучит: рекламный ролик пекарни на три голоса, шесть реплик.

Сделано в Music Labs

Рекламная сценка на три голоса

Озвучено моделью MiniMax Speech 2.8 Turbo — той же, что в студии озвучки Music Labs. Голоса Марина, Макс и диктор Борис, 6 реплик, 22 секунды

Как это работает

Нейросеть озвучивает каждую реплику отдельно — тем голосом, который вы назначили персонажу, — а потом склеивает их по порядку с паузой 0,4 секунды. Получается один MP3, в котором персонажи говорят по очереди, как в радиоспектакле, а вместе с файлом сохраняется текст сцены по ролям.

Ограничения режима:

ПараметрЗначение
Персонажей в сценеот 2 до 6
Репликот 2 до 40
Длина репликидо 2000 знаков
Длина сценыдо 5000 знаков — это примерно 8–10 минут речи
Пауза между репликами0,4 секунды; длиннее — тегом
Эмоция и скоростьодни на весь диалог
Цена5 кредитов за 1000 знаков реплик, подробнее

Голоса — те же 341, что и для обычной озвучки: мужские, женские, детские, сказочные и дикторские. Озвучка работает на модели MiniMax Speech 2.8 Turbo.

Диалог за пять минут: пошагово

  1. 1Выберите первый голос. Откройте студию озвучки и кликните по карточке голоса — он станет первым персонажем. Превью каждого голоса можно послушать бесплатно.
  2. 2Нажмите «Добавить персонажа». Появится второй слот, а в поле текста — метки обоих персонажей. Чтобы поменять голос, выделите слот и кликните по другой карточке: метка в тексте поменяется сама. Всего — до шести персонажей.
  3. 3Напишите реплики. Каждая с новой строки, в формате «Имя: текст». Имя — это имя голоса из каталога. Вот текст нашего ролика:
Марина: Макс, ты опять без завтрака?
Макс: Проспал. (sighs) Опять.
Марина: Держи круассан из «Колоска» — ещё тёплый.
Макс: Ого! Откуда такой запах?
Марина: Они пекут ночью, и к семи утра всё уже свежее.
Борис: Пекарня «Колосок». Свежий хлеб к семи утра — каждый день.
  1. 1Настройте подачу. В «Параметрах озвучки» можно выбрать эмоцию — авто, радость, грусть, злость, спокойствие, нейтрально — и скорость от 0,5 до 2. Они применяются ко всему диалогу сразу. Если не уверены, оставьте «Авто»: модель сама подберёт интонацию по смыслу каждой реплики.
  2. 2Нажмите «Озвучить». Внизу поля видна стоимость. Готовый диалог появится во вкладке генераций с пометкой «Диалог» и числом голосов — обычно меньше чем через минуту.

Правила разметки: что нужно знать

Сервис узнаёт персонажа по метке в начале строки. Отсюда несколько правил, которые экономят время:

Как написалиЧто получится
Марина: Привет!Реплика голосом Марины
марина: Привет!Тоже Марина — регистр не важен
Продавец: Привет!Строка прилипнет к предыдущей реплике: персонажа «Продавец» нет в слотах. Метка — это имя голоса, а не роль
Строка без меткиПродолжение предыдущей реплики — удобно, чтобы разбить длинный монолог на абзацы
Текст до первой меткиНе озвучится — начинайте сразу с «Имя:»
Меньше двух репликСервис попросит добавить реплики минимум для двух персонажей
Второй персонаж не добавленЭто обычная озвучка: весь текст прочитает один голос — вместе с именами из меток

Если в сценарии роли называются «Продавец» и «Покупатель», держите рядом шпаргалку «Продавец — Макс, Покупатель — Марина» и пишите в тексте имена голосов. Имена в метках не тарифицируются — платите только за текст реплик.

Паузы, вздохи и смех внутри реплики

Внутри реплики работают те же теги, что и в обычной озвучке:

  • Пауза — <#0.8#>, цифра задаёт длительность в секундах. Поставьте тег в начало реплики, если перед ней нужна пауза длиннее стандартных 0,4 секунды, — например, перед финальной фразой рассказчика.
  • Звуки — (laughs) смех, (sighs) вздох, (whistles) свист и ещё семь. Полный список открывается кнопкой «Теги» в поле текста.

Вот сказка на три голоса, где в одной реплике есть смех, а перед последней — пауза:

Сделано в Music Labs

Сказка на три голоса: рассказчица, Лиса и Кузьмич

Голоса Бабушка Люся, Лиска и Кузьмич, 5 реплик, 33 секунды. В реплике Кузьмича — тег (laughs), перед последней репликой — тег паузы <#0.8#>

Бабушка Люся: Жила-была в лесу Лиса, и была она большая хитрюга.
Лиска: Ой, Кузьмич, какая у тебя рыбка! Дай попробовать хвостик?
Кузьмич: (laughs) Знаю я твои хвостики, Лиса. Весь улов уйдёт!
Лиска: Да я только понюхать… Честное лисье!
Бабушка Люся: <#0.8#> Но Кузьмич был мужик непростой и рыбку свою не отдал.

В нашем тесте теги не прочитались словами: (laughs) прозвучал как смех, (sighs) — как вздох, а <#0.8#> дал паузу около секунды перед репликой рассказчицы. Учтите, что теги считаются знаками при подсчёте цены.

Как подобрать голоса персонажам

Главное правило — контраст. Два похожих голоса в диалоге сливаются, и слушатель теряет, кто говорит. Разводите персонажей по полу, возрасту и манере: деловой женский голос и мягкий мужской, бабушка-рассказчица и звонкая лисичка. У голосов в студии есть категории — «Реклама», «Сказки», «Игры», «Подкасты», «Обучение», «Аудиокниги», — по ним удобно искать.

Голоса, с которых можно начать (описания — из карточек в студии):

ЗадачаГолоса
Рекламный роликМарина — уверенный деловой голос, Макс — харизматичный бархатный, Борис — торжественный голос диктора для финальной фразы, Жанна — бодрый позитивный, Стас — голос стендап-комика
Сказка для детейБабушка Люся — ласковая рассказчица, Лиска — лисичка из русских сказок, Кузьмич — весёлый мужик с прибаутками, Илья — твёрдый голос богатыря, Добрыня — юный искатель приключений
Подкаст с двумя ведущимиИгнат — бархатный ночной радиоведущий, Наташа — дружелюбная старшая подруга, Лёша — свой парень без пафоса
Обучающий диалогОльга — надёжная старшая сестра, Савелий — основательный молодой помощник, Тихон — терпеливый и несуетливый
ИграТарас — боевой голос юного воина, Руслан — уверенный властный, Каролина — величественная властная, Робо — механический голос робота

Не смущайтесь происхождением голоса. В каталоге много голосов из китайской, корейской и японской библиотек — та же Бабушка Люся или Лиска, — но по-русски они говорят без акцента: в нашей сказке все три голоса как раз такие. Голоса, у которых акцент слышен, отмечены в каталоге тегом «Иностранный акцент». Перед генерацией послушайте превью: это бесплатно, а нужный голос по описанию угадывается не всегда.

Сколько стоит и где доступно

  • Цена — 5 кредитов за 1000 знаков текста реплик; счёт округляется вверх до целого кредита. Имена в метках бесплатны, теги паузы и звуков считаются знаками. Наши сцены на 219 и 257 знаков стоили по 2 кредита, сцена на максимальные 5000 знаков — 25 кредитов.
  • Где доступно — режим диалога входит в тарифы «Попробовать все», Pro и Max. На тарифе Start и на разовых пакетах кредитов его нет. Одноголосая озвучка — 3 кредита за 1000 знаков — доступна всем, у кого есть кредиты, в том числе приветственные.
  • Самый дешёвый вход — тариф «Попробовать все»: 99 ₽ на сутки и 50 кредитов, неизрасходованные сгорают вместе с доступом. Он доступен в первые 48 часов после регистрации и через сутки переходит в Pro за 1 490 ₽ в месяц, если не отключить автопродление в личном кабинете. 50 кредитов хватит на два десятка таких сцен, как наш ролик.
  • Скачать MP3 можно на любом из этих тарифов. Готовые диалоги не публикуются в общем каталоге — они видны только вам.
  • Если озвучка не удалась, кредиты возвращаются автоматически.

Где пригодится многоголосая озвучка

  • Реклама. Сценка «покупатель — продавец» и финальная фраза диктором — для радио, видео и аудиобаннеров. Двадцать секунд — это 2 кредита.
  • Сказки и аудиоспектакли. Рассказчик и герои разными голосами — так дети не теряют нить. Для длинного текста — гайд про аудиокниги нейросетью.
  • Видео и скетчи. Диалоги для роликов, обучающих видео и инструкций; как наложить готовый звук на видео, мы разбирали в статье про озвучку видео нейросетью.
  • Обучение. Диалоги для уроков, тренажёры «вопрос — ответ», ролевые сценки для тренингов продаж.
  • Подкасты. Короткие перебивки и вступления с двумя ведущими. Музыку к ним подберёт гайд про музыку для подкаста.
  • Игры. Реплики персонажей и NPC — каждому свой тембр из категории «Игры».

Что показал наш тест

Обе сцены из статьи мы озвучили той же моделью, что работает в студии: каждую реплику отдельно, с теми же параметрами, и склеили с паузой 0,4 секунды — так, как это делает режим диалога. Потом каждую реплику распознали и сверили с текстом.

  • Текст прочитан полностью. Все 11 реплик обеих сцен прозвучали без пропусков и замен слов.
  • Быстро. Одна реплика озвучивается за 2–3 секунды, вся сцена — за 12–14 секунд.
  • Теги работают. Смех и вздох прозвучали звуками, а не словами; пауза <#0.8#> дала около секунды тишины перед репликой.
  • Темп зависит от голоса. Реклама на 219 знаков звучит 22 секунды, сказка на 257 знаков — 33: рассказчица и Лиска читают неторопливо. Для хронометража закладывайте 7–10 знаков на секунду речи: 30-секундный ролик — это 210–300 знаков.

Частые ошибки

  1. 1Роль вместо имени голоса в метке. «Продавец:» сервис не узнает — пишите имя голоса из слота: «Макс:».
  2. 2Похожие голоса. Два близких тембра сливаются. Разводите персонажей по полу, возрасту и манере.
  3. 3Вступление без метки. Текст до первой метки не озвучивается. Если нужен рассказчик, сделайте его отдельным персонажем.
  4. 4Забыли добавить второго персонажа. С одним голосом студия делает обычную озвучку и читает весь текст подряд — вместе с именами из меток. Сначала «Добавить персонажа», потом реплики.
  5. 5Омографы. «За́мок» и «замо́к», «а́тлас» и «атла́с» модель может прочитать не так, как вы задумали. Перестройте фразу или замените слово.
  6. 6Ждать разных эмоций у персонажей. Эмоция задаётся одна на весь диалог. Если одному персонажу нужна грусть, а другому радость, оставьте «Авто» и передайте настроение словами и тегами вроде (sighs).
  7. 7Длинные монологи. Реплика до 2000 знаков допустима, но слушается тяжело. Дробите её на короткие фразы.

FAQ

Как сделать многоголосую озвучку нейросетью?

Откройте студию озвучки, выберите первый голос, нажмите «Добавить персонажа» и напишите реплики построчно в формате «Имя: текст», где имя — это имя голоса. Нажмите «Озвучить»: меньше чем через минуту будет один MP3 со всеми репликами. Пошагово — выше.

Сколько голосов может быть в одном диалоге?

До шести персонажей и до 40 реплик в одной сцене, общий объём — до 5000 знаков. Если сцена длиннее, разбейте её на части и озвучьте по очереди.

Можно ли сделать многоголосую озвучку бесплатно?

В Music Labs — нет: режим диалога входит в тарифы «Попробовать все», Pro и Max, а скачивание озвучки — платная функция. Самый дешёвый вход — «Попробовать все» за 99 ₽ на сутки с 50 кредитами; через сутки он переходит в Pro, если не отключить автопродление. Послушать превью всех 341 голоса можно бесплатно.

Сколько стоит озвучка диалога?

5 кредитов за 1000 знаков текста реплик с округлением вверх до целого кредита. Двадцатисекундный ролик на 219 знаков — 2 кредита, максимальная сцена на 5000 знаков — 25 кредитов. Имена персонажей не тарифицируются.

Можно ли задать каждому персонажу свою эмоцию?

Параметр эмоции один на весь диалог. Но в режиме «Авто» модель подбирает интонацию по смыслу каждой реплики, а смех, вздохи и паузы можно добавить тегами прямо в нужную реплику — (laughs), (sighs), <#0.8#>.

Как сделать паузу между репликами длиннее?

Поставьте тег паузы в начало реплики: <#1#> — это секунда тишины к стандартным 0,4 секунды между репликами.

Можно ли использовать многоголосую озвучку в рекламе и на YouTube?

Да, это частый сценарий: ролики, сценки, обучающие видео. Готовые диалоги не публикуются в общем каталоге сервиса. Условия использования озвучки — в пользовательском соглашении.

Как создан материал

Статью подготовила команда Music Labs с использованием ИИ-инструментов. Возможности и ограничения режима диалога сверены с работающей версией студии озвучки. Примеры озвучены моделью MiniMax Speech 2.8 Turbo с теми же параметрами, что в студии, и склеены с паузой 0,4 секунды, как в режиме диалога; каждая реплика распознана и сверена с текстом, паузы замерены. Цены сверены с действующими тарифами сервиса. Опубликовано: 6 октября 2026.

Попробуйте сами — это быстрее, чем дочитать статью

Регистрация даёт 10 приветственных кредитов — хватит, чтобы проверить всё описанное на собственном треке.

Озвучить текст
Источники и данные статьи
  • Собственный тест: две сцены (6 и 5 реплик, 219 и 257 знаков) озвучены моделью MiniMax Speech 2.8 Turbo — той же, что в студии озвучки Music Labs, — по одной реплике и склеены с паузой 0,4 секунды, как в режиме диалога; каждая реплика распознана и сверена с текстом, паузы замерены, 6 октября 2026
  • Справка Music Labs: /help/voiceover, /help/credits (проверено 6 октября 2026)
  • Действующие цены сервиса в кредитах, сверены с каталогом моделей

Читайте дальше

ИП Гилязутдинова Н. Н. · ИНН 165701146174 · ОГРНИП 325169000033324 · support@musiclabs.ru

ОфертаПолитика конфиденциальности