Гайды

Аудиокнига нейросетью: как озвучить книгу самому

Как озвучить книгу нейросетью: подготовка текста, выбор голоса, паузы и диалоги, расчёт стоимости по объёму и сборка глав. С примерами реальной озвучки.

Редакция Music Labs15 мин чтения
Аудиокнига нейросетью: как озвучить книгу самому — иллюстрация Music Labs
Содержание

Аудиокнигу нейросетью делают не «одной кнопкой», а по главам: текст чистят от сносок и сокращений, подбирают голос, размечают паузы и озвучивают куски по 5000 символов. В студии озвучки Music Labs это стоит 3 кредита за 1000 символов, а час звучания получается примерно из 40 000 символов текста — то есть авторский лист превращается в час аудио за 120 кредитов.

Раньше у автора было два выхода: платить чтецу или садиться к микрофону самому. Первое — деньги и недели ожидания, второе — вечера дублей, шумящий холодильник за стеной и осипший к третьей главе голос. Нейросетевая озвучка убирает и то и другое: вы отдаёте текст, получаете ровное чтение без запинок и переделываете любой абзац столько раз, сколько нужно. Дальше — как это делается по шагам, сколько стоит книга целиком и где начинающие спотыкаются.

Вот фрагмент главы, озвученный в студии одним голосом. Текст — авторский, написан для этой статьи: чужую книгу озвучивать и публиковать нельзя, об этом ниже отдельный раздел.

Сделано в Music Labs

Фрагмент главы — голос «Гриша»

Пример из Music Labs: 842 символа текста, 80 секунд звучания, скорость 0,95×

Когда книгу стоит озвучивать нейросетью

У самостоятельной аудиокниги три пути, и выбирают между ними обычно по бюджету и срокам.

СпособСколько ждатьЧто получитсяКогда выбирают
Профессиональный чтецНедели, иногда месяцыЖивая актёрская игра, интонации по смыслуХудожественная проза, где голос — половина впечатления
Запись самомуНесколько вечеров на главуВаш настоящий голос, но слышны дубли, шум и усталостьЛичные истории, где важна именно ваша подача
Озвучка нейросетьюМинуты на главуРовное чтение без запинок, любая правка переделывается зановоНон-фикшн, черновая версия, большие объёмы, малый бюджет

Нейросеть особенно хороша там, где текст ещё живой. Автор дописывает главу, слушает её в машине, слышит, что абзац провисает, правит текст и переозвучивает — с чтецом такой цикл невозможен, каждая правка стоила бы отдельной сессии в студии. По этой же причине ИИ-озвучкой часто делают «рабочую» версию: сначала книга целиком звучит машинным голосом, а к чтецу идут уже с вычитанным текстом.

Есть и обратная сторона, о ней честно: в сложной художественной прозе слушатель разницу заметит. Нейросеть ровно ведёт фразу, но не сыграет иронию, которая держится на одном взгляде между строк. Для нон-фикшна, документалистики, учебных и справочных текстов это почти не важно — там нужны разборчивость и одинаковый темп, и с этим машина справляется лучше уставшего человека.

Что можно озвучивать: права на текст

Это первый вопрос, а не последний: озвучка чужой книги без разрешения — нарушение, независимо от того, кто читал, человек или модель.

  • Своя книга. Полная свобода: озвучивайте, публикуйте, продавайте.
  • Общественное достояние. Исключительное право на произведение действует всю жизнь автора и 70 лет после его смерти (ст. 1281 ГК РФ), затем произведение переходит в общественное достояние и используется свободно. Здесь есть ловушка: перевод — самостоятельный объект прав (ст. 1260 ГК РФ). Роман зарубежного классика может быть в общественном достоянии, а перевод, по которому вы читаете, — под охраной ещё десятки лет.
  • Чужая книга под охраной. Нужно письменное разрешение правообладателя — автора, наследников или издательства, которому переданы права. Без него аудиоверсию нельзя выкладывать даже бесплатно.
  • Для себя. Воспроизведение правомерно обнародованного произведения в личных целях допускается без согласия правообладателя (ст. 1273 ГК РФ). Озвучить учебник, чтобы слушать в дороге, — можно; выложить эту запись в сеть — уже нет.

Отдельно про голос. Свой голос вы клонируете свободно. Чужой — только с согласия человека: в студии перед клонированием нужно отметить, что вы имеете право использовать этот голос и берёте ответственность на себя. Голос узнаваемого диктора или актёра — это не «просто тембр», претензии по такой записи предъявляют вполне реальные.

Шаг 1. Подготовить текст

Главная работа над аудиокнигой — не в студии, а в текстовом редакторе. Модель читает ровно то, что видит, поэтому из файла убирают всё, что предназначалось глазам, а не уху.

Что вычистить:

  • номера сносок и сами сноски — «[12]» в тексте прозвучит вслух как «двенадцать» посреди фразы;
  • колонтитулы, номера страниц, «продолжение на с. 45», оглавление;
  • таблицы и подписи к иллюстрациям — их либо переписывают прозой, либо выбрасывают;
  • разметку вроде ** и _, если текст выгружен из редактора.

Что переписать словами. Мы проверили на пробе, как студия читает типичный «книжный» набор: римские цифры и «т. е.» модель раскрывает сама — «XIX павильон» звучит как «девятнадцатый», «т. е.» как «то есть». А вот сокращения с точкой она сохраняет: «1905 г.», «1500 руб.», «20 мин.» так и остаются «г.», «руб.», «мин.». Значит, в тексте для озвучки пишем «в тысяча девятьсот пятом году», «полторы тысячи рублей», «двадцать минут».

На что смотреть отдельно: слова с подвижным ударением. «Замок» в описании крепости и «замок» на двери пишутся одинаково, а звучат по-разному, и угадывает модель не всегда. Такие места проще переписать, чем спорить с ними: «старинный замок» → «крепость», «замок заело» → «щёлкнул засов». То же с фамилиями, географией и терминами — послушайте главу целиком, прежде чем считать её готовой.

Как резать на куски. За одну генерацию студия принимает до 5000 символов. Резать нужно по смыслу, а не по счётчику: конец абзаца, конец сцены, конец подглавки. Если разрезать на середине фразы, на стыке будет слышен обрыв интонации, который потом не склеить.

Шаг 2. Выбрать голос

В галерее 43 голоса, и двадцать из них помечены категорией «Аудиокниги» — это те, чей тембр и темп держат долгое чтение. Нажмите на чип «Аудиокниги» над галереей, чтобы не листать всё подряд.

Аудиокнига нейросетью: галерея голосов студии озвучки Music Labs
Галерея голосов: чипы категорий, поиск и превью прямо на карточке

У каждой карточки есть кнопка воспроизведения — послушать голос можно бесплатно, до всякой генерации. Выбирая, держите в голове три вещи:

  1. 1Долгая дистанция. Голос, который нравится на десяти секундах превью, может утомлять на сороковой минуте. Слушайте превью дважды подряд — эффект усталости проявляется сразу.
  2. 2Соответствие жанру. Восемь голосов в каталоге — родные русские, они звучат без акцента. Есть и голоса с лёгким акцентом: они собраны в отдельную категорию «Иностранный акцент» и для русской прозы обычно не подходят, зато выручают, когда персонаж — иностранец.
  3. 3Один голос на всю книгу. Смена диктора между главами слышна мгновенно и читается как небрежность. Выбранный голос, скорость и громкость фиксируйте до начала работы и не меняйте до последней главы.

Для нон-фикшна берут спокойные дикторские голоса, для сказок и детских книг — тёплые и мягкие, для хоррора в каталоге есть отдельная категория с шёпотом.

Шаг 3. Озвучить главу

Дальше всё быстро. Откройте студию озвучки, нажмите на карточку голоса — он появится чипом в композере внизу экрана, — вставьте кусок текста и нажмите «Озвучить». Отправить можно с клавиатуры: Ctrl+Enter (на Mac — Cmd+Enter). Готовый файл появится на вкладке «Генерации» через минуту-две.

Композер студии озвучки Music Labs с текстом главы и выбранным голосом
Композер: текст, параметры, теги и точная стоимость прямо на кнопке

Стоимость видна на самой кнопке и пересчитывается по мере набора: 3 кредита за 1000 символов, минимум — 1 кредит. Если генерация не удалась, на карточке будет «Не удалось — кредиты возвращены»: списанное вернётся на баланс автоматически.

Фрагмент в начале статьи — ровно такая генерация: 842 символа текста, 80 секунд звучания на скорости 0,95×. Из этого и берётся ориентир для расчётов: около 40 000 символов текста дают примерно час аудио.

Паузы, эмоции и темп: разметка, которая слышна

Аудиокнига отличается от «прочитанного вслух текста» дыханием. Три инструмента дают его почти целиком.

Паузы. Тег <#0.5#> вставляется прямо в текст и означает паузу указанной длины в секундах. Ставьте её там, где в книге сменяется план: между описанием и репликой, перед развязкой абзаца, на переходе от сцены к сцене. В примере выше пауз пять, от 0,3 до 0,6 секунды, — именно они превращают ровное чтение в главу. Сам тег вслух не звучит, мы это проверили транскрибацией.

Эмоция и темп. Кнопка с ползунками открывает «Параметры»: «Скорость» от 0,5 до 2 (по умолчанию 1,00×), «Громкость» от 1 до 10 и «Эмоция» — «Авто», «Радость», «Грусть», «Злость», «Спокойствие» или «Нейтрально». Для книги обычно хватает «Авто» и скорости чуть ниже единицы: 0,9–0,95× заметно улучшает разборчивость на длинной дистанции. Эмоцию на всю главу ставить не стоит — «Грусть», растянутая на двадцать минут, звучит болезненно.

Звуки-теги. В текст можно вставить (sighs) — вздох, (laughs) — смех, (breath) — вдох, (chuckle) — смешок и ещё несколько. Полный список открывает кнопка «Теги», нажатие копирует тег. Приём точечный: один вздох перед признанием работает, десять на страницу превращают чтение в пародию.

Если размечать вручную не хочется, есть кнопка «Улучшить промпт» — ИИ сам расставит паузы и теги по смыслу текста. Результат стоит перечитать: автоматика иногда добавляет эмоций там, где автор задумал сухость.

Диалоги: несколько голосов в одной сцене

Там, где в книге разговаривают, одноголосое чтение проседает: рассказчик и оба героя звучат одинаково. Многоголосый режим разводит реплики по голосам — в диалоге до 6 персонажей, на выходе один трек. Текст размечается по строке на реплику в формате «Имя: текст», а имена персонажей в стоимость не входят.

Вот тот же фрагмент, что играл в начале статьи, но разложенный на трёх исполнителей: рассказчик, дед и Анна.

Сделано в Music Labs

Тот же фрагмент по ролям — три голоса

Пример из Music Labs: многоголосый режим, 7 реплик, 37 секунд

Слышно, ради чего это делается: реплики перестают сливаться с описанием, и сцена держится сама, без пояснений «сказал он». Режим стоит 5 кредитов за 1000 символов и доступен на тарифах Pro, Max и «Попробовать все». Для книги, где диалогов много, разумный компромисс — озвучивать многоголосьем только сцены, а описательные куски оставлять одному рассказчику.

Свой голос: клон диктора

Если книга личная — мемуары, письма, история семьи — её логично прочитать своим голосом, не садясь к микрофону на неделю. Нажмите «Создать голос» над галереей: нужно 30 секунд чистой речи, записать можно прямо в браузере (минимум 12 секунд, максимум 4 минуты) или загрузить файл до 30 МБ.

Клонирование стоит 65 кредитов и доступно на тарифах Pro, Max и «Попробовать все». Готовый голос появляется в категории «Мои голоса» и дальше работает как обычный диктор — тем же тарифом 3 кредита за 1000 символов. Клон хранится 5 дней с момента последнего использования и продлевается, пока вы им озвучиваете: если книга большая, просто не делайте перерывов длиннее.

Две вещи, которые стоит знать заранее. Первая: качество клона целиком зависит от сэмпла — читайте образец так, как хотите слышать книгу, в тишине, без музыки и эха в комнате. Вторая: клон для озвучки говорит, а не поёт. Если по сюжету нужна песня, для этого есть отдельный поющий клон в студии песен — про него мы писали в разборе генерации голоса нейросетью.

Сколько стоит озвучить книгу

Считается просто: объём в символах делим на 1000 и умножаем на 3. Час звучания — примерно 40 000 символов.

Объём текстаСимволовКредитовПримерно звучания
Рассказ20 00060около 30 минут
Большая статья, глава нон-фикшна40 000120около часа
Повесть150 000450около 3,5 часа
Роман400 0001 200около 10 часов

Дальше кредиты берутся либо тарифом, либо пакетом. Тариф Pro — 1490 ₽ за 500 кредитов в месяц, Max — 2999 ₽ за 900; кредиты тарифа сгорают вместе с оплаченным периодом, поэтому под тариф удобно подгонять работу: месяц — примерно повесть. Кредиты пакетов не сгорают, и большой пакет выгоднее: 1000 кредитов стоят 5000 ₽, то есть 5 ₽ за кредит против 7 ₽ в самом маленьком.

Один расход легко упустить: скачивание файлов платное. Оно входит в любой платный тариф, но на бесплатном плане открывается разовой покупкой. Для аудиокниги файлы нужны обязательно — их придётся собирать и выкладывать, — так что тариф стоит оформить до начала работы, а не после.

Многоголосые сцены считаются по 5 кредитов за 1000 символов, клон голоса — разовые 65 кредитов. Полезная мелочь: баланс на странице озвучки сразу показывает, на сколько примерно символов его хватит.

Как собрать главы в аудиокнигу

После озвучки на руках десятки файлов — по куску на генерацию. Собрать их в главы можно прямо в браузере, в редакторе: он обрезает, склеивает и выравнивает громкость без установки программ.

Редактор Music Labs: склейка и обрезка аудиофайлов в браузере
Редактор аудио: обрезка, склейка и экспорт прямо в браузере

Порядок сборки, который экономит время:

  1. 1Склейте куски внутри главы в один файл. На стыках слушайте пару секунд до и после — если интонация обрывается, кусок проще переозвучить, чем чинить монтажом.
  2. 2Держите паузы между главами одинаковыми. Полторы-две секунды тишины на переходе — привычный для слушателя ритм.
  3. 3Один файл — одна глава. Так удобнее и слушателю, и площадкам: плеер запоминает место, а вы можете переозвучить одну главу, не пересобирая книгу.
  4. 4Проверьте книгу на телефоне в наушниках — не на колонках ноутбука. Шипящие и щелчки на стыках слышны именно там.
  5. 5Назовите файлы по порядку с ведущими нулями: 01-glava.mp3, 02-glava.mp3. Плееры сортируют по имени, и «глава 10» без нуля встанет между первой и второй.

Скачать готовое можно в MP3 — этого формата хватает для аудиокниги; WAV нужен, только если файл пойдёт на дальнейшую обработку.

Куда выложить готовую аудиокнигу

Здесь важно понимать расстановку сил. Крупные книжные сервисы предпочитают озвучивать книги сами: у платформы самиздата Литрес аудиоверсия создаётся либо чтецом из их проекта, либо их собственным синтезом речи — загрузить туда готовый файл со стороны не получится. Поэтому самостоятельно озвученные аудиокниги чаще живут там, где принимают обычные аудиофайлы:

  • подкаст-платформы — аудиокнига раскладывается по эпизодам-главам и получает RSS-ленту, а вместе с ней попадает в приложения-подкасты;
  • YouTube — с обложкой-статикой или простым видео; заодно даёт поиск и рекомендации;
  • свой сайт или рассылка — если книга продаётся напрямую читателям или идёт бонусом к электронной версии;
  • дистрибьюторы музыки — путь, по которому аудиокнигу можно завести на стриминги; о механике загрузки мы писали в разборе, как выложить трек на Яндекс Музыку.

Что бы вы ни выбрали, укажите в описании, что озвучка синтезированная. Это не минус: слушатель, который выбирает аудиокнигу по голосу, всё равно услышит правду в первую минуту, а честная пометка снимает половину недовольных отзывов.

Частые ошибки

  • Гнать книгу в студию как есть. Сноски, номера страниц и «см. рис. 3» прозвучат вслух. Полчаса чистки текста экономят день переозвучки.
  • Резать текст по счётчику символов. Кусок должен заканчиваться на границе смысла, иначе на стыке слышен обрыв.
  • Менять голос или скорость между главами. Книга разъезжается на глазах: зафиксируйте параметры в самом начале и запишите их себе.
  • Ставить эмоцию на весь текст. Эмоция — точечный инструмент; на длинной главе она превращается в манеру.
  • Не слушать результат целиком. Ударения, имена и термины проверяются только ушами — читайте вместе с текстом, отмечая места для правки.
  • Забыть про права. Чужой текст, чужой перевод, чужой голос — три отдельных разрешения, а не одно.
  • Планировать бюджет без скачивания. Файлы нужны обязательно, а скачивание открывается тарифом или разовой покупкой.

FAQ

Можно ли озвучить книгу нейросетью бесплатно?

Целую книгу — нет, но начать можно без вложений: после регистрации даются приветственные кредиты, и их хватает, чтобы озвучить несколько страниц, послушать голоса и понять, устраивает ли вас результат. Дальше объём считается по 3 кредита за 1000 символов, и книга неизбежно требует тарифа или пакета кредитов.

Сколько времени занимает озвучка книги?

Машинное время — минуты: кусок в 5000 символов озвучивается за одну-две минуты, и очередь идёт параллельно вашей работе. Реальный срок определяет подготовка текста и прослушивание: на повесть уходит обычно два-три вечера, из них на саму генерацию — меньше часа.

Отличит ли слушатель ИИ-озвучку от диктора?

В нон-фикшне, справочных и учебных текстах — чаще нет, если вы почистили текст и расставили паузы. В художественной прозе с тонкой игрой — да, скорее всего. Поэтому машинную озвучку берут либо там, где важнее ясность, чем актёрская подача, либо как рабочую версию перед записью с чтецом.

Можно ли озвучить книгу своим голосом?

Да, для этого есть клон голоса: 30 секунд чистой речи, 65 кредитов, тарифы Pro, Max и «Попробовать все». Дальше клон работает как обычный диктор. Клон говорит, а не поёт, и хранится 5 дней с последнего использования, продлеваясь при работе.

Что делать с иностранными именами и терминами?

Проверить на слух и переписать проблемные так, как они звучат. Модель хорошо читает обычные слова и раскрывает римские цифры, но редкие фамилии и заимствования может произнести неожиданно. Один прогон куска на 500 символов дешевле, чем переозвучка главы.

Можно ли продавать аудиокнигу, озвученную нейросетью?

Если текст ваш или в общественном достоянии — да, ограничений на способ озвучки нет. Если текст чужой, нужно разрешение правообладателя, и оно должно покрывать создание аудиоверсии. Отдельно проверьте перевод: он охраняется независимо от оригинала.

Какой голос выбрать для нон-фикшна?

Спокойный дикторский, с ровным темпом и хорошей дикцией — в галерее такие собраны в категориях «Обучение», «Подкасты» и «Новости». Скорость поставьте чуть ниже единицы: слушатель нон-фикшна часто возвращается к абзацу, и разборчивость для него важнее живости.

Обязательно ли резать текст на куски по 5000 символов?

Да, это лимит одной генерации. Но резать стоит крупнее самой книги: удобно готовить куски по 3000–4000 символов, заканчивая их на границе сцены или подглавки, — тогда остаётся запас, если при правке текст немного вырастет.

Попробуйте сами — это быстрее, чем дочитать статью

Регистрация даёт 10 приветственных кредитов — хватит, чтобы проверить всё описанное на собственном треке.

Озвучить текст
Источники и данные статьи
  • Справка Music Labs: /help/voiceover, /help/audio-tools, /help/credits (проверено 30 июля 2026)
  • Действующие цены сервиса в кредитах, сверены с каталогом моделей
  • ГК РФ, ст. 1273 (воспроизведение в личных целях), ст. 1260 (производные произведения), ст. 1281 (срок действия исключительного права)

Читайте дальше

ИП Гилязутдинов А. Р. · ИНН 165500004740 · ОГРНИП 304165735600579 · support@musiclabs.ru

ОфертаПолитика конфиденциальности