Аудиокнигу нейросетью делают не «одной кнопкой», а по главам: текст чистят от сносок и сокращений, подбирают голос, размечают паузы и озвучивают куски по 5000 символов. В студии озвучки Music Labs это стоит 3 кредита за 1000 символов, а час звучания получается примерно из 40 000 символов текста — то есть авторский лист превращается в час аудио за 120 кредитов.
Раньше у автора было два выхода: платить чтецу или садиться к микрофону самому. Первое — деньги и недели ожидания, второе — вечера дублей, шумящий холодильник за стеной и осипший к третьей главе голос. Нейросетевая озвучка убирает и то и другое: вы отдаёте текст, получаете ровное чтение без запинок и переделываете любой абзац столько раз, сколько нужно. Дальше — как это делается по шагам, сколько стоит книга целиком и где начинающие спотыкаются.
Вот фрагмент главы, озвученный в студии одним голосом. Текст — авторский, написан для этой статьи: чужую книгу озвучивать и публиковать нельзя, об этом ниже отдельный раздел.
Фрагмент главы — голос «Гриша»
Пример из Music Labs: 842 символа текста, 80 секунд звучания, скорость 0,95×
Когда книгу стоит озвучивать нейросетью
У самостоятельной аудиокниги три пути, и выбирают между ними обычно по бюджету и срокам.
| Способ | Сколько ждать | Что получится | Когда выбирают |
|---|---|---|---|
| Профессиональный чтец | Недели, иногда месяцы | Живая актёрская игра, интонации по смыслу | Художественная проза, где голос — половина впечатления |
| Запись самому | Несколько вечеров на главу | Ваш настоящий голос, но слышны дубли, шум и усталость | Личные истории, где важна именно ваша подача |
| Озвучка нейросетью | Минуты на главу | Ровное чтение без запинок, любая правка переделывается заново | Нон-фикшн, черновая версия, большие объёмы, малый бюджет |
Нейросеть особенно хороша там, где текст ещё живой. Автор дописывает главу, слушает её в машине, слышит, что абзац провисает, правит текст и переозвучивает — с чтецом такой цикл невозможен, каждая правка стоила бы отдельной сессии в студии. По этой же причине ИИ-озвучкой часто делают «рабочую» версию: сначала книга целиком звучит машинным голосом, а к чтецу идут уже с вычитанным текстом.
Есть и обратная сторона, о ней честно: в сложной художественной прозе слушатель разницу заметит. Нейросеть ровно ведёт фразу, но не сыграет иронию, которая держится на одном взгляде между строк. Для нон-фикшна, документалистики, учебных и справочных текстов это почти не важно — там нужны разборчивость и одинаковый темп, и с этим машина справляется лучше уставшего человека.
Что можно озвучивать: права на текст
Это первый вопрос, а не последний: озвучка чужой книги без разрешения — нарушение, независимо от того, кто читал, человек или модель.
- Своя книга. Полная свобода: озвучивайте, публикуйте, продавайте.
- Общественное достояние. Исключительное право на произведение действует всю жизнь автора и 70 лет после его смерти (ст. 1281 ГК РФ), затем произведение переходит в общественное достояние и используется свободно. Здесь есть ловушка: перевод — самостоятельный объект прав (ст. 1260 ГК РФ). Роман зарубежного классика может быть в общественном достоянии, а перевод, по которому вы читаете, — под охраной ещё десятки лет.
- Чужая книга под охраной. Нужно письменное разрешение правообладателя — автора, наследников или издательства, которому переданы права. Без него аудиоверсию нельзя выкладывать даже бесплатно.
- Для себя. Воспроизведение правомерно обнародованного произведения в личных целях допускается без согласия правообладателя (ст. 1273 ГК РФ). Озвучить учебник, чтобы слушать в дороге, — можно; выложить эту запись в сеть — уже нет.
Отдельно про голос. Свой голос вы клонируете свободно. Чужой — только с согласия человека: в студии перед клонированием нужно отметить, что вы имеете право использовать этот голос и берёте ответственность на себя. Голос узнаваемого диктора или актёра — это не «просто тембр», претензии по такой записи предъявляют вполне реальные.
Шаг 1. Подготовить текст
Главная работа над аудиокнигой — не в студии, а в текстовом редакторе. Модель читает ровно то, что видит, поэтому из файла убирают всё, что предназначалось глазам, а не уху.
Что вычистить:
- номера сносок и сами сноски — «[12]» в тексте прозвучит вслух как «двенадцать» посреди фразы;
- колонтитулы, номера страниц, «продолжение на с. 45», оглавление;
- таблицы и подписи к иллюстрациям — их либо переписывают прозой, либо выбрасывают;
- разметку вроде
**и_, если текст выгружен из редактора.
Что переписать словами. Мы проверили на пробе, как студия читает типичный «книжный» набор: римские цифры и «т. е.» модель раскрывает сама — «XIX павильон» звучит как «девятнадцатый», «т. е.» как «то есть». А вот сокращения с точкой она сохраняет: «1905 г.», «1500 руб.», «20 мин.» так и остаются «г.», «руб.», «мин.». Значит, в тексте для озвучки пишем «в тысяча девятьсот пятом году», «полторы тысячи рублей», «двадцать минут».
На что смотреть отдельно: слова с подвижным ударением. «Замок» в описании крепости и «замок» на двери пишутся одинаково, а звучат по-разному, и угадывает модель не всегда. Такие места проще переписать, чем спорить с ними: «старинный замок» → «крепость», «замок заело» → «щёлкнул засов». То же с фамилиями, географией и терминами — послушайте главу целиком, прежде чем считать её готовой.
Как резать на куски. За одну генерацию студия принимает до 5000 символов. Резать нужно по смыслу, а не по счётчику: конец абзаца, конец сцены, конец подглавки. Если разрезать на середине фразы, на стыке будет слышен обрыв интонации, который потом не склеить.
Шаг 2. Выбрать голос
В галерее 43 голоса, и двадцать из них помечены категорией «Аудиокниги» — это те, чей тембр и темп держат долгое чтение. Нажмите на чип «Аудиокниги» над галереей, чтобы не листать всё подряд.

У каждой карточки есть кнопка воспроизведения — послушать голос можно бесплатно, до всякой генерации. Выбирая, держите в голове три вещи:
- 1Долгая дистанция. Голос, который нравится на десяти секундах превью, может утомлять на сороковой минуте. Слушайте превью дважды подряд — эффект усталости проявляется сразу.
- 2Соответствие жанру. Восемь голосов в каталоге — родные русские, они звучат без акцента. Есть и голоса с лёгким акцентом: они собраны в отдельную категорию «Иностранный акцент» и для русской прозы обычно не подходят, зато выручают, когда персонаж — иностранец.
- 3Один голос на всю книгу. Смена диктора между главами слышна мгновенно и читается как небрежность. Выбранный голос, скорость и громкость фиксируйте до начала работы и не меняйте до последней главы.
Для нон-фикшна берут спокойные дикторские голоса, для сказок и детских книг — тёплые и мягкие, для хоррора в каталоге есть отдельная категория с шёпотом.
Шаг 3. Озвучить главу
Дальше всё быстро. Откройте студию озвучки, нажмите на карточку голоса — он появится чипом в композере внизу экрана, — вставьте кусок текста и нажмите «Озвучить». Отправить можно с клавиатуры: Ctrl+Enter (на Mac — Cmd+Enter). Готовый файл появится на вкладке «Генерации» через минуту-две.

Стоимость видна на самой кнопке и пересчитывается по мере набора: 3 кредита за 1000 символов, минимум — 1 кредит. Если генерация не удалась, на карточке будет «Не удалось — кредиты возвращены»: списанное вернётся на баланс автоматически.
Фрагмент в начале статьи — ровно такая генерация: 842 символа текста, 80 секунд звучания на скорости 0,95×. Из этого и берётся ориентир для расчётов: около 40 000 символов текста дают примерно час аудио.
Паузы, эмоции и темп: разметка, которая слышна
Аудиокнига отличается от «прочитанного вслух текста» дыханием. Три инструмента дают его почти целиком.
Паузы. Тег <#0.5#> вставляется прямо в текст и означает паузу указанной длины в секундах. Ставьте её там, где в книге сменяется план: между описанием и репликой, перед развязкой абзаца, на переходе от сцены к сцене. В примере выше пауз пять, от 0,3 до 0,6 секунды, — именно они превращают ровное чтение в главу. Сам тег вслух не звучит, мы это проверили транскрибацией.
Эмоция и темп. Кнопка с ползунками открывает «Параметры»: «Скорость» от 0,5 до 2 (по умолчанию 1,00×), «Громкость» от 1 до 10 и «Эмоция» — «Авто», «Радость», «Грусть», «Злость», «Спокойствие» или «Нейтрально». Для книги обычно хватает «Авто» и скорости чуть ниже единицы: 0,9–0,95× заметно улучшает разборчивость на длинной дистанции. Эмоцию на всю главу ставить не стоит — «Грусть», растянутая на двадцать минут, звучит болезненно.
Звуки-теги. В текст можно вставить (sighs) — вздох, (laughs) — смех, (breath) — вдох, (chuckle) — смешок и ещё несколько. Полный список открывает кнопка «Теги», нажатие копирует тег. Приём точечный: один вздох перед признанием работает, десять на страницу превращают чтение в пародию.
Если размечать вручную не хочется, есть кнопка «Улучшить промпт» — ИИ сам расставит паузы и теги по смыслу текста. Результат стоит перечитать: автоматика иногда добавляет эмоций там, где автор задумал сухость.
Диалоги: несколько голосов в одной сцене
Там, где в книге разговаривают, одноголосое чтение проседает: рассказчик и оба героя звучат одинаково. Многоголосый режим разводит реплики по голосам — в диалоге до 6 персонажей, на выходе один трек. Текст размечается по строке на реплику в формате «Имя: текст», а имена персонажей в стоимость не входят.
Вот тот же фрагмент, что играл в начале статьи, но разложенный на трёх исполнителей: рассказчик, дед и Анна.
Тот же фрагмент по ролям — три голоса
Пример из Music Labs: многоголосый режим, 7 реплик, 37 секунд
Слышно, ради чего это делается: реплики перестают сливаться с описанием, и сцена держится сама, без пояснений «сказал он». Режим стоит 5 кредитов за 1000 символов и доступен на тарифах Pro, Max и «Попробовать все». Для книги, где диалогов много, разумный компромисс — озвучивать многоголосьем только сцены, а описательные куски оставлять одному рассказчику.
Свой голос: клон диктора
Если книга личная — мемуары, письма, история семьи — её логично прочитать своим голосом, не садясь к микрофону на неделю. Нажмите «Создать голос» над галереей: нужно 30 секунд чистой речи, записать можно прямо в браузере (минимум 12 секунд, максимум 4 минуты) или загрузить файл до 30 МБ.
Клонирование стоит 65 кредитов и доступно на тарифах Pro, Max и «Попробовать все». Готовый голос появляется в категории «Мои голоса» и дальше работает как обычный диктор — тем же тарифом 3 кредита за 1000 символов. Клон хранится 5 дней с момента последнего использования и продлевается, пока вы им озвучиваете: если книга большая, просто не делайте перерывов длиннее.
Две вещи, которые стоит знать заранее. Первая: качество клона целиком зависит от сэмпла — читайте образец так, как хотите слышать книгу, в тишине, без музыки и эха в комнате. Вторая: клон для озвучки говорит, а не поёт. Если по сюжету нужна песня, для этого есть отдельный поющий клон в студии песен — про него мы писали в разборе генерации голоса нейросетью.
Сколько стоит озвучить книгу
Считается просто: объём в символах делим на 1000 и умножаем на 3. Час звучания — примерно 40 000 символов.
| Объём текста | Символов | Кредитов | Примерно звучания |
|---|---|---|---|
| Рассказ | 20 000 | 60 | около 30 минут |
| Большая статья, глава нон-фикшна | 40 000 | 120 | около часа |
| Повесть | 150 000 | 450 | около 3,5 часа |
| Роман | 400 000 | 1 200 | около 10 часов |
Дальше кредиты берутся либо тарифом, либо пакетом. Тариф Pro — 1490 ₽ за 500 кредитов в месяц, Max — 2999 ₽ за 900; кредиты тарифа сгорают вместе с оплаченным периодом, поэтому под тариф удобно подгонять работу: месяц — примерно повесть. Кредиты пакетов не сгорают, и большой пакет выгоднее: 1000 кредитов стоят 5000 ₽, то есть 5 ₽ за кредит против 7 ₽ в самом маленьком.
Один расход легко упустить: скачивание файлов платное. Оно входит в любой платный тариф, но на бесплатном плане открывается разовой покупкой. Для аудиокниги файлы нужны обязательно — их придётся собирать и выкладывать, — так что тариф стоит оформить до начала работы, а не после.
Многоголосые сцены считаются по 5 кредитов за 1000 символов, клон голоса — разовые 65 кредитов. Полезная мелочь: баланс на странице озвучки сразу показывает, на сколько примерно символов его хватит.
Как собрать главы в аудиокнигу
После озвучки на руках десятки файлов — по куску на генерацию. Собрать их в главы можно прямо в браузере, в редакторе: он обрезает, склеивает и выравнивает громкость без установки программ.

Порядок сборки, который экономит время:
- 1Склейте куски внутри главы в один файл. На стыках слушайте пару секунд до и после — если интонация обрывается, кусок проще переозвучить, чем чинить монтажом.
- 2Держите паузы между главами одинаковыми. Полторы-две секунды тишины на переходе — привычный для слушателя ритм.
- 3Один файл — одна глава. Так удобнее и слушателю, и площадкам: плеер запоминает место, а вы можете переозвучить одну главу, не пересобирая книгу.
- 4Проверьте книгу на телефоне в наушниках — не на колонках ноутбука. Шипящие и щелчки на стыках слышны именно там.
- 5Назовите файлы по порядку с ведущими нулями:
01-glava.mp3,02-glava.mp3. Плееры сортируют по имени, и «глава 10» без нуля встанет между первой и второй.
Скачать готовое можно в MP3 — этого формата хватает для аудиокниги; WAV нужен, только если файл пойдёт на дальнейшую обработку.
Куда выложить готовую аудиокнигу
Здесь важно понимать расстановку сил. Крупные книжные сервисы предпочитают озвучивать книги сами: у платформы самиздата Литрес аудиоверсия создаётся либо чтецом из их проекта, либо их собственным синтезом речи — загрузить туда готовый файл со стороны не получится. Поэтому самостоятельно озвученные аудиокниги чаще живут там, где принимают обычные аудиофайлы:
- подкаст-платформы — аудиокнига раскладывается по эпизодам-главам и получает RSS-ленту, а вместе с ней попадает в приложения-подкасты;
- YouTube — с обложкой-статикой или простым видео; заодно даёт поиск и рекомендации;
- свой сайт или рассылка — если книга продаётся напрямую читателям или идёт бонусом к электронной версии;
- дистрибьюторы музыки — путь, по которому аудиокнигу можно завести на стриминги; о механике загрузки мы писали в разборе, как выложить трек на Яндекс Музыку.
Что бы вы ни выбрали, укажите в описании, что озвучка синтезированная. Это не минус: слушатель, который выбирает аудиокнигу по голосу, всё равно услышит правду в первую минуту, а честная пометка снимает половину недовольных отзывов.
Частые ошибки
- Гнать книгу в студию как есть. Сноски, номера страниц и «см. рис. 3» прозвучат вслух. Полчаса чистки текста экономят день переозвучки.
- Резать текст по счётчику символов. Кусок должен заканчиваться на границе смысла, иначе на стыке слышен обрыв.
- Менять голос или скорость между главами. Книга разъезжается на глазах: зафиксируйте параметры в самом начале и запишите их себе.
- Ставить эмоцию на весь текст. Эмоция — точечный инструмент; на длинной главе она превращается в манеру.
- Не слушать результат целиком. Ударения, имена и термины проверяются только ушами — читайте вместе с текстом, отмечая места для правки.
- Забыть про права. Чужой текст, чужой перевод, чужой голос — три отдельных разрешения, а не одно.
- Планировать бюджет без скачивания. Файлы нужны обязательно, а скачивание открывается тарифом или разовой покупкой.
FAQ
Можно ли озвучить книгу нейросетью бесплатно?
Целую книгу — нет, но начать можно без вложений: после регистрации даются приветственные кредиты, и их хватает, чтобы озвучить несколько страниц, послушать голоса и понять, устраивает ли вас результат. Дальше объём считается по 3 кредита за 1000 символов, и книга неизбежно требует тарифа или пакета кредитов.
Сколько времени занимает озвучка книги?
Машинное время — минуты: кусок в 5000 символов озвучивается за одну-две минуты, и очередь идёт параллельно вашей работе. Реальный срок определяет подготовка текста и прослушивание: на повесть уходит обычно два-три вечера, из них на саму генерацию — меньше часа.
Отличит ли слушатель ИИ-озвучку от диктора?
В нон-фикшне, справочных и учебных текстах — чаще нет, если вы почистили текст и расставили паузы. В художественной прозе с тонкой игрой — да, скорее всего. Поэтому машинную озвучку берут либо там, где важнее ясность, чем актёрская подача, либо как рабочую версию перед записью с чтецом.
Можно ли озвучить книгу своим голосом?
Да, для этого есть клон голоса: 30 секунд чистой речи, 65 кредитов, тарифы Pro, Max и «Попробовать все». Дальше клон работает как обычный диктор. Клон говорит, а не поёт, и хранится 5 дней с последнего использования, продлеваясь при работе.
Что делать с иностранными именами и терминами?
Проверить на слух и переписать проблемные так, как они звучат. Модель хорошо читает обычные слова и раскрывает римские цифры, но редкие фамилии и заимствования может произнести неожиданно. Один прогон куска на 500 символов дешевле, чем переозвучка главы.
Можно ли продавать аудиокнигу, озвученную нейросетью?
Если текст ваш или в общественном достоянии — да, ограничений на способ озвучки нет. Если текст чужой, нужно разрешение правообладателя, и оно должно покрывать создание аудиоверсии. Отдельно проверьте перевод: он охраняется независимо от оригинала.
Какой голос выбрать для нон-фикшна?
Спокойный дикторский, с ровным темпом и хорошей дикцией — в галерее такие собраны в категориях «Обучение», «Подкасты» и «Новости». Скорость поставьте чуть ниже единицы: слушатель нон-фикшна часто возвращается к абзацу, и разборчивость для него важнее живости.
Обязательно ли резать текст на куски по 5000 символов?
Да, это лимит одной генерации. Но резать стоит крупнее самой книги: удобно готовить куски по 3000–4000 символов, заканчивая их на границе сцены или подглавки, — тогда остаётся запас, если при правке текст немного вырастет.





