Если вы хотите озвучить книгу нейросетью, главная проблема начинается не с выбора голоса, а с объёма текста. Роман на несколько сотен тысяч знаков нельзя разумно обработать одним куском: рукопись приходится подготовить, разделить на части, проверить произношение, сохранить единый голос и потом собрать готовую аудиоверсию книги.
На практике самая неприятная часть — не первая генерация, а двадцатая. Где-то сноска превращается в часть повествования, имя читается с неправильным ударением, а соседние главы звучат так, будто их записывали разные дикторы. Ниже разберём весь процесс от подготовки рукописи до расчёта стоимости книги на 300 тысяч знаков.
Для самой озвучки текст можно вставить в кабинете озвучки: там выбирается голос и формат результата, а готовые файлы сохраняются в списке генераций.
Что сделать с текстом до первой генерации
Перед тем как сделать аудиокнигу из текста, приведите рукопись к виду, в котором её удобно читать вслух. Текст для печати и текст для синтеза речи — не совсем одно и то же. То, что нормально выглядит на странице, в аудио может превратиться в длинную паузу, странное ударение или бессмысленное произнесение служебного элемента.
Первым делом уберите из рабочего текста то, что слушателю не нужно слышать. Это могут быть номера страниц, колонтитулы, технические пометки редактора, повторяющиеся заголовки и элементы оформления. Сноски лучше заранее решить отдельно: если примечание должно попасть в аудиоверсию, его нужно встроить в текст понятным способом, а не оставлять внизу страницы.
Полезно также пройтись по абзацам глазами и представить, как они прозвучат. Несколько коротких абзацев подряд обычно воспринимаются естественнее, чем один огромный блок. При этом не стоит механически менять пунктуацию: сначала исправляйте очевидные места, где синтезатор действительно может ошибиться.
Отдельная подготовка нужна для чисел, сокращений и необычных обозначений. Если в рукописи встречается «2026 г.», «ООО», название с нестандартным написанием или редкое слово, проверьте результат на небольшом фрагменте до массовой генерации. Сервис не гарантирует правильное ударение в именах, аббревиатурах, редких словах и числах, поэтому такие места приходится корректировать в исходном тексте.
Не рассчитывайте и на перевод внутри озвучки. Какой текст вы дали, такой он и будет прочитан: выбор языка отвечает за произношение, а не за изменение смысла. Если книга на русском, но внутри есть французская реплика или японское имя, это стоит проверить отдельно.

Сноски, диалоги и прямая речь: как их читать
В обычной книге сноска может быть маленькой цифрой внизу страницы. Для аудио такая цифра сама по себе ничего не объясняет. Если примечание важно для слушателя, лучше превратить его в нормальную часть текста: например, вместо номера сноски использовать формулировку «Примечание автора: …» и проверить, естественно ли она звучит.
Если сноска нужна только редактору и не является частью произведения, её обычно разумнее убрать из текста для озвучки. Иначе слушатель получит неожиданный переход от сюжета к справочной информации. Особенно это заметно в художественной книге, где ритм повествования важнее визуальной структуры страницы.
С диалогами ситуация сложнее. В тексте читатель видит тире, кавычки и знает, кто говорит, потому что это подсказывает оформление страницы. В аудио эту информацию приходится передавать самим звучанием, а при необходимости использовать диалоговый режим, где реплики идут разными голосами.
Диалоговый режим стоит на 30% дороже обычной озвучки. Поэтому перед генерацией длинной сцены имеет смысл решить, действительно ли разные голоса помогают восприятию, или достаточно одного голоса с обычной интонацией.
Для большой книги лучше заранее придерживаться одного правила оформления. Например, каждую реплику оставлять отдельным абзацем, а авторские слова не отделять от неё без необходимости. Это уменьшает количество ручных исправлений, когда главы приходится перерабатывать повторно.
Есть ещё одна практическая деталь: соседние фрагменты можно учитывать при генерации. В кабинете предусмотрены поля «предыдущий текст» и «следующий текст». В них можно положить куски вокруг текущего фрагмента, чтобы интонация на границе частей не ломалась.
Имена и редкие слова: где машина спотыкается
Самый неприятный дефект озвучки — ошибка, которую замечаешь только после нескольких минут прослушивания. Особенно часто такие проблемы проявляются в именах персонажей, географических названиях, аббревиатурах, терминах и словах, которые встречаются в книге всего один-два раза.
Поэтому не стоит сначала генерировать 50 тысяч знаков, а потом слушать всё целиком. Сделайте небольшой контрольный фрагмент, где есть фамилии, числа, сокращения и самые необычные слова из главы. Если произношение вас не устраивает, исправьте именно исходный текст.
Иногда для этого достаточно изменить написание так, чтобы оно однозначнее подсказывало нужное произношение. Например, сложное имя можно записать в рабочей копии в форме, которая лучше передаёт ударение. Основной текст книги при этом сохраняется отдельно, чтобы редакторская версия не смешивалась с версией для синтеза.
Такой рабочий файл особенно полезен для длинного романа. В нём можно постепенно собрать список проблемных имён и терминов и применять одинаковое написание во всех главах. Иначе один и тот же персонаж может прозвучать по-разному в начале и конце книги.
Готовые голоса выбираются из библиотеки. Сервис не клонирует голос по образцу, поэтому рассчитывать на воспроизведение голоса конкретного человека не стоит. Бесплатные голоса тоже не являются платным голосом без оплаты: это отдельные голоса из доступной библиотеки, за которые списывается 0 ₽.

Разбивка на части и сборка в один файл
Для большой книги я бы начинал не с деления «по 10 000 знаков», а со структуры самой рукописи. Глава, подглава или логически законченная сцена удобнее для проверки, чем случайный кусок текста, оборванный посреди диалога.
После этого каждый фрагмент стоит ещё раз проверить по объёму и содержанию. В начале и конце части лучше избегать мест, где предложение или реплика обрываются. Если разделить текст приходится внутри сцены, используйте соседние фрагменты в полях «предыдущий текст» и «следующий текст».
Практичная схема выглядит так: сначала подготовить рукопись, затем сделать тест одного небольшого отрывка, после проверки голоса и произношения перейти к главам, а уже потом собрать получившиеся аудиофайлы в правильной последовательности. Это проще контролировать, чем пытаться найти одну ошибку в многочасовой записи.
В кабинете готовые файлы остаются в списке генераций. Их можно скачать позже, а список можно фильтровать по голосу и состоянию. Для большой книги это существенно удобнее, чем пытаться держать в голове, какая версия какой главы уже готова.
Формат результата тоже лучше выбрать до массовой обработки. Для MP3 доступны 44,1 кГц с битрейтом 128 и 192 кбит/с. WAV/PCM доступен в 16, 22,05 и 24 кГц, а Opus — в 48 кГц с битрейтом 32, 64 и 96 кбит/с.
Если книга рассчитана на несколько часов, заранее определитесь с правилом именования файлов. Например: «01 — Пролог», «02 — Глава 1», «03 — Глава 2». Простая нумерация избавляет от ситуации, когда при сборке приходится угадывать порядок файлов.
Языки можно определить автоматически либо выбрать явно. Доступны русский, английский, немецкий, французский, испанский, итальянский, португальский, польский, японский, корейский и китайский.
Сколько стоит книга: считаем по знакам
Главное число здесь — не количество глав и не продолжительность готовой записи, а объём исходного текста. Озвучка текста стоит 18 ₽ за каждые 1000 знаков, при этом минимальная стоимость запуска составляет 18 ₽.
| Объём текста | Расчёт | Стоимость |
|---|---|---|
| 1 000 знаков | 1 × 18 ₽ | 18 ₽ |
| 10 000 знаков | 10 × 18 ₽ | 180 ₽ |
| 50 000 знаков | 50 × 18 ₽ | 900 ₽ |
| 100 000 знаков | 100 × 18 ₽ | 1 800 ₽ |
| 300 000 знаков | 300 × 18 ₽ | 5 400 ₽ |
Таким образом, книга на 300 тысяч знаков при обычной озвучке — это 5 400 ₽, если считать весь текст по базовой ставке. Если использовать диалоговый режим, стоимость увеличивается на 30%, то есть для тех же 300 тысяч знаков расчёт составит 7 020 ₽.
Важно не путать цену за 1000 знаков с ценой запуска. Фраза «озвучка стоит 18 ₽» верна только для минимального объёма в 1000 знаков или меньшего запуска с учётом минимальной стоимости. Для 10 000 знаков это уже 180 ₽, а для 50 000 — 900 ₽.
Оплата идёт за запуск, без абонентской платы и без минимального платежа. При выпуске первого ключа на баланс начисляется 50 ₽ для пробы. Для обычной работы с большой рукописью это позволяет сначала проверить небольшой фрагмент, а затем переходить к основному объёму.
Если считать через API, у сервиса есть операции с маршрутом для запуска задачи, проверки состояния и получения результата, а также загрузка файла. Для текста озвучка обозначена как операция tts с ценой 18 ₽ за 1000 знаков. Ограничение частоты для ключа — не более 60 запросов в минуту.
Для автора, который не занимается интеграциями, API для этой задачи не обязателен: озвучка текста живёт в отдельном кабинете. Там можно вставить текст руками или загрузить файл, выбрать голос и получить готовый аудиофайл.

Права: чью книгу озвучивать можно, а чью нельзя
Техническая возможность сделать аудиоверсию книги не означает автоматического права её публиковать. Если произведение ваше, вопрос с авторскими правами обычно определяется вашими правами на текст и условиями, на которых вы его создавали или передавали.
С чужой современной книгой ситуация другая. Наличие файла EPUB, DOCX или PDF не даёт само по себе права превратить произведение в аудиокнигу и распространять запись. Для коммерческого выпуска нужна правовая основа: например, соответствующие права от правообладателя или иное предусмотренное законом основание.
Отдельно стоит учитывать общественное достояние. Произведение может быть свободно от исключительных авторских прав, но это не означает, что любые элементы конкретного издания можно копировать без проверки. Перевод, комментарии, редакторские материалы и иллюстрации могут иметь собственный правовой статус.
Если книгу написал другой человек, самый безопасный практический порядок — сначала разобраться, кто владеет необходимыми правами именно на воспроизведение и распространение текста в аудиоформате. После этого уже имеет смысл тратить время и деньги на полную генерацию.
Для собственного произведения полезно сохранить исходную рукопись, рабочую версию для озвучки и готовые файлы отдельно. Если вы вносите изменения в текст после генерации, это позволит быстро понять, какие главы нужно озвучить заново, а какие остались актуальными.
Частые вопросы
Можно ли озвучить книгу целиком одним запуском?
Для большой рукописи практичнее разбить текст на части и обрабатывать их отдельно. Так проще контролировать произношение, единообразие голоса и порядок готовых файлов.
Можно ли использовать собственный голос?
Нет. В озвучке используются готовые голоса из библиотеки, клонирование голоса по образцу не заявлено.
Можно ли бесплатно озвучить большую книгу?
В библиотеке есть бесплатные голоса, за которые списывается 0 ₽, но это отдельные голоса. Для платной озвучки действует цена 18 ₽ за каждые 1000 знаков с минимумом 18 ₽ за запуск.
Переведёт ли сервис книгу перед озвучкой?
Нет. Сервис читает предоставленный текст. Выбор языка меняет параметры произношения, но не переводит содержание.
Что делать, если имя персонажа произносится неправильно?
Исправить написание в исходном тексте и повторить генерацию нужного фрагмента. Отдельной настройки, которая гарантирует правильное ударение в именах, редких словах, аббревиатурах и числах, нет.
Где скачать готовые части аудиокниги?
Готовые файлы остаются в кабинете со списком генераций. Их можно скачать позже и отфильтровать по голосу и состоянию. Для работы с новой книгой можно начать с страницы генерации озвучки, проверить короткий фрагмент и только после этого переходить к остальному тексту.
