Два соседних инструмента легко перепутать: и там, и там компьютер говорит человеческим голосом. Но задачи у них разные, и результат тоже.

Синтез речи
Озвучка текста берёт готовый голос из библиотеки: диктор, робот, мужской, женский. Вы выбираете из списка и получаете речь. Голос не ваш и не чей-то конкретно — это усреднённая модель, обученная на записях актёров озвучивания.
Применение: закадровый текст для ролика, аудиоверсия статьи, автоответчик, озвучка курса. Главное достоинство — скорость и предсказуемость.
Клонирование голоса
Здесь модель строится по вашей записи и повторяет именно ваш тембр. Список голосов заменяется одним — вашим. Это нужно, когда важно, чтобы узнали конкретного человека: поздравление, гимн команды, песня к семейной дате.
Из-за того, что голос персональный, добавляется шаг подтверждения: случайную фразу нужно прочитать вслух. Без него любой мог бы загрузить чужую запись и петь чужим голосом.
Сравнение
| Синтез речи | Свой голос | |
|---|---|---|
| Чей голос | из библиотеки | ваш |
| Что нужно | только текст | текст и запись голоса |
| Подтверждение | не требуется | чтение проверочной фразы |
| Пение | нет, только речь | да |
| Когда выбрать | дикторский текст | личное обращение, песня |
Можно ли совмещать
Да, и это частый сценарий: закадровый текст ролика делается синтезом, а песня в финале — своим голосом. Оба файла сводятся в любом видеоредакторе.
Частые вопросы
Может ли синтез речи спеть?
Нет. Синтез строит речь: интонацию, паузы, ударения. Пение — другая задача, у него есть мелодия и длительности нот.
Нужен ли свой голос, если я просто хочу песню?
Нет. Если конкретный тембр не важен, быстрее взять песню нейросетью — там вокал подбирается автоматически.
Сколько записей нужно для клонирования?
Одной: двадцать секунд чистой речи плюс чтение проверочной фразы.
