Как нейросеть учится петь вашим голосом: разбор по шагам


Со стороны выглядит как магия: двадцать секунд речи — и голос поёт. Внутри это четыре понятных этапа. Разберём каждый, потому что понимание помогает получить результат лучше.

Как нейросеть учится петь вашим голосом: волна голоса и нейронная сеть
Как нейросеть учится петь вашим голосом: волна голоса и нейронная сеть

Этап 1. Разбор образца

Модель получает вашу запись и выделяет из неё голос: отделяет речь от фона, находит участок с чистым звуком и строит характеристику тембра. Ей не нужны слова — нужен звук связок и резонаторов. Отсюда простое следствие: чем чище запись, тем точнее характеристика. Шум, эхо и музыка на фоне размывают её.

Этап 2. Проверочная фраза

Сервис придумывает случайную фразу и просит прочитать её вслух. Смысл в том, что фразу нельзя подготовить заранее: она новая каждый раз и в интернете её нет. Значит, записать её может только человек, который сейчас у микрофона. Так система убеждается, что голос принадлежит вам, и отсекает попытки клонировать чужой голос из ролика.

Этап 3. Создание голоса

Два фрагмента — образец и прочитанная фраза — сравниваются между собой. Если тембр совпадает, создаётся модель вашего голоса и ей присваивается идентификатор. Он и хранится в кабинете: сам звук больше не нужен, песни делаются по модели.

Это занимает от минуты до нескольких. Ошибка на этом шаге обычно означает несовпадение: фразу прочитал другой человек, запись оказалась слишком короткой или слишком шумной.

Этап 4. Пение

Дальше работает генератор музыки: по тексту и описанию стиля он пишет мелодию, аранжировку и вокальную партию, а модель голоса определяет, каким тембром эта партия звучит. Поэтому песня каждый раз новая, а голос — один и тот же.

Читать  Сделать песню онлайн: что нужно и сколько времени это займёт

Что это значит на практике

  • Качество образца важнее его длины: двадцать чистых секунд лучше минуты с шумом.
  • Петь в образце не нужно — пение строится отдельно.
  • Голос создаётся один раз, а песен им можно спеть сколько угодно.

Частые вопросы

Хранится ли моя запись?

Для песен хранится модель голоса, а не сам файл. Удалить голос можно в кабинете.

Почему проверочная фраза странно звучит?

Она собирается случайно и специально не похожа на осмысленный текст: так её нельзя заранее найти в чужой записи. Читать её нужно как есть.

Можно ли создать голос по записи из видео?

Образец — можно, но проверочную фразу всё равно придётся прочитать вслух. Без этого голос не создастся.

Создать свой голос.