Нейросеть создаёт песни: как это работает и что получается на выходе

Нейросеть создаёт песни целиком: придумывает мелодию, собирает аранжировку, поёт голосом и сводит всё в готовый трек. Это не нарезка из библиотеки семплов — каждая песня появляется заново под ваше описание.

Что происходит после нажатия кнопки

Модель обучена на связке «описание — звучание», поэтому она понимает не только жанр, но и настроение, темп, набор инструментов. Вы пишете словами, какая нужна песня, — она пишет музыку. За одну генерацию приходит два разных варианта примерно по три минуты: можно выбрать тот, что ближе, или запустить ещё раз с уточнённым описанием.

Два режима

Режим Что получается Когда брать
Инструментал музыка без голоса фон для видео, подкаста, стрима, заставки
Песня с вокалом музыка плюс спетый текст подарок, поздравление, корпоративный гимн, трек для канала

Текст можно вписать свой — тогда нейросеть споёт именно его. Если поле оставить пустым, она придумает слова сама по описанию.

Как описывать, чтобы попасть в нужное звучание

Работает правило: конкретика вместо оценок. «Красивая песня» для модели значит немногое, а «спокойная акустическая гитара, медленный темп, мужской вокал, тёплое настроение» — вполне.

  • Жанр: поп, рок, лоу-фай, эмбиент, шансон, фолк, электроника.
  • Настроение: тёплое, тревожное, бодрое, меланхоличное.
  • Инструменты: акустическая гитара, пианино, струнные, синтезатор.
  • Темп: медленный, средний, быстрый.
  • Голос: мужской, женский, хор, дуэт.

Чего ждать не стоит

  • Копии конкретного исполнителя. Модель работает со стилем, а не с чужим голосом.
  • Попадания с первого раза в сложную задумку. Обычно нужно две-три попытки с уточнением описания.
  • Точной длительности. Трек получается примерно по три минуты; подрезать под хронометраж ролика придётся в монтаже.

Что делать с готовым треком

Скачать в MP3 и использовать в своих проектах. Если нужен только инструментал, а сгенерировалась песня с голосом — дорожки можно разделить на вокал и музыку. Для коротких звуковых эффектов под видео есть отдельный генератор звуков, а озвучить текст голосом — синтез речи.

Читать  Очистить голос от посторонних звуков: шаги, клики, дыхание

Создать песню нейросетью.