Песня по словам своим голосом: что писать, чтобы спелось именно так

Результат генерации на девяносто процентов определяется тем, что вы написали в трёх полях: текст, стиль и название. Разберём, что в каждое из них попадает и как это влияет на звучание.

Поле «текст песни»

Сюда идут именно слова, которые прозвучат. Не описание, не пожелания — строки. Разметка [Куплет] и [Припев] задаёт структуру, а пустая строка между блоками помогает модели услышать паузу.

Если поле оставить пустым, нейросеть напишет текст сама по описанию. Это удобно для первого подхода, но точность пострадает: имена, даты и детали она не угадает.

Поле «стиль»

Здесь описывается звучание, а не смысл. Работают четыре группы слов:

  • Жанр: поп, рок, шансон, фолк, регги, электроника.
  • Темп: медленно, средний темп, быстро; можно числом — «около 90 ударов».
  • Инструменты: акустическая гитара, фортепиано, струнные, синтезатор.
  • Настроение: тёплое, тревожное, торжественное, ироничное.

Порядок слов значения почти не имеет, а вот противоречия — имеют: «быстрая колыбельная» даст непредсказуемый результат.

Поле «название»

Оно не влияет на звучание, но попадает в метаданные файла и помогает не запутаться среди вариантов. Если не заполнить, название придумается автоматически.

Пять частых ошибок

  1. Описание вместо текста. «Песня про маму, тёплая» в поле текста — модель споёт эту фразу буквально.
  2. Слишком длинный текст. Больше четырёх блоков в три минуты не помещается, и слова поются скороговоркой.
  3. Пустой стиль. Без описания жанр выбирается случайно, и два запуска звучат совсем по-разному.
  4. Цифры и сокращения. «8 марта» лучше писать «восьмое марта».
  5. Один запуск. Два-три прогона с уточнением формулировки обычно дают заметно лучший результат.

Частые вопросы

Сколько вариантов приходит за запуск?

Два. Платить за второй не нужно, он входит в тот же запуск.

Читать  Аудио из видео для расшифровки: как подготовить запись правильно

Можно ли задать конкретную мелодию?

Нет, мелодию модель пишет сама. Влиять на неё можно только описанием стиля и темпа.

Почему два варианта звучат по-разному?

Так и задумано: модель предлагает два прочтения одного описания, чтобы было из чего выбрать.

Попробовать. Если голос не нужен, подойдёт песня нейросетью.