Говорящий аватар
Загрузите фотографию и аудио с речью — нейросеть синхронизирует губы с голосом. На выходе видео, где человек со снимка говорит вашим текстом: для аватара канала, приветствия на сайте или поздравления.
Сделать говорящее видеоЗагрузите запись или вставьте ссылку на ролик — нейросеть переведёт аудио в текст: с отметками времени, разделением по говорящим и выгрузкой в TXT, SRT или VTT. Подходит для интервью, созвонов, лекций и подкастов.
Час интервью руками набирается за три-четыре часа: запись приходится останавливать, отматывать, переспрашивать себя. Нейросеть возвращает текст за несколько минут, и работа сводится к вычитке — расставить абзацы, поправить имена и термины. На созвонах и лекциях выигрыш тот же: вместо конспекта по памяти остаётся точный текст с отметками времени.
Отдельно доставать дорожку не нужно: сервис принимает MP4 и WebM и сам берёт из них звук. Если ролик лежит в сети, достаточно ссылки — файл не придётся скачивать. Когда дорожка нужна ещё и отдельным файлом, её отдаст извлечение звука из видео.
Точность распознавания упирается в качество записи. Диктофон ближе к говорящему, отсутствие музыки на фоне и разговор без перебиваний дают текст, который почти не нужно править. Шумную запись стоит прогнать через очистку от шума и только потом расшифровывать — разница в результате видна сразу.
Короткие разборы под конкретные задачи — с примерами формулировок и ценами.
Все инструменты работают на одном балансе — переключайтесь между ними без отдельной оплаты.
Загрузите фотографию и аудио с речью — нейросеть синхронизирует губы с голосом. На выходе видео, где человек со снимка говорит вашим текстом: для аватара канала, приветствия на сайте или поздравления.
Сделать говорящее видеоЗагрузите трек — нейросеть отделит вокал от музыки и вернёт две дорожки: чистый инструментал для караоке и отдельно голос. Ничего устанавливать не нужно.
Убрать вокалВставьте ссылку на ролик — и заберите звуковую дорожку отдельным файлом. Само видео скачивать не нужно: дорожка снимается на нашей стороне и приходит готовым файлом.
ОткрытьОпишите словами, какая нужна музыка — стиль, настроение, инструменты. Нейросеть напишет и сыграет трек: инструментал для фона видео или песню с вокалом на ваш текст. За одну генерацию приходит два разных варианта.
ОткрытьЗагрузите запись — нейросеть уберёт фоновый гул, шум улицы, шипение микрофона и оставит чистый голос. Подходит для интервью, созвонов, голосовых и звука из видео.
Очистить записьОпишите звук словами — нейросеть соберёт готовый эффект в MP3: взрывы, шаги, интерфейсные сигналы, атмосфера и бесшовные лупы.
Создать звукБольше 12 000 готовых звуков в 945 категориях — слушайте онлайн и скачивайте бесплатно в MP3.
Открыть каталогТе же инструменты из вашего кода: оживление фото, аватар, картинки, звуки и озвучка по HTTP-запросу. Ключ, JSON, оплата за запуск.
Смотреть документациюЧастые задачи: оживить фото, музыка для видео, песня нейросетью, аудио с youtube, звук из рилс.
MP3, WAV, M4A и OGG, а также видео в MP4 и WebM — дорожку из него сервис достанет сам. Кроме файла можно дать ссылку на ролик: тогда загружать ничего не нужно.
3 ₽ за минуту записи, минимальный заказ — 10 ₽. Длительность считается до оплаты, поэтому сумму видно заранее: часовое интервью обойдётся в 180 ₽.
Да, отметьте «разделить по говорящим» — в тексте появятся «Говорящий 1», «Говорящий 2» и так далее. На записях, где люди перебивают друг друга, границы реплик получаются приблизительными.
Вместе с текстом отдаются файлы SRT и VTT — их понимают YouTube, ВКонтакте, Premiere и DaVinci Resolve. Достаточно загрузить файл рядом с видео.
Русский и английский распознаются увереннее всего, поддерживаются и другие распространённые языки. Язык можно указать явно — на записи с сильным акцентом это заметно повышает точность.