Запись, ссылка или видео

Перевести аудио в текст онлайн

Загрузите запись или вставьте ссылку на ролик — нейросеть переведёт аудио в текст: с отметками времени, разделением по говорящим и выгрузкой в TXT, SRT или VTT. Подходит для интервью, созвонов, лекций и подкастов.

3 ₽ за минуту записи, минимум 10 ₽ без установки программ результат сразу скачивается
MP3, WAV, M4A, OGG, а также MP4 и WebM. До 10 МБ и 120 минут.
Годится и прямая ссылка на файл, и ссылка на ролик — дорожку достанем сами.
На коротких записях явный язык заметно повышает точность.
Для интервью, совещаний и подкастов.
Смех, музыка, аплодисменты — пометками в тексте.

Когда расшифровка экономит день работы

Час интервью руками набирается за три-четыре часа: запись приходится останавливать, отматывать, переспрашивать себя. Нейросеть возвращает текст за несколько минут, и работа сводится к вычитке — расставить абзацы, поправить имена и термины. На созвонах и лекциях выигрыш тот же: вместо конспекта по памяти остаётся точный текст с отметками времени.

Что именно вы получаете

  • TXT — сплошной текст для статьи, протокола или конспекта.
  • SRT и VTT — субтитры с таймкодами для видео.
  • Разделение по говорящим — кто и что сказал, если в записи несколько человек.
  • Отметки событий — смех, аплодисменты и паузы, когда это включено.

Аудио из видео и ссылок

Отдельно доставать дорожку не нужно: сервис принимает MP4 и WebM и сам берёт из них звук. Если ролик лежит в сети, достаточно ссылки — файл не придётся скачивать. Когда дорожка нужна ещё и отдельным файлом, её отдаст извлечение звука из видео.

Как повысить точность

Точность распознавания упирается в качество записи. Диктофон ближе к говорящему, отсутствие музыки на фоне и разговор без перебиваний дают текст, который почти не нужно править. Шумную запись стоит прогнать через очистку от шума и только потом расшифровывать — разница в результате видна сразу.

Как это работает

  1. 1 Загрузите запись или вставьте ссылку на ролик.
  2. 2 Укажите язык и включите разделение по говорящим, если в записи несколько человек.
  3. 3 Через пару минут заберите текст, субтитры SRT или VTT.

Частые задачи с расшифровкой записей

Короткие разборы под конкретные задачи — с примерами формулировок и ценами.

Что ещё можно сделать со звуком и видео

Все инструменты работают на одном балансе — переключайтесь между ними без отдельной оплаты.

Говорящий аватар

Загрузите фотографию и аудио с речью — нейросеть синхронизирует губы с голосом. На выходе видео, где человек со снимка говорит вашим текстом: для аватара канала, приветствия на сайте или поздравления.

Сделать говорящее видео

Убрать вокал

Загрузите трек — нейросеть отделит вокал от музыки и вернёт две дорожки: чистый инструментал для караоке и отдельно голос. Ничего устанавливать не нужно.

Убрать вокал

Звук из видео

Вставьте ссылку на ролик — и заберите звуковую дорожку отдельным файлом. Само видео скачивать не нужно: дорожка снимается на нашей стороне и приходит готовым файлом.

Открыть

Создать музыку

Опишите словами, какая нужна музыка — стиль, настроение, инструменты. Нейросеть напишет и сыграет трек: инструментал для фона видео или песню с вокалом на ваш текст. За одну генерацию приходит два разных варианта.

Открыть

Убрать шум

Загрузите запись — нейросеть уберёт фоновый гул, шум улицы, шипение микрофона и оставит чистый голос. Подходит для интервью, созвонов, голосовых и звука из видео.

Очистить запись

Создать звук

Опишите звук словами — нейросеть соберёт готовый эффект в MP3: взрывы, шаги, интерфейсные сигналы, атмосфера и бесшовные лупы.

Создать звук

Частые задачи: оживить фото, музыка для видео, песня нейросетью, аудио с youtube, звук из рилс.

Частые вопросы

Какие форматы принимаются?

MP3, WAV, M4A и OGG, а также видео в MP4 и WebM — дорожку из него сервис достанет сам. Кроме файла можно дать ссылку на ролик: тогда загружать ничего не нужно.

Сколько стоит перевести аудио в текст?

3 ₽ за минуту записи, минимальный заказ — 10 ₽. Длительность считается до оплаты, поэтому сумму видно заранее: часовое интервью обойдётся в 180 ₽.

Распознаются ли разные говорящие?

Да, отметьте «разделить по говорящим» — в тексте появятся «Говорящий 1», «Говорящий 2» и так далее. На записях, где люди перебивают друг друга, границы реплик получаются приблизительными.

Как получить субтитры?

Вместе с текстом отдаются файлы SRT и VTT — их понимают YouTube, ВКонтакте, Premiere и DaVinci Resolve. Достаточно загрузить файл рядом с видео.

На каких языках работает распознавание?

Русский и английский распознаются увереннее всего, поддерживаются и другие распространённые языки. Язык можно указать явно — на записи с сильным акцентом это заметно повышает точность.