Перевести аудио в текст онлайн — значит отдать запись модели распознавания речи и получить обратно готовый текст. Звучит просто, и в большинстве случаев так и есть. Проблемы начинаются там, где запись сделана плохо: тогда «онлайн-сервис плохо распознаёт» оказывается не про сервис, а про исходник.
Что именно происходит с записью
Модель не «слышит слова» — она разбирает звуковой поток на короткие отрезки и предсказывает, какая последовательность букв и слов им соответствует. Отсюда две особенности, которые объясняют почти все странности в результате:
- Контекст важнее громкости. Фразу целиком модель разбирает лучше, чем отдельное выкрикнутое слово.
- Незнакомые имена и термины — слабое место. Фамилию, название препарата или редкий топоним модель подгонит под похожее знакомое слово.
Какие файлы подходят
| Что | Требование |
|---|---|
| Формат | MP3, WAV, M4A, OGG, а также дорожка из видео |
| Громкость речи | речь должна быть отчётливо слышна на обычной громкости |
| Фон | ровный шум переносится нормально, перебивающая музыка — плохо |
| Язык | лучше указать явно, чем оставить автоопределение |
Если запись лежит внутри видео, дорожку сначала нужно вынуть отдельным файлом — или просто дать ссылку на ролик, тогда извлечение произойдёт автоматически.
Порядок действий
- Откройте раздел расшифровки в кабинете.
- Загрузите файл или вставьте ссылку на него.
- Укажите язык записи — это заметно повышает точность на коротких файлах.
- Включите разделение по говорящим, если в записи больше одного человека.
- Запустите и дождитесь текста: минута записи обрабатывается за считанные секунды.
Где точность проседает и что с этим делать
| Проблема в записи | Как выглядит в тексте | Решение |
|---|---|---|
| Гул, кондиционер, улица | пропуски, обрывки фраз | прогнать через очистку записи до расшифровки |
| Музыка под речью | текст «плывёт», путаются окончания | отделить голос от музыки, расшифровывать голосовую дорожку |
| Говорят одновременно | реплики слипаются в одну | включить разделение по говорящим, потом поправить вручную |
| Диктофон в кармане | сплошные пропуски | ничего не спасёт: голос не записан, а приглушён тканью |
| Термины и фамилии | подмена похожими словами | пройтись поиском по тексту и заменить разом |
Что получается на выходе
Не только сплошной текст. Полезнее всего три вещи:
- Фразы с временем — можно вернуться к нужному месту записи, не переслушивая всё.
- Разделение по говорящим — «Говорящий 1», «Говорящий 2»; в интервью это экономит больше всего времени.
- Субтитры SRT и VTT — файл сразу подхватывается видеоредактором и плеером.
Сколько это занимает
Час записи обрабатывается за несколько минут — против трёх-четырёх часов ручного набора. Даже с последующей вычиткой выигрыш остаётся кратным: править готовый текст быстрее, чем набирать с нуля, останавливая плеер каждые десять секунд.
Частые вопросы
Нужно ли указывать язык? Желательно. На длинной записи модель определит его сама, на десятисекундном фрагменте — может ошибиться.
Понимает ли она акцент? Обычно да. Сильный акцент повышает долю ошибок, но текст остаётся читаемым.
А если в записи два языка? Модель переключится по ходу, но на стыках возможны огрехи — такие места стоит проверить.
Сохраняется ли пунктуация? Да, знаки и заглавные буквы расставляются по смыслу.
