Механика проще, чем кажется. Модель не «понимает» текст — она работает со звуком. Разберём по шагам, потому что понимание процесса сразу объясняет, почему одни ролики выходят убедительными, а другие нет.
Что происходит со звуком
Дорожка разбивается на короткие отрезки, и для каждого определяется фонема — минимальная единица речи. Дальше фонемы группируются в висемы: видимые положения губ. Звуки «м», «б», «п» дают сомкнутые губы, «о» и «у» — округлённые, «с» и «з» — приоткрытые с видимыми зубами.
Что происходит с кадром
На фотографии находится лицо, строится его карта: контуры губ, подбородок, щёки. Затем кадр за кадром эта карта деформируется под нужную висему, а соседние кадры сглаживаются, чтобы движение не дёргалось. Попутно добавляется естественная мелочь — моргание и микродвижение головы, без них лицо выглядит маской.
Почему важна чистая запись
Если на дорожке музыка или сильный шум, деление на фонемы сбивается: модель принимает удар барабана за согласный. Результат — губы шевелятся не в такт. Поэтому перед липсинком дорожку стоит очистить от шума, а музыку убрать совсем.
Какие фото не подойдут
- профиль и сильный поворот головы — не видно обе стороны рта;
- закрытое лицо: маска, шарф, микрофон у губ;
- сильно размытый или мелкий снимок;
- солнцезащитные очки — технически сработает, но лицо выйдет неживым, потому что глаза не участвуют.
Что улучшает результат
| Приём | Эффект |
|---|---|
| Фото анфас, лицо крупно | точная артикуляция |
| Ровный свет | мимика читается |
| Речь в среднем темпе | губы успевают за звуком |
| Паузы между фразами | видео выглядит естественно |
Частые вопросы
Работает ли с русским языком? Да, и с большинством других: модель опирается на звук, а не на текст.
А если человек на фото в маске? Липсинк не получится — губы не видны.
