Нейросеть заставляет фото говорить: как работает синхронизация губ

Механика проще, чем кажется. Модель не «понимает» текст — она работает со звуком. Разберём по шагам, потому что понимание процесса сразу объясняет, почему одни ролики выходят убедительными, а другие нет.

Что происходит со звуком

Дорожка разбивается на короткие отрезки, и для каждого определяется фонема — минимальная единица речи. Дальше фонемы группируются в висемы: видимые положения губ. Звуки «м», «б», «п» дают сомкнутые губы, «о» и «у» — округлённые, «с» и «з» — приоткрытые с видимыми зубами.

Что происходит с кадром

На фотографии находится лицо, строится его карта: контуры губ, подбородок, щёки. Затем кадр за кадром эта карта деформируется под нужную висему, а соседние кадры сглаживаются, чтобы движение не дёргалось. Попутно добавляется естественная мелочь — моргание и микродвижение головы, без них лицо выглядит маской.

Почему важна чистая запись

Если на дорожке музыка или сильный шум, деление на фонемы сбивается: модель принимает удар барабана за согласный. Результат — губы шевелятся не в такт. Поэтому перед липсинком дорожку стоит очистить от шума, а музыку убрать совсем.

Какие фото не подойдут

  • профиль и сильный поворот головы — не видно обе стороны рта;
  • закрытое лицо: маска, шарф, микрофон у губ;
  • сильно размытый или мелкий снимок;
  • солнцезащитные очки — технически сработает, но лицо выйдет неживым, потому что глаза не участвуют.

Что улучшает результат

Приём Эффект
Фото анфас, лицо крупно точная артикуляция
Ровный свет мимика читается
Речь в среднем темпе губы успевают за звуком
Паузы между фразами видео выглядит естественно

Частые вопросы

Работает ли с русским языком? Да, и с большинством других: модель опирается на звук, а не на текст.

Читать  Анимация фото онлайн: обзор режимов и цен

А если человек на фото в маске? Липсинк не получится — губы не видны.

Попробовать на своём фото.