Допустим, есть готовое видео: рыжий кот обнимает и гладит ребенка, снято через связку «изображение → Seedance» — кадр сгенерирован в Nano Banana, а видео из него собрано по текстовому промпту "кот обнимает и гладит ребенка". Хочется, чтобы кот не просто сидел в кадре, а как будто пел — под короткую песню про дружбу с ребенком.
Как собрать цепочку
В блоке «Промпт 2» описываем задачу для текста: "Напиши короткую песню про любовь рыжего кота и ребенка на 5 секунд".
Подключаем этот промпт к блоку LLM — он генерирует сами слова песни: куплет про рыжего котика у окна, лапку, которая машет, и мур-мур-мур в конце.
Параллельно собираем видеоряд: изображение из Nano Banana идет в Seedance вместе с промптом-описанием сцены, на выходе — готовый видеоролик с котом и ребенком.
- Оба результата — текст песни из LLM и видео из Seedance — ведем в блок «Infinitalk».
- Infinitalk превращает текст в голос и накладывает его на видео так, чтобы движения рта персонажа совпадали с произносимыми словами — это не просто наложение звука, а синхронизация по кадрам.
- Запускаем финальную сборку и получаем ролик, где кот "поет" песню, сгенерированную на предыдущем шаге.
Почему просто добавить голос не получится?
Кажется, что раз текст и видео уже готовы, останется только соединить их стрелкой. На деле именно здесь чаще всего всплывают проблемы.
- Длина текста должна соответствовать длине ролика
- Если песня из LLM получилась длиннее или короче заданных пяти секунд, синхронизация поплывет: либо слова обрываются раньше, чем кончится видео, либо рот продолжает двигаться, когда текст уже закончился. Формулировку в промте для LLM лучше сразу давать с четким хронометражем — как в примере с "5 секунд" — и после генерации проверять, укладывается ли текст по факту, а не по ощущению.
- Естественность движения рта
- Lip-sync работает заметно хуже, если исходное видео — с резкими поворотами головы или быстрой сменой ракурса. Чем спокойнее исходная сцена (кот сидит, смотрит в одну сторону), тем чище получается синхронизация. Если видео снято с активным движением персонажа, Infinitalk может "плыть" — рот открывается не в такт, а с заметной задержкой.
- Характер текста
- LLM иногда выдает текст, который звучит красиво на бумаге, но плохо ложится на голос — слишком длинные фразы без пауз, нагромождение согласных. Для песенных и разговорных вставок лучше просить у LLM короткие строки с ритмом, близким к естественной речи: так и голос звучит правдоподобнее, и синхронизация губ получается точнее.
Infinitalk решает техническую часть — переводит текст в голос и подгоняет его под движение рта в кадре. Но чтобы результат не выглядел механическим, важно заранее продумать хронометраж текста и характер исходного видео, а не полагаться на то, что блок сам все выровняет.



