Как добавить озвучку и музыку к готовому видео

За звук на платформе отвечает блок «Аудио». У него две функции: озвучка текста голосом (TTS) и наложение музыки. Это разные входы с разной логикой, собирать их стоит по отдельности.

Статьи и разделы

Допустим, есть готовое видео: рыжий кот обнимает и гладит ребенка, снято через связку «изображение → Seedance» — кадр сгенерирован в Nano Banana, а видео из него собрано по текстовому промпту "кот обнимает и гладит ребенка". Хочется, чтобы кот не просто сидел в кадре, а как будто пел — под короткую песню про дружбу с ребенком.

Пример выбора инструмента для ноды "аудио"

Как собрать цепочку

В блоке «Промпт 2» описываем задачу для текста: "Напиши короткую песню про любовь рыжего кота и ребенка на 5 секунд".

Пример текстовой ноды

Подключаем этот промпт к блоку LLM — он генерирует сами слова песни: куплет про рыжего котика у окна, лапку, которая машет, и мур-мур-мур в конце.

Параллельно собираем видеоряд: изображение из Nano Banana идет в Seedance вместе с промптом-описанием сцены, на выходе — готовый видеоролик с котом и ребенком.

Пример готовой цепочки
  • Оба результата — текст песни из LLM и видео из Seedance — ведем в блок «Infinitalk».
  • Infinitalk превращает текст в голос и накладывает его на видео так, чтобы движения рта персонажа совпадали с произносимыми словами — это не просто наложение звука, а синхронизация по кадрам.
  • Запускаем финальную сборку и получаем ролик, где кот "поет" песню, сгенерированную на предыдущем шаге.
Результат workflow

Почему просто добавить голос не получится?

Кажется, что раз текст и видео уже готовы, останется только соединить их стрелкой. На деле именно здесь чаще всего всплывают проблемы.

  • Длина текста должна соответствовать длине ролика
  • Если песня из LLM получилась длиннее или короче заданных пяти секунд, синхронизация поплывет: либо слова обрываются раньше, чем кончится видео, либо рот продолжает двигаться, когда текст уже закончился. Формулировку в промте для LLM лучше сразу давать с четким хронометражем — как в примере с "5 секунд" — и после генерации проверять, укладывается ли текст по факту, а не по ощущению.
  • Естественность движения рта
  • Lip-sync работает заметно хуже, если исходное видео — с резкими поворотами головы или быстрой сменой ракурса. Чем спокойнее исходная сцена (кот сидит, смотрит в одну сторону), тем чище получается синхронизация. Если видео снято с активным движением персонажа, Infinitalk может "плыть" — рот открывается не в такт, а с заметной задержкой.
  • Характер текста
  • LLM иногда выдает текст, который звучит красиво на бумаге, но плохо ложится на голос — слишком длинные фразы без пауз, нагромождение согласных. Для песенных и разговорных вставок лучше просить у LLM короткие строки с ритмом, близким к естественной речи: так и голос звучит правдоподобнее, и синхронизация губ получается точнее.

Infinitalk решает техническую часть — переводит текст в голос и подгоняет его под движение рта в кадре. Но чтобы результат не выглядел механическим, важно заранее продумать хронометраж текста и характер исходного видео, а не полагаться на то, что блок сам все выровняет.

Открыть статьи
08 октября 2026 г.

Как улучшить качество видео до 4K: генерируем в 480p и делаем апскейл

Видео в высоком разрешении генерировать дороже и дольше. Если ролик не получился с первого раза, а так бывает почти всегда, вы платите за каждую попытку полную цену. Есть способ проще. Сначала делаете ролик в 480p, выбираете удачный вариант и только его доводите до хорошего качества. Для этого на Syntasy.pro есть отдельное приложение «Улучшить видео».

07 октября 2026 г.

Как оживить фото нейросетью: движение, мимика и голос для говорящего портрета

Из любой фотографии можно сделать короткое видео. Человек на снимке начнёт моргать и улыбаться, на пейзаже зашевелится трава, на воде появится рябь. Для этого нужна нейросеть и режим image to video. На Syntasy.pro он работает без VPN. В статье покажем, какое фото подойдёт, как выбрать модель, написать промт и сделать так, чтобы человек на снимке заговорил.

02 октября 2026 г.

Как сделать серию стикеров или эмодзи с одним персонажем

Один красивый стикер сделать несложно. Трудности начинаются на втором: персонаж меняет форму головы, цвет шапки и толщину линий, и набор перестаёт выглядеть единым. В workflow как раз поможет строить серию вокруг одного эталонного изображения.