Почему групповая сцена сложнее, чем сумма одиночных персонажей
Когда генерируется один герой, у модели есть один набор черт, за который нужно держаться: лицо, причёска, одежда. Когда героев двое или больше, добавляется новая проблема, а именно смешение признаков. Модель может случайно перенести причёску одного персонажа на лицо другого, дать обоим героям одинаковую одежду просто потому, что легче сгенерировать что-то усреднённое, или вовсе слить два лица в один гибрид где-то на границе кадра. Чем больше персонажей, тем выше риск подобной путаницы, особенно если герои визуально похожи по возрасту, полу или цветотипу. Вторая проблема - это то, что происходит физически между персонажами: как они стоят друг к другу, куда смотрят, кто выше, кто ближе к камере. Если это не прописать явно, модель расставит героев произвольно, и в итоге пропадает ощущение, что персонажи вообще друг друга замечают.
Базовый принцип: карточка на каждого персонажа отдельно
Для одного героя достаточно одного описания внешности. Для группы нужно составить мини-карточку на каждого персонажа и явно связать её с местом в кадре, чтобы модель не путала, кто есть кто.
Промт-паттерн:
Character A (left): young woman, red curly hair, freckles, green eyes, wearing a beige trench coat. Character B (right): middle-aged man, short grey beard, brown eyes, wearing a navy blue sweater. Both characters standing side by side, facing each other in conversation
Диалоговые сцены
Диалог - это самый частый сценарий групповой генерации: два и больше персонажа общаются друг с другом. Здесь важны три вещи: направление взгляда, положение тел друг относительно друга и расстояние между героями, которое задаёт степень близости отношений.
Промт-паттерн для диалога двух персонажей:
Two people in casual conversation, facing each other at a slight angle, character A gesturing with one hand while speaking, character B listening with head slightly tilted, natural eye contact between them, medium shot, soft indoor lighting
Для сцены с тремя и более участниками диалога добавляется указание на общую композицию группы:
"Three colleagues standing in a loose semi-circle, engaged in discussion, one person speaking with an open hand gesture, the other two listening and facing the speaker, natural office environment, candid documentary style"
Слово semi-circle (полукруг) или triangle formation (треугольная расстановка) в промте помогает избежать построения персонажей в одну плоскую линию, что визуально выглядит неестественно для группового разговора.
Сцены объятий и физического контакта
Объятия, держание за руки и другой физический контакт - одна из самых проблемных зон для AI-генерации, потому что модели часто путают, где заканчивается тело одного персонажа и начинается тело другого, особенно в области рук и переплетающихся конечностей.
Промт-паттерн для объятий:
Warm embrace between two people, character A wrapping both arms around character B's shoulders, character B's arms around character A's waist, faces close together, eyes closed, soft warm lighting, emotional tender moment
Практический совет: для сцен физического контакта стоит явно указывать, чьи именно руки где находятся ("character A's arms around character B's shoulders", а не просто "hugging"), потому что общее слово "hug" или "embrace" модель интерпретирует по-разному, и результат может получиться анатомически некорректным, если не задать точное расположение конечностей.
Для сцены держания за руки:
Two people walking side by side, holding hands, fingers interlaced, character A slightly ahead, character B looking toward character A with a smile, outdoor golden hour lighting"
Групповые сцены без прямого физического контакта
Групповое фото, кадр вечеринки, командное фото - сцены, где персонажи находятся рядом, но не взаимодействуют физически. Здесь ключевая задача - расстановка по глубине и высоте кадра, чтобы группа не выглядела как ряд одинаковых фигур в одну линию.
Промт-паттерн:
Group of four friends posing for a photo, arranged in staggered positions with two people standing and two people crouching in front, varied heights creating visual depth, all facing camera, warm natural lighting, candid smiles
Слово staggered (расположенные вразнобой, ступенчато) - рабочий приём для того, чтобы избежать эффекта плоского ряда манекенов, когда все персонажи стоят на одной линии и одной высоте.
Как удерживать консистентность лиц при повторной генерации сцен
Если группа персонажей должна появляться в нескольких кадрах подряд (серия, сторибord, лукбук), самая надёжная практика - это фиксировать полное описание каждого персонажа в отдельном текстовом блоке и переиспользовать его без изменений в каждом новом промте, меняя только действие и композицию.
Пример структуры для серии из нескольких кадров:
Кадр 1: "[Character A fixed description] and [Character B fixed description], sitting at a cafe table, character A pointing at a menu, character B nodding"
Кадр 2: "[Character A fixed description] and [Character B fixed description], now standing outside the cafe, character A laughing, character B checking phone"
Здесь [Character A fixed description] и [Character B fixed description] - это один и тот же неизменный текст, который копируется из кадра в кадр. Это не гарантирует стопроцентную идентичность лиц (для этого нужны инструменты с поддержкой референсных изображений персонажа, например через загрузку референс-фото), но существенно снижает разброс и держит модель в рамках одного и того же набора черт.
Для инструментов, которые поддерживают загрузку референсного изображения персонажа (как в SeeDance 2.0 при работе со сториборд-подходом), стоит использовать эту возможность напрямую вместо того, чтобы полагаться только на текстовое описание - референс-изображение почти всегда даёт более стабильный результат для группы из трёх и более героев.
Как избежать смешения персонажей между собой
Несколько практических приёмов, которые снижают риск того, что модель перепутает черты персонажей:
Во-первых, делайте персонажей визуально различимыми не только по лицу, но и по одежде и цвету. Если оба героя в промте описаны нейтрально ("man in a shirt" и "man in a shirt"), модели не за что зацепиться, чтобы их разделить. Разный цвет одежды работает как якорь: "character A in a red jacket" и "character B in a blue jacket" почти всегда лучше удерживаются моделью раздельно, чем два персонажа в одинаковой цветовой гамме.
Во-вторых, избегайте генерации более четырёх-пяти детально прописанных персонажей в одном кадре одновременно. Начиная с этого количества даже самые продвинутые модели начинают терять индивидуальные черты и генерировать фоновых персонажей более обобщённо. Если по сюжету нужна большая группа, стоит явно разделить её на "featured characters" (два-три героя с детальным описанием) и "background crowd" (остальные, без детализации).
В-третьих, порядок описания в промте имеет значение: указывайте персонажей в том порядке, в котором они расположены в кадре слева направо, это помогает модели соотнести описание с позицией, а не перепутать, кто где стоит.
Частая ошибка
Самая распространённая ошибка - описывать взаимодействие абстрактным глаголом без уточнения деталей: "two people talking", "friends hugging", "group posing together". Модель заполняет пробелы по своему усмотрению, и результат часто выглядит статичным или анатомически странным, особенно в местах контакта рук и тел. Чем детальнее прописано физическое взаимодействие: чья рука где, куда направлен взгляд, кто ближе к камеру, тем более естественной получается сцена. Для групповых кадров стоит относиться к позе взаимодействия так же тщательно, как к описанию внешности каждого персонажа отдельно.



