• Продакшн-видео на генеративных моделях держится на пайплайне из 6 стадий, а не на модели
  • Консистентность дают 3 механизма (наследование, типы референсов, lock-слои), не обучение
  • Сцены рендерятся параллельно, кадры внутри сцены строго последовательно

Задача

Большинство текстов про генеративное видео трактуют генерацию как один шаг: промпт заходит, клип выходит. Продакшн так не работает. Ролик на тридцать кадров — не тридцать независимых генераций, а граф зависимостей: кадры одной сцены должны держаться вместе, персонажи и локации должны узнаваться между кадрами, стиль должен выжить через весь хронометраж, и кто-то должен писать все эти промпты так, чтобы выход одной стадии был пригоден для следующей.

Эта статья описывает пайплайн, построенный и эксплуатируемый в продакшнах 2024–2026 годов, как референсную архитектуру. Тезис: продакшн-качество генеративного видео получается из пайплайна распространения ограничений, а не из модели. Модели в нём взаимозаменяемы: замените видеомодель или image-модель — пайплайн продолжает работать, потому что проект держит вместе именно он.

Метод

Пайплайн раскладывается на шесть стадий, каждая добавляет один класс информации и может уточняться независимо, без перезапуска предыдущих.

setup → scenario → storyboard → moodboard → stills → video.

flowchart LR
    S[Setup:<br/>входы] --> SC[Scenario:<br/>шот-лист]
    SC --> SB[Storyboard:<br/>композиция]
    SC --> MB[Moodboard:<br/>стиль, цвет, свет]
    SB --> ST[Stills:<br/>рендер]
    MB --> ST
    ST --> V[Video:<br/>движение]

Setup. Минимальное описание проекта: название, аспект, оценка хронометража, технические заметки, файлы базы знаний (брифы, сценарии, референс-документы). Ничего не сгенерировано — это зона подготовки входов.

Scenario. Бриф или сценарий становится структурированным шот-листом. Модель в роли продакшн-режиссёра выдаёт список кадров, у каждого имя вида «номер сцены + буква» (1A, 1B, 2A), семиэлементное описание (субъект и действие, локация, крупность, угол, движение, оптика, свет), тип (полностью генеративный, композит, живая съёмка), длительность и опциональная пометка парного ключевого кадра для сшивки переходов. Схема имён несущая: кадры с общим номером сцены образуют серию, которая должна оставаться визуально консистентной, и схема без изменений проходит через все следующие стадии. Подробнее в пайплайне бриф → сценарий.

Storyboard. Быстрый дешёвый визуальный лок на композицию и язык камеры. Модель выдаёт промпт на кадр с фиксированным стилевым префиксом рисованного эскиза (чёрная тушь на белой бумаге, красные акценты, штриховка). Два свойства делают стадию несущей: один префикс на все проекты превращает эскизы в нейтральный словарь композиции, который следующие стадии читают ради кадрирования, а не стиля; ранние эскизы серии становятся референсами для поздних, и модель намеренно выбирает другие углы, удерживая стиль. См. систему storyboard.

Moodboard — параллельно storyboard. Двухуровневая система референсов: проектный moodboard держит общие референсы, сценный держит переопределения. У каждого референса типизированная роль (локация, персонаж, стиль, реквизит, цвет, камера), по которой следующие стадии решают, какой референс отвечает на какой вопрос. На сцену генерируется один композитный 16:9 moodboard-кадр, схлопывающий множество референсов в одну картинку. Так стиль, цвет и свет достигают стадии стиллов как один визуальный вход, а не как десяток сырых картинок, которые переограничили бы генерацию.

Stills. Фотореалистичный рендер на кадр. Стадия потребляет шесть источников: текст описания кадра, эскиз (только композиция), предыдущие рендеры той же серии (непрерывность), композитный moodboard (стиль, цвет, свет), подписи moodboard (контекст среды) и тип кадра. Системный промпт намеренно запрещает описывать стиль, цвет и свет текстом: эти измерения приходят через картинки. Текст описывает только субъект, локацию и камеру, см. намеренное умолчание. Это инверсия подхода A.O.C. для одиночных и кампанийных кадров, где текст задаёт все три оси: у продакшн-кадра плотные визуальные референсы, у кампанийного часто один-два, и внимание распределяется по доступным якорям.

flowchart LR
    T[Текст: субъект,<br/>локация, камера] --> S[Stills:<br/>рендер кадра]
    E[Эскиз:<br/>композиция] --> S
    P[Прошлые рендеры<br/>серии] --> S
    M[Композит moodboard:<br/>стиль, цвет, свет] --> S
    C[Подписи<br/>moodboard] --> S
    K[Тип кадра] --> S

Линейное наследование в серии заменяет обучение кастомной модели персонажа. Внутри серии (1A → 1B → 1C) каждый рендер прикрепляет картинку предыдущего кадра как референс. Облик персонажа, установленный в 1A, распространяется дальше без обучения. Механизм подробно описан в архитектуре последовательной консистентности.

Video. Генерация движения. Модель выдаёт промпт в одно-два предложения: движение камеры и действие субъекта, без эстетических прилагательных и описания сцены, потому что сцена уже отрисована. Ключевая возможность — сшивка по первому и последнему кадру: для пары кадров, помеченных на стадии сценария, рендер одного подаётся как первый кадр, рендер другого — как последний, и модель генерирует только движение между ними. Получается бесшовный переход без наплыва и склейки. Это возможно только потому, что пайплайн frame-first: движение — последнее решение, а не первое.

flowchart LR
    A[Рендер A:<br/>первый кадр] --> V[Видеомодель:<br/>только движение]
    B[Рендер B:<br/>последний кадр] --> V
    V --> T[Бесшовный<br/>переход]

Три механизма консистентности. Тридцать кадров дают тридцать шансов одежде персонажа уплыть, свету сдвинуться, надписи на упаковке исказиться. Пайплайн держит это тремя взаимоблокирующими механизмами. Первый — наследование внутри серии: линейный порядок рендера, каждый кадр наследует рендер предыдущего. Второй — типология референсов между кадрами внутри проекта: у каждого референса объявленная роль, и модели предписано объявлять прямо в промпте, что даёт каждая приложенная картинка; молчаливое использование референсов запрещено. Третий — lock-слои на уровне промпта для кампанийных кадров: блок IDENTITY LOCK или PRODUCT LOCK с дескриптором субъекта (лицо, тело, волосы; или форма, материал, ориентация, текст), который неизменен по всему батчу и переживает вариативность генерации.

flowchart TD
    K[Консистентность<br/>30 кадров] --> I[Наследование<br/>внутри серии]
    K --> R[Типология<br/>референсов]
    K --> L[Lock-слои<br/>в промпте]
    I --> I1[Кадр наследует<br/>рендер предыдущего]
    R --> R1[Роль каждой<br/>картинки объявлена]
    L --> L1[IDENTITY или<br/>PRODUCT LOCK]

Граф зависимостей. Между стадиями пайплайн линеен, но внутри поздних стадий граф кадров превращается в лес линейных цепочек: между сценами зависимости нет, и они рендерятся параллельно; внутри сцены порядок строгий, рендер кадра блокируется, пока не готовы предыдущие кадры той же сцены. Два условия допуска (у предыдущих кадров серии есть эскиз; у предыдущих кадров серии есть рендер) обеспечивают это. Форма графа делает большой проект посильным: работа параллелится между сценами, а консистентность гарантирована внутри каждой.

flowchart TB
    subgraph s1[Сцена 1]
        direction LR
        A1[1A] -->|рендер| B1[1B]
        B1 -->|рендер| C1[1C]
    end
    subgraph s2[Сцена 2, параллельно]
        direction LR
        A2[2A] -->|рендер| B2[2B]
        B2 -->|рендер| C2[2C]
    end
    s1 ~~~ s2

Слой оркестрации. Каждая стадия, кроме композитинга moodboard, — это LLM-вызов с узким контрактом: своя роль, своя температура (0.4 для анализа брифа, 0.3 для парсинга и правок), строгий формат выхода. Два свойства слоя несущие. Дисциплина системного промпта: у каждой роли узкий мандат, промпт стиллов явно запрещает стиль, цвет и свет, промпт видео запрещает эстетику; широкий мандат позволяет модели загрязнить следующую стадию заботами, которые должны были остаться в этой (см. двухстадийный паттерн архитектора). И дешёвые правки: у каждой генеративной стадии есть режим уточнения одного кадра, переиспользующий существующий промпт как базу. Если бы правка стоила как свежая генерация, продюсеры либо коммитили бы рано, либо жгли бюджет; дешёвая правка держит их в режиссёрской позиции.

Чего пайплайн намеренно не делает. Не обучает кастомные модели персонажей как основной механизм консистентности: обучение доступно, но зарезервировано для долгосрочных персон между проектами, для одного продакшна наследование и типология дешевле и достаточно быстры. Не выставляет одну кнопку «сгенерировать весь проект»: пошаговая прогрессия и есть интерфейс, продюсер остаётся в петле на каждой стадии. Не пытается авторствовать нарратив: парсинг реструктурирует, а не изобретает; бриф — автор, пайплайн — съёмочная группа. Не борется с причудами моделей запасной логикой: сбои генерации всплывают к продюсеру как приглашение к итерации, а не как тихие повторы.

Обновление, сентябрь 2026. Ретроспектива рекламных проектов 2025–2026 показывает, где проходит граница для обучения. Один из проектов делался до появления image-моделей, которые держат персонажа по референсу, и там обучение было единственным рабочим путём: под героев обучены LoRA на датасете из 12 кадров, у каждого кадра своё текстовое описание и общий триггер. Сцены на Flux собирались в два шага: сначала окружение, затем герои вписывались в кадр инпейнтингом через эти LoRA, чтобы попасть в свет и перспективу сцены, а не лечь поверх неё. Когда модель умеет держать облик по референсу, эту работу забирают наследование в серии и типология референсов, а обучение остаётся для долгоживущих персон.

Что оказалось несущим, примерно по убыванию боли от отсутствия: схема имён кадров, от которой зависит каждый механизм консистентности; фиксированный стиль storyboard; минимализм в промптах стиллов, спасающий рендеры от переограничения; дешёвые правки, делающие пайплайн полезным, а не теоретическим; сшивка по первому и последнему кадру как самый заметный результат на экране; предсказуемые усилия на стадию, благодаря которым продюсеры доверяют системе.

Где ломается

  • Консистентность между сценами для повторяющихся персонажей держится на moodboard-референсах и дисциплине пользователя. Пайплайн гарантирует серию, но не проект целиком; лёгкий межсценный якорь («сцена 3 содержит того же персонажа, что сцена 1») закрыл бы разрыв без обучения, но пока его нет.
  • Лес цепочек не описывает настоящие межсценные зависимости, например подобранный монтажный стык от последнего кадра сцены 1 к первому кадру сцены 2. Сегодня это обрабатывается сшивкой только на смежных индексах; общий DAG был бы честнее.
  • Тип кадра задаётся вручную на стадии брифа, а оценка семиэлементных описаний остаётся ad-hoc. Обе задачи просят автоматической эвристики или рубрики.
  • Нет метрики консистентности: «ощущаются ли 1A и 1B как одна сцена» решает глаз. Возможные подходы (CLIP-близость, расстояние эмбеддингов лиц, сравнение графов сцены) не проверены.
  • Неизвестно, переносится ли шестистадийная форма на продакшны, ведомые звуком, или на интерактивные форматы.

Итог

  • Генеративное видео продакшн-качества — это пайплайн распространения ограничений; модели в нём — взаимозаменяемые компоненты.
  • Шесть стадий, каждая добавляет один класс информации и уточняется независимо; композиция, рендер и движение разделены.
  • Консистентность обеспечивают наследование в серии, типология референсов и lock-слои, а не обучение моделей.
  • Наименьший набор обязательств, надёжно дающий консистентный и управляемый выход: декомпозиция на стадии, серийная консистентность, минимализм в промптах стиллов, порядок «сначала кадр, потом движение».

© Александр Никулин. Цитирование — с указанием автора и ссылкой · Версия для LLM