Мультфильм нейросетью собирают не одним промтом, а цепочкой: опорное изображение героя, кадры сцен правкой от него, оживление каждого кадра в отдельный фрагмент, монтаж. На домашней видеокарте кадр считается 55–90 секунд, фрагмент — 8–9 минут, длина фрагмента упирается в окно модели: 81 кадр. Дороже всего обходятся не настройки, а формулировки — ниже замеры того, какая фраза ломает кадр и чем её заменить.
Это отчёт по прогонам 30–31 августа 2026 года на одной домашней карте, а не обзор сервисов. Снимали выпуск сериала: два постоянных героя, узнаваемых из выпуска в выпуск, десяток сцен подряд. Кадры рисует FLUX.2 klein в режиме правки, оживляет Wan 2.2 в старшей версии 14B, всё через ComfyUI на RTX 4070 Super с 12 ГБ видеопамяти. Каждый фрагмент смотрели глазами и мерили дрожание края кадра числом.
Сценарий: одна сцена — одно действие
Мультфильм по своему сценарию начинается не с выбора сервиса, а с разбивки. Модель отдаёт окно в 81 кадр, из которого выходит фрагмент чуть больше пяти секунд, и растянуть его настройками нельзя: 81 — обученное окно, за ним картинка теряет связность (арифметика фрагмента разобрана ниже). Значит, сценарий сразу пишется сценами по одному действию, и каждая строка сценария — это отдельный кадр, отдельный прогон и отдельная пересъёмка. Из этой арифметики растёт всё остальное: полминуты ролика — шесть-семь сцен, шесть-семь опорных кадров и столько же прогонов оживления.
Сам текст сценария нейросеть напишет, с этим справляется любая чат-модель, а карточка сценария вертикального ролика даёт готовую структуру с покадровой росписью. Разбивку на действия придётся править руками: чат-модель охотно выдаёт «герой заходит на кухню, ставит кастрюлю и включает плиту» — это три сцены, а не одна, и в один фрагмент они не влезают ни при каких настройках.
Чем серия отличается от одного клипа
Одиночный клип живёт пять секунд, и герою в нём не с кем себя сверять: как модель нарисовала, так и хорошо. В серии зритель видит того же человека второй, третий, пятый раз. Любое расхождение он читает не как погрешность генерации, а как другого персонажа — и весь смысл сериала, узнавание, рассыпается.
Шесть независимых генераций по одному и тому же описанию дают шесть разных людей. Черты лица словами не удерживаются: «бородатый мужчина сорока лет в клетчатой рубашке» — это не человек, это класс людей, и модель каждый раз берёт из класса нового.
Поэтому серия начинается не со сцены, а с опорного изображения. Один кадр на героя, навсегда: герой один в кадре, руки свои, пустая стена за спиной, поясной план. Дальше каждая сцена рождается правкой этого файла, а не новой генерацией.
Опорный кадр рисуем с нуля, не из фотографии. Фотография тянет рисованную манеру обратно в реализм: получается не персонаж мультфильма, а подкрашенный человек. И опорный кадр обязан быть стерильным — чужая рука, кружка или тарелка с него переезжают потом во все сцены разом.
Пять шагов, из которых собирается выпуск
- Сценарий, разбитый по сценам. Одна сцена — одно действие, один кадр, один прогон.
- Опорное изображение героя. По одному на каждого постоянного персонажа. Хранить отдельно и не перегенерировать: следующий выпуск снимается из этих же файлов.
- Кадры сцен правкой от опорного. Первый кадр локации — от опорного изображения героя, остальные кадры той же локации — от этого первого. Новая локация — снова от опорного, а не от последнего кадра, иначе она потащит за собой прежнюю комнату.
- Оживление. Каждый кадр отдельным прогоном превращается во фрагмент. Считаем в 480×832, апскейл до 1080×1920 делает сам граф.
- Сборка. Монтаж, музыка, подписи, субтитры.
Сила правки решает больше, чем текст промта. Замер 26 августа: до 0,80 сцена не меняется вообще, 0,85 меняет только реквизит, 0,90 меняет обстановку и оставляет героя, 0,93 и выше — лицо уплывает, и в кадре опять незнакомый человек. Рабочая пара получилась такая: 0,90 на смену локации, 0,87 на смену позы внутри уже снятой локации.
Сколько это стоит по времени
Арифметика простая, её легко пересчитать под свою карту. Кадр правкой — 55–90 секунд. Оживление одного фрагмента — 8–9 минут. Полминуты ролика — шесть-семь фрагментов: 48–63 минуты на оживление плюс 6–10 минут на кадры. Час машинного времени за тридцать секунд экранного.
Кадры рисуем в 864×1536 и уменьшаем до 480×832 уже на входе в оживление. Если генерировать сразу мелким, модель ломает пальцы и лица — на 480 точек по ширине ей не хватает места на кисть руки.
Переснять две сцены из шести — ещё минут двадцать. Поэтому все кадры сначала собираются в контактный лист и просматриваются глазами до оживления: пересъёмка кадра стоит полторы минуты, пересъёмка фрагмента — девять.
Домашней карты нет — тот же порядок работает в облаке, но арифметика там другая: время считается секундами, а расход — генерациями. Формулировки ниже мы мерили на локальной связке и на облачных моделях не перепроверяли.
Числительное рождает второго героя
Первое место по потерянным прогонам — счёт людей. Фраза exactly one bearded man is in the frame дала двух героев на трёх сидах подряд, без исключений. Механизм видно, если прочитать промпт целиком: в префиксе серии персонаж уже назван, the bearded man, и «ровно один бородатый мужчина» читается как ещё один такой же. Лечится определённой отсылкой: the man — ссылка на уже названного, без числа.
Отменять счёт нельзя: на предметах он точен — «три белых зефирины в кастрюле», «одна кастрюля на конфорке» выходят как заказано.
Рождает второго героя: exactly one bearded man is in the frame Держит одного: the man stands at the stove Счёт на предметах: three white marshmallows in the pot, one pot on the burner

Дефект не разовый: тот же лишний герой нашёлся в предыдущем выпуске, в сцене с ноутбуком. Не случайный сид, а реакция на конструкцию фразы.

Из той же семьи — попытка спрятать второго персонажа. Фраза «сидит мелко и размыто позади него» должна была увести героиню на задний план, а нарисовала вторую такую же: одну там, куда её поставил префикс, вторую позади. Описание модель читает как заявку на нового героя, а не как правку старого.
Внешность общими словами тоже не держится: просьба «keep characters as they are» очки на героине не сохранила — они исчезли из кадра и вернулись, только когда названы отдельным предметом.

Слово screen и слова о плане модель понимает буквально
У ноутбука формулировка The laptop screen is plain blank grey, completely empty and smooth работает и проверена: экран выходит пустым, без выдуманного интерфейса. Перенос той же фразы на телефон дважды, на разных сидах, дал одно: модель нарисовала смартфон и поместила ему на экран всю сцену. Телефон стал рамкой картинки.

Лечится описанием телефона как предмета — как лежит, какого цвета — без слова screen вообще. Обезличенная форма ещё хуже: The screen is... без владельца дало шахматку прозрачности во всю нижнюю треть кадра.
Второй буквализм — слова о кадре. «Поясной план», «в средней трети», «заполняет вертикальный кадр» модель принимает не за указание оператору, а за содержимое картинки и заливает верх и низ белым, до 27% высоты. Композицию приходится задавать через сцену: где стоят герои, что перед ними, что за ними. Проверка средней яркости брак не ловит: она считает по всему кадру, белые поля усредняются со сценой. Видно только глазами на контактном листе.
Пустой фон усиливает наезд камеры
Общий совет по видеогенерации: упростите фон, чтобы не трясло. На рисованной манере замер развернул его наоборот. Один промт движения, один сид, два кадра под ним: голая стена — дрожание 1,05, плотная кухня с полками, банками и окном — 0,59 при пороге 0,60. Тот кадр, что выглядел спокойнее, и оказался единственным браком из пары.
Объяснение механическое. При наезде модель держится за опорные точки: угол шкафа, раму окна, край полки. На голой стене держаться не за что, и вместо движения камеры выходит дрожание всей картинки. Побочный эффект — цвет: на голой стене насыщенность падала до 93–119, с плотной кухней держалась 134–168.

Ещё один ход из чужих гайдов — вычищать слово «камера» из промта движения. Проверили: с фразой «камера неподвижна» дрожание 1,05, без неё 1,19, то есть хуже. Фразу оставляем.
Глагол движения: на месте, а не через кадр
Здесь мы сначала вывели неверное правило и потратили на него партию прогонов. Казалось, что дело в объектах: мол, трогать предметы нельзя, можно только пар и блики. Следующий замер это опроверг. Дрожание на одной манере, один порог 0,60:
поднимает крышку выше — крышка едет через кадр, содержимое кастрюли пропало к середине газировка льётся в кастрюлю — струя тянется через кадр — 0,87, брак переводит взгляд в кастрюлю — слишком мелко — 0,60, ровно на пороге пар поднимается над кастрюлей — на месте, содержимое держится все пять секунд зефир тонет в жиже — на месте, в одной точке — 0,45, лучший результат партии
Зефир — предмет, и он движется. Дрожание при этом лучшее в партии. Значит, граница проходит не между предметом и не-предметом, а между движением на месте и движением через кадр.
Логика механическая, как и с фоном. Всё, что едет по кадру, модель считает главным и ведёт за ним камеру — отсюда 0,87 у льющейся струи. Всё, что происходит в одной точке, она отрабатывает внутри неподвижной рамки — отсюда 0,45 у тонущего зефира. Крышка, которую герой поднимает выше, уносит с собой не только себя: снимали ровно то, что в кастрюле, а к середине фрагмента содержимое ушло за верхний край. Английский вариант той же фразы дал то же самое, дело не в языке.
Обратная граница тоже есть. «Переводит взгляд с телефона в кастрюлю» — движение на месте, но крошечное: работы модели хватает на полсекунды, оставшиеся четыре с половиной она добирает наездом, и число садится ровно на порог. Слишком мало движения так же плохо, как слишком много.
Проверка глагола перед прогоном занимает секунду: спросите себя, есть ли у движения маршрут. «Льётся в», «поднимает выше», «проходит мимо», «влетает слева» — маршрут есть, камера поедет. «Тонет», «поднимается», «кипит», «колышется», «мигает», «оседает» — маршрута нет, есть точка. И второй вопрос: видно ли это движение с расстояния вытянутой руки. Взгляд — не видно.
Длина фрагмента: 81 кадр — это потолок
Обученное окно старшей модели — 81 кадр, и выходить за него нельзя: на 121 кадре картинка теряет связность, камера идёт срывами. Частота кадров тут не спасает — она не добавляет движения, а растягивает то же самое, и герои начинают двигаться неправдоподобно медленно.
Растянуть по-честному помогает интерполяция, и её мы прогнали. Граф множит кадры втрое: умножаются промежутки между кадрами, поэтому из 81 выходит не 243, а 241 — 80 промежутков превращаются в 240, плюс исходный первый кадр. При 48 fps это 5,02 секунды фрагмента. Те же 241 кадр при 16 fps дадут около 15 секунд, но это будет замедление, а не более длинная сцена.
Практический вывод: сцена, которую нельзя показать за пять секунд, должна быть разрезана на две сцены с разными кадрами, а не растянута настройками.
Чего эта связка не умеет
Список честнее любого обещания — вот что мы за две ночи так и не получили.
- Надписи в кадре. Любой текст при оживлении плывёт. Вывески, этикетки, обложки книг, облачка реплик в промпт кадра просто не попадают.
- Липсинк. Когда в кадре двое, модель не понимает, кто из них говорит. Мы ушли на закадровый голос.
- Сцена длиннее пяти секунд. Только склейка двух кадров, только разрез сценария.
- Два действия в одном фрагменте. Правило выведено на прогонах: одно движение на фрагмент. Связка «ставит кастрюлю и оборачивается» в пять секунд не помещается, и модель делает по половине от каждого.
- Пустая декорация без героя. Кадр локации рождается только из опорного изображения персонажа; вписанный словами герой каждый раз получает новое лицо.
- Мелкие детали на входе. Пальцы, зубы, узор на ткани в 480 точек по ширине не выживают — их надо либо убирать из кадра, либо не показывать крупно.
И отдельно про метрики. Число дрожания ловит тряску рамки, но не ловит рывки внутри движения и не ловит белые поля сверху и снизу. Контактный лист глазами отменить нечем.
Готовые промпты под этот конвейер
В каталоге лежат карточки под соседние шаги — их удобно взять, если своей карты нет и вы работаете в облаке.
- Сценарий вертикального ролика до 60 секунд — хук, раскрытие, решение и покадровая роспись: что говорит автор, что в кадре.
- Референс-борд героя по фото — три ракурса в рост и шесть поворотов головы. Путь для реалистичной манеры; для рисованной опорный кадр лучше рисовать с нуля, фотография тянет картинку в реализм.
- Сцена с персонажем: действие и движение камеры — сцена, действие, свет и требование держать одежду и черты весь ролик.
- Промпт для видео в Gemini (Veo) — восьмисекундный кадр с росписью камеры по секундам и звуком: в облаке окно длиннее нашего.
- Оживить фото: мимика по секундам — раскладка вдоха, моргания и полуулыбки при полностью неподвижной камере. Та же логика движения на месте.
Замеры по самой карте — сколько стоит секунда, какие разрешения проходят в 12 ГБ и почему слово static в негативном промте портит клип — в отчёте локальные нейросети для видео. Разбор видеопромпта по блокам, включая звук и негативный список, — в статье промпты для генерации видео.
FAQ
Почему нейросеть рисует двух одинаковых персонажей вместо одного?
Чаще всего виноват счёт. Фраза «в кадре ровно один бородатый мужчина» дала у нас двух героев на трёх сидах подряд: персонаж уже назван в общем префиксе сцены, и числительное модель читает как заявку на ещё одного такого же. Лечится определённой отсылкой — «the man», ссылка на уже названного, без числа. Спрятать лишнего описанием «мелко и размыто позади» тоже не получится: так рисуется второй экземпляр. На предметах счёт, наоборот, нужен и работает точно.
Правда ли, что простой фон уменьшает тряску в видео?
В нашем замере вышло наоборот. Один промпт движения, один сид, два кадра под ним: голая стена — дрожание 1,05, плотная кухня с полками, банками и окном — 0,59 при пороге 0,60. При наезде модели нужны опорные точки: рама окна, угол шкафа, край полки. На пустой стене держаться не за что, и она трясёт всю картинку. Голая стена вдобавок высушивает цвет — насыщенность 93–119 против 134–168.
Сколько времени занимает один фрагмент и весь ролик?
Кадр — 55–90 секунд, оживление одного пятисекундного фрагмента — 8–9 минут. Ролик на семь фрагментов выходит примерно в час машинного времени плюс отбор кадров. Замер сделан на RTX 4070 Super с 12 ГБ: семь прогонов оживления дают 56–63 минуты, семь кадров — ещё 6–10 минут. Пересъёмка двух неудачных сцен добавляет минут двадцать. Сценарий, запись голоса и монтаж считаются на процессоре и в этот час не входят.
Почему герой меняется от сцены к сцене?
Потому что каждая сцена рождается заново: шесть независимых генераций по одному и тому же описанию дают шесть разных людей. Лечится это не описанием внешности словами, а правкой от одного опорного изображения героя — сила правки 0,90 меняет обстановку и оставляет лицо, 0,93 и выше лицо уже уводит. Общая формулировка «keep characters as they are» не удержала у нас даже очки: они вернулись, только когда были названы отдельным предметом.
Что делать с текстом на экранах устройств в кадре?
Не генерировать его вовсе: просить пустую поверхность, а содержимое ставить в кадр самому до оживления. У ноутбука фраза про пустой серый экран сработала, а на телефоне она же дважды превратила смартфон в рамку — модель поместила внутрь него всю сцену. Обезличенное «The screen is...» без владельца дало шахматку прозрачности в нижней трети кадра. И держите зону экрана неподвижной: любые надписи при оживлении плывут.