Домашняя видеокарта на 12 ГБ делает видео — короткое и по жёстким правилам. На нашей RTX 4070 Super модель Wan 2.2 в старшей версии 14B оживляет кадр 1024×576 на три секунды за 411 секунд счёта, младшая 5B шевелит пар и капли на 704×704 за 108 секунд. За границей остаются лица, надписи в кадре, клипы длиннее трёх с половиной секунд и сложное движение камеры на младшей модели.

Это отчёт по замерам 18 августа 2026 года на одной карте, а не пересказ анонса. В обзорах локальное видео описывают словами разработчика: «пять секунд 720p». Нам нужно было другое — сколько стоит секунда, какие кадры оживают и в каком месте модель начинает врать. Клипы считались через ComfyUI своим скриптом, каждый мы смотрели глазами и мерили дрожание края кадра числом.

Что именно стояло на карте

Карта — RTX 4070 Super, 12 281 МБ видеопамяти. Оболочка — ComfyUI версии 0.33. Моделей две, и это принципиально: они умеют разное и стоят по-разному.

  • Wan 2.2 TI2V-5B, обычный fp16 — один файл на 9,3 ГБ, без ускоряющих LoRA. Быстрая, с узким кругом задач.
  • Wan 2.2 I2V-A14B в квантованном виде — два файла GGUF Q4_K_S по 8,15 ГБ (модель двухстадийная, стадии грузятся по очереди), к каждой стадии своя четырёхшаговая LoRA-ускоритель. Отдельная тонкость, на которой легко споткнуться: VAE тут берётся от версии 2.1, а не 2.2.

Карточка модели на Hugging Face (сверено 18.08.2026) обещает пятисекундное видео 720p «меньше чем за 9 минут на одной потребительской карте», а пример запуска там рассчитан на 24 ГБ — вдвое больше, чем у нас. Отсюда и квант. Штатный шаблон ComfyUI тянет fp8-вариант по 13,31 ГБ на стадию, 26,6 ГБ на обе: в 12 не влезает ни одна, каждый шаг идёт с подкачкой из оперативной памяти. Q4_K_S — 8,15 ГБ на стадию, влезает целиком, и качать на 10 ГБ меньше.

Ещё одно про версии, чтобы не искать зря. Открытыми файлами выложена именно 2.2, под лицензией Apache 2.0. Номера свежее — 2.5 и 2.6 — доступны через облачный сервис Alibaba, весов для скачивания у них нет (проверено веб-поиском 18.08.2026). «Локально» и «самая новая версия» здесь пока не одно и то же.

Сколько стоит секунда видео

Замеры младшей 5B. Везде 73 кадра — 3 секунды при 24 fps, сид фиксирован, модель уже прогрета (первый прогон после запуска дольше: в него входит загрузка).

480×480,  20 шагов — 48–51 с — мусор: радужные ореолы, «пластилин»
480×480,  30 шагов — 64 с    — тот же мусор, шаги не лечат
576×576,  20 шагов — 73 с    — чисто
640×640,  20 шагов — 92 с    — чисто
704×704,  20 шагов — 108 с   — чисто, рабочий формат
960×544,  20 шагов — 113 с   — движения меньше
1280×704, 20 шагов — 210 с   — деталей больше, но не чище 704

Верхние две строки читайте внимательно: 480p — не «дешёвый режим», а брак. Радужные ореолы по контурам, пересветка, зелёный пар. Мы перебрали cfg 2.0, 3.5, 5.0 и 7.0, shift 3, 8 и 12, двадцать и тридцать шагов, два сэмплера — артефакт остался. Причина не в настройках, а в арифметике: VAE у 5B сжимает кадр в 16 раз, и от 480×480 остаётся сетка 30×30 — модель работает вне обученного диапазона. С 576 по короткой стороне кадр чистый, с 704 — чистый надёжно: появляются отражения, глубина, пар завивается.

Второе наблюдение: широкий кадр 960×544 стоит почти столько же, сколько квадрат 704×704 — 113 секунд против 108. Токенов в скрытом представлении почти одинаково, 510 против 484 на кадр, поэтому формат 16:9 достаётся практически бесплатно. Вес файла тоже не проблема: три секунды 704×704 после перекодирования — 45 КБ.

Три секунды за семь минут: что даёт старшая модель

Главный результат дня: то, чего 5B не может, 14B делает. Один и тот же кадр городской улицы, один запрос (пар из люка, взлетающая стая голубей, медленный проезд камеры), один сид. Для сравнения — готовый клип этой же сцены, снятый раньше в облачном Kling.

  • Голуби. У 5B — размазанные силуэты, вырастающие прямо из асфальта, либо ни одной птицы. У 14B летят стаей, крылья читаются.
  • Отражения в луже. Ключевая деталь кадра: у 5B пропадала, у 14B держится.
  • Лишние объекты. 5B однажды вырастила в кадре машину, которой в исходнике нет. У 14B такого не было.
  • Проезд камеры. У 5B вместо плавного движения рывки: дрейф края 0,99 при максимуме 6,66. У 14B ровно.
  • Надписи на витрине. Единственная явная слабость 14B: буквы искажены, в облачном референсе они читаются.
  • Время. 5B на максимуме своих возможностей (1280×704, 121 кадр, 30 шагов) — 583 секунды, и всё равно без птиц. 14B — 411 секунд и вердикт «почти как оригинал».

Цена — 411 секунд против 132 у 5B на том же кадре, втрое дороже. В пересчёте это около 135 секунд счёта на одну секунду видео (411 разделить на 3,04). Распределение отсюда простое: 14B — под движение камеры и живой мелкий объект, 5B — под оживление кадра, где шевелится один предмет.

Окно 81 кадр: клип не растягивается

Три прогона одного кадра и одного промта, сид 777, разница только в длине и частоте кадров:

  1. 73 кадра, 24 fps — 3,04 секунды видео, 411 секунд счёта. Лучший результат.
  2. 121 кадр, 24 fps — 5,04 секунды, 808 секунд счёта. Камера пошла срывами.
  3. 81 кадр, 16 fps — 5,06 секунды, 447 секунд счёта. Не трясёт, но голуби летят неправдоподобно медленно.

У 14B обученное окно — 81 кадр, и выходить за него нельзя: на 121 модель теряет связность. Метрика этого не показывает: дрейф края у рваного клипа 3,78 против 9,29 у хорошего, потому что мерит смещение рамки, а не рывки внутри движения. Здесь решает только просмотр.

А частота кадров на генерацию не влияет вообще. Модель отдаёт набор кадров, fps — это метаданные контейнера, скорость воспроизведения. Поставив 16 вместо 24, мы не включили «нативный темп», а растянули то же движение с 3,4 до 5,06 секунды: птицы стали махать крыльями медленнее, чем машут в жизни. Доказательство прямое — клипы 81/16 и 81/24 дали идентичные метрики: край 6,45, максимум 15,48, движение 8,38, плавность 1,58. Один и тот же набор кадров.

Рабочее правило: 81 кадр при 24 fps, это 3,38 секунды, и это потолок. Нужен клип длиннее — склейка двух проходов или интерполяция, а не «поднять длину». У 5B окно шире, 121 кадр проходил ровно, но она не умеет ни птиц, ни проезда камеры, так что запасом пользоваться негде.

Главная ошибка промта: описывать, как именно движется

Промт для оживления кадра короче, чем для картинки, и это первое, что удивляет. Субъект, свет и стиль уже заданы кадром, дописывать их не надо — пишется только движение и движение камеры:

[ЧТО ДВИЖЕТСЯ: a flock of pigeons takes off and flies from right to left, wings flapping],
[ОДНО ДВИЖЕНИЕ КАМЕРЫ: camera slowly pushes in],
everything else stays fixed

Эта формулировка дала эталонный клип. А теперь то, что сломало ту же сцену: попытка уточнить механику — «летят как одна группа, все птицы в одном направлении, крылья синхронно, никто не летит к камере». Птицы полетели в стену. Модель не понимает согласованность как ограничение: она реагирует на каждый оборот речи и начинает изобретать движение. Правило, которое стоило нам пяти прогонов: описывайте, что движется, а не как именно. Слово «стая» нужно, иначе птицы разлетятся в разные стороны; расписывать полёт стаи — нет.

И методическая честность: в тех пяти прогонах мы дважды поменяли по два параметра сразу — длину и fps, длину и промт. Три результата из пяти вышли неоднозначными: непонятно, что именно сработало. Меняйте по одному, иначе получается не замер, а впечатление.

Слово static в негативном промте стоило нам брака

У Wan негативный промпт работает — в отличие от локальных картиночных моделей вроде FLUX, где запреты просто попадают в кадр обычными словами (разбор этого — в отчёте про локальную нейросеть для картинок). И почти во всех популярных наборах негатива стоит слово static. Человеческая логика понятна: не хочу неподвижную картинку. Логика модели другая: статичность запрещена — значит надо чем-то двигать, и она двигает камерой.

Замер: клип с блюдом еды на негативе из гайда дал дрожание края 3,21, смотреть невозможно. Тот же кадр, тот же сид, тот же позитив с вычищенным словом — 0,96, движение сохранилось. Наш рабочий негатив:

camera shake, camera movement, zoom, push-in, dolly, panning, bright colors,
overexposed, blurred details, low quality, extra fingers, malformed limbs,
cluttered background

Он запрещает движение камеры целиком: это набор для клипов, где двигается предмет, а рамка стоит. Нужен проезд камеры — уберите из строки camera movement, push-in, dolly и panning, иначе вы просите модель ехать и не ехать разом.

Что оживает, а что нет: шесть кадров из каталога

Мы прогнали через 5B шесть готовых картинок каталога, короткая сторона 576. Итог:

  • Улица с люком, пар поднимается. Годится: край 0,77, движение 0,95.
  • Лазанья, пар над блюдом. Годится, но только после вычистки static из негатива.
  • Кот у мокрого окна, капли по стеклу. Формально чисто (край 0,15), а на просмотре шерсть и размытый фон «дышат» — читается как тряска.
  • Скандинавский интерьер, шторы и листья. Брак: дрожание на месте.
  • Сауна, свет и пар у полка. Пусто: движение 0,27, смотреть нечего.
  • Ночной переулок, отражения в луже. Годится, силуэт в тени устоял.

Закономерность одна: 5B нужен один крупный, явно движущийся объект — пар, дым, капли, ткань на ветру. Если такого объекта нет, модель не оставляет кадр в покое, а начинает шевелить всё по мелочи. Получается «дыхание» картинки, и на просмотре оно читается как брак. Интерьер без дыма и воды оживлять бессмысленно: это не слабое движение, это дрожь.

Люди — отдельная история, и запрет тут жёсткий. Крупный портрет 704×704: кожа без текстуры, волосы слипшимся пятном, глаза нарисованные — кукла, а не человек. Мелкая фигура в глубине кадра не лучше: модель заставляет её идти, ноги не прорисовываются, человек болтается в воздухе. Словами это не выключается. Отдельный прогон с прямым «двое стоят совершенно неподвижно, никто не идёт» в позитиве и запретом движения камеры в негативе: камеру негатив удержал (край 1,66 против 0,99), а фигуры всё равно пошли по дорожке и выросли в кадре. Кадр с человеком в оживление лучше не отдавать.

И третья ловушка: ни тряска, ни неестественная походка не видны на сетке кадров — она показывает композицию, а не пластику. Ловится только просмотром, и это, а не счёт, съедает вечер. Три секунды приходится пересматривать раз десять, каждый раз с ощущением, что показалось.

Где рвётся установка

  • GGUF читает только отдельная нода — ComfyUI-GGUF (автор city96). Без неё квантованная модель просто не появится в списке загрузчиков.
  • Папки unet в ComfyUI 0.33 нет как типа. Запрос списка папок отдаёт 27 типов, среди них diffusion_models и diffusers, а unet отсутствует. При этом нода GGUF регистрирует свой тип и эту папку видит: файлы в models/unet работают, но только вместе с ней. Круг мы на этом и потеряли: файлы легли туда до установки ноды, и ComfyUI не увидел их вовсе.
  • После установки ноды нужен полный перезапуск процесса. Кнопка Restart в менеджере новые ноды не поднимает — выглядит как «нода не работает».
  • Картинки и видео в один вечер — по очереди. Два движка держат модель в видеопамяти, второй уползёт в системную и станет непригодно медленным.

И запас, который мы пока не выбрали. Во время работы 14B на карте свободно 7 258 МБ из 12 281: ComfyUI осторожничает и подкачивает веса из оперативной памяти, хотя место есть. Отсюда два рычага. Первый — вынести текстовый энкодер на процессор: у загрузчика есть параметр device со значением cpu, а энкодер весит около 6,7 ГБ и висит в видеопамяти постоянно, хотя нужен один раз, чтобы закодировать промпт. Второй — флаг запуска, держащий модель в видеопамяти целиком. Точка отсчёта для сравнения: 458 секунд на 81 кадр 1024×576.

Большая новая модель домашнюю карту не спасает

Соблазн понятный: если 12 ГБ мало, взять модель посвежее и посильнее. Мы проверили по числам MiniMax H3 — 33B, открытые веса с начала августа 2026, шаблон в ComfyUI есть. Скачать нужно 42,5 ГБ. Официального минимума по видеопамяти у неё нет, для 12 ГБ формулировка звучит как «возможно при агрессивной выгрузке, ждите медленной генерации»; практичный коридор — 16–24 ГБ.

Вывод обратный интуиции: на 12 ГБ выигрывает не самая новая модель, а хорошо сжатая старшая — она влезает в память целиком и не гоняет веса через оперативку.

Чего мы пока не проверили

Честный список, чтобы не принимать отчёт за полный:

  • Петля. Шаблон «видео по первому и последнему кадру» позволяет подать один кадр и началом, и концом — теоретически ровный цикл без рваного стыка. В обсуждениях жалуются на уползающий к концу цвет, сами не проверяли.
  • Интерполяция кадров. RIFE обещает сгладить движение почти бесплатно.
  • Флаг запуска, держащий модель в видеопамяти целиком. Прирост правдоподобен, цифры не наши.
  • Склейка проходов в клип длиннее 81 кадра. Единственный способ выйти за три с половиной секунды — и тот, о котором нам нечего сказать.

Границы, за которые не стоит и пробовать

  • Лица и люди в движении. Портрет крупным планом выходит куклой, мелкая фигура — идущей вопреки прямому запрету.
  • Текст в кадре. Витрину с надписями искажает даже 14B. Негатив помогает слабо, надёжнее убрать текст из сюжета.
  • Звук. Наша сборка отдаёт только картинку.
  • Клип длиннее 3,4 секунды. За окном 81 кадра камера идёт срывами.
  • Мелкие быстрые объекты и проезд камеры на 5B. Птицы получаются размазанным пятном, движение камеры — рывками. Это работа для 14B.
  • «Документные» кадры. Экраны, чаты, планы, чертежи, карты не оживляются вовсе: текст плывёт, а он там главный.

Если нужно как раз то, что в этом списке — сложное движение, длинный клип, говорящий человек, — дело не в железе, а в модели: это снимают облачные генераторы, и там всё решают формулировки. Как устроен такой запрос, разобрано в статье про промпты для генерации видео.

Рецепт, который у нас работает

Два набора настроек с лучших прогонов. Это не универсальные значения: на другой карте и другой сборке цифры уедут, но начинать разумно отсюда.

Оживление кадра, один движущийся предмет (модель 5B, fp16):
704×704 или 960×544 · 73 кадра · 24 fps · 20 шагов · cfg 3.5 · shift 8 · uni_pc + simple
промт: [ЧТО ДВИЖЕТСЯ] + everything else stays fixed
время на нашей карте: 108–113 секунд

Движение камеры и живой мелкий объект (модель 14B, GGUF Q4_K_S):
1024×576 · 81 кадр · 24 fps · 8 шагов (переход на 4-м) · cfg 1.0 · shift 8 · euler + simple
промт: [ЧТО ДВИЖЕТСЯ] + [ОДНО ДВИЖЕНИЕ КАМЕРЫ], без детализации механики
время на нашей карте: около 460 секунд

Обратите внимание на cfg во втором наборе. Единица здесь не опечатка: так работают дистиллированные четырёхшаговые LoRA, и значение выше их ломает. Поэтому чужой совет «cfg 3.5 обязательно» сначала проверяйте: к дистилляту он или к полной модели, к одностадийной 5B или к двухстадийной 14B. Половина противоречий в обсуждениях растёт отсюда.

FAQ

Хватит ли 12 ГБ видеопамяти для генерации видео?

На нашей RTX 4070 Super с 12 ГБ обе модели Wan 2.2 работают: младшая 5B в fp16 напрямую, старшая 14B — в квантованном виде Q4_K_S, по 8,15 ГБ на стадию. Полновесный fp8-вариант той же 14B просит 13,31 ГБ на стадию и в память не влезает. Дело не только в объёме карты, а в том, какую сборку вы скачали.

Сколько времени идёт один клип на домашней карте?

По нашим замерам: три секунды 704×704 на младшей модели — 108 секунд, три секунды 1024×576 на старшей — 411 секунд, то есть около 135 секунд счёта на секунду видео. Первый клип после запуска дольше остальных, в него входит загрузка модели. Вечер при этом уходит не на счёт, а на пересмотр: тряску и неестественное движение видно только глазами.

Почему клип 480p выходит с радужными ореолами?

Это не настройки, а разрешение. VAE у младшей модели сжимает кадр в 16 раз, и от 480×480 остаётся сетка 30×30 — модель работает вне обученного диапазона. Мы перебрали cfg, shift, число шагов и сэмплеры, артефакт остался. Чисто становится с 576 по короткой стороне, надёжно чисто — с 704.

Почему нельзя сделать клип длиннее трёх секунд?

У старшей модели обученное окно 81 кадр, это 3,38 секунды при 24 fps. На 121 кадре в нашем прогоне камера пошла срывами, а время счёта выросло до 808 секунд. Снижать частоту кадров бесполезно: fps не влияет на генерацию, он только растягивает то же движение, и объекты начинают двигаться неправдоподобно медленно.

Можно ли оживить фотографию с людьми?

По нашим прогонам — нет. Крупный портрет выходит куклой: кожа без текстуры, волосы пятном. Мелкая фигура в глубине кадра начинает идти, и ноги не прорисовываются. Запретить движение словами не получилось: прямое указание стоять неподвижно удержало камеру, но не людей. Для портретной зоны надёжнее картиночная модель, а не видео.