Рабочий промпт для видео — это карточка одного кадра, а не пересказ ролика. Порядок, который модели разбирают лучше всего: субъект → действие → крупность и ракурс → движение камеры → свет → звук → список того, чего в кадре быть не должно. Одна генерация — это 4–15 секунд и ровно одно законченное действие, всё длиннее собирается из нескольких таких карточек. Ниже — разбор блоков, чем Veo отличается от Kling, где у обеих отваливаются руки и лица, и готовые промпты под задачи.

Типичная первая попытка: «красивое кинематографичное видео, девушка гуляет по осеннему городу, атмосферно». На выходе восемь секунд, где девушка стоит на месте, а «атмосферно» модель поняла как оранжевый фильтр. Слова про движение в промпте нет, а видеомодель предсказывает следующий кадр: «прогулка» движения не содержит, «идёт, наступая на палую листву, камера едет рядом» — содержит.

Живых видеосетей в каталоге осталось две

  • Veo 3.1 (Google) — речь, шумы и эмбиент рождаются в одном проходе с картинкой, и по речи это самая обкатанная модель четвёрки. Ограничения жёсткие: 4, 6 или 8 секунд за генерацию, только 16:9 и 9:16, 24 кадра в секунду; 1080p и 4K по документации Gemini API доступны лишь для восьмисекундного ролика.
  • Kling 3.0 (Kuaishou) — сайт и приложение открываются из России, интерфейс понимает русский, бесплатный тариф есть. До 15 секунд за генерацию (по релизу Kuaishou от 5 февраля 2026) плюс Motion Brush: кистью помечаете, что двигается, а что стоит.
  • Sora (OpenAI) — закрыта: сайт и приложения отключены 26 апреля 2026, API работает до 24 сентября 2026. Генерации видео в ChatGPT сейчас нет.
  • Gemini, Claude, YandexGPT — видео не рисуют, но раскладывают идею на карточки кадров с таймингом; без этого шага тридцатисекундный замысел схлопывается в восемь секунд каши.
  • Midjourney — стартовый кадр и обложка: первый кадр задаёт лицо, свет и композицию намертво.

Все видеопромпты каталога — в разделе «Промпты для видео».

Из чего собран рабочий видеопромпт

Порядок блоков не декоративный: модели учились на роликах со структурированными подписями, где эти поля разнесены, и промпт, повторяющий структуру подписи, попадает в знакомое распределение.

Субъект и действие. Кто в кадре — с одной характерной деталью: не «мужчина», а «мужчина за пятьдесят, седая щетина, вязаный свитер с растянутым воротом». Эту деталь вы будете дословно повторять в каждой генерации, чтобы герой не поменял лицо. Действие — одно, с началом и концом: «поворачивает голову к окну и замирает» идёт стабильно, «поворачивает голову» уходит в бесконечное дёрганье. Называйте и способ — «переворачивает оладью лопаткой», иначе модель домыслит физику сама и сунет в раскалённую сковороду голую руку.

Крупность и камера. Движение камеры — одно на кадр. Dolly in, pull back, pan left, tilt up, orbital shot, handheld — слова из описаний обучающих видео, у них есть точное визуальное соответствие; у «кинематографично» его нет. «Облёт плюс наезд плюс подъём» схлопывается во что-то одно или в дрожь: два движения — это два кадра.

Свет и звук. Свет — самый сильный рычаг реализма: «жёсткий контровой из окна», «холодный неон через мокрое стекло» вместо «красивого освещения». Звук пишите помеченными строками, иначе «шум дождя» станет визуальным дождём: реплика — после двоеточия, эффекты — через «SFX:», фон — через «Ambient:». И привязывайте звук к видимому действию: «щелчок в момент, когда крышка закрывается».

Чего в кадре быть не должно. Списком существительных и только в отдельном поле негативного промпта. В основном тексте отрицания не работают: Google просит не писать «no walls», а описывать желаемое — «пустынный ландшафт до горизонта». Энкодер кодирует смысл слов, а не логику отрицания: «без стены» превращается во внимание к стене.

Субъект: [кто в кадре — возраст, одежда, одна характерная деталь]
Действие: [одно законченное действие, с началом и концом]
Крупность и ракурс: [medium shot / close-up / wide, низкий или верхний ракурс]
Движение камеры: [одно движение: dolly in / pan left / static shot]
Свет: [мягкий свет золотого часа / жёсткий контровой из окна / холодный неон]
Оптика и стиль: [35 mm, малая глубина резкости, зерно плёнки]
Звук: SFX: [звук, привязанный к видимому действию]; Ambient: [фон места]
Длительность: [4 / 6 / 8 секунд]
Негативный список: warped hands, on-screen text, subtitles, watermark

Разобранный вариант схемы — карточка «сцена, камера, движение и стиль». Готовый пример по этой схеме, без говорящего героя, — атмосферный b-roll.

Восемь секунд — это одно действие, а не короткий фильм

Считайте секунды до генерации. Восемь секунд вмещают одно событие: человек оборачивается и говорит фразу или камера облетает предмет. Три события дают мешанину.

Длинный ролик собирается иначе: сценарий режется на карточки по одному действию, каждая генерируется отдельно, склейка — в монтажке. У Veo продление добавляет 7 секунд за вызов, но только в 720p: минута — это 8 секунд старта плюс семь шагов, все в 720p, хуже одиночной генерации в 1080p. У Kling продления есть, но к концу цепочки первым сыплется звук.

Несколько тактов внутри одной генерации задаются таймстемп-разметкой — это лечит беду «восемь секунд одного статичного плана». Последняя строка нужна, если склеек не надо: иначе модель поставит их сама.

[00:00–00:03] [крупность] — [что в кадре, что происходит]
[00:03–00:06] [крупность] — [следующий такт действия]
[00:06–00:08] [крупность] — [финальная точка кадра]
Герой, свет и оптика во всех тактах: [дословно повторить описание]
single continuous shot, no cuts

Сюжет стоит разложить текстовой моделью до генерации: у Veo вход ограничен 1024 токенами, лишнее отрезается молча — человек видит «модель меня не послушала», хотя его текста там не было. Раскадровку делает сценарий короткого видео для Shorts, вертикальный формат до минуты — сценарий вертикального видео до 60 секунд, а на русском без препятствий работает промпт для Reels, Shorts и Клипов ВК. Референс-борд героя собирает character sheet по фото.

Речь, липсинк и субтитры-призраки

Реплику оформляйте служебным синтаксисом: «смотрит в камеру and says in Russian: „реплика“». Двоеточие и кавычки отделяют произносимый текст от описания сцены — без них персонаж молча изображает разговор.

Длину реплики считайте арифметикой: речь идёт примерно два-три слова в секунду, значит в восемь секунд с паузой на вдох влезает фраза слов на десять-двенадцать. Сверх этого модель тараторит или обрывает на полуслове. Если в кадре двое, называйте говорящего по имени и место: «medium shot, Анна слева». И средний план прощает липсинку больше, чем макро.

Отдельная беда Veo — вшитые субтитры: модель училась на видео с подписями и дорисовывает их к каждой реплике, а выключить нельзя, они прямо в кадре (проблему разбирал MIT Technology Review ещё на Veo 3). Практика сообщества — писать NO SUBTITLES в начале и в конце промпта: гарантии нет, частота падает.

Medium shot, [ИМЯ] стоит слева в кадре, [возраст, одежда, характерная деталь].
NO SUBTITLES, no on-screen text, no captions.
Смотрит в камеру and says in Russian: «[РЕПЛИКА — не больше 10–12 слов]».
Камера статична, свет мягкий из окна слева, 35 mm.
SFX: [звук, привязанный к видимому действию].
Ambient: [фоновый шум места].
NO SUBTITLES.

Про русскую речь прямо. У Kling в официальном списке нативной озвучки пять языков: английский, китайский, японский, корейский, испанский. Русского там нет — озвучку кладут поверх готового видео. У Veo документация Gemini API пишет, что полностью протестирован только английский. Короткая русская реплика в статичном кадре обычно выходит, монолог на восемь секунд — рулетка. Наш промпт под эту задачу — говорящий персонаж с репликой по-русски, и оговорка стоит внутри карточки.

Veo: когда нужен звук в одном проходе

Veo берут ровно за это: ролик про готовку без шкворчания на сковороде — половина ролика. В приложении Gemini видео с мая 2026 делает Gemini Omni Flash — 3–10 секунд, 720p; Veo 3.1 живёт в Gemini API, AI Studio и Flow, туда идут за 1080p и продлениями. Сборки под частые задачи в разделе Veo:

Про деньги: бесплатного тарифа на видеогенерацию у Google нет. По прайсу Gemini API секунда Veo 3.1 стоит $0,40 в 720p и 1080p — восьмисекундный дубль обходится в $3,2, а дублей нужно несколько; Lite идёт по $0,05 за секунду, те же восемь секунд — сорок центов, но без 4K. И вторая часть: сервисы Gemini в России недоступны, карты российских банков Google Billing не принимает.

Kling: доступен из России и оживляет фото

Главная причина брать Kling — работа со стартовым кадром: картинка становится первым кадром, текст управляет движением. Это же лечит дрейф внешности — лицо зафиксировано изображением, а не словами. Кадр рисуется по промптам для генерации изображений, обложку закрывает кликабельное превью YouTube-видео и статья обложка для Reels и Shorts. И правило, которое ломает большинству людей первую генерацию: не пересказывайте то, что уже видно на фото — иначе модель перерисовывает то, что должна была сохранить. Ориентир: 15–40 слов на оживление фото против 60–100 на генерацию с нуля.

[ЧТО ИМЕННО НАЧИНАЕТ ДВИГАТЬСЯ на загруженном кадре]
Конец движения: [в какой позе действие завершается]
Камера: [одно движение с направлением, например slow push-in]
Скорость: [рывком / плавно, без слоу-мо]
Негативный промпт: motion blur, face distortion, warping, morphing,
extra limbs, floating objects, background shifting

Негативный промпт пишите сразу, а не после трёх испорченных дублей: он в отдельном поле и стоит ноль лишних попыток. И ставьте глагол скорости, если не хотите слоу-мо: по умолчанию Kling снимает всё как рекламу духов — человек встаёт со стула четыре секунды. Единственный случай, когда этот дефолт играет за вас, — фуд-ролик.

Из ограничений: причинно-следственную цепочку через весь ролик Kling держит плохо — блюдо на тарелке в конце может не совпасть с тем, что жарилось на сковороде секундой раньше. Плюс китайская модерация: политические сюжеты режутся. Лимиты и цены бесплатного тарифа Kling менял за 2026 не раз. Российской картой подписка не оформляется, способов обойти это мы не разбираем.

Sora: что было и куда переехали промпты

OpenAI закрыла Sora: приложение и сайт отключены 26 апреля 2026, API доживает до 24 сентября 2026, после чего пользовательские библиотеки удаляются. Преемник не анонсирован, видеонаправление ушло в исследования world models. По разборам прессы причина экономическая, но своих цифр компания не публиковала.

Десять наших промптов Sora мы не удалили. Sora 2 разбирала промпт по смысловым слоям: сцена, кинематография, действие, реплики, фон — ровно эта структура работает в Veo и Kling. Так что кинематографичная сцена по формуле, диалоговая сцена со звуком, фоновое видео для лендинга и историческая сцена для учебного видео живут дальше как заготовки: берёте текст, добавляете звуковые метки Veo или негативный список Kling — и отправляете в живую модель. Уведомление о закрытии стоит на каждой карточке.

Что ломается чаще всего и как это чинится

Перегенерация — норма: ни одна модель 2026 года не даёт годный дубль с первого раза.

  • Руки и пальцы. Крупный план кистей, шнурки, набор текста. Лечится отъездом камеры: развалившееся на макро на среднем плане проходит.
  • Текст в кадре. Вывеска, этикетка, цена, титры превращаются в псевдобуквы. Читаемые надписи не закладывайте — накладывайте их в монтаже.
  • Лицо героя плывёт между дублями. Памяти между генерациями нет. Внешность держат два средства: дословно повторяемая формула и референсы — до трёх картинок у Veo, набор Elements у Kling. Даже с ними форма носа гуляет.
  • Жидкость, ткань, волосы, дым. Всплеск воды, развевающееся платье, волосы на ветру выдают ролик быстрее всего.

Сюда же перегруз сцены: Kling при нехватке бюджета жертвует следованием промпту ради плавности, длинный текст исполняется наполовину — держите три-пять значимых элементов. И противоречия: «яркое ночное небо», «крупный план общей панорамы» модель не разрешает, а усредняет. Правило отладки: артефакты чаще лечатся вычёркиванием. Черновики гоняйте на 720p, детали наращивайте после того, как вышло движение.

Чего видеомодели не сделают ни при каком промпте

  • Не снимут ваш сценарий целиком. Одна генерация — 4–15 секунд; ролик на минуту существует как набор клипов, а монтаж, титры и финальный звук — ручная работа.
  • Не дадут повторяемости. Мелкая правка промпта выдаёт другой дубль: замка на камеру и тайминг нет.
  • Не сгенерируют узнаваемых людей и чужие франшизы. Публичные лица, персонажи чужих вселенных и торговые марки режутся модерацией, плюс это чужая интеллектуальная собственность.
  • Не заменят оператора там, где нужна точность. Быстрый бег, драки, резкие проводки камерой дают артефакты. Движение камеры вместе с несколькими анимируемыми объектами модель упрощает: либо едет камера, либо живут все в кадре.
  • Не обойдут региональные ограничения. Напрямую из России доступен Kling; для картинок и коротких видео есть Kandinsky и Шедеврум — они отстают по длительности и звуку, но работают без препятствий. Что выбрать из этих двух — разбор Kandinsky или Шедеврум.

FAQ

Сколько секунд длится ролик, сгенерированный по одному промпту?

У Veo 3.1 — 4, 6 или 8 секунд, причём 1080p и 4K доступны только для восьмисекундного варианта. У Kling 3.0 — до 15 секунд. Длиннее собирается продлениями или монтажом: продление у Veo добавляет 7 секунд за вызов и отдаётся в 720p, так что длинный ролик теряет в разрешении.

Будет ли в ролике звук и заговорит ли персонаж по-русски?

Звук будет: и Veo, и Kling генерируют речь, шумы и эмбиент в одном проходе с картинкой. С русским сложнее. У Kling в списке нативной озвучки пять языков, русского нет — озвучку кладут поверх видео. У Veo документация Gemini API называет полностью протестированным только английский: короткая реплика выходит, длинный монолог — как повезёт.

Можно ли сделать видео из своей фотографии?

Да, это режим image-to-video: снимок становится первым кадром, а текст управляет движением. У Kling он штатный, плюс Motion Brush — кистью помечаете области, которые должны двигаться, и фиксируете фон. Правило одно: не описывайте то, что уже видно на фото, иначе модель начнёт это перерисовывать. Заготовка — оживить фото.

Почему лицо героя меняется от дубля к дублю?

Между генерациями у модели нет памяти о персонаже: каждый раз она заново тянет ближайшее к описанию лицо. Внешность держат два средства — дословно повторяемая формула (возраст, одежда, цвет волос, свет) и референсные изображения: до трёх у Veo, набор Elements у Kling. Полной гарантии не даёт ни одно.

Какую сеть выбрать под мою задачу?

Звук и говорящий персонаж — Veo, если есть доступ к сервисам Google. Оживить фотографию, снять вертикальный ролик или продуктовый облёт из России — Kling. Сценарий и раскадровка — Gemini, Claude или YandexGPT. Стартовый кадр — Midjourney или Kandinsky. Все карточки собраны в разделе видеопромптов.