Рабочий промпт для видео — это карточка одного кадра, а не пересказ ролика. Порядок, который модели разбирают лучше всего: субъект → действие → крупность и ракурс → движение камеры → свет → звук → список того, чего в кадре быть не должно. Одна генерация — это 4–15 секунд и ровно одно законченное действие, всё длиннее собирается из нескольких таких карточек. Ниже — разбор блоков, чем Veo отличается от Kling, где у обеих отваливаются руки и лица, и готовые промпты под задачи.
Типичная первая попытка: «красивое кинематографичное видео, девушка гуляет по осеннему городу, атмосферно». На выходе восемь секунд, где девушка стоит на месте, а «атмосферно» модель поняла как оранжевый фильтр. Слова про движение в промпте нет, а видеомодель предсказывает следующий кадр: «прогулка» движения не содержит, «идёт, наступая на палую листву, камера едет рядом» — содержит.
Живых видеосетей в каталоге осталось две
- Veo 3.1 (Google) — речь, шумы и эмбиент рождаются в одном проходе с картинкой, и по речи это самая обкатанная модель четвёрки. Ограничения жёсткие: 4, 6 или 8 секунд за генерацию, только 16:9 и 9:16, 24 кадра в секунду; 1080p и 4K по документации Gemini API доступны лишь для восьмисекундного ролика.
- Kling 3.0 (Kuaishou) — сайт и приложение открываются из России, интерфейс понимает русский, бесплатный тариф есть. До 15 секунд за генерацию (по релизу Kuaishou от 5 февраля 2026) плюс Motion Brush: кистью помечаете, что двигается, а что стоит.
- Sora (OpenAI) — закрыта: сайт и приложения отключены 26 апреля 2026, API работает до 24 сентября 2026. Генерации видео в ChatGPT сейчас нет.
- Gemini, Claude, YandexGPT — видео не рисуют, но раскладывают идею на карточки кадров с таймингом; без этого шага тридцатисекундный замысел схлопывается в восемь секунд каши.
- Midjourney — стартовый кадр и обложка: первый кадр задаёт лицо, свет и композицию намертво.
Все видеопромпты каталога — в разделе «Промпты для видео».
Из чего собран рабочий видеопромпт
Порядок блоков не декоративный: модели учились на роликах со структурированными подписями, где эти поля разнесены, и промпт, повторяющий структуру подписи, попадает в знакомое распределение.
Субъект и действие. Кто в кадре — с одной характерной деталью: не «мужчина», а «мужчина за пятьдесят, седая щетина, вязаный свитер с растянутым воротом». Эту деталь вы будете дословно повторять в каждой генерации, чтобы герой не поменял лицо. Действие — одно, с началом и концом: «поворачивает голову к окну и замирает» идёт стабильно, «поворачивает голову» уходит в бесконечное дёрганье. Называйте и способ — «переворачивает оладью лопаткой», иначе модель домыслит физику сама и сунет в раскалённую сковороду голую руку.
Крупность и камера. Движение камеры — одно на кадр. Dolly in, pull back, pan left, tilt up, orbital shot, handheld — слова из описаний обучающих видео, у них есть точное визуальное соответствие; у «кинематографично» его нет. «Облёт плюс наезд плюс подъём» схлопывается во что-то одно или в дрожь: два движения — это два кадра.
Свет и звук. Свет — самый сильный рычаг реализма: «жёсткий контровой из окна», «холодный неон через мокрое стекло» вместо «красивого освещения». Звук пишите помеченными строками, иначе «шум дождя» станет визуальным дождём: реплика — после двоеточия, эффекты — через «SFX:», фон — через «Ambient:». И привязывайте звук к видимому действию: «щелчок в момент, когда крышка закрывается».
Чего в кадре быть не должно. Списком существительных и только в отдельном поле негативного промпта. В основном тексте отрицания не работают: Google просит не писать «no walls», а описывать желаемое — «пустынный ландшафт до горизонта». Энкодер кодирует смысл слов, а не логику отрицания: «без стены» превращается во внимание к стене.
Субъект: [кто в кадре — возраст, одежда, одна характерная деталь] Действие: [одно законченное действие, с началом и концом] Крупность и ракурс: [medium shot / close-up / wide, низкий или верхний ракурс] Движение камеры: [одно движение: dolly in / pan left / static shot] Свет: [мягкий свет золотого часа / жёсткий контровой из окна / холодный неон] Оптика и стиль: [35 mm, малая глубина резкости, зерно плёнки] Звук: SFX: [звук, привязанный к видимому действию]; Ambient: [фон места] Длительность: [4 / 6 / 8 секунд] Негативный список: warped hands, on-screen text, subtitles, watermark
Разобранный вариант схемы — карточка «сцена, камера, движение и стиль». Готовый пример по этой схеме, без говорящего героя, — атмосферный b-roll.
Восемь секунд — это одно действие, а не короткий фильм
Считайте секунды до генерации. Восемь секунд вмещают одно событие: человек оборачивается и говорит фразу или камера облетает предмет. Три события дают мешанину.
Длинный ролик собирается иначе: сценарий режется на карточки по одному действию, каждая генерируется отдельно, склейка — в монтажке. У Veo продление добавляет 7 секунд за вызов, но только в 720p: минута — это 8 секунд старта плюс семь шагов, все в 720p, хуже одиночной генерации в 1080p. У Kling продления есть, но к концу цепочки первым сыплется звук.
Несколько тактов внутри одной генерации задаются таймстемп-разметкой — это лечит беду «восемь секунд одного статичного плана». Последняя строка нужна, если склеек не надо: иначе модель поставит их сама.
[00:00–00:03] [крупность] — [что в кадре, что происходит] [00:03–00:06] [крупность] — [следующий такт действия] [00:06–00:08] [крупность] — [финальная точка кадра] Герой, свет и оптика во всех тактах: [дословно повторить описание] single continuous shot, no cuts
Сюжет стоит разложить текстовой моделью до генерации: у Veo вход ограничен 1024 токенами, лишнее отрезается молча — человек видит «модель меня не послушала», хотя его текста там не было. Раскадровку делает сценарий короткого видео для Shorts, вертикальный формат до минуты — сценарий вертикального видео до 60 секунд, а на русском без препятствий работает промпт для Reels, Shorts и Клипов ВК. Референс-борд героя собирает character sheet по фото.
Речь, липсинк и субтитры-призраки
Реплику оформляйте служебным синтаксисом: «смотрит в камеру and says in Russian: „реплика“». Двоеточие и кавычки отделяют произносимый текст от описания сцены — без них персонаж молча изображает разговор.
Длину реплики считайте арифметикой: речь идёт примерно два-три слова в секунду, значит в восемь секунд с паузой на вдох влезает фраза слов на десять-двенадцать. Сверх этого модель тараторит или обрывает на полуслове. Если в кадре двое, называйте говорящего по имени и место: «medium shot, Анна слева». И средний план прощает липсинку больше, чем макро.
Отдельная беда Veo — вшитые субтитры: модель училась на видео с подписями и дорисовывает их к каждой реплике, а выключить нельзя, они прямо в кадре (проблему разбирал MIT Technology Review ещё на Veo 3). Практика сообщества — писать NO SUBTITLES в начале и в конце промпта: гарантии нет, частота падает.
Medium shot, [ИМЯ] стоит слева в кадре, [возраст, одежда, характерная деталь]. NO SUBTITLES, no on-screen text, no captions. Смотрит в камеру and says in Russian: «[РЕПЛИКА — не больше 10–12 слов]». Камера статична, свет мягкий из окна слева, 35 mm. SFX: [звук, привязанный к видимому действию]. Ambient: [фоновый шум места]. NO SUBTITLES.
Про русскую речь прямо. У Kling в официальном списке нативной озвучки пять языков: английский, китайский, японский, корейский, испанский. Русского там нет — озвучку кладут поверх готового видео. У Veo документация Gemini API пишет, что полностью протестирован только английский. Короткая русская реплика в статичном кадре обычно выходит, монолог на восемь секунд — рулетка. Наш промпт под эту задачу — говорящий персонаж с репликой по-русски, и оговорка стоит внутри карточки.
Veo: когда нужен звук в одном проходе
Veo берут ровно за это: ролик про готовку без шкворчания на сковороде — половина ролика. В приложении Gemini видео с мая 2026 делает Gemini Omni Flash — 3–10 секунд, 720p; Veo 3.1 живёт в Gemini API, AI Studio и Flow, туда идут за 1080p и продлениями. Сборки под частые задачи в разделе Veo:
- Вертикальный Shorts со звуком под ключ — 9:16 нативный, без кропа из горизонтали.
- Рецепт-ролик с кухонными звуками — случай, когда звук работает сильнее картинки.
- Обучающий ролик с пояснением голосом — закадровый текст вместо говорящей головы, риск рассинхрона снят.
- Музыкальный клип по референс-фото — сегментный промпт по кадрам; трек — по промптам для Suno.
Про деньги: бесплатного тарифа на видеогенерацию у Google нет. По прайсу Gemini API секунда Veo 3.1 стоит $0,40 в 720p и 1080p — восьмисекундный дубль обходится в $3,2, а дублей нужно несколько; Lite идёт по $0,05 за секунду, те же восемь секунд — сорок центов, но без 4K. И вторая часть: сервисы Gemini в России недоступны, карты российских банков Google Billing не принимает.
Kling: доступен из России и оживляет фото
Главная причина брать Kling — работа со стартовым кадром: картинка становится первым кадром, текст управляет движением. Это же лечит дрейф внешности — лицо зафиксировано изображением, а не словами. Кадр рисуется по промптам для генерации изображений, обложку закрывает кликабельное превью YouTube-видео и статья обложка для Reels и Shorts. И правило, которое ломает большинству людей первую генерацию: не пересказывайте то, что уже видно на фото — иначе модель перерисовывает то, что должна была сохранить. Ориентир: 15–40 слов на оживление фото против 60–100 на генерацию с нуля.
[ЧТО ИМЕННО НАЧИНАЕТ ДВИГАТЬСЯ на загруженном кадре] Конец движения: [в какой позе действие завершается] Камера: [одно движение с направлением, например slow push-in] Скорость: [рывком / плавно, без слоу-мо] Негативный промпт: motion blur, face distortion, warping, morphing, extra limbs, floating objects, background shifting
Негативный промпт пишите сразу, а не после трёх испорченных дублей: он в отдельном поле и стоит ноль лишних попыток. И ставьте глагол скорости, если не хотите слоу-мо: по умолчанию Kling снимает всё как рекламу духов — человек встаёт со стула четыре секунды. Единственный случай, когда этот дефолт играет за вас, — фуд-ролик.
- Оживить фото — самый частый запрос, включая старые семейные снимки.
- Вертикальный ролик для Reels и Shorts — 9:16 у Kling тоже нативный.
- Продуктовый ролик с облётом камеры — один облёт, без попыток одновременно наехать и подняться.
Из ограничений: причинно-следственную цепочку через весь ролик Kling держит плохо — блюдо на тарелке в конце может не совпасть с тем, что жарилось на сковороде секундой раньше. Плюс китайская модерация: политические сюжеты режутся. Лимиты и цены бесплатного тарифа Kling менял за 2026 не раз. Российской картой подписка не оформляется, способов обойти это мы не разбираем.
Sora: что было и куда переехали промпты
OpenAI закрыла Sora: приложение и сайт отключены 26 апреля 2026, API доживает до 24 сентября 2026, после чего пользовательские библиотеки удаляются. Преемник не анонсирован, видеонаправление ушло в исследования world models. По разборам прессы причина экономическая, но своих цифр компания не публиковала.
Десять наших промптов Sora мы не удалили. Sora 2 разбирала промпт по смысловым слоям: сцена, кинематография, действие, реплики, фон — ровно эта структура работает в Veo и Kling. Так что кинематографичная сцена по формуле, диалоговая сцена со звуком, фоновое видео для лендинга и историческая сцена для учебного видео живут дальше как заготовки: берёте текст, добавляете звуковые метки Veo или негативный список Kling — и отправляете в живую модель. Уведомление о закрытии стоит на каждой карточке.
Что ломается чаще всего и как это чинится
Перегенерация — норма: ни одна модель 2026 года не даёт годный дубль с первого раза.
- Руки и пальцы. Крупный план кистей, шнурки, набор текста. Лечится отъездом камеры: развалившееся на макро на среднем плане проходит.
- Текст в кадре. Вывеска, этикетка, цена, титры превращаются в псевдобуквы. Читаемые надписи не закладывайте — накладывайте их в монтаже.
- Лицо героя плывёт между дублями. Памяти между генерациями нет. Внешность держат два средства: дословно повторяемая формула и референсы — до трёх картинок у Veo, набор Elements у Kling. Даже с ними форма носа гуляет.
- Жидкость, ткань, волосы, дым. Всплеск воды, развевающееся платье, волосы на ветру выдают ролик быстрее всего.
Сюда же перегруз сцены: Kling при нехватке бюджета жертвует следованием промпту ради плавности, длинный текст исполняется наполовину — держите три-пять значимых элементов. И противоречия: «яркое ночное небо», «крупный план общей панорамы» модель не разрешает, а усредняет. Правило отладки: артефакты чаще лечатся вычёркиванием. Черновики гоняйте на 720p, детали наращивайте после того, как вышло движение.
Чего видеомодели не сделают ни при каком промпте
- Не снимут ваш сценарий целиком. Одна генерация — 4–15 секунд; ролик на минуту существует как набор клипов, а монтаж, титры и финальный звук — ручная работа.
- Не дадут повторяемости. Мелкая правка промпта выдаёт другой дубль: замка на камеру и тайминг нет.
- Не сгенерируют узнаваемых людей и чужие франшизы. Публичные лица, персонажи чужих вселенных и торговые марки режутся модерацией, плюс это чужая интеллектуальная собственность.
- Не заменят оператора там, где нужна точность. Быстрый бег, драки, резкие проводки камерой дают артефакты. Движение камеры вместе с несколькими анимируемыми объектами модель упрощает: либо едет камера, либо живут все в кадре.
- Не обойдут региональные ограничения. Напрямую из России доступен Kling; для картинок и коротких видео есть Kandinsky и Шедеврум — они отстают по длительности и звуку, но работают без препятствий. Что выбрать из этих двух — разбор Kandinsky или Шедеврум.
FAQ
Сколько секунд длится ролик, сгенерированный по одному промпту?
У Veo 3.1 — 4, 6 или 8 секунд, причём 1080p и 4K доступны только для восьмисекундного варианта. У Kling 3.0 — до 15 секунд. Длиннее собирается продлениями или монтажом: продление у Veo добавляет 7 секунд за вызов и отдаётся в 720p, так что длинный ролик теряет в разрешении.
Будет ли в ролике звук и заговорит ли персонаж по-русски?
Звук будет: и Veo, и Kling генерируют речь, шумы и эмбиент в одном проходе с картинкой. С русским сложнее. У Kling в списке нативной озвучки пять языков, русского нет — озвучку кладут поверх видео. У Veo документация Gemini API называет полностью протестированным только английский: короткая реплика выходит, длинный монолог — как повезёт.
Можно ли сделать видео из своей фотографии?
Да, это режим image-to-video: снимок становится первым кадром, а текст управляет движением. У Kling он штатный, плюс Motion Brush — кистью помечаете области, которые должны двигаться, и фиксируете фон. Правило одно: не описывайте то, что уже видно на фото, иначе модель начнёт это перерисовывать. Заготовка — оживить фото.
Почему лицо героя меняется от дубля к дублю?
Между генерациями у модели нет памяти о персонаже: каждый раз она заново тянет ближайшее к описанию лицо. Внешность держат два средства — дословно повторяемая формула (возраст, одежда, цвет волос, свет) и референсные изображения: до трёх у Veo, набор Elements у Kling. Полной гарантии не даёт ни одно.
Какую сеть выбрать под мою задачу?
Звук и говорящий персонаж — Veo, если есть доступ к сервисам Google. Оживить фотографию, снять вертикальный ролик или продуктовый облёт из России — Kling. Сценарий и раскадровка — Gemini, Claude или YandexGPT. Стартовый кадр — Midjourney или Kandinsky. Все карточки собраны в разделе видеопромптов.