Что делает промпт для генерации изображений

Промпт для генерации изображений — короткое техзадание из шести блоков: субъект, окружение, стиль, свет, ракурс, технические параметры. Нейросеть не «видит» сцену, а достраивает её по словам: чем конкретнее блоки, тем меньше случайности. Одного существительного мало — «кот» вернёт кота из ниоткуда, а не кадр.

Речь про генерацию с нуля: фото загружать не нужно, картинка собирается из описания. Обратная задача — переснять себя в другом образе по селфи — идёт через референс и разобрана в материале промпты для ИИ-фотосессии.

Формула промпта: 6 блоков

Соберите запрос в этом порядке — так его считывают и русские модели, и Midjourney:

  • Субъект — кто или что в кадре: возраст, материал, цвет, состояние.
  • Окружение и фон — где находится субъект и что за ним.
  • Стиль — фотореализм, акварель, плоский вектор, название течения.
  • Свет — студийный softbox, золотой час, неон, пасмурное окно.
  • Ракурс — план, объектив, куда оставить пустое место.
  • Технические якоря — соотношение сторон, что исключить.
[СУБЪЕКТ с деталями], [ОКРУЖЕНИЕ/ФОН], в стиле [СТИЛЬ], [ОСВЕЩЕНИЕ], [РАКУРС/ОБЪЕКТИВ], высокая детализация, соотношение [СООТНОШЕНИЕ]. Избегать: [ЧТО ИСКЛЮЧИТЬ].

Шесть блоков — максимум, а не минимум: открытке хватит трёх. Шаблоны ниже — короткие каркасы под подстановку; в карточках каталога те же сценарии расписаны подробнее: генерация фото по описанию, изображение по описанию в Gemini.

Что в промпте не работает

  • Вежливость и оценки — «пожалуйста», «сделай красиво», «шедевр»: модель не знает, что для вас красиво, и берёт среднее по обучению.
  • Стопка синонимов — «очень детально, ультрадетально, максимально детально» работает как одно «высокая детализация». Туда же «8k»: размер задаёт параметр генерации.
  • Марка камеры — рядом с «85 мм, softbox, малая глубина резкости» приписка «снято на Hasselblad» ничего не меняет.
  • Номер версии модели — зашитый в шаблон, он устареет вместе с самой моделью. Соотношение сторон указывайте, версию — нет.

Разбор заказа: кадр для кофейни

Дизайнеру нужна картинка под баннер кофейни. На «реклама кофейни, вкусный кофе, красиво» вернётся чашка, пар и зёрна по столешнице — кадр залит объектами до краёв. Красиво, но цену и адрес ставить некуда. Тот же заказ по шести блокам:

Капучино в керамической чашке на светлой мраморной стойке, за стойкой размытый интерьер кофейни с латунными деталями, коммерческая фотография, мягкий боковой свет из окна, средний план, объектив 50 мм, левая треть кадра пустая под текст, соотношение 16:9. Избегать: надписи и логотипы.

Решают три отличия: назван продукт (капучино, а не «кофе»), назван свет, оставлено место под заголовок. Готовый вариант — промпт для рекламного баннера.

Люди и персонажи: 2 промпта

1. Студийный портрет — человек, которого не существует: для аватарки, обложки, макета сайта.

Фотореалистичный портрет: [КТО, возраст и внешность], [ЭМОЦИЯ], студийный свет softbox, однотонный фон [ЦВЕТ], объектив 85 мм, малая глубина резкости, естественная фактура кожи, соотношение 4:5.

Лицо выходит «стоковым» от общего описания: возраст, веснушки или седая прядь и эмоция вместо «улыбается» вытаскивают кадр в живой. Ещё вариант — портрет для аватарки.

2. Концепт-арт персонажа для игры. Важен не портрет, а читаемость силуэта и снаряжения; полная версия — в карточке концепт-арт персонажа игры.

Концепт-арт персонажа в полный рост: [АРХЕТИП, пол, вид], снаряжение [ОДЕЖДА И ДЕТАЛИ], в руках [ПРЕДМЕТ], поза [БОЕВАЯ / СПОКОЙНАЯ], стиль [РЕАЛИЗМ / СТИЛИЗАЦИЯ / ДАРК-ФЭНТЕЗИ], нейтральный серый фон, соотношение 2:3.
Концепт-арт персонажа игры в полный рост
Силуэт читается, фон нейтральный.

Товар, реклама, площадки: 3 промпта

3. Карточка товара для маркетплейса.

Предметная съёмка: [ТОВАР], чистый белый фон, мягкий рассеянный свет без жёстких теней, высокая детализация текстуры, коммерческая фотография, соотношение 1:1.

Оговорка для продавцов: сгенерированный с нуля товар — похожий товар, а не ваш; на карточку нужна съёмка своего экземпляра.

4. Превью для видео — половина кадра свободна под крупный заголовок. Полная версия — в карточке превью YouTube-видео.

Композиция для превью: [ГЕРОЙ: кто, эмоция] в левой половине кадра, взгляд и жест направлены вправо, фон [2 КОНТРАСТНЫХ ЦВЕТА] с диагональными полосами, направленный свет на героя, правая половина пустая под заголовок, высокий контраст, соотношение 16:9.
Превью видео с пустым местом под заголовок
Справа пустое поле — заголовок не перекроет лицо.

5. Постер-инфографика с надписями — редкий случай, когда текст просят у самой модели.

Постер-инфографика на тему [ТЕМА], крупный заголовок «[ДО 3 СЛОВ]», [ЧИСЛО] блоков с короткими подписями [ПЕРЕЧИСЛИТЬ], иллюстрация к каждому блоку, палитра [2-3 ЦВЕТА], чистая типографика, много воздуха, вертикальный формат.
Постер-инфографика с заголовком и подписями
Читаемый заголовок и подписи.

Надписи долго были слабым местом генераторов. Картиночная модель Gemini 3 — Nano Banana Pro — ставит текст в кадр читаемо и выдаёт до 4K, у ChatGPT это делает GPT Image 2. Правило: до трёх слов просите у модели, абзац — в редакторе. Полная версия — в карточке инфографика-постер.

Интерьер, архитектура, пейзаж: 3 промпта

6. Архитектурная визуализация.

Экстерьер здания [ТИП] в стиле [СТИЛЬ], фасад из [МАТЕРИАЛ], [ВРЕМЯ СУТОК], одна-две фигуры людей для масштаба, реалистичный рендер, объёмный свет, соотношение 16:9.

Фигура человека у входа — самый дешёвый способ показать размер: без неё дом читается то дачным домиком, то виллой. Полные версии: рендер в Midjourney, дом мечты по описанию.

7. Интерьер в конкретном стиле.

Интерьер [ПОМЕЩЕНИЕ] в стиле [СТИЛЬ], стены [ОТДЕЛКА], пол [ПОКРЫТИЕ], мебель [2-3 ПРЕДМЕТА С МАТЕРИАЛАМИ], акцент [ОДИН ЯРКИЙ ОБЪЕКТ], тёплый приглушённый свет, фотореалистичный рендер, соотношение 3:2.

Проверьте любой сгенерированный интерьер на одну деталь: розеток и выключателей на стенах почти никогда нет. Для презентации неважно, для проекта — знак, что перед вами картинка, а не чертёж. Карточка лофт-интерьер, выбор модели — Midjourney или Kandinsky.

8. Пейзаж.

Пейзаж: [МЕСТО/ЛАНДШАФТ], [ВРЕМЯ СУТОК и ПОГОДА], [НАСТРОЕНИЕ], широкий план, золотой час, объёмный свет, высокая детализация, соотношение 16:9.

Иллюстрация, стилизация, русские мотивы: 3 промпта

9. Иллюстрация для детской книги.

Иллюстрация для детской книги: [ПЕРСОНАЖ] [ДЕЙСТВИЕ] в [МЕСТО], акварель, тёплая палитра, мягкие контуры, добрая атмосфера, снизу оставить место под текст, возраст читателя [3-6 / 6-9].

Сложность не в картинке, а в серии: медвежонок на второй странице должен остаться тем же медвежонком. Помогает описание героя — цвет, форма ушей, одежда, — повторённое слово в слово. Карточка: детская иллюстрация.

10. Стилизация под художественное направление. Называйте направление и эпоху, а не живого автора: имена современных художников модель часто игнорирует, зато спор о правах возникает легко.

[СУБЪЕКТ или СЦЕНА] в стиле [НАПРАВЛЕНИЕ или ЭПОХА], характерная палитра и фактура направления, видимые мазки, [НАСТРОЕНИЕ], соотношение 4:5.

11. Русский лубок, советский плакат, «Союзмультфильм». На этих сюжетах англоязычные шаблоны дают чужие лица и чужие интерьеры — выигрывают модели, обученные на русском.

Иллюстрация в стиле [РУССКИЙ ЛУБОК / СОВЕТСКИЙ КОНСТРУКТИВИЗМ / РИСОВАННАЯ АНИМАЦИЯ 1970-Х], сюжет [СЮЖЕТ], палитра [КРАСНЫЙ, ОХРА, ЗЕЛЁНЫЙ, ЧЁРНЫЙ], плоская композиция, [ОРНАМЕНТ ПО КРАЯМ / ДИАГОНАЛИ И КРУПНЫЕ ФИГУРЫ], без текста, вертикальный формат.
Иллюстрация в стиле русского лубка
Плоская композиция, орнамент по краям.

Карточки куста: русский лубок, советский агитплакат, персонаж «Союзмультфильма». Логотип — отдельная задача: минималистичный знак и логотип как чертёж; генерация отдаёт растр, знак потом перерисовывают в кривых.

Технические параметры: негатив, формат, печать

Избегать: искажённые руки, лишние пальцы, деформированное лицо, нечитаемый текст, водяной знак, дубли объектов, низкое разрешение.

Негативный промпт перечисляет то, что модель добавляет от себя. В Midjourney и Stable Diffusion под него есть отдельный параметр, в Шедевруме, Kandinsky и чатах хватит «без …» в конце. Пять пунктов по делу лучше сорока на всякий случай.

Соотношение под площадку: 1:1 — карточки и посты; 4:5 и 3:4 — портреты и обложки; 9:16 — вертикальное видео; 16:9 — баннеры, интерьеры, пейзажи. Не указали — модель возьмёт своё и обрежет композицию.

Печать считайте заранее: открытка A6 — 105×148 мм, при 300 dpi нужен файл 1240×1748 пикселей. Квадрат 1024×1024 из бесплатных генераций для такой печати мал.

Какая нейросеть под какую задачу

  • Шедеврум (Яндекс, YandexART) — русский без перевода, базовый доступ бесплатный.
  • Kandinsky (Сбер, не Яндекс) — русские сюжеты: лубок, агитплакат, открытки.
  • GigaChat — картинка прямо в чате по команде «нарисуй»: промпты для GigaChat.
  • Midjourney (v7 и новее) — максимум по стилю и свету, через веб; бесплатного триала нет с 2023 года.
  • Nano Banana Pro, картиночная модель Gemini 3, — до 4K и лучшая работа с надписями внутри кадра.
  • ChatGPT — рисует нативно GPT Image 2, прежний генератор выведен; правка словами: «тот же кадр, фон темнее».
  • FLUX.2 — генерация на своём железе; у ветки dev лицензия без коммерции.

Сравнения: Midjourney против Kandinsky, Kandinsky или Шедеврум, фото в Gemini.

Чего нейросеть не сделает

  • Не напишет абзац внутри картинки — заголовок в два-три слова да, состав мелким кеглем нет; кириллица ломается чаще.
  • Не построит график по данным — рисует похожее на диаграмму, а не считает числа. Для схемы процесса берите блок-схему в Mermaid.
  • Не удержит персонажа в серии без референса или дословно повторённого описания.
  • Руки, украшения, отражения — браслет срастается с кожей, отражение в зеркале живёт своей жизнью.
  • Не даст права на чужой образ — логотип компании, персонаж франшизы, лицо знаменитости: это правовой риск.

Если — то: ремонт результата

  • Похоже, но не то — меняйте по одному блоку: после трёх правок сразу неясно, какая сработала.
  • Все варианты одинаковые — вы переставляете прилагательные, а менять надо сцену: время суток, ракурс, фон.
  • Лицо и анатомия ломаются — на общем плане лицу достаётся пара процентов кадра.
  • Кадр «мыльный» — уберите «8k, ультрадетально», назовите объектив, свет, материал.
  • Цвета кислотные — назовите палитру в двух-трёх цветах, добавьте «приглушённые тона».

Генерация по своему фото — другая задача

Всё выше — про кадр из ничего. Если исходник есть, включается режим с референсом: вы описываете, что сохранить (лицо, позу) и что изменить (фон, свет, стиль). Частности разобраны отдельно: промпты для ИИ-фотосессии, обработка фото нейросетью, Pixar-портрет.

FAQ

На каком языке писать промпт для генерации изображений?

Для Шедеврума, Kandinsky и GigaChat — на русском, они на нём и учились. Для Midjourney, FLUX и Stable Diffusion сцену можно описать по-русски, а два-три технических якоря добавить латиницей: cinematic lighting, 35mm, sharp focus. Полный перевод промпта на английский обычно ничего не добавляет, если сцена описана точно.

С каких слов лучше начинать промпт для генерации изображения в GigaChat?

С прямого глагола-команды: «Нарисуй…» или «Создай изображение…», а сразу за ним — субъект. Без глагола ассистент решит, что вы хотите текст, и опишет картинку словами вместо того, чтобы нарисовать. Дальше идут стиль, свет, ракурс и формат по формуле из шести блоков. Одна картинка за запрос — серию собирайте по кадру.

Какой элемент не является важной составляющей хорошего промпта?

Вежливые обороты и оценочные усилители: «пожалуйста», «сделай красиво», «шедевр», «лучшее качество» — визуального содержания в них нет, модель подставит своё среднее. Важные составляющие: субъект с деталями, окружение, стиль, освещение, ракурс и технические параметры вроде соотношения сторон и списка исключений. Порядок блоков в запросе тоже влияет.

Почему нейросеть рисует не то, что я описал?

Обычно промпт короткий или противоречивый: в одном запросе просят студийный свет и закат, крупный план и полный рост. Соберите его по шести блокам, уберите конфликтующие требования, добавьте короткий негативный список и дальше правьте по одному пункту за проход — так видно, какая замена сработала.

Можно ли генерировать картинку по своему фото?

Да, но это другой режим — работа с референсом: вы загружаете снимок и описываете, что сохранить (лицо, позу) и что изменить (фон, свет, одежду). Сила влияния референса регулируется: выше — ближе к оригиналу, ниже — больше свободы у модели. Готовые сценарии собраны в разборе промптов для ИИ-фотосессии.