Локальная нейросеть для картинок — модель, которая считает кадр на вашей видеокарте: без подписки, без очереди и без интернета после установки. На карте с 12 ГБ видеопамяти FLUX.2 [klein] 4B рисует кадр 1344×896 за 24–42 секунды. Потолок качества честный: интерьер, пейзаж, предмет — уверенно; лица крупным планом, мелкая графика и текст в кадре — нет.
Дальше не инструкция «скачайте и нажмите» — таких в выдаче десятки. Это отчёт: что вышло за несколько сотен кадров на одной домашней карте и какие правила промпта убрали брак. Запрос «нейросеть локально» в июле 2026 набрал 5731 показ в Вордстате против 909 в августе 2024: искать замену подписке стали чаще.
Где домашняя генерация выигрывает и где проигрывает
Выигрывает она режимом работы, а не качеством. Ежемесячного платежа нет: карта уже стоит в компьютере, добавляется электричество. Счётчика генераций нет — серию можно поставить на ночь. Промпты и кадры не уходят на чужой сервер: планировка своей квартиры остаётся на своём диске. И нет фильтра, который отклонит кухонный интерьер из-за слова «нож». Ограничения у весов при этом свои: 4B выложена под Apache 2.0, 9B — под некоммерческой лицензией.
Проигрывает — в качестве и во времени. Мелкая графика расплывается. Лицо незнакомого человека крупным планом выходит «сток-красивым» и одинаковым от кадра к кадру. Текст карточка модели прямо называет слабым местом: «текст может выйти неточным или искажённым». Первый вечер уходит на установку и подбор параметров. Midjourney она не заменяет — она закрывает объём: серии, варианты, двадцать повторов кадра без мысли о кредитах.
Мелочь, которой нет в обзорах: летом в комнате с работающей картой через час ощутимо теплее, а вентилятор слышно через закрытую дверь. Ночные серии лучше запускать не в спальне.
Железо и параметры, на которых сняты эти кадры
Карта — RTX 4070 Super, 12 ГБ видеопамяти. Модель — FLUX.2 [klein] 4B; её карточка на Hugging Face говорит: «умещается примерно в 13 ГБ VRAM, доступна на NVIDIA RTX 3090/4070 и выше». Двенадцать меньше тринадцати — работает, но с потолком по разрешению. Оболочка — Forge Neo (форк Stable Diffusion WebUI Forge, ставится через Pinokio, заявленный минимум — 6 ГБ видеопамяти). Она поднимает локальный сервер с API — кадры можно гнать скриптом.
| Параметр | Значение | Почему так |
|---|---|---|
| Пресет | flux | Пресет klein включает дистилляцию: шаги падают до 4, кадр недоделанный |
| Шаги | 28 | Ниже 20 сыпется геометрия, выше 30 разницы глазом не видно |
| CFG Scale | 1 | Классический CFG у FLUX выключен; в коде BFL guidance_scale тоже 1.0 |
| Distilled CFG | 3.5 | Регулятор «насколько буквально следовать промпту» |
| Сэмплер | Euler | Штатная пара к архитектуре потока |
| Планировщик | beta | Ровнее держит детали на 28 шагах |
| CLIP skip | 1 | Двойка — наследие пресетов SD; отдельного CLIP в FLUX.2 нет |
| Разрешение | 1344×896 | Стороны кратны 16; на 12 ГБ держимся в пределах 2 мегапикселей |
| Время кадра | 24–42 с | Второй движок в памяти карты замедляет: картиночный и видео на 12 ГБ вместе не идут |
Четыре шага в пресете klein — не ошибка настройки: дистиллированный вариант на них и рассчитан, в примере кода на карточке модели стоит num_inference_steps=4. Идею посмотреть хватает, для финального кадра нет: волосы, ткань и стыки остаются недорисованными.
Вторая ловушка интерфейса — счётчик «75 токенов» над полем промпта, наследие CLIP из прошлого поколения моделей. У FLUX.2 энкодер другой, языковая модель Mistral-Small-3.2-24B, и 75 токенов для неё не предел: документация Black Forest Labs называет рабочим диапазоном 30–80 слов. Счётчик краснеет, кадр рисуется целиком.
Промпт описывает сцену, а не задачу дизайнеру
Первые наши промпты были техзаданием верстальщику: «оставь место под заголовок», «без надписей», «композиция под баннер». Выходил мусор. Модели нечего рисовать по служебным указаниям: что такое «место под заголовок», она не знает, зато слово «заголовок» отрабатывает честно — буквами прямо в кадре.
Правило, которое всё исправило: в промпте должно быть только то, что видно на фотографии. Место под текст — это «комната заметно шире мебели». Камера — не «сделай красиво», а «24 мм, f/8». Карточка модели предупреждает сама: «следование промпту сильно зависит от стиля промптинга».
Было (мусор три кадра подряд): [СЦЕНА: interior of a kitchen], leave space at the top for a headline, no text, no watermarks, banner composition, clean layout Стало (кадр с первого раза): one continuous photograph of a single [СЦЕНА: kitchen, 14 m2], the room is noticeably wider than the furniture, plain wall above the counter, flat evenly painted ceiling in flawless condition, cold daylight from the window meets warm lamp light over the island, 24 mm, f/8, sharp focus throughout
Негативных промптов у FLUX.2 нет — совсем
Это записано в документации Black Forest Labs: FLUX.2 негативный промпт не поддерживает, вместо «no blur» надо писать «sharp focus throughout». Отдельного прохода, к которому цепляется «чего не должно быть», у модели нет — слова из запрета попадают в сцену как обычные. «no text» повышает шанс увидеть буквы. «Без надписей» — тоже. Перевод запретов в утверждения делается один раз, дальше список живёт под рукой:
- «no blur» — «sharp focus throughout»;
- «без людей» — «an empty room, furniture only»;
- «без надписей на посуде» — «smooth ceramic, plain glaze»;
- «не мультяшно» — «architectural interior photography» для комнаты, «natural skin texture» для человека;
- «не показывай улицу за окном» — «green foliage outside the window».
У Midjourney параметр --no есть, но и там он вычитает фразу целиком: «--no cartoon people» уносит заодно и людей, заказанных позитивно. Общая формула промпта разобрана в статье про промпты для генерации изображений.
JSON-промпт, когда нужна серия
Документация BFL описывает структурированный ввод: поля scene, subjects, style, color_palette, lighting, mood, background, composition, camera. Ради одного кадра городить JSON смысла нет. Ради серии — это способ не получить разнобой: меняете один блок, остальные остаются побуквенно теми же, и восемь картинок выглядят снятыми в один день.
{
"scene": "one continuous photograph of a single room, [КОМНАТА: scandinavian living room, 18 m2], noticeably wider than the furniture",
"subjects": [
{"description": "[ГЛАВНЫЙ ПРЕДМЕТ: three-seat sofa in grey linen]", "position": "against the far wall, fully inside the frame", "action": "cushions slightly creased"},
{"description": "[ВТОРОЙ ПРЕДМЕТ: low oak table]", "position": "in front of the sofa", "action": "an open magazine lies face down"}
],
"background": "plain painted wall, one large window, green foliage outside it, flat evenly painted ceiling in flawless condition",
"lighting": "[СВЕТ: cold daylight from the window meets warm 2700K lamp light near the sofa]",
"style": "[СТИЛЬ: architectural interior photography]",
"color_palette": "[ПАЛИТРА: warm grey, oak, off-white, one deep green accent]",
"mood": "quiet weekday morning, someone lives here",
"composition": "the sofa fully visible with clear floor on both sides",
"camera": {"angle": "eye level", "lens": "24 mm", "depth_of_field": "f/8, sharp focus throughout"}
}
Дальше это работает как пульт: меняете «lighting» — получаете утро, вечер и пасмурный день в одной комнате; меняете «camera» — общий план, средний и деталь; меняете «scene» и «subjects» — квартиру, а не подборку с разных сайтов.
Длина промпта: 983 знака против 2189
Документация BFL делит длину на три диапазона: 10–30 слов — быстрая проверка идеи, 30–80 слов — «обычно оптимально для большинства задач», 80 и больше — сложные сцены. Раздутый промпт на 2189 знаков дал у нас три посторонних кадра подряд — не «чуть мимо», а другой сюжет целиком. Тот же замысел, сжатый до 983 знаков, вышел с первого раза; для сложного существа 900–1000 знаков хватает с запасом.
Всё, что длиннее, обычно оказывается спором с моделью: одно требование, повторённое тремя способами. Дописываете строку третий раз подряд, а кадр не меняется — вычёркивайте.
Реализм даёт свет, а не износ

Самая дорогая наша ошибка. Мы хотели, чтобы интерьеры перестали выглядеть рендером из каталога, и писали «honest worn textures», «lived-in», «faint marks near the skirting». Получили не жизнь, а заброшенное жильё: облупленная краска, серые пятна у плинтуса, потолок в разводах. Детскую владелец забраковал одной фразой: «на тюрьму похоже». Переделывали её семь раз.
Работает другое. Реализм создаёт столкновение источников света: холодный дневной из окна и тёплый ламповый в одной комнате — глаз читает это как съёмку, а не рендер с равномерной подсветкой. Дальше — мятый лён вместо пластика, живые растения и честная оптика: 24 мм и f/8 для интерьера, 85 мм и f/2 для портрета. Сценарии света разобраны в статье про освещение в интерьере через нейросеть.
И два предмета, которые модель портит по умолчанию, если промолчать. Потолок без строки «flat evenly painted ceiling in flawless condition» приходит в разводах. Пустая стена без описания читается как незаконченный ремонт — её нужно назвать: «плоская окрашенная стена ровного цвета».
Композиция: доли кадра, края и числительные

Слова про доли и края ломают композицию наглухо: модель понимает их как монтаж. «Каждая зона занимает треть картинки» дало триптих — три отдельные картинки с белыми разделителями. «Отступ от левого и правого края» дало диптих. «Часть кадра» для неё означает часть коллажа.
Работает описание через сцену: строка «одна непрерывная фотография одной комнаты» стоит теперь в каждом нашем интерьерном промпте, а запас по бокам задаёт факт «комната заметно шире мебели».
Числительные модель не соблюдает вовсе. «Два шезлонга» стабильно превращаются в три-пять: она добирает мебель, чтобы заполнить пустоту. Помогает изоляция — назвать не количество, а пустоту вокруг: «ровно два лежака, между ними и краем кадра широкая полоса пустого настила».
Гибриды и существа: описывайте зонами тела
Типовая ошибка — описывать гибрид через подменённые детали. «Клюв вместо морды» четыре раза подряд дал накладку: клюв поверх кошачьей пасти, две челюсти в одном лице. Модель не вычитает деталь, она добавляет. Заработала грифонья схема: существо делится на зоны, каждая описывается целиком, плюс строка про одно тело — без неё выходят два зверя рядом.
[СУЩЕСТВО: griffin]: from the neck up entirely a raven — black feathers, dark curved beak, glossy black eye; from the shoulders down entirely a lynx — tawny spotted fur, heavy paws, thick tail. One single body, the transition covered by a dense feather collar. Standing on [ПОВЕРХНОСТЬ: wet granite rocks], overcast daylight, 85 mm, f/2, sharp focus throughout
Псевдотекст: откуда в кадре берутся буквы

Модель дорисовывает буквы везде, где текст подразумевается самим предметом. Читать она их не умеет, поэтому выходит абракадабра. Наш улов: книжные корешки, экраны мониторов, плакаты, вывеска за окном, шильдик на технике. Слово «catalogue» в описании стиля повесило ценник на стул. «book cover» дало заголовок «SIEND EKINEV» через весь верх кадра. Просьба оставить «поля под название и имя автора» дала «ESTINTIDB DONIIE». Уточнение «масло XIX века» заставило модель подписать картину в углу. Обходы:
- стеллаж отодвинуть вглубь кадра — на дальнем плане корешки становятся цветными полосками;
- экраны выключить прямо в промпте: «screens are dark and switched off»;
- за окном ставить листву, а не улицу: улица приводит вывески и номера домов;
- не называть носитель, называть вид изображения: вместо «book cover» — «a portrait in the style of...».
Русские сюжеты промптите по-русски
Документация BFL советует писать на языке того контента, который вы создаёте: французский для парижской сцены, японский для аниме. На нашем материале это подтвердилось буквально. Английский промпт на лубок, на сюжет в духе Васнецова, на деревянный терем выдаёт усреднённую европейскую картинку: фэнтезийный замок, «славянский стиль» из мировых стоков. Русский промпт теми же словами даёт резные наличники, правильные пропорции сарафана, тот самый лубочный контур. Фотографический словарь на английском плотнее, поэтому интерьеры мы пишем по-английски, а всё связанное с русской культурой — по-русски.
Процесс: гейт критика, кроп и диагностика срыва
Правила промпта без проверки не работают, и это мы проверили дорого. Каждый готовый кадр проходит один вопрос: показывает ли картинка то, что обещано в задаче? Не «красиво ли» — красиво почти всегда. Этот шаг мы однажды выбросили ради скорости и выпустили 57 негодных превью: сюжет в духе Васнецова без единого богатыря, фотография вместо рендера, деревянные кубики вместо иконок приложения.
Второй шаг — кроп. Псевдотекст на общем плане не виден: тот самый ценник на стуле занимал 30 пикселей по ширине кадра в 1344, чуть больше двух процентов. Проверять нужно каждое место, где текст может появиться: корешки, экраны, стены, технику, окно.
Третье — что браковать не нужно, иначе перегенерация не сходится никогда. Ворс ковра длиннее заказанного, шкафы не до потолка, лишний шезлонг в ряду — не брак. Ронять кадр стоит за подмену сути (заказан рендер, пришла фотография), срез предмета по краю и псевдотекст.
Кадр вышел не мимо, а совершенно посторонним — дело не в формулировках. Порядок: синтаксис JSON (одна лишняя запятая — и половина полей уходит в никуда), какой чекпойнт загружен на самом деле, сколько занято видеопамяти, затем короткий контрольный промпт на 512×512.
[ПРЕДМЕТ: a red ceramic mug] on a wooden table, plain grey background, daylight from the left, sharp focus throughout
Контрольный кадр вышел нормальным — модель и железо в порядке, виноват промпт. Не вышел — ищите в окружении. У нас три посторонних кадра подряд совпали по времени с переустановкой драйвера; причину мы не доказывали, но проверять окружение после обновлений начали первым делом.
Edit по референсу: то же лицо в другом кадре
Полгода мы гоняли модель только на генерацию с нуля — и зря. klein умеет править поданную картинку по референсу, и лицо между кадрами остаётся тем же: веснушки, родинки, седина в бороде. Решает сила изменения. На 0,55 фон почти не двигается — приезжает тот же кадр с одной новой деталью. На 0,70–0,72 окружение меняется целиком, одежда, фон, свет, предметы, а лицо держится. Выше 0,75 оно начинает уплывать. Это замер на klein 4B в этом коридоре, а не гарантия: каждый кадр всё равно смотрим глазами.
Практический выход: пары «до и после» для аватарок считаются на домашней карте, а не в облаке. Референсное лицо генерим сами — вымышленный человек, дневной свет, нейтральный фон, — и этот же кадр становится кадром «до».
Чего домашняя видеокарта не может
- Мелкая графика описанием сцены. Иконка, схема, циферблат, интерфейс на экране приходят замыленными — это наш опыт на 4B, в документации модели такой формулировки нет. Иконки и инфографику мы всё же получаем, но структурированным промптом с полями, как в JSON выше, а не описанием сцены.
- Крупные портреты с нуля. По текстовому промпту лицо во весь кадр не выходит: кожа уходит в пластик, взгляд одинаковый от кадра к кадру. Средний план и силуэт — прилично. Обход не в промпте, а в режиме: edit по референсу, разобранный выше.
- Текст в кадре. Ограничение записано в карточке модели. Надписи добавляйте после генерации в редакторе.
- Узнаваемые авторские сюжеты. «В духе Васнецова» компактная модель понимает как «сказочно-славянское вообще». Проверяйте по сути сюжета, а не по названию.
- Точное число объектов. Пять яблок, три окна, два кресла — считать модель не умеет.
Та же карта считает и видео, только там другой масштаб цены и свои границы: на 12 ГБ Wan 2.2 оживляет готовый кадр в клип длиной до трёх с половиной секунд, а лица и надписи в кадре не выходят и здесь. Замеры времени по разрешениям и правила промпта для движения — в отчёте про локальные нейросети для видео.
Сколько попыток уходит на самом деле
Арифметика по трём десяткам превью подряд. В каждой десятке шесть кадров вышли с первого раза, три со второго, один с третьего — на десять принятых приходится пятнадцать генераций: шесть плюс шесть плюс три. При 24–42 секундах на кадр это 6–10 минут чистого счёта.
Вторая половина правды: те же десять кадров занимают вечер. Время уходит не на генерацию, а на чтение результата — открыть, кропнуть подозрительные места, сверить с задачей, переписать строку. Одна детская комната потребовала семи заходов. Если собираете сцену с нуля, начните с готовой структуры — разбор по блокам есть в статье как составить промпт для рендера комнаты.
FAQ
Хватит ли 8 или 12 ГБ видеопамяти для генерации картинок?
Карточка FLUX.2 [klein] 4B называет около 13 ГБ и карты уровня RTX 3090/4070 и выше. На 12 ГБ модель работает, но разрешение приходится держать в пределах 2 мегапикселей. Для 8 ГБ есть квантованные сборки fp8 и int4 — они снижают аппетит к памяти ценой деталей.
Заменит ли локальная нейросеть Midjourney?
Нет. Midjourney сильнее в деталях, лицах, стилизации и в тексте внутри кадра. Локальная модель выигрывает режимом: нет подписки, нет счётчика генераций, кадры не уходят на чужой сервер, серию можно поставить на ночь. Разумная схема — черновики, серии и правки готового кадра по референсу считать дома, а сложную стилизацию и текст внутри кадра отдавать облаку.
Почему не работают «no text» и «без надписей»?
Потому что негативного промпта у FLUX.2 нет — это сказано в документации Black Forest Labs. Запрет не отсекает объект, а попадает в сцену обычными словами, и шанс увидеть буквы растёт. Пишите утверждениями: вместо «no blur» — «sharp focus throughout», вместо «без надписей на кружке» — «smooth ceramic».
Нужен ли интернет для генерации картинок?
После установки нет. Сеть нужна один раз: скачать оболочку и веса модели, а это десятки гигабайт. Дальше кадр считается на вашей карте офлайн — аргумент для ноутбука в поезде или дачи со слабой связью. Возвращаться в интернет придётся за обновлениями и новыми чекпойнтами.
Сколько времени занимает один кадр и целая партия?
Кадр 1344×896 на RTX 4070 Super — 24–42 секунды. По нашей статистике на десять принятых кадров уходит пятнадцать генераций, то есть 6–10 минут чистого счёта. Вечер тратится не на это, а на проверку: открыть кадр, кропнуть места возможного псевдотекста, сверить с задачей.