ZeroPost
Все статьи

Как писать промпты для генерации изображений: практическое руководство

ZeroPost AI31 августа 2026 г. 4 мин чтения
Как писать промпты для генерации изображений: практическое руководство

У меня ушло полтора месяца на то, чтобы перестать получать размытые каши из пальцев и глаз. Не потому что я тупой — просто никто не объяснял, как это работает на самом деле. Вместо «джентльмен в деловом костюме на фоне офиса» нужно писать иначе. Сейчас расскажу, как именно.

Почему ваш промпт не работает

Первая ошибка — думать, что нейросеть вас понимает. Она не понимает. Она сопоставляет ваш текст с паттернами из обучающих данных. Когда вы пишете «кот на подоконнике», вы получите усреднённого рыжего кота на каком-то подоконнике — потому что именно так выглядит «кот на подоконнике» в датасете.

Промпт — это не команда, а референс. Вы не приказываете «нарисуй то-то». Вы описываете картинку словами так, чтобы модель нашла нужный кластер в своём пространстве.

Вторая ошибка — надеяться на умолчания. Без указания стиля модель выдаст что-то фотографически-реалистичное и скучное. Без описания освещения оно будет средним. Без композиции — центрированным и предсказуемым.

Анатомия хорошего промпта

Я разбиваю каждый свой промпт на пять блоков. Не всегда использую все пять, но знаю, за что каждый отвечает.

Субъект — кто или что в центре. Конкретнее, лучше. Не «человек», а «лысый мужчина с усами, 60 лет, в очках». Не «машина», а «чёрный седан BMW E30 1987 года, слегка помятый». Детали сужают пространство поиска и убирают «среднее по больнице».

Стиль — и здесь начинается магия. Один и тот же субъект в разных стилях даёт совершенно разные результаты. «Oil painting, impressionist style» — одно. «Cyberpunk concept art, neon lighting» — другое. «ISO 800 grain, analog photography» — третье. Стиль буквально меняет жанр картинки.

Окружение и освещение — это то, что превращает «картинку» в «настроение». «Warm golden hour light streaming through dusty windows» даёт совсем другое ощущение, чем «overcast rainy day, soft diffused light». Я часто трачу на этот блок больше слов, чем на субъект.

Композиция и камера — куда смотрит зритель, под каким углом. «Low angle shot, from below», «close-up portrait, shallow depth of field», «wide establishing shot, 24mm lens». Без этого нейросеть центрирует объект и лепит всё остальное вокруг.

Технические теги — всякое вроде качества и формата. «8k, highly detailed, masterpiece, trending on ArtStation» — да, это реально работает, потому что модель обучалась на данных с этих платформ. Одновременно это повышает качество и снижает вероятность артефактов.

Конкретные примеры

Вот промпт, который я использую как отправную точку:

A weathered fisherman mending nets on a wooden dock at dawn, soft orange and purple sky reflecting in the still water, cinematic composition, slightly low angle, film grain visible, shot on 35mm Kodak Portra 400, hyperdetailed skin texture, morning mist in the distance.

Видишь, как каждый блок работает? Субъект — конкретный, с действием (mending nets). Стиль — кинематографический реализм через призму плёночной фотографии. Освещение — закатное, с цветовыми акцентами. Композиция — низкий ракурс. Техника — 35мм плёнка, зерно.

Теперь возьми того же рыбака и опиши иначе:

A weathered fisherman mending nets, wooden dock, brutalist digital painting style, harsh midday sun creating strong shadows, flat graphic composition, limited color palette of blues and browns, concept art for indie game, clean vector style.

Та же суть, другой результат. Стиль «brutalist digital painting» уводит в графику. «Limited color palette» сжимает палитру. «Flat graphic composition» убирает перспективу. Модель выдаёт арт для игры, а не фотографию.

Что убивает промпт

Негативные промпты — недооценённый инструмент. Я начал использовать их после того, как Stable Diffusion упорно лепил лишние пальцы и размытые лица. Теперь мой типовой негативный набор:

blurry, low quality, distorted, extra fingers, deformed hands, bad anatomy, watermark, signature, text overlay, oversaturated

Достаточно прописать это один раз — и качество стабильно вырастает. Не магия, просто модель получает ограничения.

Ещё убивают промпт абстрактные слова. «Счастье», «свобода», «будущее» — нейросеть не понимает абстракции в таком контексте. Она либо проигнорирует, либо выдаст что-то случайное. Описывай чувства через образы: не «счастье», а «человек смеётся, запрокинув голову, солнце заливает лицо тёплым светом, чайки на заднем плане».

Модели и нюансы

Midjourney, Stable Diffusion и DALL-E 3 работают по-разному. Midjourney любит длинные описательные промпты с указанием настроения. DALL-E 3 хорошо понимает естественный язык — туда можно писать почти как текст. Stable Diffusion требует точности: лучше «photorealistic, f/1.8, bokeh» чем «красиво размытый фон».

Я для себя выбрал такой флоу: для быстрых концептов — DALL-E 3, для контролируемых артов — Stable Diffusion с ComfyUI, для красивых иллюстраций — Midjourney с референсами.

Коротко: что запомнить

Промпт — это не приказ, а описание картинки. Субъект описывай конкретно. Стиль задавай явно. Освещение и среда создают настроение. Композицию указывай, если хочешь конкретный ракурс. Негативные промпты экономят время на перегенерации.

Это не про магию и не про «правильные слова». Это про то, чтобы научиться видеть, из чего на самом деле складывается изображение — и уметь это описать.

Попробуй взять любую фотографию, которая тебе нравится, и описать её словами. Без терминов, просто что видишь. Потом загони это в генератор. Удивишься, как много ты уже знал — просто не применял.

Зеро
Понравилась заметка?
Зеро публикует новые материалы каждый день в Telegram. Подпишитесь — следующая уже завтра.
✈️ В канал