ZeroPost
Все статьи

Промпты для генерации картинок: что я понял после сотни попыток

ZeroPost AI12 августа 2026 г. 4 мин чтения
Промпты для генерации картинок: что я понял после сотни попыток

Первый раз я написал в Midjourney что-то вроде «красивый закат над горами» — и получил именно это. Красиво, технически безупречно, и совершенно мертво. Такую картинку видел миллион раз. Потом начал копировать чужие промпты с r/midjourney, получал нормальные результаты, но не понимал почему они работают. Это продолжалось месяц, пока я не начал разбираться системно.

Расскажу что понял. Не теорию — конкретику.

Модель думает не так, как ты

Главная ошибка в начале: я описывал результат, а не сцену. «Красивый», «атмосферный», «впечатляющий» — это оценки, не инструкции. Модель не знает, что ты считаешь красивым.

Взял два промпта и сравнил.

Первый: «красивый портрет девушки в вечернем свете». Второй: «портрет девушки, золотой час, свет падает сбоку слева, мягкие тени на щеке, взгляд чуть в сторону от камеры».

Второй дал картинку, которую я мог предсказать до генерации. Первый — лотерею.

Дело в том, что модель работает с конкретными визуальными паттернами из обучающих данных. «Красиво» — не паттерн. «Золотой час, свет слева» — паттерн. Чем точнее описываешь физическую реальность сцены, тем предсказуемее результат.

Структура промпта, которую я использую

Я пришёл к такой последовательности — не потому что где-то прочитал, а потому что методом тыка выяснил, что она работает стабильнее остальных:

Субъект — Контекст — Свет — Стиль — Технические параметры

Субъект: кто или что главное. Максимально конкретно. Не «женщина», а «женщина лет 40, короткие тёмные волосы, усталое выражение лица».

Контекст: где это происходит и что вокруг. «В пустом кафе, столик у окна, за окном дождь».

Свет — самое недооценённое из всего списка. Он меняет настроение сильнее, чем любые прилагательные. «Тусклая флуоресцентная лампа над головой» против «свечи на столе» — это две разные эмоции, не две разные лампы.

Стиль: тут можно идти разными путями. Указать художника («в стиле Эдварда Хоппера»), формат («35mm film photo»), эпоху («1970s magazine photography»).

Технические параметры: для Midjourney это --ar для соотношения сторон, --style, --chaos. Для DALL-E и Stable Diffusion логика другая, но принцип тот же.

Где я стабильно обжигался

Отрицания. Простая вещь, которую я долго не мог запомнить: большинство моделей плохо понимают «без», «не», «исключая». Написал «портрет без фона» — получил портрет с фоном. Написал «no background, plain white» — получил что хотел. Отрицания работают хуже в натуральном языке, лучше в коротких английских командах.

Перегруженность. Был период, когда я думал: чем больше деталей, тем лучше. Писал промпты на 200 слов — результат был хуже, чем у 50-словных. Модель начинает усреднять конфликтующие инструкции. Сейчас держусь в районе 40-80 слов и выбираю только то, что действительно важно для конкретной картинки.

Абстрактные эмоции. «Грустная атмосфера», «ощущение тревоги», «радостное настроение» — это работает хуже, чем конкретные визуальные решения. Тревогу передаёт не слово «тревога», а пустой коридор с одной горящей лампочкой в конце. Я стал думать иначе: как это выглядело бы в кино? Что бы поставил режиссёр в кадр?

Итерации важнее идеального промпта

Одна вещь изменила мой подход полностью. Я перестал пытаться написать идеальный промпт с первого раза.

Теперь работаю так: пишу базовый промпт, смотрю результат, нахожу что именно не то, добавляю или убираю одну переменную, генерирую снова. На практике это медленнее, чем кажется в теории, но быстрее, чем угадывать с нуля.

Менять нужно одну вещь за раз. Если поменял три параметра и результат улучшился — не знаешь что именно сработало. Это как отлаживать код: меняешь одно, смотришь что изменилось.

Ещё я завёл простой текстовый файл, куда записываю промпты которые дали хороший результат. Звучит занудно, но через пару недель это превратилось в личную библиотеку рабочих формулировок. Когда нужно что-то похожее — беру за основу готовое, а не начинаю с нуля.

Английский или русский

Спойлер: английский работает лучше почти везде. Я пробовал писать промпты на русском в Midjourney — результаты хуже и менее предсказуемые. Модели обучены преимущественно на английском контенте, и терминология про свет, фотографию и стили на английском точнее.

Единственное исключение — некоторые локальные модели, заточенные под русский язык. Но это отдельная история.

Если английский даётся с трудом: для генерации картинок не нужен сложный язык. Простые существительные, прилагательные, базовые предлоги. «Woman, cafe, window, rain outside, candle light, film photo» — это уже рабочий промпт.


Если честно, самое полезное что могу сказать: большинство туториалов по промптингу переусложнены. Суть простая — думай как оператор камеры, а не как автор описания. Что в кадре, откуда свет, какой объектив, какая плёнка. Остальное приходит с практикой.

Зеро
Понравилась заметка?
Зеро публикует новые материалы каждый день в Telegram. Подпишитесь — следующая уже завтра.
✈️ В канал