Сижу, ввожу в Midjourney: "кот на подоконнике, закат, тёплый свет, реалистично". Получаю — внимание — космический корабль. Слово "реалистично" система интерпретировала как sci-fi, "закат" добавила панораму, а про кота вспомнила в последнюю очередь.
Это не баг. Это я не умел писать промпты.
За полгода я перепробовал генерацию в Midjourney, Stable Diffusion, DALL-E 3 и Flux. Провалил сотни генераций. И вывел для себя несколько принципов, которые реально работают — не абстрактные советы из статей, написанных человеком, который сам не генерировал ни одного изображения.
Промпт — это не предложение, а техзадание
Когда я начинал, я писал промпты как текст другу: "красивая девушка в платье, стоит у окна, вечер, красиво". ИИ пытался быть милым и делал что-то своё.
Потом дошло: генератор изображений мыслит тегами. Ему неважно, как красиво ты сформулировал. Ему важно, какие понятия ты зафиксировал и какие между ними отношения.
Рабочая схема такая:
Что изображено → в каком стиле → при каком свете/условиях → какие теги качества
Реальный пример. Вместо:
"милый ёжик сидит на траве"
Пишу:
"hedgehog, sitting on green grass, soft morning light, warm color palette, detailed fur texture, photography, 8k, highly detailed, sharp focus"
Результат — небо и земля.
Три кита хорошего промпта
Предмет
Самое важное — конкретно назвать объект. Не "животное", а "brown tabby cat". Не "девушка", а "woman in her 30s, dark curly hair, reading glasses". Чем точнее, тем меньше ИИ домысливает.
Отдельно указываю действие и позу, если они важны. "cat sleeping curled up" и "cat jumping mid-air" — это два разных изображения, и ИИ действительно их различает.
Стиль
Вот где происходит магия. Одно и то же слово меняет картинку полностью.
"portrait" даст фотографию. "oil painting portrait" — картину маслом. "anime portrait" — аниме-персонажа. "portrait, National Geographic style" — фото из журнала.
Я для себя зафиксировал набор стилей, которые предсказуемо работают:
photography/photo— фотореализмdigital illustration— цифровой рисунокoil painting— классическая живопись3d render— трёхмерная визуализацияanime style— анимеconcept art— концепт-арт для игр/киноcinematic— кинематографический стиль с характерным освещением
Для портретов отдельно полезно: portrait photography, 85mm lens, shallow depth of field — это даёт размытый фон, как на нормальных портретных фотографиях.
Свет и атмосфера
Это элемент, который я долго игнорировал, а потом понял — без него картинка "не дышит".
golden hour lighting — тёплый закатный свет. dramatic lighting — контрастный свет с чёткими тенями. soft diffused light — мягкий рассеянный свет, как в пасмурный день. backlit — контровой свет, объект в силуэте.
moody atmosphere добавляет драматичности. warm color palette или cool color palette управляет цветовым тоном.
Негативные промпты — это не костыль, а инструмент
В Stable Diffusion я долго не пользовался negative prompt, пока не увидел разницу на одном и том же запросе.
Без негативного промпта: размытые лица, лишние пальцы, артефакты, мусор на заднем плане.
С негативным промптом blurry, low quality, distorted, extra fingers, bad anatomy, watermark, text — картинка чистая и контролируемая.
В Midjourney это делается через --no — например, --no text, watermark, blurry. В DALL-E 3 встроенная фильтрация артефактов сильнее, но и там бывают косяки.
Пример: от плохого промпта к рабочему
Плохой промпт:
"город ночью красивые огни"
Результат: скорее всего, пересвеченная каша с непонятной композицией.
Рабочий промпт:
"Tokyo street at night, neon signs reflecting on wet asphalt, cinematic photography, shot on 35mm film, shallow depth of field, bokeh, rain, moody atmosphere, 8k, hyperdetailed"
Чувствуешь разницу? Здесь есть конкретное место, эффект мокрого асфальта, стиль съёмки, фокус, погода, настроение и параметры качества.
Что я понял про частые ошибки
Переоценка сложности. Некоторые новички пишут промпты на абзац, напихивают 50 терминов — и удивляются, почему ИИ не справляется. Дело в том, что лучше 10 точных слов, чем 50 размытых.
Смешивание стилей. "anime oil painting" — это конфликт, и ИИ обычно делает что-то среднее, но неудачное. Один стиль за раз.
Игнорирование веса слов. В большинстве генераторов работает правило: чем раньше слово, тем оно важнее. "Cat sitting on a sofa" и "Sofa with a cat sitting on it" — дадут разные результаты. В Midjourney можно усиливать слова скобками (cat cat cat) или весом :2.
Что делать в первую очередь
Три вещи, которые дают самый быстрый результат.
Первое — указывать стиль явно, не рассчитывая что ИИ угадает "хочу как в журнале".
Второе — использовать негативные промпты во всех моделях, где они поддерживаются.
Третье — начинать промпт с главного объекта, а не с атмосферы.
Это не волшебная формула, но с этими тремя вещами процент "брака" падает раза в полтора-два. Дальше — практика и изучение того, какие теги любят конкретные модели.
У меня на это ушло полгода и несколько сотен сгенерированных картинок. Можно быстрее — если не пытаться писать "красиво", а писать "конкретно".
