Описал «кошку на подоконнике в лучах закатного солнца» — и получил что-то среднее между обложкой фэнтези-романа и иллюстрацией к детской книжке. Кошка смотрела в камеру. Солнце было зелёным. Подоконник отсутствовал.
С кем такого не бывало? Я месяц угрохал на эксперименты с Midjourney, Stable Diffusion и DALL-E 3, прежде чем перестать случайно получать шедевры и начать получать их осознанно. Делюсь тем, что понял.
Почему промпт — это не запрос, а архитектура
Первая ошибка, которую я совершал: писал промпт как поисковый запрос. «Кошка закат подоконник» — и ждал чуда. Не случается.
Генератор картинок работает не как Google. Он не ищет соответствие словам, а пытается собрать образ из миллионов обучающих изображений. И делает это тем лучше, чем точнее ты описываешь не «что», а «как это выглядит».
Промпт — это не приказ, а описание. Художник рисует по референсу, а не по техническому заданию. Твоя задача — стать хорошим заказчиком.
Из чего состоит рабочий промпт
За год я выработал для себя простую структуру. Не идеальную, но работающую:
Объект — что именно должно быть в кадре. Конкретное существо, предмет, человек. Не «кто-то» — а «пожилая женщина в платке».
Среда — где это находится. Комната, улица, лес, космос. Среда задаёт освещение и настроение почти так же сильно, как сам объект.
Освещение — его часто недооценивают. Тип света меняет всё: «мягкий рассеянный свет из окна» даст совсем другое настроение, чем «контровой свет на закате» или «неоновые блики в темноте».
Стиль — и вот тут включается магия. «Фотореализм», «акварель», «киберпанк-постер», «масло на холсте», «скетч пером». Стиль — это первое, что отличает промпт от поискового запроса.
Дополнительные параметры — детали, ракурс, соотношение сторон. «Вид сверху», «крупный план», «широкоугольный объектив» — всё это сдвигает результат.
Вот и всё. Пять блоков. Звучит просто, но я пару недель писал размытые «красивые картинки» и удивлялся, почему нейросеть выдаёт что-то невнятное.
Стиль решает больше, чем ты думаешь
Возьмём один и тот же объект: мужчина в деловом костюме стоит на крыше небоскрёба.
Пробуем варианты. «Мужчина в деловом костюме, крыша небоскрёба, панорама города на закате» — результат средний, нейросеть усредняет.
Добавляем стиль: «Мужчина в деловом костюме, крыша небоскрёба, вид снизу, неоновые отблески, кинематографический свет, стиль Люка Бессона» — уже интереснее.
Или: «Мужчина в деловом костюме, крыша небоскрёба, акварель, мягкие тона, рассвет» — совсем другая история.
Заметил закономерность: чем конкретнее стиль, тем предсказуемее результат. «Реализм» — это размытый ориентир. А вот «реализм, 35mm, f/1.4, мягкое боковое освещение, фотография из журнала GQ 1998 года» — это уже что-то, с чем можно работать.
Что убивает промпт: типичные ошибки
Слишком много условий. Нейросеть работает как человек с плохой памятью: напихаешь двадцать атрибутов — она начнёт выбирать и случайно выкидывать половину. Пять-семь чётких деталей лучше, чем двадцать размытых.
Абстрактные понятия. «Счастье», «свобода», «вечность» — нейросеть не понимает абстракции, она понимает образы. «Счастье» превращается в солнечный свет, улыбки и золотые оттенки, потому что так выглядит «счастье» в миллионах фотографий. Описывай образ, а не概念.
Отрицания не работают. «Кошка, но не чёрная» — нейросеть всё равно нарисует чёрную кошку, просто добавит к ней что-то ещё. Лучше сказать «рыжая кошка» и замолчать про чёрную.
Игнорировать соотношение сторон. Запросил портрет — получил квадрат. Вставил параметр --ar 3:4 или aspect ratio: 3:4 — картинка сразу выглядит профессиональнее. Мелочь, которая меняет восприятие.
Как я обычно работаю
Сначала пробую короткий промпт. Два-три предложения, самые ключевые слова. Смотрю, что вышло.
Потом смотрю на результат и спрашиваю себя: что именно не так? Свет не тот? Не хватает глубины? Стиль нечитаем?
И добавляю по одному уточнению за раз. Это важно: не переписывать промпт целиком, а итеративно улучшать. Так быстрее понимаешь, какой параметр что делает.
Например, получил размытый фон — добавил «shallow depth of field, f/1.8». Фон чёткий, но слишком плоский — добавил «35mm lens, perspective distortion». И так далее.
Один параметр — один эксперимент. Если менять сразу пять, непонятно, что именно сработало.
Инструменты: без фанатизма
Свои фавориты я нашёл. Midjourney — для красивых артов с хорошим стилем и настроением. Stable Diffusion — когда нужно что-то конкретное и контролируемое, плюс можно ставить свои модели. DALL-E 3 — для изображений, где буквы и читаемость важны (для постеров, например).
Но честно скажу: я месяц перебирал инструменты, пытаясь найти «самый лучший». Потратил время зря. Лучший инструмент — тот, с которым ты сел и разобрался нормально. Я застрял на Stable Diffusion и Midjourney и перестал метаться.
Что реально помогает в 2024 году
Если коротко — учись у своей нейросети. Сохраняй удачные промпты, анализируй, что в них работает. Смотри на результат и описывай словами, что именно тебе нравится — потом переводи это в параметры.
Второе: не бойся длинных промптов. Но только если они конкретные. «Фотореалистичное изображение, крупный план, закатное освещение, тёплые тона» — это нормально. А вот «сделай красиво и профессионально, чтобы выглядело как дорогая съёмка» — это не промпт, а пожелание.
Третье: следи за тем, что просят другие. На форумах, в Discord-серверах генеративных моделей — там народ делится работающими рецептами. Я нашёл несколько стилевых читов, которые сэкономили мне часы экспериментов.
Коротко
Научиться писать хорошие промпты — значит научиться думать образами, а не словами. Ты не описываешь задачу, ты рисуешь картину словами. И чем лучше ты видишь эту картину сам, тем точнее её передаст нейросеть.
Кошка на подоконнике? Уточни: рыжая, ленивая, поджала лапы, вечерний свет падает косо, тень лежит на полу. Добавь стиль: «бытовая фотография, мягкий естественный свет, Canon 50mm». И подоконник будет, и солнце не станет зелёным.
Попробуй в следующий раз — и расскажи, что вышло.
