Запросил у Midjourney «красивый закат» — получил открытку из 2005-го с передержанными красками и HDR на максимум. Попробовал «cyberpunk city» — вышла каша из неоновых вывесок, в которой непонятно, что вообще происходит. Знакомо?
Я потратил месяц на то, чтобы понять простую вещь: нейросети не читают мысли. Они буквально парсят слова и пытаются свести их к статистическим паттернам из обучающей выборки. Если промпт написан абы как — результат будет соответствующий.
Разобрался, как это работает на практике. Делюсь наблюдениями.
Структура промпта: из чего он вообще состоит
Сначала я писал промпты интуитивно. «Нарисуй мне кота в космосе» — и надеялся на чудо. Иногда везло, чаще нет. Потом заметил паттерн: хорошие промпты структурированы.
Базовая формула:
[Объект] + [Действие/состояние] + [Окружение] + [Стиль] + [Технические параметры]
Например:
- Плохо: «девушка в лесу»
- Лучше: «young woman in hiking gear, walking through misty pine forest, golden hour lighting, shot on 35mm film, soft focus»
Разница колоссальная. В первом случае нейросеть додумывает всё сама — и обычно додумывает не то. Во втором я явно указываю, что хочу видеть.
Конкретика работает. Всегда.
Порядок слов имеет значение
Это я понял методом проб и ошибок. Midjourney и Stable Diffusion сильнее реагируют на слова в начале промпта. Чем дальше термин — тем меньше его вес.
Плохой порядок: «beautiful landscape with mountains, dramatic lighting, 8k, ultra detailed, a small cabin in the foreground»
Хороший порядок: «a small wooden cabin in foreground, snow-covered mountains behind, dramatic sunset lighting, photorealistic, 8k»
В первом случае нейросеть сфокусируется на «красивом пейзаже» и горах, домик может вообще потеряться. Во втором — домик будет главным объектом, как я и хотел.
Простое правило: главное — в начало, детали — следом, технические штуки — в конец.
Стилевые референсы: называй конкретных авторов и техники
«В стиле фэнтези» — это ничего не значащая фраза. А вот «in style of Greg Rutkowski» — уже конкретный визуальный паттерн, который нейросеть знает отлично.
Я собрал список имён и терминов, которые стабильно работают:
Художники и иллюстраторы:
- Greg Rutkowski — фэнтези-арт, детализация, драматичный свет
- Artgerm — чистые линии, яркие цвета, портреты
- Simon Stålenhag — rural sci-fi, ретрофутуризм
- Makoto Shinkai — anime backgrounds, атмосферность
Фотографы:
- Steve McCurry — репортажная фотография, насыщенные цвета
- Annie Leibovitz — портреты, студийный свет
- Sebastião Salgado — чёрно-белая документалистика
Технические термины:
- «shot on 35mm film» — плёночная зернистость, органичные цвета
- «bokeh» — размытый фон
- «golden hour lighting» — мягкий закатный свет
- «studio lighting» — контролируемый свет, как в фотостудии
Называй конкретику — получаешь предсказуемость.
Негативные промпты: что исключать
У Stable Diffusion есть поле для негативного промпта — списка того, чего ты НЕ хочешь видеть. Я игнорировал его первые две недели. Зря.
Оказалось, нейросети любят добавлять от себя:
- Лишние пальцы и конечности
- Водяные знаки и текст
- Размытость и артефакты
- Несколько голов у персонажа
Мой стандартный негативный промпт сейчас: «ugly, blurry, low quality, watermark, text, extra fingers, deformed hands, multiple heads, bad anatomy, worst quality»
Результат сразу чище.
Параметры и веса: когда нужна точная настройка
В Midjourney и Stable Diffusion можно управлять весом отдельных слов через скобки или параметры.
Синтаксис Stable Diffusion:
- (слово:1.2) — увеличить вес на 20%
- (слово:0.8) — уменьшить на 20%
- [слово] — уменьшить вес
Например: «a cat (sleeping:1.3) on a sofa, (cozy interior:1.1), [toys on floor]»
Здесь я акцентирую спящего кота и уютную атмосферу, но игрушки на полу пусть будут фоном.
Midjourney проще — там работают параметры вроде --stylize 100 (насколько «художественным» делать результат) или --chaos 50 (насколько неожиданным).
Я использую веса, когда нейросеть упорно игнорирует какую-то деталь. Обычно хватает 1.2–1.3, дальше начинаются перекосы.
Итерации: почему первый результат всегда черновик
Ни разу не получил идеальную картинку с первого промпта. Никогда.
Мой процесс:
- Пишу базовый промпт, генерирую 4 варианта
- Выбираю лучший, смотрю, что не так
- Дописываю уточнения в промпт (или негативный промпт)
- Перегенерирую
- Повторяю до победы
Обычно хватает 3–4 итераций. Если за пять попыток результат не улучшается — проблема в самой идее, а не в формулировке. Тогда меняю концепцию.
Относись к промптам как к черновикам кода: сначала запускаешь, смотришь где падает, правишь.
Что я понял за месяц экспериментов
Генерация картинок — это не магия и не лотерея. Это управление вероятностями через язык. Чем точнее ты описываешь желаемое, тем ближе результат к ожиданиям.
Три главных правила:
- Конкретика побеждает абстракцию
- Порядок слов влияет на приоритеты нейросети
- Итерации неизбежны — заложи на них время
У меня теперь текстовый файл с заготовками промптов, удачными формулировками и списком работающих стилевых referencer. Копирую базу, подставляю нужное, правлю — и получаю результат быстрее.
Нейросети не умнеют от наших надежд. Но если научиться говорить на их языке — они выдают именно то, что нужно.
