Как написать промт для генерации фото: шесть блоков и примеры

Промт — это текстовое описание кадра, по которому нейросеть его рисует. От того, насколько внятно он составлен, зависит почти всё: похоже ли лицо, тот ли свет, не выросло ли у человека шесть пальцев. Ниже разбор структуры, которой мы пользуемся сами, с примерами, написанными специально для этой статьи.

Что вообще делает промт

Модель не понимает намерений, она понимает описание. Фраза «красивое фото» не содержит ничего, что можно нарисовать: непонятно, кто в кадре, где он находится, откуда падает свет и каким планом снято. Модель достроит недостающее сама, и результат будет случайным — сегодня студийный портрет, завтра человек по пояс на фоне заката.

Хороший промт снимает эту случайность. Он описывает сцену так, как её описал бы фотограф ассистенту: кто, где, в чём, при каком свете и с какого расстояния. Чем меньше в описании остаётся дыр, тем стабильнее повторяется результат.

Отдельная особенность портретной генерации по своему фото: лицо берётся из загруженного снимка, а не из текста. Поэтому во внешности человека промт не должен участвовать вообще — ни цвет глаз, ни возраст, ни телосложение. Всё это модель считает с исходника, а текстовое описание внешности только конфликтует с ним и портит сходство.

Шесть блоков, из которых собирается кадр

Блок первый — тип съёмки. С него начинается промт, и он задаёт всю дальнейшую логику: «photorealistic portrait», «hyperrealistic street photograph», «studio headshot». Слово «photorealistic» в начале заметно снижает шанс получить рисунок вместо фотографии.

Блок второй — место. Конкретное, а не абстрактное. «В городе» модель поймёт как угодно, «на пешеходном мосту над рельсами в сумерках» — уже сцена. Сюда же относятся детали окружения, по которым место читается: мокрый асфальт, кирпичная стена, стеклянная витрина.

Блок третий — одежда. Описывается материалом и силуэтом, а не брендом: «тёмное шерстяное пальто поверх серой водолазки». Если не написать про одежду, модель оденет человека на своё усмотрение, и от кадра к кадру он будет переодеваться.

Блок четвёртый — поза и кадрирование. Самый недооценённый блок. Именно он отвечает за сходство: чем крупнее лицо, тем оно узнаваемее. «Средний план по пояс, камера на уровне глаз, корпус развёрнут к зрителю, лицо к камере» — этой фразы достаточно, чтобы модель перестала снимать человека со спины и с вывернутой головой.

Блок пятый — свет и цвет. «Мягкий рассеянный свет из окна слева», «холодный синий вечер с тёплыми пятнами фонарей». Свет — то, что отличает случайный снимок от кадра, который хочется поставить на аву.

Блок шестой — анатомия. Короткий технический хвост, который стоит дописывать всегда: «естественная анатомия, голова пропорциональна телу и повёрнута в ту же сторону, по пять пальцев на руке». Выглядит странно, но заметно снижает долю брака с руками и шеями.

Пример: как одна фраза превращается в промт

Возьмём исходную мысль «хочу фото в кафе». В таком виде это не промт, а тема. Разворачиваем по блокам.

Черновик: «Photorealistic portrait in a cafe». Модель нарисует что угодно — от завтрака при дневном свете до ночной забегаловки.

Собранный вариант: «Photorealistic portrait at a window table in a small city cafe on a rainy evening, wearing a dark wool coat over a light knit, holding a cup with both hands, medium shot from the waist up with the camera at eye level and the face turned toward the lens, warm lamp light inside against cold blue rain on the glass, shallow depth of field, natural anatomy with correctly proportioned head and five fingers per hand».

Разница не в длине, а в том, что во втором варианте не осталось решений, которые модель принимает за вас. При этом ни слова о внешности человека: лицо придёт с загруженной фотографии.

Ошибки, которые встречаются чаще всего

Описывать внешность. «Девушка с зелёными глазами и веснушками» в промте для генерации по своему фото — прямой конфликт с исходником. Модель начинает выбирать между текстом и лицом, и сходство падает.

Писать отрицаниями. «Без искажённых рук», «не рисуй текст» — многие модели такие конструкции просто не учитывают, а часть из них ещё и подхватывает названные слова как указание. Всё, что нужно, формулируется утвердительно: вместо «без надписей» — «вывески не в фокусе, только цветовые пятна».

Просить общий план и ждать сходства. Чем дальше человек от камеры, тем меньше пикселей приходится на лицо. Если сходство важно, кадр должен быть средним или крупным.

Смешивать три идеи в одном промте. Киберпанк, викторианская Англия и пляж в одном описании дадут кашу. Одна сцена — один промт.

Забывать про формат. Вертикальный портрет и горизонтальный кадр строятся по-разному. Формат стоит выбирать до генерации, а не обрезать результат потом.

Когда промт писать не нужно

Промт — инструмент, а не самоцель. Если задача звучит как «хочу деловой портрет» или «хочу фото в стиле девяностых», писать текст с нуля смысла мало: над формулировкой такой сцены уже кто-то посидел, проверил её на живых генерациях и починил всё, что ломалось.

В FotoAva собрано больше шестисот таких проверенных сцен. Вы выбираете образ, загружаете от одного до трёх своих снимков, и кадр собирается примерно за минуту — со светом, одеждой, кадрированием и анатомическим хвостом, которые уже настроены. Первый кадр бесплатный, так что сравнить самописный промт с готовым образом можно без затрат.

Полезно и обратное: посмотреть на готовые образы как на референс. Разбирая, из чего складывается понравившийся кадр — место, одежда, план, свет, — вы быстрее научитесь описывать собственные идеи.

Вопросы и ответы

Насколько длинным должен быть промт?

Обычно хватает 60–110 слов. Короче — модель додумывает слишком многое, длиннее — начинает терять детали из середины описания. Если идея не помещается, это чаще всего значит, что в одном промте смешаны две разные сцены.

На каком языке писать промт?

Большинство моделей обучены на английском и понимают его точнее. Русский текст часть моделей вообще пытается нарисовать буквами прямо в кадре. Если пишете по-русски, лучше перевести описание перед генерацией.

Можно ли посмотреть промты готовых образов FotoAva?

Нет, тексты образов мы не публикуем: над каждым из них проделана отдельная работа. Но структура, по которой они собраны, разобрана в этой статье целиком — по ней вы соберёте собственный промт под любую сцену.

Все образы каталога · Какое селфи загрузить · AI-фотосессия по селфи · Идеи для фотосессии · Все статьи