За последние пару месяцев я сгенерировал несколько тысяч ИИ‑портретов — себя, друзей, родственников и даже случайных людей из интернета. Мне было интересно разобраться, как выстроить этот процесс так, чтобы нейрофотки получались похожими на человека.

Короче, я потратил около $200 на эксперименты и вроде как нащупал адекватный способ.

Нам понадобится:

  1. ChatGPT с платной подпиской (бесплатный не годится, он тупой). Можно заменить на Nano Banana (тоже платную), но она мне понравилась меньше.

  2. Несколько своих фотографий с разных ракурсов, снятых при хорошем освещении

  3. Фотография‑референс, которую мы будем воссоздавать. Например, вы увидели в Пинтересте клевый портрет и хотите себе такой же.

Сразу покажу пару примеров, что получается — а вы решайте, устраивает вас такое качество или нет. Если да — читайте дальше, я расскажу, как это делается.

Я кидал эти фотке маме — она не поняла, что это не настоящий я. Считаю, что это показательно!
Я кидал эти фотке маме — она не поняла, что это не настоящий я. Считаю, что это показательно!

Фотографируемся

Качество ИИ‑генерации ОЧЕНЬ сильно зависит от исходных фото. Невероятно сильно. Сильнее, чем от любого промта, который вы можете придумать.

Если фотки некачественные, ваше лицо плохо видно, освещение плохое или ракурс кривой — нейронка будет тащить все эти проблемы в генерации или выдумывать то, что не разглядела, и никак это не исправишь.

Поэтому ИИ‑фотосет начинается с фотосета настоящего. Но не переживайте, он простой, фотограф не потребуется и никто идти не надо. Нам нужно сделать несколько фотографий себя в разных ракурсах:

  1. Лицо крупным планом

  2. Лицо в 3/4

  3. Лицо в профиль

  4. Во весь рост (можно со штатива, с помощью мужа/жены или просто облокотите телефон на что‑нибудь и поставьте таймер)

Ну и еще пару вариантов на всякий случай. Например, фото где вы улыбаетесь, чтобы нейронка поняла, как вообще ваша улыбка выглядит.

Фотки надо делать при хорошем дневном свете. Можно выйти на улицу (только не в полдень на ярком солнце, чтобы не щуриться), но лучше — просто встать напротив окна. С потолочным светом фоткаться плохо — будут тени под глазами, которые нейронка будет упорно переносить в генерации.

Когда будете фоткаться в полный рост, постарайтесь подобрать одежду, которая не скрывает фигуру. Не оверсайз. Иначе пользы будет не очень много, нейронка не поймет реальные пропорции тела и начнет выдумывать. А если точнее — усреднять. Худых людей она делает поупитаннее, полных — постройнее. Могу представить случаи, когда и это может пригодиться, но наша цель — сделать максимально похоже, поэтому даем ИИшке максимально полную информацию.

Все ИИ‑фото выше я получил с вот таким фотосетом. Сделайте что‑нибудь подобное.

Ну и еще будет полезно сделать фото, примерно похожее на референс, который вы выбрали. Если вы хотите сгенерировать портрет, где вы сидите — то и сфоткайтесь сидя.

Просим нейронку описать ваши фото

Я провел много экспериментов и обнаружил, что генерации получаются стабильнее (нейронка реже косячит), если давать ей не только пачку своих фото, но и текстовое описание внешности.

Поэтому открываем ChatGPT, кидаем ему свой селфячный фотосет и просим описать внешность на 100–200 слов. Я прошу на английском, мне кажется, что генеративные ИИ все еще лучше работают с ним, чем с русским.

Попросите описать ваше лицо, прическу, цвет глаз и волос, фигуру, соотношение ширины плеч, талии и бедер, длины ног и туловища, размер груди, если вы девушка. Ну и особые примеры: очки, пирсинг, родинки, шрамы, татуировки.

Важный момент — явно запретите нейронки описывать вашу мимику, позу, одежду, освещение и так далее. Это все нам не надо, оно будет мешать.

Или еще проще, скопируйте этот промт и приложите к своим фоткам.

Create an identity card from these photos. Focus on stable visual traits that help preserve likeness, real age impression, body build, and proportions in later portrait generation. Return plain English only, one paragraph, 100-150 words. Describe visual traits only: face, hair, eye color if visible, facial hair, skin tone, age impression, body build, proportions, and distinctive visible traits. Do not describe expression, gaze, head turn, posture, or pose; those should come from the selected photoshoot reference.

Сохраняем результат и идем дальше.

Просим нейронку описать референс

Себя описали, теперь надо описать фотографию, которую хотим получить.

Вот с этим я экспериментировал больше всего.

Если отдать нейронке свои фото и референс и сказать «замени человека на этой фотке на меня, сохрани композицию», то результат будет ОЧЕНЬ сильно зависеть от похожести вашего телосложения на телосложение человека на референском фото. Если вы похожи — все сгенерируется отлично. Но если вы худее/толще/накаченнее, то в половине случаев получится шляпа.

Иногда нейронка будет переносить вашу фигуру на ИИ‑фото правильно. А иногда она будет брать фигуру исходной модели и присобачивать к ней ваше лицо. Можно, конечно, придумать ситуации, когда именно такой эффект и нужен, но мы‑то хотим сделать фото с собой, чтобы нейроболванчик был максимально похож на нас.

Поэтому такой вариант отметаем и действуем по‑другому.

Не отдаем боту референское фото вообще, чтобы его не путать. Вместо этого снова идем в ChatGPT, показываем референс и просим его очень подробно описать:

  • где происходит сцена и какой фон

  • как кадр снят: крупность, ракурс, расстояние, что попадает в кадр

  • позу и размещение тела: как повернут корпус, где голова, плечи, руки, ноги

  • что делают руки и с чем человек взаимодействует

  • направление взгляда и выражение лица

  • одежду

  • свет, цвета, настроение и композицию

Например, вот наша фотка.

А вот ее описание от нейронки (можете показать своему ChatGPT как пример, чтобы он лучше понял, что вы от него хотите):

Scene and environment: Tight studio portrait against a smoky golden background with warm haze. The amber glow sits behind the centered head, while the edges fall darker so the forward hands read as the closest foreground layer. Camera and crop: Close face-and-hands crop at eye level. The face sits in the center, while both hands extend close to the lens and appear intentionally larger and softer than the face. Pose and body placement: The subject faces the camera directly while both arms thrust toward the lens. The camera-right hand occupies the upper-right foreground with thumb and index finger forming the top and side of a loose rectangle; the camera-left hand occupies the lower-left foreground with thumb and index finger forming the bottom and opposite side. The hands stay closer to the camera than the face, large and softly blurred, while the eyes remain centered through the open space. Avoid fists, peace signs, and hands that do not create a frame around the face. Head, gaze, expression: Direct gaze into the lens with a focused, neutral expression. The head stays steady under the cap brim, with the eyes unobstructed. Wardrobe: Black baseball cap with a plain front and black hoodie. The clothing is minimal and dark so the hand gesture and golden light carry the image. Props and object interaction: No separate props. The foreground hands are the main interaction with the camera, framing the portrait space. Lighting and color: Warm amber backlight and smoke create a glowing halo behind the cap and head. Cooler soft fill keeps the face readable, while the foreground hands catch warm highlights and slight blur. Composition and details: Keep all thumbs and index fingers visible enough to read as a frame, even if the nearest fingertips are softly out of focus. Preserve the cap brim, eyes, face center, hoodie neckline, and golden haze behind the head.

Составляем финальный промт для генерации ИИ‑фото

Итого у нас имеется: набор наших фоток, краткое текстовое описание нашей внешности и подробное описание композиции, которую мы хотим получить. Собираем все вместе.

Сначала инструкцию для нейронки:

Create one realistic photo of the person from the uploaded photos, placed into the photoshoot described below.

Use the uploaded photos as the identity source for the person: real facial likeness, age impression, skin tone, hair, visible body shape, body volume, proportions, and natural clothing fit. Do not copy the casual clothing, pose, lighting, or location from the uploaded photos.

Adapt the described outfit, pose, and camera framing to the person's real visible build from the uploaded photos. Keep their natural proportions and weight distribution; do not make the person slimmer, taller, more athletic, more model-like, or more conventionally polished than the uploaded photos show.

Затем добавляем свое описание:

Person: Adult man with light skin and a cool, slightly pink undertone. Hair is dark brown to black, cut very short with a slightly longer top and tapered sides. He has a full dense dark beard and mustache, with facial hair covering the chin, jaw, and cheeks. Eye color appears light, greenish-gray. The face is oval with a broad forehead, straight nose bridge, defined jawline, and moderately lean cheeks. He has a medium neck, slim-to-average build, moderate shoulder width, a lean torso with a flat-to-slightly rounded abdomen, slim arms, and slender legs with narrow thighs and calves. Overall proportions read compact and lean, with stable facial hair and short dark hairstyle as the most recognizable identity traits.

Ну и потом большое описание референса:

Scene and environment…
Camera and crop…
Pose and body placement:

И так далее. Так как промт получился длинный, на всякий случай повторим в конце, что мы вообще от нейронки хотим:

Render it as a realistic photo in the visual style described above, with natural skin texture, believable fabric, coherent light, and accurate hands.

Генерируем

Получившийся огромный промт вместе со своими фотографиями относим в платный ChatGPT, включаем режим Thinking (без него у меня получалось хуже) — и получаем ИИ‑фотокарточку.

Вот честно, я понимаю, что это не я, но похоже до жути
Вот честно, я понимаю, что это не я, но похоже до жути

Еще раз на всякий случай:

  • Берем несколько своих фоток, просим нейронку описать свою внешность

  • Берем референс, просим нейронку описать сцену, композицию, позу, одежду

  • В итоговый промт добавляем свои фотки, их описание и описание референса

  • Сам референс не добавляем — так реже будут возникать артефакты

Не могу сказать, что с таким подходом мы будете получать шедевры в 100% случаев. Иногда придется перегененировать несколько раз. Иногда ваши фотки ну вот вообще никак н ебудут метчиться с референсом, и придется выбирать какой‑нибудь другой. Но получить хорошую фотку за несколько попыток вполне реально.

Зачем это надо, что с этими фотками делать и почему бы просто не сфоткаться с живым фотографом — это уже на ваше усмотрение. У меня дизайнеры этим пользуются, когда надо сделать стилизованный баннер/обложку с человеком, который отказывается предоставить какие‑либо фотки, кроме домашнего селфи на фоне стены. Берем пару селфи, делаем из них фоточку за 5 минут, пихаем на баннер — все счастливы.


Спасибо, что прочитали статью, надеюсь, вам она пригодится.

Если вам было интересно, приглашаю в свою тележку — я там рассказываю про свои эксперименты с нейронками и попытки сделать с их помощью что‑то полезное для своих компаний и себя лично. Иногда даже получается =)