Como gerar imagens realistas de três amigas usando IA
A maior dificuldade com prompts que pedem múltiplos personagens é fazer com que a IA entenda quantas pessoas estão na cena e onde cada uma fica posicionada. Se você simplesmente digitar "três amigas sorrindo", o resultado mais provável é uma imagem distorcida com membros extras ou rostos deformados. Isso acontece porque os modelos de geração ainda têm dificuldade com contagem precisa de elementos. O que funciona na prática é ser extremamente específico sobre composição. Em vez de depender que a IA "entenda", você ditada cada detalhe. Vou explicar como eu construo esses prompts agora.
Construindo uma imagem de três amigas com sucesso
Eu uso sempre uma estrutura fixa. Começo pela posição das personagens na cena, depois descrevo aparência individual de cada uma, e só então coloco o cenário e o estilo. A ordem importa muito porque o modelo dá mais peso às primeiras palavras do prompt. Aqui vai um exemplo que eu testo frequentemente:
"Three young women standing side by side on a city street at golden hour. The woman on the left has curly dark hair, medium skin tone, wearing a beige trench coat and black boots. The woman in the center has straight blonde hair, fair skin, wearing a navy blue dress. The woman on the right has long wavy brown hair, olive skin, wearing a white blouse and jeans. All three are laughing naturally. Photorealistic, shot on 35mm lens, depth of field, natural lighting. Style of documentary photography." Veja que cada pessoa tem características únicas. Isso evita aquele problema clássico onde os três rostos ficam idênticos, o que é uma das queixas mais comuns.
Uma coisa que muita gente não considera é a iluminação. Se você não especificar a direção da luz, a IA costuma colocar luz frontal plana, o que mata qualquer sensação de realismo. Eu sempre incluo "side lighting" ou "golden hour" nos meus prompts. Isso já melhora drasticamente o resultado em cerca de 70 por cento dos casos, segundo minha experiência prática. Outro detalhe importante: definir a proporção da imagem desde o início. A maioria dos geradores usa 1:1 por padrão, mas fotos de grupo ficam melhores em 3:4 ou 4:3. Isso dá mais espaço horizontal para as três personagens ocuparem a cena sem ficarem espremidas.
👉 Clique no botão abaixo para saber mais sobre o assunto!
Tenho um problema recorrente que quase todo mundo enfrenta. Quando gera imagens de três ou mais pessoas, às vezes a IA mistura os rostos ou cria um quarto personagem fantasma no fundo. Minha solução foi simples: gero a imagem, identifico qual pessoa está com problema, e uso inpainting focado apenas naquela região. No lugar de regenerar tudo, você mascara só o rosto ou corpo problemático e pede para corrigir. Isso economiza tempo e evita que o resto da imagem perfeita seja perdido. Se você está começando, recomendo testar primeiro com duas personagens para entender como o modelo se comporta. Depois que dominar a dinâmica, avança para três. Pular direto para cenas com muitos elementos geralmente gera frustração desnecessária.
Para baixar ou acessar geradores, as plataformas mais acessíveis atualmente incluem serviços como Midjourney, Stable Diffusion via Automatic1111, e o Leonardo AI. Cada um tem suas limitações. O Midjourney é excelente em realismo mas exige assinatura. O Stable Diffusion local é gratuito mas demanda placa de vídeo dedicada. O Leonardo AI oferece créditos diários gratuitos, o que serve para quem quer testar sem investir. O principal ponto cego aqui é que nenhum desses geradores entende bem variações corporais complexas. Se você pedir três amigas em poses dinâmicas ou interações físicas entre elas, a chance de distorções aumenta consideravelmente. Nesses casos, o caminho mais viável é gerar as pessoas separadamente e compor a imagem final em um editor como o Photoshop ou o GIMP. Não é rápido, mas o resultado é consistentemente melhor do que insistir no prompt original.
Outro problema que vejo muito são prompters que usam termos genéricos como "beautiful" ou "pretty". Isso não ajuda em nada. A IA já associa essas palavras a um padrão estético homogenizado que sai sempre igual. Troque por descrições concretas de traços faciais, tipo de sorriso, expressão específica. "Sunken cheeks with a slight smile" funciona muito melhor do que "beautiful woman". Também vale notar que a temperatura do modelo influencia bastante. Em muitos geradores, um valor de temperatura mais baixo gera resultados mais conservadores e consistentes, o que é útil quando você quer manter coerência entre os três rostos. Se subir a temperatura, o modelo tende a ser mais criativo, mas também mais imprevisível na composição.
Se precisar de referências visuais antes de criar o prompt, busque composições fotográficas reais em sites como Unsplash ou Pinterest. Anotar como as pessoas estão posicionadas, como a luz bate nelas, e como os olhares estão direcionados te dá um mapa prático para traduzir em texto. Isso elimina muita tentativa e erro. O processo completo, desde o prompt até a imagem final em alta resolução, leva em média entre 20 e 40 minutos se você estiver familiarizado com a ferramenta. Para iniciantes, pode levar até uma hora. Não existe atalho real, mas a curva de aprendizado é mais suave se você começar com descrições curtas e ir adicionando camadas de detalhe gradualmente.