Transformar foto de pessoas em desenho não é tão simples quanto parece
A ferramenta mais acessível hoje em dia é o Google Drawings + filtros de IA, ou serviços como MyHeritage In Color, DeepAI e o próprio Bing Image Creator usando prompts de transformação fotográfica. Mas se você quer resultados consistentes, o caminho mais confiável envolve duas etapas: extração de pose e transferência de estilo. O processo básico funciona assim. Você pega uma foto, detecta os contornos e silhuetas das pessoas, depois aplica um filtro de estilo artístico sobre essas formas. O resultado varia muito dependendo da complexidade da cena original. Foto com uma pessoa só, fundo neutro, iluminação frontal? Funciona bem. Grupo de quatro pessoas se tocando, luz mixta, fundo bagunçado? Aí começa o problema.
como fazer foto de pessoas de desenho com boa qualidade
Vou listar o fluxo que uso e que mais costuma dar certo, com estimativas reais de tempo: Primeiro, pegue a foto e passe por um detector de pose como OpenPose ou MediaPipe Face Mesh. Isso gera um esqueleto esquelético dos corpos e rostos. Leva cerca de 30 segundos com uma GPU razoável ou até 2 minutos na nuvem. O arquivo gerado é basicamente um mapa de pontos conectados por linhas.
Depois, use esse esqueleto como guia para um modelo de transferência de estilo. O SDXL com ControlNet OpenPose faz isso muito bem. Você define um prompt como "illustration of people, clean lineart, white background" e alimenta o modelo com a pose extraída. O resultado sai em torno de 8 a 15 segundos por imagem em uma RTX 4070 ou superior. Se estiver usando cloud, depende do serviço, mas o Stable Diffusion WebUI com AutOMATIC1111 é gratuito se você rodar localmente. Um detalhe que muita gente perde: a densidade dos pontos de pose. MediaPipe retorna 33 pontos faciais e 33 corporais por pessoa. Isso é suficiente para a maioria dos casos, mas quando duas pessoas estão muito próximas ou uma está parcialmente oculta, o rastreamento embaralha os pontos entre os indivíduos. O esqueleto fica com linhas cruzadas e o desenho final mostra braços e pernas no lugar errado.
👉 Clique no botão abaixo para saber mais sobre o assunto!
Minha solução prática para isso é usar o modelo YOLOv8 para detecção de pessoas primeiro, limitar o processamento por bounding box individual, e depois consolidar os esqueletos. Isso adiciona uns 20 segundos ao pipeline, mas evita o problema completamente. Funciona porque isola cada pessoa antes de tentar rastrear articulações. Outro ponto importante: o estágio de pós-processamento. A saída do ControlNet vem com artefatos de linha, especialmente nas bordas dos cabelos e nas áreas de transição entre roupas e pele. Um passinho rápido de limpeza com um filtro de detecção de bordas Canny ajustado para threshold baixo e depois um leve dilatação de morfologia resolve em 5 segundos. Sem isso, o desenho fica com ruído visual que parece erro de processamento quando na verdade é só limpeza necessária.
Se você não tem GPU própria, alternativas online como Leonardo.AI custam créditos, mas o plano gratuito permite cerca de 150 transformações por dia. O resultado é similar, só que com fila de espera de 30 segundos a 2 minutos por geração dependendo do congestionamento do servidor. Agora vou falar do que os tutoriais online não mostram. O principal problema é que esses modelos foram treinados predominantemente com imagens de rostos e poses estáticas. Quando a pessoa está em movimento, com membros estendidos ou inclinação corporal acentuada, a qualidade cai drasticamente. Já vi casos onde o cabelo longa era ignorado completamente pelo detector de pose e ia parar como uma mancha sem forma no desenho final. A workaround é aumentar o peso do prompt textual para descrever detalhes específicos como "long flowing hair, dynamic pose, full body" e usar um CFG scale mais alto, entre 7 e 9, para forçar o modelo a prestar mais atenção no prompt do que apenas na estrutura de pose.
Também tem o problema da diversidade étnica nos conjuntos de treinamento. Modelos como o SDXL tendem a suavizar tons de pele mais escuros e transformar texturas capilares afro em linhas suaves demais, perdendo a características reais do cabelo. Não há solução mágica para isso além de ajustar o prompt com descrições mais específicas da textura e usar LoRAs treinados em datasets mais diversos, como os disponíveis no Civitai. Se o seu objetivo é simplesmente um filtro rápido no celular,apps como Prisma e FaceApp fazem o trabalho em segundos com resultados aceitáveis para uso casual. Mas se precisa de controle real sobre o resultado final, investir tempo configurando o pipeline com Stable Diffusion + ControlNet vale cada minuto, principalmente quando você precisa repetibilidade para múltiplas fotos do mesmo lote.