Homem Das Cavernas Puxando Mulher Pelo Cabelo - Homem Das Cavernas Puxando Pelo Cabelo - RETOEDU
Homem Das Cavernas Puxando Pelo Cabelo - RETOEDU

Gerando imagem de homem das cavernas puxando mulher pelo cabelo com IA

Esse prompt ficou viral há algum tempo nas redes. Muita gente tenta reproduzir e acaba com resultado mediano porque não entende o que fazer pra segurar a coerência anatômica. A maioria erra na pose, nas texturas ou simplesmente gera duas figuras separadas em vez de uma cena interligada.

Como funciona o prompt homem das cavernas puxando mulher pelo cabelo

O conceito é simples na teoria mas complicado na prática. Você pede uma cena pré-histórica com dois personagens interagindo fisicamente. O problema real é que modelos de imagem tendem a separar os subjects ou distorcer os braços quando há contato físico entre duas figuras humanas. Meu primeiro teste levou uns cinco minutos até eu entender que precisava tratar isso como uma única composição, não dois prompts juntos. Eu recomendo começar com ferramentas como Stable Diffusion via WebUI ou ComfyUI, que dão mais controle do que alternativas mais simplificadas. Midjourney também funciona mas exige ajustes manuais no parâmetro de estilo e no weighting dos elementos. Vou focar no fluxo com Stable Diffusion porque é onde você tem controle real sobre o resultado.

Configuração básica e prompt

Você vai precisar de um modelo check-point adequado para imagens realistas. Chega um SDXL ou qualquer variante basada em SD1.5 treinada para realismo. Eu uso principalmente Realistic Vision ou Juggernaut XL. Modelos anime ou genéricos não seguram bem esse tipo de cena. O prompt em inglês funciona muito melhor do que em português, independente do modelo. Algo na linha de:

cave man pulling woman by her hair, prehistoric scene, rocky terrain, dramatic lighting, detailed skin texture, realistic proportions, cinematic composition, wide angle shot Adicione negativo prompt pra evitar problemas comuns: bad anatomy, extra limbs, missing limbs, distorted hands, deformed, watermark, text, blurry.

👉 Clique no botão abaixo para saber mais sobre o assunto!

Configurações de geração

Sampler: DPM++ 2M Karras ou Euler a. Steps entre 30 e 40. CFG scale entre 5 e 7 — acima disso o modelo começa a overcook os detalhes e as texturas ficam artificialmente intensas. Resolução mínima de 1024x1024 pra SDXL. Se estiver usando SD1.5, vá de 768x768 ou use Hires fix. Controle de pose é o que faz diferença aqui. Sem um Reference ou ControlNet, o modelo vai inventar poses que não fazem sentido. Instale o módulo ControlNet OpenPose e use uma referência de pose real. Tire uma foto sua ou ache uma imagem de referência com a pose que quer, carregue no ControlNet e ative o peso em torno de 0.8. Isso resolve 80% dos problemas de anatomia.

Problema que eu encontrei e como resolvi

A primeira vez que tentei gerar essa cena, o braço do homem das cavernas desaparecia completamente ou ficava fundido ao corpo da mulher. Isso acontece porque o modelo não lida bem com membros que se cruzam ou se sobrepõem quando não há guidance estrutural. A solução foi usar ControlNet com o mapa de profundidade junto com o OpenPose. O depth map diz ao modelo onde cada elemento está no espaço 3D, evitando que os braços penetrem nos corpos. Também adicionei um termo de weighting no prompt: (pulling by hair:1.3) para forçar o modelo a dar prioridade à interação física entre as figuras. Em alguns casos precisei rodar inpaint depois pra corrigir mãos e dedos, que quase sempre saem tortos.

Inpainting para correções

Nunca confie no resultado direto da geração. Sempre prepare-se pra fazer inpaint. Selecione a área problemática — mão, braço, cabelo, pés — e gere apenas aquele trecho com um prompt específico pra essa parte. Use máscara suave com feather de 4 a 8 pixels pra evitar bordas visíveis. Para corrigir mãos, um truque que funciona consistentemente é usar inpaint com prompt focado só em detailed hands, realistic fingers e CFG um pouco mais alto (7-8) naquela região. O resto da imagem fica protegido pela máscara.

Limitações que ninguém conta

Essa técnica tem pontos fracos sérios. Primeiro, a qualidade final depende inteiramente do seu modelo base. Modelos baratos ou antigos vão gerar artefatos que inpaint não resolve. Segundo, cenas com contato físico entre duas figuras humanas são intrinsicamente difíceis pra qualquer gerador atual — mesmo os mais avançados falham em dedos, articulações e tensão muscular realista. Terceiro, o processo completo costuma levar de 20 a 40 minutos por imagem, contando com rodadas de inpaint e upscaling. Se você precisa de algo rápido e não se importa com qualidade alta, existem geradores online como Leonardo AI ou Playground AI que têm templates prontos. O trade-off é menos controle e resultados mais genéricos. Se quer qualidade profissional, o caminho é Stable Diffusion local com ControlNet e inpaint iterativo.

Alternativa mais simples

Se o objetivo é só ter uma imagem parecida sem passer horas refinando, existe a opção de usar seed fixa a partir de uma geração que já saiu boa. Anote o seed, varie o prompt ligeiramente e gere novas iterações. Às vezes duas ou três rodadas com pequenas modificações no weighting já entregam algo aceitável sem precisar de ControlNet ou inpaint. A ferramenta em si não tem custo se você rodar localmente, mas exige placa de vídeo com pelo menos 8GB de VRAM pra SDXL. Sem isso, o tempo de geração trava e a experiência fica ruim. Cloud GPUs como RunPod ou Vast.ai resolvem isso por uns poucos dólares por hora.