Garatuja Desordenada - Garatuja Desordenada e Garatuja Nomeada: O Desabrochar do Desenho ...
Garatuja Desordenada e Garatuja Nomeada: O Desabrochar do Desenho ...

Guia prático de garatuja desordenada para geração de imagens por IA

A técnica de garatuja desordenada consiste em usar rabiscos, linhas caóticas ou máscaras de scribble como guia para modelos de geração de imagem baseados em referência estrutural, como ControlNet. Você desenha algo grosseiramente no papel ou num tablet, envia para a IA e ela produz uma imagem final que mantém a composicional geral do seu traço, mas com conteúdo detalhado e coerente. É útil quando você quer controlar a pose, o enquadramento ou a disposição dos elementos sem ter habilidade de desenho técnico. O fluxo básico é simples, mas existem detalhes que fazem diferença entre um resultado aceitável e algo que parece bagunçado de verdade. Eu costumo fazer assim: abro o Stable Diffusion com o plugin do ComfyUI ou Automatic1111, carrego o modelo ControlNet scribble, passo a imagem de entrada pelo pré-processador, ajusto os pesos e deixo o modelo trabalhar. O tempo médio de renderização varia de 20 segundos a 2 minutos, dependendo da resolução e do modelo base usado. A maior parte do trabalho na verdade está na etapa de entrada, não na geração em si.

Como preparar a garatuja desordenada certa

A maioria das pessoas erra na etapa de entrada. Elas desenham algo muito limpo, muito simétrico, muito intencional. O problema é que o pré-processador de scribble foi treinado para reconhecer traços irregulares e lineamentos orgânicos. Quando você passa um desenho quase perfeito, o modelo ignora partes importantes ou interpreta mal as linhas. A garatuja desordenada funciona melhor quando você permite que o rabisco tenha variações de espessura, sobreposições e até áreas onde a linha simplesmente termina no meio do nada. Um detalhe que poucas pessoas mencionam: o fundo do seu desenho importa mais do que o próprio traço. Se você usar caneta preta sobre papel branco, o pré-processador vai capturar tanto as linhas quanto pequenas imperfeições do papel. O resultado pode incluir ruído indesejado. A solução que eu uso é Desenhar sobre fundo preto com caneta branca, ou vice-versa, e depois inverter os canais antes de passar pelo controle. Isso elimina cerca de 80% dos artefatos de fundo.

Outro ponto que parece óbvio mas todo mundo erra: a resolução. O pré-processador de scribble tem um tamanho máximo de entrada que varia conforme o modelo. Se você enviar uma imagem muito grande, ele downsampling de forma agressiva e perde detalhes fine. Eu normalmente trabalho com resoluções entre 512x512 e 1024x1024, ajustando a proporção conforme a composição necessária. Para retratos verticais, 768x1024 funciona bem. Para paisagens largas, 1024x576 ou similar. Quando eu comecei a usar essa técnica, tive um problema específico que levou semanas para resolver. Eu estava tentando gerar uma cena complexa com múltiplos personagens em poses diferentes, e o ControlNet estava colapsando as poses uns sobre os outros. A linha do braço de um personagem se fundia com o corpo do outro no pré-processamento, e o resultado final parecia uma massa amorfa. A solução foi separar cada personagem em camadas distintas, processar cada um individualmente com seu próprio mask de scribble, e depois compor as máscaras juntas usando um canal alpha antes de aplicar o controle. Isso dobrou o tempo de trabalho, mas eliminou completamente o problema de fusão de formas.

👉 Clique no botão abaixo para saber mais sobre o assunto!

Configuração técnica do pipeline

O modelo de controle que eu recomendo para garatuja desordenada é o ControlNet scribble da diffusers, especificamente a versão treinada com annotated sketches. Ele lida melhor com linhas irregulares do que a versão canny, que é mais restritiva e tende a ignorar traços que não sejam contornos fechados. Se você estiver usando o ComfyUI, o nó apropriado é o ControlNetApplyAdvanced, passando a image pelo sampler primeiro e depois aplicando o control net como conditioning. O weight do control net precisa ser ajustado conforme o nível de liberdade que você quer dar ao modelo. Valores entre 0.6 e 0.8 mantêm boa fidelidade estrutural sem sufocar a criatividade do diffusion. Abaixo de 0.5, o modelo frequentemente ignora o scribble completamente. Acima de 0.9, o resultado fica rígido e articular, com pouco da fluidez que é a vantagem principal da técnica. Um ponto interessante e contra intuitivo: às vezes um weight baixo combinado com um guidance rate alto produz resultados mais interessantes do que um weight alto com guidance baixo. O guidance alto força o modelo a seguir mais rigidamente o prompt textual, o que pode compensar parcialmente a fraqueza do controle estrutural.

O preprocessor de scribble permite ajustes de threshold que controlam o quão sensível ele é às linhas detectadas. Valores baixos (0.2 a 0.4) capturam quase tudo, incluindo ruído de textura. Valores altos (0.6 a 0.8) filtram linhas finas e só mantêm os traços mais marcantes. Na prática, eu uso threshold 0.35 para desenhos feitos à mão com digitalizador, e 0.5 para rabiscos mais soltos feitos com mouse. Não existe uma regra fixa, então o ideal é testar em sequência rápido. Para quem quer baixar os modelos, o checkpoint base recomendado é o SDXL ou o SD1.5 dependendo da complexidade desejada. Os modelos de control net scribble estão disponíveis no Hugging Face do lllyasviel, que é o criador original. O download é gratuito e o arquivo tem cerca de 1.5GB para a versão SDXL e 700MB para a SD1.5. Existem também variações community-trained que oferecem melhor performance em estilos específicos, como anime ou realismo fotográfico.

Pegadas comuns e como evitá-las

A armadilha mais frequente é acreditar que a garatuja desordenada substitui o planejamento composicional. Ela não substitui. Ela acelera a execução. Se você não tem clareza sobre o que quer na imagem final, um scribble mal estruturado vai gerar um resultado mal estruturado, só que com mais detalhes. O controle é sobre a forma, não sobre a ideia. Então antes de abrir o software, tenha uma noção vaga do resultado desejado. Um esboço rápido no papel com shapes grossos já ajuda mais do que começar direto no digital. Outra pegada: usar prompt muito genérico junto com garatuja desordenada. Se o seu scribble tem uma silhueta claramente definida, mas o prompt diz apenas "personagem legal", o modelo vai preencher com o que quer. O prompt precisa ser específico o suficiente para guiar a interpretação estrutural. "Warrior woman with sword in dynamic pose, fantasy art style, dramatic lighting" funciona muito melhor do que "cool character". A precisão do prompt compensa a imprecisão controlada do scribble.

Limitações importantes que preciso deixar claras: a técnica falha completamente quando você precisa de precisão anatômica ou proporções exatas. O scribble é inerentemente aproximativo, então músculos, mãos, dedos e proporções faciais tendem a sair erradas. Se o seu projeto exige accuracy anatômica, use sketch control em vez de scribble, ou combine os dois com weights diferentes. Além disso, a geração com control net dobra basicamente o tempo de inferência comparado a uma geração sem controle, porque o modelo precisa processar a imagem de entrada como máscara adicional em cada passo de denoising. Para projetos que exigem alta complexidade estrutural com múltiplos elementos, uma alternativa viável é usar IP-Adapter junto com o scribble. O IP-Adapter mantém consistência de estilo e composição a partir de uma imagem de referência, enquanto o control net scribble fornece a estrutura posicional. Combinar os dois não é trivial — você precisa balancear os weights cuidadosamente para que um não sobreponha o outro — mas o resultado costuma ser significativamente melhor do que usar qualquer um dos dois isoladamente. O trade-off é que o tempo de renderização aumenta ainda mais, e a configuração inicial exige mais iteração para encontrar os parâmetros certos.