PUBLICIDADE

Gerar imagem IA local: guia prático com Z-Image-Turbo e Qwen

03/10/2026
11 visualizações
7 min de leitura
Gerar imagem IA local ficou viável: o Z-Image-Turbo roda em GPUs de 8GB e o Qwen-Image-2.1 traz edição e transparência. Guia com instalação no ComfyUI, diffusers e API.
Imagem principal do post

Se o objetivo é gerar imagem IA local, rodando tudo na sua própria GPU, sem fila de nuvem e sem pagar por imagem, o fim de 2025 trouxe duas opções que mudaram essa conta: o Z-Image-Turbo do Tongyi Lab/Alibaba e o Qwen-Image-2.1 da linha QwenLM. Um é velocidade pura em GPU de consumo; o outro é recurso completo de geração e edição.

Neste guia vou destrinchar os requisitos de hardware de cada um, a instalação passo a passo no ComfyUI e via diffusers, e como expor isso numa API para automatizar com n8n. Também conto como isso roda na prática nas minhas máquinas aqui em Fortaleza.

Por que gerar imagem IA local virou viável: Z-Image-Turbo e Qwen-Image-2.1 mudaram o jogo

Imagem complementar

O Z-Image-Turbo, lançado em 26 de novembro de 2025, é uma variante destilada de 6B parâmetros da linha Z-Image, com arquitetura S3-DiT. A sacada principal: gera imagens em 8 passos, sem CFG, rodando em GPUs de consumo com 16GB de VRAM. Isso derrubou a barreira que antes exigia placa topo de linha ou nuvem.

A recepção foi imediata: o modelo passou de 500 mil downloads no primeiro dia e liderou o gráfico de tendências do Hugging Face. A licença é Apache 2.0, o que permite uso comercial sem royalties — detalhe que pesa muito pra quem pensa em produto, não só em hobby.

PUBLICIDADE

Já o Qwen-Image-2.1 é a versão mais recente da linha Qwen-Image e mira em outra frente: une geração e edição na mesma ferramenta, gera nativamente imagens transparentes (RGBA), monta foto de grupo a partir de seis retratos de referência e suporta proporções até 2752x1536. É mais canivete suíço do que bala de prata de velocidade.

Requisitos de GPU e RAM: o que roda na sua máquina (bf16, fp8 e GGUF)

Segundo o guia prático da Thunder Compute, os requisitos do Z-Image-Turbo variam bastante conforme a precisão escolhida, e é aqui que muita gente se engana ao avaliar se dá pra rodar ou não:

VarianteVRAMRAM
bf1614 a 16GB16GB
FP88GBnão informado
GGUF Q4/Q3até 6GB32GB recomendados

Além disso, conte com Python 3.10+, CUDA 12.x e cerca de 30GB de disco só pros arquivos. Ou seja: uma GPU de 8GB já entra no jogo com FP8, e até 6GB de VRAM é possível com GGUF, desde que a RAM do sistema acompanhe.

Vale lembrar que esses números são do Turbo, o modelo destilado. A versão base não destilada (Z-Image) usa 30 a 50 passos com CFG entre 3 e 5: mais lenta, porém com mais liberdade criativa e suporte a fine-tuning, como detalha o post do blog do ComfyUI sobre o modelo.

Instalando o Z-Image-Turbo no ComfyUI: arquivos, pastas e workflow oficial

O ComfyUI deu suporte nativo day-0 à família Z-Image, e existe tutorial oficial de workflow na documentação, o que facilita muito a vida de quem já usa a ferramenta.

O download oficial é feito direto do repositório, com o huggingface_hub atualizado:

pip install -U huggingface_hub
hf download Tongyi-MAI/Z-Image-Turbo

Depois de baixar, cada arquivo vai numa pasta específica da sua instalação do ComfyUI:

ArquivoPasta do ComfyUI
z_image_turbo_bf16.safetensorsdiffusion_models
qwen_3_4b (bf16/fp8/fp4)text_encoders
ae.safetensorsvae
LoRA de destilaçãoloras

Repare que o text encoder é o Qwen 3 4B — mesmo sendo um modelo da Alibaba concorrente "de linha", eles se complementam aqui. O modelo aceita prompts em inglês e chinês, incluindo renderização de texto misto chinês/inglês dentro da imagem.

Se você precisar de controle preciso de pose e composição, no início de dezembro de 2025 o Tongyi Lab abriu também o Z-Image-Turbo-Fun-Controlnet-Union, variante com ControlNet, igualmente em Apache 2.0. Está publicado no repositório deles no Hugging Face.

Qwen-Image-2.1 via diffusers: instalação, cpu offload e quando usar

O caminho recomendado pro Qwen-Image-2.1 é a biblioteca diffusers. As dependências listadas no model card são:

pip install "torch>=2.4.0" "transformers>=5.17" accelerate pillow

O diffusers, nessa configuração, é instalado via git — confira o comando exato no model card do modelo no Hugging Face, porque a forma de instalação pode mudar conforme a versão. Pra reduzir o consumo de VRAM, o próprio model card indica o offload:

pipe.enable_model_cpu_offload()

Como linha de base, conte com ~40 passos por imagem. É uma ordem de grandeza diferente dos 8 passos do Turbo, e isso reflete a filosofia de cada modelo.

Contexto importante pra calibrar expectativas: o Qwen-Image original, de 20B parâmetros, pedia cerca de 40GB de VRAM sem otimização, e ~58GB na variante Edit, segundo esse artigo da MindStudio. Localmente, ele só ficava viável com quantização e offload. O 2.1 segue sendo pesado, então o cpu offload não é opcional, é parte do setup.

Turbo ou Qwen? Escolhendo o modelo certo para cada tarefa

Essa escolha depende do seu caso de uso, e os fatos ajudam a decidir:

  • Volume e velocidade: Turbo. 8 passos sem CFG, em GPU de 8GB com FP8. Se você gera dezenas de imagens por dia, essa é a conta que fecha.
  • Edição, transparência e referências: Qwen-Image-2.1. Geração e edição juntas, RGBA nativo, foto de grupo a partir de seis retratos e proporções grandes até 2752x1536.
  • Fine-tuning e liberdade criativa: versão base Z-Image, com 30 a 50 passos e CFG 3 a 5.
  • Controle de pose e composição: Z-Image-Turbo-Fun-Controlnet-Union.

Na dúvida, comece pelo Turbo: é o mais barato de testar em hardware modesto, e a licença Apache 2.0 não trava nada. Se sentir falta de edição ou transparência, aí sim o Qwen-Image-2.1 entra na jogada.

Integração via API: chamando o ComfyUI pelo n8n para automatizar geração de imagens

Gerar imagem na interface é ótimo pra teste, mas o valor real aparece quando você automatiza. Workflows do ComfyUI podem ser executados via API com o SDK oficial (@comfyorg/sdk), usando API key e o workflow_api.json. Isso permite chamar a geração de imagens de qualquer backend, incluindo o n8n.

O fluxo geral fica assim: você monta e testa o workflow na interface, exporta a versão de API, e consome esse endpoint num fluxo do n8n — por exemplo, disparado por um formulário, um webhook ou uma planilha. A página de workflows do ComfyUI tem exemplos prontos que você pode usar de base.

Um detalhe que economiza tempo: o workflow_api.json não é o mesmo arquivo que você salva normalmente na interface. É a exportação específica de API, senão o endpoint não reconhece o formato.

Na prática: como uso isso aqui

Hoje tenho o Z-Image rodando nas minhas aplicações e gerando boas imagens. Uso mais pra gerar imagens pros blogs em formato 16:9, e os números no meu hardware: cerca de 20 segundos pra subir pra VRAM, e depois que já está na VRAM, cada imagem sai em torno de 9 a 10 segundos.

Testei a comparação com o Qwen, e a conclusão que cheguei: não me trouxe uma diferença muito grande em qualidade em relação ao Z-Image, mas o uso de VRAM aumentou muito. Optei por continuar com o Z-Image porque, como meu hardware é limitado, preciso de um padrão que dê pra rodar aqui junto o llama.cpp com o gerador de imagens — LLM e imagem dividindo a mesma máquina.

Sobre a integração via API: hoje temos a opção de usar o ComfyUI por esse caminho, mas o custo disso aumenta. No meu caso, que gero em média 60 imagens por dia, o custo ao mês, juntando com os demais custos, ficaria muito alto. Então opto por rodar localmente.

Pra quem usa poucas gerações por dia, a conta pode inverter: usar por API, pela OpenRouter ou outra opção. Minha indicação seria o muse-image, que custa cerca de US$ 0,01 por imagem, em vez de montar geração local. Mas aí vêm alguns critérios que devem ser pensados:

  1. Custo — local exige hardware que você já tem; API cobra por uso.
  2. Privacidade — local não envia nada pra fora.
  3. Disponibilidade — local roda sem internet.
  4. Desempenho — no meu caso, 9 a 10 segundos por imagem.

São esses fatores, entre outros, que devem ser ponderados na decisão entre geração local e API.

Perguntas frequentes

O Z-Image-Turbo roda em qual GPU?

Em bf16, ele pede 14 a 16GB de VRAM e 16GB de RAM. Com FP8, roda em 8GB de VRAM, e em GGUF Q4/Q3 chega a 6GB de VRAM, com 32GB de RAM recomendados. O setup também exige Python 3.10+, CUDA 12.x e ~30GB de disco.

Posso usar o Z-Image-Turbo comercialmente?

Sim. O modelo é licenciado em Apache 2.0, o que permite uso comercial sem royalties. A variante com ControlNet, Z-Image-Turbo-Fun-Controlnet-Union, segue a mesma licença.

Qual a diferença entre o Turbo e a versão base do Z-Image?

O Turbo é destilado: gera em 8 passos sem CFG, priorizando velocidade. A base usa 30 a 50 passos com CFG 3 a 5, sendo mais lenta, porém com mais liberdade criativa e suporte a fine-tuning.

PUBLICIDADE
Este post foi útil para você?
🛒
Vai rodar IA no seu computador?

Modelos locais dependem da placa de vídeo: quanto mais VRAM, maiores os modelos e mais rápidas as respostas. Compare os preços de placas RTX na Amazon.

Ver preços na Amazon →
Como associado da Amazon, o blog ganha com compras qualificadas, sem custo extra para você.

Leitura recomendada

💬 Comentários

Nenhum comentário ainda. Conte o que achou, tire uma dúvida ou discorde. Seja o primeiro!

Deixe seu comentário
O e-mail não aparece. Serve só para avisar quando responderem você.
Os comentários passam por aprovação antes de aparecer. Crie uma conta de leitor e, depois do primeiro aprovado, os próximos saem na hora.
Apoie o ConexãoTC

O ConexãoTC é independente e gratuito. Se as notícias fazem parte do seu dia, contribua com qualquer valor pelo PIX e ajude a manter o blog no ar.

QR code PIX para apoiar o ConexãoTC
Aponte a câmera do app do banco
Favorecido: Jean Dgardany C. Lima, editor do ConexãoTC
🗳️ O que você quer ler aqui?

Marque os assuntos que te interessam. Os mais pedidos viram os próximos artigos.

Leitores cadastrados têm as sugestões atendidas primeiro e recebem um aviso quando o artigo sai.
Fique por dentro

Os destaques do dia no seu e-mail, todo dia às 8h.

PUBLICIDADE