Se o objetivo é gerar imagem IA local, rodando tudo na sua própria GPU, sem fila de nuvem e sem pagar por imagem, o fim de 2025 trouxe duas opções que mudaram essa conta: o Z-Image-Turbo do Tongyi Lab/Alibaba e o Qwen-Image-2.1 da linha QwenLM. Um é velocidade pura em GPU de consumo; o outro é recurso completo de geração e edição.
Neste guia vou destrinchar os requisitos de hardware de cada um, a instalação passo a passo no ComfyUI e via diffusers, e como expor isso numa API para automatizar com n8n. Também conto como isso roda na prática nas minhas máquinas aqui em Fortaleza.
Por que gerar imagem IA local virou viável: Z-Image-Turbo e Qwen-Image-2.1 mudaram o jogo
O Z-Image-Turbo, lançado em 26 de novembro de 2025, é uma variante destilada de 6B parâmetros da linha Z-Image, com arquitetura S3-DiT. A sacada principal: gera imagens em 8 passos, sem CFG, rodando em GPUs de consumo com 16GB de VRAM. Isso derrubou a barreira que antes exigia placa topo de linha ou nuvem.
A recepção foi imediata: o modelo passou de 500 mil downloads no primeiro dia e liderou o gráfico de tendências do Hugging Face. A licença é Apache 2.0, o que permite uso comercial sem royalties — detalhe que pesa muito pra quem pensa em produto, não só em hobby.
Já o Qwen-Image-2.1 é a versão mais recente da linha Qwen-Image e mira em outra frente: une geração e edição na mesma ferramenta, gera nativamente imagens transparentes (RGBA), monta foto de grupo a partir de seis retratos de referência e suporta proporções até 2752x1536. É mais canivete suíço do que bala de prata de velocidade.
Requisitos de GPU e RAM: o que roda na sua máquina (bf16, fp8 e GGUF)
Segundo o guia prático da Thunder Compute, os requisitos do Z-Image-Turbo variam bastante conforme a precisão escolhida, e é aqui que muita gente se engana ao avaliar se dá pra rodar ou não:
| Variante | VRAM | RAM |
|---|---|---|
| bf16 | 14 a 16GB | 16GB |
| FP8 | 8GB | não informado |
| GGUF Q4/Q3 | até 6GB | 32GB recomendados |
Além disso, conte com Python 3.10+, CUDA 12.x e cerca de 30GB de disco só pros arquivos. Ou seja: uma GPU de 8GB já entra no jogo com FP8, e até 6GB de VRAM é possível com GGUF, desde que a RAM do sistema acompanhe.
Vale lembrar que esses números são do Turbo, o modelo destilado. A versão base não destilada (Z-Image) usa 30 a 50 passos com CFG entre 3 e 5: mais lenta, porém com mais liberdade criativa e suporte a fine-tuning, como detalha o post do blog do ComfyUI sobre o modelo.
Instalando o Z-Image-Turbo no ComfyUI: arquivos, pastas e workflow oficial
O ComfyUI deu suporte nativo day-0 à família Z-Image, e existe tutorial oficial de workflow na documentação, o que facilita muito a vida de quem já usa a ferramenta.
O download oficial é feito direto do repositório, com o huggingface_hub atualizado:
pip install -U huggingface_hub
hf download Tongyi-MAI/Z-Image-Turbo
Depois de baixar, cada arquivo vai numa pasta específica da sua instalação do ComfyUI:
| Arquivo | Pasta do ComfyUI |
|---|---|
| z_image_turbo_bf16.safetensors | diffusion_models |
| qwen_3_4b (bf16/fp8/fp4) | text_encoders |
| ae.safetensors | vae |
| LoRA de destilação | loras |
Repare que o text encoder é o Qwen 3 4B — mesmo sendo um modelo da Alibaba concorrente "de linha", eles se complementam aqui. O modelo aceita prompts em inglês e chinês, incluindo renderização de texto misto chinês/inglês dentro da imagem.
Se você precisar de controle preciso de pose e composição, no início de dezembro de 2025 o Tongyi Lab abriu também o Z-Image-Turbo-Fun-Controlnet-Union, variante com ControlNet, igualmente em Apache 2.0. Está publicado no repositório deles no Hugging Face.
Qwen-Image-2.1 via diffusers: instalação, cpu offload e quando usar
O caminho recomendado pro Qwen-Image-2.1 é a biblioteca diffusers. As dependências listadas no model card são:
pip install "torch>=2.4.0" "transformers>=5.17" accelerate pillow
O diffusers, nessa configuração, é instalado via git — confira o comando exato no model card do modelo no Hugging Face, porque a forma de instalação pode mudar conforme a versão. Pra reduzir o consumo de VRAM, o próprio model card indica o offload:
pipe.enable_model_cpu_offload()
Como linha de base, conte com ~40 passos por imagem. É uma ordem de grandeza diferente dos 8 passos do Turbo, e isso reflete a filosofia de cada modelo.
Contexto importante pra calibrar expectativas: o Qwen-Image original, de 20B parâmetros, pedia cerca de 40GB de VRAM sem otimização, e ~58GB na variante Edit, segundo esse artigo da MindStudio. Localmente, ele só ficava viável com quantização e offload. O 2.1 segue sendo pesado, então o cpu offload não é opcional, é parte do setup.
Turbo ou Qwen? Escolhendo o modelo certo para cada tarefa
Essa escolha depende do seu caso de uso, e os fatos ajudam a decidir:
- Volume e velocidade: Turbo. 8 passos sem CFG, em GPU de 8GB com FP8. Se você gera dezenas de imagens por dia, essa é a conta que fecha.
- Edição, transparência e referências: Qwen-Image-2.1. Geração e edição juntas, RGBA nativo, foto de grupo a partir de seis retratos e proporções grandes até 2752x1536.
- Fine-tuning e liberdade criativa: versão base Z-Image, com 30 a 50 passos e CFG 3 a 5.
- Controle de pose e composição: Z-Image-Turbo-Fun-Controlnet-Union.
Na dúvida, comece pelo Turbo: é o mais barato de testar em hardware modesto, e a licença Apache 2.0 não trava nada. Se sentir falta de edição ou transparência, aí sim o Qwen-Image-2.1 entra na jogada.
Integração via API: chamando o ComfyUI pelo n8n para automatizar geração de imagens
Gerar imagem na interface é ótimo pra teste, mas o valor real aparece quando você automatiza. Workflows do ComfyUI podem ser executados via API com o SDK oficial (@comfyorg/sdk), usando API key e o workflow_api.json. Isso permite chamar a geração de imagens de qualquer backend, incluindo o n8n.
O fluxo geral fica assim: você monta e testa o workflow na interface, exporta a versão de API, e consome esse endpoint num fluxo do n8n — por exemplo, disparado por um formulário, um webhook ou uma planilha. A página de workflows do ComfyUI tem exemplos prontos que você pode usar de base.
Um detalhe que economiza tempo: o workflow_api.json não é o mesmo arquivo que você salva normalmente na interface. É a exportação específica de API, senão o endpoint não reconhece o formato.
Na prática: como uso isso aqui
Hoje tenho o Z-Image rodando nas minhas aplicações e gerando boas imagens. Uso mais pra gerar imagens pros blogs em formato 16:9, e os números no meu hardware: cerca de 20 segundos pra subir pra VRAM, e depois que já está na VRAM, cada imagem sai em torno de 9 a 10 segundos.
Testei a comparação com o Qwen, e a conclusão que cheguei: não me trouxe uma diferença muito grande em qualidade em relação ao Z-Image, mas o uso de VRAM aumentou muito. Optei por continuar com o Z-Image porque, como meu hardware é limitado, preciso de um padrão que dê pra rodar aqui junto o llama.cpp com o gerador de imagens — LLM e imagem dividindo a mesma máquina.
Sobre a integração via API: hoje temos a opção de usar o ComfyUI por esse caminho, mas o custo disso aumenta. No meu caso, que gero em média 60 imagens por dia, o custo ao mês, juntando com os demais custos, ficaria muito alto. Então opto por rodar localmente.
Pra quem usa poucas gerações por dia, a conta pode inverter: usar por API, pela OpenRouter ou outra opção. Minha indicação seria o muse-image, que custa cerca de US$ 0,01 por imagem, em vez de montar geração local. Mas aí vêm alguns critérios que devem ser pensados:
- Custo — local exige hardware que você já tem; API cobra por uso.
- Privacidade — local não envia nada pra fora.
- Disponibilidade — local roda sem internet.
- Desempenho — no meu caso, 9 a 10 segundos por imagem.
São esses fatores, entre outros, que devem ser ponderados na decisão entre geração local e API.
Perguntas frequentes
O Z-Image-Turbo roda em qual GPU?
Em bf16, ele pede 14 a 16GB de VRAM e 16GB de RAM. Com FP8, roda em 8GB de VRAM, e em GGUF Q4/Q3 chega a 6GB de VRAM, com 32GB de RAM recomendados. O setup também exige Python 3.10+, CUDA 12.x e ~30GB de disco.
Posso usar o Z-Image-Turbo comercialmente?
Sim. O modelo é licenciado em Apache 2.0, o que permite uso comercial sem royalties. A variante com ControlNet, Z-Image-Turbo-Fun-Controlnet-Union, segue a mesma licença.
Qual a diferença entre o Turbo e a versão base do Z-Image?
O Turbo é destilado: gera em 8 passos sem CFG, priorizando velocidade. A base usa 30 a 50 passos com CFG 3 a 5, sendo mais lenta, porém com mais liberdade criativa e suporte a fine-tuning.