PUBLICIDADE

Alibaba antecipa o futuro: Qwen3.8-Flash-Next dá um gostinho do Qwen4 com 180 bilhões de parâmetros, contexto de 1 milhão de tokens e custo de treinamento nove vezes menor

26/08/2026
117 visualizações
4 min de leitura
Imagem principal do post

Equipe Qwen da Alibaba apresenta Qwen3.8-Flash-Next como prévia da próxima geração Qwen4

A equipe Qwen, ligada ao Alibaba, disponibilizou o Qwen3.8-Flash-Next, um modelo multimodal de pesos abertos baseado na arquitetura Mixture-of-Experts, conhecida como MoE, um sistema em que apenas parte dos parâmetros é acionada a cada token processado. O lançamento funciona como uma prévia antecipada da arquitetura que sustentará a futura família Qwen4, papel semelhante ao desempenhado pelo Qwen3-Next em relação ao Qwen3.5. A proposta central é reduzir o custo por token gerado, mantendo capacidade de raciocínio e suporte a múltiplas modalidades.

O modelo combina um backbone principal de 125 bilhões de parâmetros com uma tabela de embeddings N-gram de 51 bilhões e um módulo de previsão multi-token de 4 bilhões, totalizando 180 bilhões de parâmetros em disco. Apesar desse volume, apenas 6 bilhões de parâmetros são efetivamente ativados a cada token, o que reduz o custo computacional por inferência. A equipe destaca que o treinamento do Qwen3.8-Flash-Next custou aproximadamente um nono do investimento necessário para treinar o Qwen3.7-Plus, indicando ganhos significativos de eficiência.

Imagem complementar

Quatro mudanças arquiteturais sustentam o lançamento. A primeira é um esquema híbrido de atenção que combina o Gated DeltaNet, um mecanismo de atenção linear que comprime o histórico em um estado recorrente de tamanho fixo, com o Qwen Sparse Attention, uma técnica que seleciona trechos do contexto em granularidade de microblocos em vez de token a token. Em um total de 48 camadas, três em cada quatro utilizam o Gated DeltaNet, enquanto a quarta opera com o Qwen Sparse Attention, respeitando um orçamento de 512 blocos ou 2.048 tokens por camada desse tipo.

A segunda mudança é o Gated Residual, que amplia o fluxo residual em quatro ramos paralelos, com portões de leitura e escrita por elemento, operando em um posto de gargalo de 320. A terceira inovação é a incorporação de embeddings N-gram, uma tabela com 20 milhões de entradas de bigramas e trigramas posicionada na camada 2, que amplia a capacidade do modelo por meio de consultas determinísticas. Essa tabela pode ser descarregada para a memória do hospedeiro com pré-busca assíncrona, embora o suporte atual esteja restrito a dispositivos da NVIDIA.

PUBLICIDADE

A quarta mudança envolve a receita de treinamento. O otimizador Muon foi aplicado em conjunto com o AdamW a categorias específicas de pesos, eliminando a fase de aquecimento do tamanho de lote e permitindo o reajuste das leis de escala. A camada MoE do modelo abriga 512 especialistas, dos quais 10 são roteados e um é compartilhado, operando com dimensão intermediária de 640 por especialista.

Os benchmarks divulgados pela equipe Qwen mostram resultados expressivos em tarefas de programação e agentes. O modelo alcançou 58,7 no DeepSWE 1.1, 62,5 no SWE-bench Pro, 81,0 no SWE-bench Multilingual e 91,9 no LiveCodeBench v6. Em tarefas agentivas, registrou 73,9 no CoWorkBench, 55,7 no JobBench e 73,5 no Toolathlon Verified. Nos testes multimodais, os números incluem 84,5 no AndroidWorld, 76,6 no LVBench, 88,5 no RealWorldQA e 95,7 no MathVision com interpretador de código.

Apesar do desempenho, o modelo não lidera todos os rankings. O Claude Opus 4.6 Max atinge 40,0 no HLE, contra 35,9 do Qwen, e o DeepSeek-V4-Flash-0731 lidera o NL2Repo-Bench com 54,2, ante 48,1 do novo lançamento. O raciocínio de fronteira continua sendo um campo aberto para evolução.

No quesito eficiência em produção, a Qwen cita acelerações de até 7,6 vezes no pré-preenchimento e 4,9 vezes na decodificação ao processar contextos de um milhão de tokens. Outras receitas, como as dos projetos SGLang e vLLM, relatam fatores de 10,2 e 6,6 vezes nos mesmos cenários, valores que devem ser tratados como referências do fabricante até medições independentes. A empresa também afirma entregar 8,6 vezes a vazão de pré-preenchimento do Qwen3.7-Plus com taxa de acerto de 90% no prefix-cache.

O contexto nativo é de 262.144 tokens, extensível a um milhão com o método YaRN, uma técnica que extrapola a janela de atenção por meio de interpolação de embeddings rotativos. Em termos de implantação, o ponto de verificação FP8 ocupa 172,78 gibibytes, enquanto a versão BF16 atinge 335,28 gibibytes, o que exige um nó com múltiplas GPUs em vez de uma estação de trabalho convencional. As receitas oficiais recomendam TP2 como configuração mínima validada em FP8 no GB300 e TP4 como ajuste ideal. Em um nó com 8 placas H200, a orientação é usar TEP8, já que o TP8 tradicional é incompatível com os blocos de quantização de 128 elementos do ponto de verificação.

O modelo pode ser executado por meio das ferramentas vLLM, SGLang, TokenSpeed, transformers serve e llama.cpp, que oferece versões GGUF para quantização. O ajuste fino é compatível com Unsloth, Swift e LLaMA-Factory. Ele já alimenta o modo "Standard" no QwenWork e funciona com o Qwen Code, contando com o modo de raciocínio ativado por padrão, configurável entre os níveis xhigh, medium e low.

A Qwen recomenda temperatura 1.0 e top_p 0,95 no modo de raciocínio, e temperatura 0,7 com top_p 0,80 no modo de instrução. A licença adotada é a qwen-community-1.0, distinta da Apache-2.0, o que exige verificação prévia dos termos antes de qualquer uso comercial.

PUBLICIDADE
Este post foi útil para você?
🛒
Vai rodar IA no seu computador?

Modelos locais dependem da placa de vídeo: quanto mais VRAM, maiores os modelos e mais rápidas as respostas. Compare os preços de placas RTX na Amazon.

Ver preços na Amazon →
Como associado da Amazon, o blog ganha com compras qualificadas, sem custo extra para você.

Leitura recomendada

💬 Comentários

Nenhum comentário ainda. Conte o que achou, tire uma dúvida ou discorde. Seja o primeiro!

Deixe seu comentário
O e-mail não aparece. Serve só para avisar quando responderem você.
Os comentários passam por aprovação antes de aparecer. Crie uma conta de leitor e, depois do primeiro aprovado, os próximos saem na hora.
Apoie o ConexãoTC

O ConexãoTC é independente e gratuito. Se as notícias fazem parte do seu dia, contribua com qualquer valor pelo PIX e ajude a manter o blog no ar.

QR code PIX para apoiar o ConexãoTC
Aponte a câmera do app do banco
Favorecido: Jean Dgardany C. Lima, editor do ConexãoTC
🗳️ O que você quer ler aqui?

Marque os assuntos que te interessam. Os mais pedidos viram os próximos artigos.

Leitores cadastrados têm as sugestões atendidas primeiro e recebem um aviso quando o artigo sai.
Fique por dentro

Os destaques do dia no seu e-mail, todo dia às 8h.

PUBLICIDADE