PUBLICIDADE

DeepSeek V4.1-Flash chega com contexto de 1 milhão de tokens e KV cache 437 vezes menor para revolucionar agentes de IA de longa duração

10/09/2026
7 visualizações
5 min de leitura
Imagem principal do post

DeepSeek lança V4.1-Flash com contexto de um milhão de tokens e arquitetura orientada a agentes de longa duração

A DeepSeek disponibilizou o DeepSeek-V4.1-Flash, um modelo multimodal baseado em Mixture-of-Experts projetado para reduzir o custo de servir agentes de inteligência artificial que operam com contextos muito longos. O lançamento foi construído em torno de um gargalo específico identificado pela própria empresa: o acúmulo de cache de chave e valor, conhecido como KV cache, gerado por prefills repetidos e por janelas de contexto que podem chegar a um milhão de tokens. Esse tipo de workload pressiona memória de alta largura de banda, capacidade de SSD e largura de banda de forma intensa, especialmente em aplicações agenticas que mantêm histórico extenso entre chamadas.

Imagem complementar

O novo modelo conta com 552 bilhões de parâmetros na espinha dorsal, somados a 196 bilhões de parâmetros adicionais do módulo Engram, e oferece uma janela de contexto nativa de um milhão de tokens. Durante a fase de prefill, etapa em que o modelo processa todo o prompt de entrada antes de começar a gerar respostas, são ativados 8 bilhões de parâmetros por token. Já na fase de decode, quando o modelo gera cada novo token de saída, a ativação sobe para 16 bilhões. O principal número divulgado pela equipe de pesquisa é o tamanho do KV cache global, fixado em 890 bytes por token, o que representa cerca de um quarto do consumo do DeepSeek-V4-Flash e aproximadamente 437 vezes menos do que o DeepSeek-V1.

PUBLICIDADE

Para viabilizar a implantação, os pesos abertos são distribuídos sob licença MIT, com suporte para os frameworks vLLM, SGLang e Transformers na plataforma Hugging Face. A equipe também descreve uma API pública organizada em três níveis de raciocínio, chamados baixo, alto e máximo, permitindo que aplicações escolham o equilíbrio entre custo e profundidade de raciocínio conforme a tarefa.

A arquitetura central recebeu o nome de Causal Encoder-Decoder. A espinha dorsal de 40 camadas foi dividida em duas partes iguais: um codificador causal de 20 camadas e um decodificador de outras 20 camadas. Inspirada no trabalho YOCO, a proposta elimina a necessidade de o decodificador calcular seu próprio KV cache global. Em vez disso, pesos de projeção por camada derivam esse estado a partir do estado oculto final do codificador. Com isso, os tokens do prompt são processados apenas no codificador, reduzindo pela metade o custo computacional do prefill. Uma atenção de janela deslizante com 128 tokens continua rodando em todas as camadas, mas o estado do decodificador é reconstruído apenas a partir dos últimos 128 tokens do prompt, em um mecanismo apelidado de Decoder SWA Bounded Replay.

No plano da atenção esparsa, o V4.1-Flash abandona o esquema híbrido usado na versão anterior e adota integralmente a Compressed Sparse Attention 2, conhecida como CSA2. Cada camada CSA2 é atribuída estaticamente a um dos três modos. No modo Full, a camada calcula seu próprio KV principal, projeta o indexador K a partir dele e seleciona novos índices Top-512. No modo Reindex, ela reutiliza o KV principal e o indexador K da última camada Full, mas recalcula as pontuações com seu próprio indexador Q. No modo Reuse, a camada reaproveita tanto o KV principal quanto os índices Top-K mais recentes, dispensando totalmente o indexador. As 18 camadas CSA2 do codificador operam com taxa de compressão 2, em três grupos de seis camadas, cada um com uma camada Full e cinco Reuse. As 20 camadas do decodificador usam taxa 1, em cinco grupos de quatro, sendo o primeiro composto por uma camada Full e três Reuse, e os demais por uma Reindex e três Reuse. Um Hierarchical Sparse Indexer no decodificador permite que a camada Full construa um conjunto de candidatos de até 16.384 posições, divididas em 2.048 blocos de oito, de modo que camadas Reindex posteriores pontuem apenas um subconjunto delimitado em vez de todo o contexto.

A versão também introduz a quantização do KV principal para o formato E2M1, com uma escala E4M3 a cada 16 canais, seguindo o padrão NVFP4 sem sua escala global. A técnica é aplicada por meio de treinamento consciente de quantização no pós-treinamento e praticamente reduz à metade o armazenamento em relação ao cache FP8 da versão V4. No nível de implantação, o KV da janela deslizante deixou de ser persistido em SSD e passou a viver em um pool distribuído que ocupa 10 por cento da DRAM do hospedeiro, com tempo de vida medido em minutos, enquanto o KV global mantém uma garantia de retenção de 72 horas. Em caso de falha de cache, o mecanismo Encoder SWA Bounded Replay recomputa apenas 128 tokens em vez de camadas inteiras vezes o tamanho da janela.

Outras mudanças incluem o Single-Pass mHC, que desloca em um bloco os coeficientes de mistura de entrada para permitir que um kernel Mega-mHC fundido reduza à metade o tráfego de memória de ativações, o módulo Engram de memória condicional nas camadas 1 e 14, o DSpark de decodificação especulativa treinado após o pré-treinamento com a espinha dorsal congelada e o otimizador Muon aplicado por cabeça.

O pré-treinamento cobriu 45 trilhões de tokens multimodais, com proporção de sete para um entre texto e outras modalidades. A atenção esparsa foi treinada do zero em sequências de 64 mil tokens, sem aquecimento denso, e o contexto foi estendido para um milhão de tokens quando o treinamento alcançou 34 trilhões de tokens. O modelo base iguala o DeepSeek-V4-Pro-Base em conhecimento geral e codificação utilizando um terço do total de parâmetros e um quarto dos ativados. Nos resultados publicados em esforço máximo, o V4.1-Flash supera modelos como Opus-5 e GPT-5.6 Sol em benchmarks como Terminal-Bench 2.1, DeepSWE v1.1 e GPQA Diamond, demonstrando que as otimizações de eficiência não comprometeram o desempenho em tarefas agenticas e de raciocínio.

PUBLICIDADE

Leitura recomendada

Comentários

Nenhum comentário ainda. Seja o primeiro a comentar!