PUBLICIDADE

JetBrains Mellum2.1: a IA aberta de 12 bilhões de parâmetros que promete rodar agentes de programação direto no seu computador

08/10/2026
8 visualizações
4 min de leitura
A JetBrains lançou o Mellum2.1, modelo aberto de 12 bilhões de parâmetros disponível na Hugging Face sob Apache 2.0, criado para agentes de programação que rodam localmente.
Imagem principal do post

A JetBrains anunciou o lançamento do Mellum2.1, um modelo de linguagem aberto desenvolvido especificamente para agentes de programação e subagentes de alta velocidade. O modelo possui 12 bilhões de parâmetros no total, mas ativa apenas 2,5 bilhões por token graças à arquitetura de mistura de especialistas, técnica que seleciona apenas uma parte da rede para processar cada elemento de texto, reduzindo o custo computacional. Os pesos estão disponíveis sob a licença Apache 2.0 na plataforma Hugging Face, permitindo uso, modificação e implantação sem restrições comerciais significativas.

O checkpoint divulgado chama-se Mellum2.1-12B-A2.5B-Thinking e é uma evolução direta do Mellum2 Thinking, aberto pela JetBrains em junho de 2026. Trata-se de um modelo de raciocínio, que emite sua cadeia de pensamento antes de apresentar a resposta final. Segundo a empresa, o objetivo é atender a três cenários: trabalho como agente autônomo, assistente geral de raciocínio e implantação privada em infraestrutura própria. O resultado é um sistema compacto, capaz de hospedar-se localmente, que explora um repositório de código, edita arquivos e verifica as próprias alterações.

A arquitetura permaneceu idêntica à da versão anterior, com 28 camadas e 64 especialistas, dos quais um roteador ativa 8 para cada token. O mecanismo de atenção usa consultas agrupadas, com 32 cabeças de consulta e 4 cabeças de memória, enquanto três de cada quatro camadas operam com uma janela deslizante de 1.024 tokens. O comprimento de contexto alcança 131.072 tokens, o vocabulário contém 98.304 entradas e os pesos são distribuídos no formato bfloat16, padrão numérico que equilibra precisão e eficiência.

Imagem complementar

Praticamente todo o avanço da nova versão veio do pós-treinamento com aprendizado por reforço, método que treina o modelo por meio de recompensas a partir de resultados verificáveis. A JetBrains transformou o que antes era um estágio curto ao final do processo na parte principal do treinamento, adicionando tarefas de matemática, programação competitiva, ciências, uso de ferramentas e engenharia de software. A empresa filtrou conjuntos de dados abertos para remover testes quebrados, respostas impossíveis de verificar e desafios excessivamente fáceis ou inviáveis.

Na engenharia de software, o treinamento ocorreu dentro de repositórios reais, com acesso a um terminal e a ferramentas de edição de arquivos, sendo o modelo recompensado sempre que os testes fossem aprovados. Para viabilizar esse processo em escala, a JetBrains executou milhões de ambientes de execução isolados, os chamados sandboxes, distribuídos em milhares de configurações distintas, simulando condições reais de desenvolvimento.

PUBLICIDADE

Nos testes de desempenho, conduzidos com um único pipeline em modo de raciocínio, o maior salto apareceu na programação agentiva, área em que o modelo atua de forma autônoma em múltiplas etapas. O índice no SWE-bench Verified, avaliação que mede a capacidade de resolver problemas reais em repositórios de código, subiu de 2.0 para 47.0. No SWE-bench Pro, a pontuação passou de 0.0 para 28.0, e no Terminal-Bench 2.1, que avalia tarefas no terminal, o crescimento foi de 0.6 para 17.4. As execuções agentivas utilizaram a estrutura de código aberto Pi v0.73.1, com contexto de 114 mil tokens.

O Mellum2.1 superou a versão anterior em 15 dos 17 testes listados e venceu o Qwen3.5-9B em 5 deles. O modelo lidera o grupo no LiveCodeBench v6 com 82.0 pontos, à frente do Qwen3.5-9B, que marcou 75.4, e do Gemma 4 E4B, com 69.4. Também fica na frente no HumanEval+, com 91.5, no MBPP+, com 79.4, e no BFCL v4, avaliação de chamada de funções, com 62.3. Houve ainda melhora em segurança: o HarmBench caiu de 21.5 para 8.5, e nesse caso quanto menor a pontuação, melhor.

O Qwen3.5-9B, contudo, segue à frente nas tarefas agentivas mais difíceis e em conhecimento geral, com 50.0 no SWE-bench Verified, 38.0 no SWE-bench Pro, 86.7 no AIME 25/26, prova de matemática, e 77.8 no GPQA Diamond. A própria JetBrains reconhece que os pipelines de avaliação influenciam os números: a ficha oficial da Qwen registra 65.6 no LiveCodeBench v6 e 81.7 no GPQA Diamond, enquanto a medição da JetBrains encontrou 75.4 e 77.8 para o mesmo modelo. Todas as pontuações divulgadas são autorrelatadas pela empresa.

Como o pós-treinamento não alterou a arquitetura, a velocidade equivale à do Mellum2. Em uma única placa NVIDIA H200 sob carga intensa, o modelo entrega quase o dobro de tokens por segundo do Qwen3.5-9B, segundo a JetBrains. Em requisições individuais, a previsão de múltiplos tokens acelera o processamento em cerca de 1,6 vez. O componente de previsão de múltiplos tokens para decodificação especulativa no vLLM ainda está em desenvolvimento.

Para execução local, o modelo completo funciona no vLLM com o analisador de raciocínio qwen3, e o suporte a chamadas de ferramentas exige parâmetros adicionais de configuração. A JetBrains recomenda temperatura de 0.6, com valores de amostragem de 0.95 e 20. Conversões no formato GGUF já estão disponíveis em cinco variantes, começando em 7.0 gigabytes e chegando a 24.3 gigabytes na versão de referência, compatíveis com llama.cpp, Ollama e LM Studio. A variante recomendada ocupa 8.1 gigabytes, tamanho que, segundo a avaliação, torna práticos os subagentes de programação rodando localmente.

PUBLICIDADE
Este post foi útil para você?
🛒
Vai rodar IA no seu computador?

Modelos locais dependem da placa de vídeo: quanto mais VRAM, maiores os modelos e mais rápidas as respostas. Compare os preços de placas RTX na Amazon.

Ver preços na Amazon →
Como associado da Amazon, o blog ganha com compras qualificadas, sem custo extra para você.

Leitura recomendada

💬 Comentários

Nenhum comentário ainda. Conte o que achou, tire uma dúvida ou discorde. Seja o primeiro!

Deixe seu comentário
O e-mail não aparece. Serve só para avisar quando responderem você.
Os comentários passam por aprovação antes de aparecer. Crie uma conta de leitor e, depois do primeiro aprovado, os próximos saem na hora.
Apoie o ConexãoTC

O ConexãoTC é independente e gratuito. Se as notícias fazem parte do seu dia, contribua com qualquer valor pelo PIX e ajude a manter o blog no ar.

QR code PIX para apoiar o ConexãoTC
Aponte a câmera do app do banco
Favorecido: Jean Dgardany C. Lima, editor do ConexãoTC
🗳️ O que você quer ler aqui?

Marque os assuntos que te interessam. Os mais pedidos viram os próximos artigos.

Leitores cadastrados têm as sugestões atendidas primeiro e recebem um aviso quando o artigo sai.
Fique por dentro

Os destaques do dia no seu e-mail, todo dia às 8h.

PUBLICIDADE