PUBLICIDADE

IBM aposta alto na IA aberta: Granite 4.2 chega com raciocínio nativo e agentes autônomos para revolucionar o mercado corporativo

26/08/2026
6 visualizações
4 min de leitura
Imagem principal do post

IBM lança Granite 4.2 com raciocínio nativo e aprendizado por reforço agentico para modelos empresariais abertos

A IBM apresentou o Granite 4.2, uma nova família de modelos de linguagem abertos voltada para raciocínio explícito, disponível em três tamanhos: 3 bilhões, 8 bilhões e 30 bilhões de parâmetros. Diferentemente das versões anteriores do Granite, que funcionavam principalmente como assistentes de instrução, a nova geração foi projetada em torno da capacidade de raciocínio, permitindo que cada modelo produza uma cadeia de pensamento antes de responder às perguntas dos usuários.

Imagem complementar

Todos os modelos da família contam com um mecanismo que alterna entre modos de operação. Há um modo de pensamento, um modo sem pensamento e ainda um modo de baixo esforço, que consome menos recursos de raciocínio para questões consideradas mais simples. Essa flexibilidade permite que os desenvolvedores ajustem o equilíbrio entre custo computacional e qualidade das respostas conforme a necessidade da aplicação.

PUBLICIDADE

Do ponto de vista arquitetônico, o Granite 4.2 utiliza a estrutura de transformador denso do tipo decoder-only, ou seja, um modelo que gera texto palavra por palavra a partir de um único bloco de processamento neural. Os componentes principais incluem atenção por consulta agrupada com oito cabeças de chave-valor, embeddings rotativos posicionais com parâmetro theta de dez milhões, funções de ativação SwiGLU nas camadas intermediárias e normalização RMSNorm. Todo o treinamento e a inferência ocorrem em precisão bfloat16, um formato numérico que ocupa menos memória do que o padrão tradicional. O modelo de 3 bilhões utiliza 40 camadas com dimensão de embedding de 2.560, o de 8 bilhões mantém as 40 camadas, mas amplia a dimensão para 4.096, e o de 30 bilhões vai a 64 camadas com tamanho oculto de 32.768 nas camadas intermediárias. O comprimento de contexto publicado é de 128 mil tokens, mas o pré-treinamento inclui uma fase estendida que alcança 512 mil tokens.

O pré-treinamento foi realizado a partir do zero com aproximadamente 15 trilhões de tokens, e o pós-treinamento segue uma cadeia de aprendizado por reforço dividida em múltiplas etapas. Esse pipeline combina ajuste fino supervisionado com cerca de 7,2 milhões de amostras, totalizando aproximadamente 100 bilhões de tokens, dos quais cerca de 65 bilhões são efetivamente treináveis. A mistura de dados é composta por 31,6% de tarefas agenticas e 68,4% de tarefas não agenticas, sendo que engenharia de software representa a maior parte da fatia agentica. As trajetórias de treinamento foram geradas por ferramentas como OpenHands, SWE-agent, Terminus-2, MiniSWE, Codex e Goose, com controle de qualidade realizado pelos modelos GPT-OSS-120B e Gemma 4, além de deduplicação por hash criptográfico.

Um dos destaques do Granite 4.2 é o bloco de aprendizado por reforço agentico, presente apenas nas versões de 8 e 30 bilhões. Nessa etapa, os modelos aprendem a editar código, operar terminais e realizar buscas na web dentro de ambientes isolados e controlados. Essa escolha de design é a principal responsável pela diferença de capacidade entre os tamanhos, já que o modelo de 3 bilhões recebe apenas aprendizado por reforço fundamental e alinhamento. Todo o processo de treinamento foi executado sobre os frameworks NeMo-RL e NeMo-Gym em um cluster com chips NVIDIA GB200 NVL72, hospedado pela CoreWeave. A IBM também disponibilizou um trilhão de tokens de código sintético gerados pelo pipeline interno chamado CodeAlchemy, além de uma camada de decodificação especulativa para acelerar a geração de respostas em produção.

Os três modelos são distribuídos sob a licença Apache 2.0, o que permite download, ajuste fino e uso comercial sem restrições de licenciamento. O modelo de 3 bilhões é voltado para desenvolvedores individuais e startups que rodam os modelos localmente em laptops usando ferramentas como Ollama ou LM Studio, enquanto a de 8 bilhões atende equipes de médio porte com acesso a uma única GPU moderna. A versão de 30 bilhões foi projetada para empresas com capacidade de hardware de classe A100 ou H100, além de oferecer suporte à inferência em precisão FP8 e NVFP4 no servidor vLLM. Organizações que operam em setores regulados se beneficiam ainda da possibilidade de executar os modelos completamente em infraestrutura própria, sem dependência de serviços externos.

Os resultados divulgados pela IBM incluem pontuações em benchmarks como SWE-Bench Verified, onde a versão de 30 bilhões atinge 57,00 e a de 8 bilhões marca 47,67. No Terminal-Bench 2.1, o modelo de 30 bilhões chega a 29,24 e o de 8 bilhões a 20,56. Em raciocínio matemático, medido pelo AIME25, o modelo de 30 bilhões obtém 89,17, enquanto o de 3 bilhões alcança 78,33. As aplicações indicadas incluem agentes de engenharia de software, automação de terminais e operações de DevOps, agentes de pesquisa aprofundada, sistemas de geração aumentada por recuperação sobre documentos longos, chamadas estruturadas a ferramentas externas e transcrição de áudio em larga escala.

Juntamente com os modelos de linguagem, a IBM também lançou dois modelos Granite Speech 5.0 Turbo CTC com 470 milhões de parâmetros. Diferentemente de abordagens tradicionais, essas versões dispensam completamente o modelo de linguagem como backbone e utilizam classificação temporal conexionista, uma técnica que converte diretamente áudio em texto. A IBM reporta uma taxa de processamento próxima de 12.600 vezes em tempo real em uma única GPU H200, contra cerca de 6.000 vezes para os líderes atuais do ranking Open ASR. Um demonstrativo em WebGPU já está disponível para testes no navegador.

PUBLICIDADE

Leitura recomendada

Comentários

Nenhum comentário ainda. Seja o primeiro a comentar!