PUBLICIDADE

CLM-8B: o modelo aberto que abandona a geração de texto e pontua ações de agentes até nove vezes mais rápido que o Jev

24/09/2026
7 visualizações
5 min de leitura
Imagem principal do post

Contrastive-LM lança CLM-8B, modelo aberto que pontua ações de agentes até nove vezes mais rápido que o Jev

A Contrastive-LM apresentou o CLM-8B, primeiro modelo aberto de uma nova categoria chamada Contrastive Language Models, ou CLMs. Diferentemente dos modelos de linguagem generativos tradicionais, o CLM não produz texto. Em vez disso, ele avalia um conjunto de ações candidatas em relação ao estado atual e retorna probabilidades para cada uma delas.

Imagem complementar

O principal parâmetro de comparação utilizado pelos desenvolvedores é o Jev, modelo proprietário do tipo System One desenvolvido pela TypeSafe AI. O Jev entrou em acesso antecipado e limitado em 15 de setembro de 2026 e se diferencia justamente por devolver valores tipados acompanhados de probabilidades, em vez de gerar frases. O CLM foi desenhado para atingir a mesma interface funcional.

PUBLICIDADE

Em termos de implantação, o CLM-8B é leve. A cabeça de projeção do modelo, disponível sob a licença Apache-2.0, pesa apenas 75 MB e pode ser executada em uma única GPU NVIDIA em ambiente Linux, com o vLLM, sistema de serving de modelos, encarregado de servir o codificador Qwen3-8B. Toda a infraestrutura necessária cabe em hardware acessível para empresas e equipes de pesquisa.

A interface do CLM-8B expõe três tipos de pergunta compatíveis com a API da TypeSafe. O primeiro é o Noul, que retorna a probabilidade de uma afirmação ser verdadeira. O segundo é o Choice, que escolhe uma opção dentro de um conjunto declarado, atribuindo probabilidades a cada alternativa. O terceiro é o Score, que devolve um nível esperado dentro de uma escala ordenada. Segundo a publicação, uma requisição escrita para a API da TypeSafe pode ser reproduzida diretamente pelo cliente Python do CLM sem alterações.

O funcionamento interno do modelo se baseia em duas redes codificadoras treinadas com uma função chamada InfoNCE bidirecional, uma técnica de aprendizado contrastivo que aproxima representações de pares corretos e afasta representações de pares incorretos. Cada codificador combina um backbone Qwen3-8B congelado com uma cabeça treinável de cerca de 20 milhões de parâmetros. Durante o treinamento, o sistema puxa cada estado em direção à ação efetivamente tomada e o afasta das demais alternativas. Na inferência, o CLM calcula a probabilidade de cada candidata por meio do produto escalar entre os embeddings, representações numéricas, do estado e da ação. Uma softmax, função matemática que converte valores numéricos em distribuição de probabilidades, aplicada sobre esses escores gera a distribuição final de respostas.

A mesma estrutura permite ordenar as melhores entre N soluções candidatas, roteiar ferramentas e responder decisões tipadas. Esse desenho separa explicitamente as representações de estado e de ação. Em agentes que operam em ciclos repetitivos, o estado muda a cada passo enquanto o conjunto de ações permanece praticamente fixo. O componente clm-serve reserva uma fatia de memória da GPU, semelhante ao cache de chave-valor do vLLM, e reutiliza vetores já calculados. Em testes com uma RTX 4090 e três ações, estados revisitados passaram de 1,7 ms para 0,6 ms. Segundo o cartão do modelo, o CLM chega a ser treze vezes mais rápido que o Jev em cenários com cerca de mil candidatas.

O treinamento do CLM ocorreu em três etapas. Na pré-treinamento, o modelo foi exposto a aproximadamente 60 milhões de pares de perguntas e respostas do conjunto Nemotron DQA. No treinamento intermediário, foram gerados cerca de 30 milhões de exemplos negativos sintéticos com o Gemini 2.5 Flash-Lite, modelo do Google usado para produzir casos difíceis que forçam o modelo a distinguir opções sutis. Na pós-treinamento, foram usados cerca de um milhão de trajetórias de agentes provenientes das fontes Agent Data Protocol, Endless-Terminals e LiteCoder-Terminal-SFT. Em cerca de 100 mil perguntas reservadas para validação, a pré-treinamento isolada atinge 52,1% de acerto na escolha da melhor opção. O treinamento intermediário eleva esse índice para 69,2%. Treinar com negativos difíceis logo de início atinge no máximo 62,4% e depois sofre overfitting, quando o modelo se ajusta demais aos dados de treino e perde capacidade de generalização.

Nos testes de comparação direta com o Jev sem ajuste fino, o CLM-8B foi mais rápido em todas as tarefas avaliadas. No jogo T-Rex, a latência foi de 16,5 ms contra 149,8 ms do Jev, com cinco acertos em cinco. Na chamada de ferramentas avaliada pelo benchmark BFCL v4, o CLM marcou 76,8 ms contra 125,5 ms, mas com taxa de sucesso de 95,2% frente a 99,2% do Jev. No WikiRacing, a latência foi de 79,8 ms contra 225 ms, com 26 acertos em 30, contra 30 em 30 do Jev. No Super Mario, foram 33,5 ms contra 132,6 ms, com cinco acertos em cinco para ambos. O ganho de nove vezes citado pelos desenvolvedores vem justamente do jogo T-Rex, em que as ações se repetem em estados consecutivos.

O CLM também foi avaliado como verificador para agentes de codificação. Nesse cenário, um gerador produz várias soluções candidatas e o verificador escolhe a melhor. O Opus 5 gerou as candidatas do benchmark DeepSWE em conjuntos de quatro, enquanto o Fable 5 produziu as candidatas do Terminal-Bench 2.1 em conjuntos de cinco. A equipe avaliou 38 tarefas reservadas do DeepSWE e 30 do Terminal-Bench 2.1, com latência medida em uma GPU H100. No DeepSWE, o CLM com cabeça ajustada atingiu 81,6% de acerto, frente a 71,1% do Jev, com latência de 79 ms contra 449 ms. No Terminal-Bench 2.1, o CLM chegou a 87,6%, contra 83,1% do Jev, com 32 ms frente a 131 ms. Os números são apresentados como novos resultados estado da arte para verificadores, embora se refiram a subconjuntos reservados e não a submissões completas nos rankings. O Jev pontuou abaixo da taxa de acerto da primeira tentativa nos dois benchmarks, o que indica que utilizá-lo como verificador é pior do que aceitar a primeira amostra gerada.

Entre os principais destaques divulgados, o CLM-8B pontua ações candidatas em vez de gerar texto, atinge latência até nove vezes menor que o Jev em testes sem ajuste fino, alcança 81,6% no subconjunto do DeepSWE e 87,6% no Terminal-Bench 2.1 com cabeças ajustadas, utiliza cache de vetores de estado e ação para reduzir a latência em ciclos de agentes, e pode ser implantado de forma autônoma em uma única GPU NVIDIA com a cabeça aberta sob licença Apache-2.0.

PUBLICIDADE

Leitura recomendada

Comentários

Nenhum comentário ainda. Seja o primeiro a comentar!