PUBLICIDADE

Saluki 27B: a IA comprimida que cabe em menos de 8 GB e supera o gigante Qwen3.8-27B na chamada de ferramentas

09/10/2026
7 visualizações
4 min de leitura
A Underdog lançou o Saluki 27B, versão comprimida em 2 bits do Qwen3.8-27B que ocupa 7,89 GB e supera o modelo original em chamadas paralelas de ferramentas, marcando 42 contra 35 pontos no BFCL v4.
Imagem principal do post

A Underdog, assistente para dispositivos locais desenvolvido pela Conway Research, lançou o modelo Saluki 27B sob licença Apache 2.0. Trata-se de uma versão comprimida em 2 bits do Qwen3.8-27B, distribuída no formato GGUF, padrão usado por ferramentas de execução local de modelos de linguagem. O resultado é um arquivo de apenas 7,89 GB, contra os 54 GB exigidos pelo modelo original em BF16, um formato numérico de alta precisão. O ajuste da compressão foi direcionado para preservar a chamada de ferramentas, competência que transforma um chatbot em um agente capaz de executar ações.

Para os desenvolvedores, a proposta é ter um modelo agêntico da classe de 27 bilhões de parâmetros rodando no llama.cpp padrão, com transferência completa para a GPU. Há ainda um módulo opcional de visão, disponível em duas variantes de 629 MB ou 928 MB. Segundo a Underdog, o Saluki mantém 96% da performance média do Qwen3.8-27B original em nove benchmarks. O destaque está nas chamadas paralelas de ferramentas, em que a versão comprimida atinge 42 pontos contra 35 do modelo completo, uma retenção de 120%. O ponto mais fraco aparece no AIME 2025, avaliação de matemática competitiva, com 79,2 pontos contra 96,7 do original, retenção de aproximadamente 82%.

A construção do Saluki combina três camadas de trabalho. A base é o Qwen3.8-27B, modelo denso de 27 bilhões de parâmetros criado pela equipe Qwen, com 64 camadas que misturam atenção linear do tipo Gated DeltaNet com atenção gated, e suporte nativo a 262.144 tokens de contexto. A segunda camada vem do arquivo Qwen3.8-27B-GSQ-RCO-GGUF, publicado pelo grupo ISTA-DASLab. Nesse trabalho, a técnica GSQ aprende grades escalares de baixa precisão precisas para cada tensor, enquanto o RCO define o tipo de quantização de cada tensor dentro de um orçamento fixo de tamanho. O menor arquivo do ISTA, chamado IQ2_XS, ocupa 8,4 GB a 2,50 bits por peso.

Imagem complementar

A terceira camada é o próprio ajuste da Underdog, que reduziu o arquivo para 7,89 GB com foco específico na chamada de ferramentas. O arquivo recebeu o nome de IQ2-mix e carrega uma etiqueta imatrix, referência a um método de importância de matrizes usado na compressão. A empresa não divulgou a receita completa dessa etapa final do processo.

Nos testes conduzidos pela própria Underdog, ambos os modelos rodaram na mesma plataforma de avaliação. No Underdog Bench, conjunto de 120 tarefas do BFCL v4 congelado antes dos testes, executado com modo de raciocínio desligado e temperatura zero, o Saluki marcou 88 pontos, o modelo completo fez 84 e o Bonsai 2, da PrismML, ficou em 70. Nas 100 tarefas de chamadas paralelas de ferramentas do BFCL v4, verificadas com o verificador oficial, o placar foi de 42 a 35 para o Saluki. No SWE-bench Verified, com 50 problemas de engenharia de software, o modelo comprimido resolveu 30 questões, contra 33 da versão integral.

PUBLICIDADE

Outro grupo de resultados compara o Saluki com notas públicas do Qwen3.8-27B em tamanho completo. O modelo comprimido vence no IFEval, com 93,5 contra 91,5, e no IFBench, com 72,7 contra 71,0. No MBPP+, teste de programação, perde por 78,0 a 83,9. A queda se aprofunda no MuSR, de raciocínio multietapas, com 67,5 contra 79,6, e nas avaliações de matemática: 79,2 contra 96,7 no AIME 2025 e 80,0 contra 94,6 no AIME 2026. No balanço geral, competição matemática e raciocínio em múltiplas etapas recuam entre 12 e 18 pontos.

O Saluki também foi colocado ao lado de outras construções compactas do mesmo modelo base. O Bonsai 2, da PrismML, tem 27,36 bilhões de parâmetros e ocupa apenas 5,95 GB a 1,75 bit por peso, com retenção de 98,2% do FP16 em 14 benchmarks de modo raciocínio. Ele ainda apresenta matemática mais forte, incluindo 95,0 pontos no AIME25. A limitação é que o Bonsai 2 exige um fork do llama.cpp mantido pela PrismML, já que a versão padrão do executor rejeita seus formatos de empacotamento. O Saluki, por sua vez, roda no llama.cpp convencional. A Underdog ressalta que cada fabricante usa sua própria estrutura de testes, o que impede comparação direta entre os números divulgados por empresas diferentes.

O Saluki 27B chega ao mercado como opção para rodar agentes de inteligência artificial localmente, com licença aberta Apache 2.0. O modelo comprime o Qwen3.8-27B de 54 GB para 7,89 GB, supera o original na chamada de ferramentas por 88 a 84 e nas chamadas paralelas por 42 a 35, e funciona no llama.cpp padrão. O custo da compressão aparece na matemática e no raciocínio complexo, com quedas de 12 a 18 pontos. O cartão do modelo está publicado na plataforma Hugging Face, e o anúncio foi feito na página de lançamento da Underdog.

PUBLICIDADE
Este post foi útil para você?
🛒
Vai rodar IA no seu computador?

Modelos locais dependem da placa de vídeo: quanto mais VRAM, maiores os modelos e mais rápidas as respostas. Compare os preços de placas RTX na Amazon.

Ver preços na Amazon →
Como associado da Amazon, o blog ganha com compras qualificadas, sem custo extra para você.

Leitura recomendada

💬 Comentários

Nenhum comentário ainda. Conte o que achou, tire uma dúvida ou discorde. Seja o primeiro!

Deixe seu comentário
O e-mail não aparece. Serve só para avisar quando responderem você.
Os comentários passam por aprovação antes de aparecer. Crie uma conta de leitor e, depois do primeiro aprovado, os próximos saem na hora.
Apoie o ConexãoTC

O ConexãoTC é independente e gratuito. Se as notícias fazem parte do seu dia, contribua com qualquer valor pelo PIX e ajude a manter o blog no ar.

QR code PIX para apoiar o ConexãoTC
Aponte a câmera do app do banco
Favorecido: Jean Dgardany C. Lima, editor do ConexãoTC
🗳️ O que você quer ler aqui?

Marque os assuntos que te interessam. Os mais pedidos viram os próximos artigos.

Leitores cadastrados têm as sugestões atendidas primeiro e recebem um aviso quando o artigo sai.
Fique por dentro

Os destaques do dia no seu e-mail, todo dia às 8h.

PUBLICIDADE