PUBLICIDADE

AWS entra na era dos modelos de decisão: conheça o Strands Decider 2B, open source e leve o suficiente para rodar no seu próprio computador

02/10/2026
9 visualizações
5 min de leitura
A AWS Strands Labs lançou o Strands Decider 2B, um modelo de decisão open source com 1,9 bilhão de parâmetros que roda localmente e responde escolhas, probabilidades e notas com confiança calibrada.
Imagem principal do post

AWS Strands Labs lança Strands Decider 2B, modelo de decisão open source com 1,9 bilhão de parâmetros

A AWS Strands Labs anunciou o lançamento do Strands Decider 2B, um modelo de decisão de código aberto que não gera texto, mas é capaz de analisar um estado e perguntas tipadas, retornando uma escolha, uma probabilidade de sim ou não, ou uma pontuação acompanhada de um nível de confiança calibrado. Com 1,9 bilhão de parâmetros, o modelo foi projetado para rodar localmente em processadores comuns, em placas de vídeo voltadas ao consumidor e em Macs com chip Apple Silicon. Seu lançamento marca a entrada da gigante da nuvem na categoria de modelos de decisão, também conhecidos como modelos de Sistema Um, que ganhou força após a TypeSafe AI apresentar o Jev no mês anterior.

Diferentemente dos grandes modelos de linguagem tradicionais, que podem produzir qualquer tipo de saída textual, um modelo de decisão se limita a escolher entre opções predefinidas ou atribuir notas em uma escala. O Strands Decider 2B aceita três tipos de perguntas: escolha, na qual seleciona uma entre N alternativas; noul, que retorna uma probabilidade binária entre zero e um; e score, que atribui um nível dentro de uma rubrica ordenada. Cada resposta é sempre acompanhada de um valor de confiança, informando o grau de certeza do modelo sobre o resultado apresentado. A própria equipe de desenvolvimento reconhece que o sistema é menos eficaz do que modelos de raciocínio em problemas complexos e não é indicado para tarefas como programação, conversação livre ou sumarização de textos.

Imagem complementar

Do ponto de vista arquitetônico, o modelo foi construído a partir do Qwen3.5-2B-Base, mas com a cabeça de modelagem de linguagem original descartada. No lugar, foi instalada uma pequena cabeça do tipo pointer, com cerca de um milhão de parâmetros, responsável por comparar o estado oculto na posição de resposta com o estado oculto do último token de cada opção disponível. O resultado é obtido em uma única passagem, sem a necessidade de um loop de decodificação. O tronco do modelo utiliza uma adaptação de baixo rank, técnica conhecida como LoRA com rank 16, enquanto a cabeça de decisão opera em precisão fp32, ou seja, com 32 bits de ponto flutuante para maior exatidão. O conjunto de rótulos é definido pela própria requisição, o que significa que não há limite fixo para a quantidade de opções que podem ser oferecidas. A versão disponibilizada ao público é a v19.

Em relação à implantação, os pesos do modelo estão disponíveis no Hugging Face sob a licença Apache-2.0, e a instalação pode ser feita por meio do comando pip install strands-decider, que oferece uma interface de linha de comando e um servidor HTTP. A equipe alerta, porém, que o servidor incluído escuta apenas no endereço local 127.0.0.1 e não possui nenhum mecanismo de autenticação, o que exige a implementação de uma camada própria de segurança antes de qualquer uso em ambiente de produção. Até o momento, não há provedores hospedados oferecendo inferência para o modelo.

PUBLICIDADE

Os testes de desempenho foram realizados sobre o conjunto público do JevBench, referência usada para avaliar modelos da mesma categoria. Na versão v19, o Strands Decider 2B alcançou acurácia de 0,723, acertando 167 das 231 tarefas avaliadas, com Brier score de 0,342 e erro esperado de calibração de 0,052, um indicador de quão bem as probabilidades geradas correspondem à frequência real dos acertos. Quando segmentado por nível de dificuldade, o modelo atingiu 1,000 nas tarefas fáceis, 0,875 nas padrão e 0,505 nas difíceis. No ranking v1.4.2 do JevBench, divulgado em 25 de setembro, a versão v19 ocupou a terceira posição entre 33 modelos da classe de 2 bilhões de parâmetros, e a primeira quando considerados apenas os 30 modelos de tamanho igual ou inferior a esse limite. Os próprios autores destacam que o modelo decider-2b v11, da Mapika, teria obtido 175 acertos no mesmo teste, ficando oito tarefas à frente. A latência mediana medida em uma placa RTX 3090 foi de 115 milissegundos, com percentil 95 de 299 milissegundos, enquanto em um chip M3 Pro o tempo mediano em estado quente ficou em torno de 153 milissegundos para entradas com até 300 tokens.

Na comparação com outros modelos da categoria, o Strands Decider 2B se diferencia por ser o único da amostra com pesos totalmente abertos e licença Apache-2.0, enquanto o Jev da TypeSafe AI opera exclusivamente por API hospedada e fechada. O decider-2b da Mapika e o Decision 2B da FlyMy.AI também permitem auto-hospedagem, mas o primeiro é baseado no Qwen3.5-2B-Base com leitura treinada, e o segundo adota o modelo MiniCPM5-2B com 2,5 bilhões de parâmetros densos. A AWS publicou a lista completa de dados e a receita de treinamento, o que ainda não foi feito pela TypeSafe AI.

Entre os usos relatados pela equipe estão o roteamento entre modelos, a seleção de ferramentas, a verificação de argumentos, a triagem de solicitações, a aplicação de guardrails, ou seja, barreiras automáticas de segurança, além de avaliações e agentes híbridos. No exemplo apresentado no repositório, um agente Strands precisa decidir se deve acionar uma ferramenta de consulta meteorológica. Antes da execução, o sistema faz duas perguntas de sim ou não: se os argumentos estão baseados no que o usuário disse e se a chamada no momento atual é precipitada. Caso o agente tenha presumido uma cidade que não foi confirmada, ele retorna ao usuário para obter essa informação. Pela interface de linha de comando, uma mensagem como "Help! My payouts have been failing for 3 days!" foi roteada para a categoria de cobrança com confiança de 0,768, descartando as alternativas de vendas e devoluções.

O Strands Decider 2B representa, portanto, mais um passo na consolidação de uma nova classe de modelos leves e especializados, voltados a tarefas de decisão rápidas e locais, complementando o uso de grandes modelos generativos em fluxos de trabalho que envolvem agentes de inteligência artificial.

PUBLICIDADE
Este post foi útil para você?
🛒
Vai rodar IA no seu computador?

Modelos locais dependem da placa de vídeo: quanto mais VRAM, maiores os modelos e mais rápidas as respostas. Compare os preços de placas RTX na Amazon.

Ver preços na Amazon →
Como associado da Amazon, o blog ganha com compras qualificadas, sem custo extra para você.

Leitura recomendada

💬 Comentários

Nenhum comentário ainda. Conte o que achou, tire uma dúvida ou discorde. Seja o primeiro!

Deixe seu comentário
O e-mail não aparece. Serve só para avisar quando responderem você.
Os comentários passam por aprovação antes de aparecer. Crie uma conta de leitor e, depois do primeiro aprovado, os próximos saem na hora.
Apoie o ConexãoTC

O ConexãoTC é independente e gratuito. Se as notícias fazem parte do seu dia, contribua com qualquer valor pelo PIX e ajude a manter o blog no ar.

QR code PIX para apoiar o ConexãoTC
Aponte a câmera do app do banco
Favorecido: Jean Dgardany C. Lima, editor do ConexãoTC
🗳️ O que você quer ler aqui?

Marque os assuntos que te interessam. Os mais pedidos viram os próximos artigos.

Leitores cadastrados têm as sugestões atendidas primeiro e recebem um aviso quando o artigo sai.
Fique por dentro

Os destaques do dia no seu e-mail, todo dia às 8h.

PUBLICIDADE