PUBLICIDADE

Ember-1: a IA da Fireworks que aprendeu a pensar mais enxuto e corta 40% dos tokens sem perder qualidade

28/09/2026
9 visualizações
4 min de leitura
A Fireworks AI lançou o Ember-1, modelo derivado do Kimi K3 treinado para raciocinar de forma mais curta, consumindo cerca de 40% menos tokens sem perder precisão.
Imagem principal do post

Fireworks AI lança Ember-1, versão otimizada do Kimi K3 com 40% menos tokens

A Fireworks AI anunciou o lançamento do Ember-1, modelo especializado desenvolvido pela Fireworks Research a partir do pós-treinamento do Kimi K3, modelo de pesos abertos da Moonshot AI. A proposta central é entregar a mesma qualidade do K3 consumindo cerca de 40% menos tokens, sem recorrer ao simples rebaixamento do nível de esforço de raciocínio no momento da inferência. Em outras palavras, o modelo aprende a pensar de forma mais enxuta em vez de simplesmente pensar menos.

Segundo a empresa, o Ember-1 foi treinado para produzir cadeias de raciocínio mais curtas, preservando a precisão nas tarefas. O modelo é o primeiro de uma série de modelos especializados da Fireworks Research e está disponível exclusivamente como Research Preview por meio da API serverless da Fireworks. Os pesos, o código de treinamento e os algoritmos exatos utilizados não foram publicados, o que impede a hospedagem própria por parte dos clientes neste momento.

Imagem complementar

A motivação para o projeto veio de uma queixa recorrente dos usuários. Modelos de raciocínio, como o próprio Kimi K3, podem gastar mais de 90% dos tokens gerados apenas em raciocínio interno, etapa em que o modelo trabalha para chegar à resposta antes de produzi-la de fato. Esse custo se multiplica em cargas de trabalho agênticas com múltiplos turnos, situação em que cada nova chamada ao modelo precisa receber como contexto o raciocínio anterior.

O contexto cresce de forma aproximadamente quadrática com o número de turnos, fazendo com que traços longos de etapas iniciais sejam relidos e cobrados repetidamente nas chamadas seguintes. Os clientes da Fireworks queriam manter a capacidade de programação do K3, porém a um custo menor. Diminuir o esforço de raciocínio do modelo não resolvia o problema, pois comprometia a qualidade das respostas. A solução foi ensinar o modelo a raciocinar de maneira mais eficiente.

PUBLICIDADE

Para construir o Ember-1, a equipe da Fireworks Research partiu do princípio de que nem todo o raciocínio do K3 é desperdício. Algumas etapas, como revisitar uma hipótese ou reagir a um retorno, são formas úteis de autorreflexão. O objetivo do treinamento foi preservar esse comportamento e, ao mesmo tempo, eliminar redundâncias e loops improdutivos. A coleta de treinamento abrangeu matemática, programação, seguimento de instruções, conversação, busca, uso de ferramentas e engenharia de software.

A empresa afirma ter realizado mais de 50 experimentos de treinamento e conduzido mais de 200 avaliações. Também desenvolveu novos algoritmos de treinamento, que ainda não foram divulgados. Todo o processo foi executado sobre a plataforma Serverless Training da própria Fireworks, utilizando exclusivamente dados próprios e nenhum dado de clientes.

Nos benchmarks publicados pela Fireworks, o Ember-1 foi comparado ao Kimi K3 em três níveis de esforço de raciocínio. No Terminal Bench 2.1, o Ember-1 alcançou 82,0%, superando os 80,9% do K3 Max. No DeepSWE 1.1, o modelo chegou a 75,2%, também acima do K3 Max, que obteve 66,4%. Já no SWE-bench Verified, o Ember-1 ficou ligeiramente atrás, com 92,2% contra 93,2% do K3 Max, e no SWE-Interact registrou 20,0% diante dos 21,3% do K3 Max.

A redução de tokens nesses cenários variou entre 15% e 51%, com economia em dólares proporcional. Além dos benchmarks públicos, a Fireworks destaca o desempenho no Bedside Bench da Doximity, conjunto de 500 casos clínicos validados por médicos, no qual o Ember-1 estabeleceu uma nova fronteira de custo por tarefa dentro do Specialized Intelligence Index, métrica criada pela própria empresa.

A Fireworks também conduziu testes A/B com dois clientes em cargas reais de programação em produção, comparando o modelo com o K3 em condições idênticas de uso. Os dois relatos indicam cerca de 35% menos tokens por tarefa com qualidade equivalente. Na rodada publicada, os tokens de saída caíram de 49,3 mil para 29,9 mil por tarefa. Os tokens dedicados ao raciocínio diminuíram 71,3% e o total de tokens caiu 39%.

A pontuação da tarefa permaneceu praticamente estável, passando de 0,751 no K3 para 0,753 no Ember-1, enquanto o número médio de etapas por interação recuou de 23,8 para 21,4. Um dos clientes já opera o Ember-1 em produção. O preço do Ember-1 é o mesmo praticado para o Kimi K3 na plataforma da Fireworks: 3 dólares por milhão de tokens de entrada, 0,30 dólar por milhão de tokens de entrada em cache e 15 dólares por milhão de tokens de saída.

Como a tarifa por token é idêntica, toda a economia obtida pelos usuários vem da geração de um número menor de tokens. Por se tratar de um Research Preview, o acesso inicial é restrito à API serverless da própria Fireworks, sem possibilidade de execução on-premises enquanto pesos, código e algoritmos de treinamento não forem liberados publicamente.

PUBLICIDADE
Este post foi útil para você?
🖥️
Quer ter o seu próprio servidor?

Para rodar sites, automações ou IA do seu jeito, uma VPS resolve. Este blog roda numa VPS da Hostinger, e pelo link abaixo você ganha desconto na contratação.

Ver planos de VPS da Hostinger →
Link de indicação: o blog recebe uma comissão, sem custo extra para você.

Leitura recomendada

💬 Comentários

Nenhum comentário ainda. Conte o que achou, tire uma dúvida ou discorde. Seja o primeiro!

Deixe seu comentário
O e-mail não aparece. Serve só para avisar quando responderem você.
Os comentários passam por aprovação antes de aparecer. Crie uma conta de leitor e, depois do primeiro aprovado, os próximos saem na hora.
Apoie o ConexãoTC

O ConexãoTC é independente e gratuito. Se as notícias fazem parte do seu dia, contribua com qualquer valor pelo PIX e ajude a manter o blog no ar.

QR code PIX para apoiar o ConexãoTC
Aponte a câmera do app do banco
Favorecido: Jean Dgardany C. Lima, editor do ConexãoTC
🗳️ O que você quer ler aqui?

Marque os assuntos que te interessam. Os mais pedidos viram os próximos artigos.

Leitores cadastrados têm as sugestões atendidas primeiro e recebem um aviso quando o artigo sai.
Fique por dentro

Os destaques do dia no seu e-mail, todo dia às 8h.

PUBLICIDADE