PUBLICIDADE

Step 5 Preview, da StepFun: o que o modelo de 600B entrega, quanto custa e como testar via API

10/10/2026
10 visualizações
8 min de leitura
O Step 5 Preview, da StepFun, tem 600B de parâmetros (27B ativos), contexto de 1M e custa US$ 1 / 2,70 por milhão de tokens. Veja especificações, benchmarks, exemplo de API e o que ainda não está confirmado.
Imagem principal do post

A StepFun lançou em 20 de setembro de 2026 o Step 5 Preview, seu novo modelo principal para trabalho com agentes, com foco em engenharia de software e tarefas profissionais, com destaque para finanças. Desde 8 de outubro ele também está disponível na OpenRouter. Este guia reúne o que a documentação e as fontes dizem, o que ainda é só alegação da empresa e como testar com custo baixo. Os dados foram consultados em 10/10/2026.

Atenção: quase todos os benchmarks abaixo são divulgados pela própria StepFun. Não há relatório técnico nem avaliação independente completa. Trate os números como indicação, e não como veredito.

O que é o Step 5 Preview

  • Arquitetura: mistura esparsa de especialistas (MoE), com 600 bilhões de parâmetros no total e 27 bilhões ativos por token (cerca de 4,5%). Só uma fração dos pesos trabalha a cada token, o que reduz o custo de execução.
  • Contexto: 1 milhão de tokens, com saída de até 64 mil.
  • Entrada: texto, imagens (até 60 por requisição) e vídeo. A saída é só texto.
  • Raciocínio: parâmetro reasoning_effort com os níveis low, medium e high.
  • Recursos de API: chamada de ferramentas (tool calling), streaming, JSON Mode e JSON Schema, e cache de prompt.
  • Disponibilidade: API da StepFun (step-5-preview) e OpenRouter (stepfun/step-5-preview, servido só pela StepFun em fp8). O nome "Preview" indica versão em avaliação, sujeita a mudanças.
  • Licença: proprietário por enquanto. A StepFun prometeu abrir os pesos em 15 de outubro de 2026, sem informar a licença.

Quanto custa

PUBLICIDADE
ItemPreço por 1M de tokens
Entrada (sem cache)US$ 1,00
Entrada com cacheUS$ 0,05
Saída (inclui o raciocínio)US$ 2,70

O custo de saída conta os tokens de raciocínio. Isso importa porque o Step 5 é verboso: na Artificial Analysis ele gerou 160 milhões de tokens de saída para completar o índice, contra uma mediana de 82 milhões. Uma tarefa completa do índice custou cerca de US$ 1,03. A velocidade medida foi de 87 tokens por segundo, e o primeiro token chega em 2,8 segundos.

Um exemplo simples: uma tarefa de código com 20 mil tokens de entrada e 8 mil de saída (com raciocínio) custa cerca de US$ 0,04. Em volume alto isso pesa. Comparado aos modelos baratos de fluxo, como o Claude Haiku 5.5 (US$ 0,10 / 0,50) e o Gemini 2.5 Flash-Lite (US$ 0,10 / 0,40), o Step 5 é dez vezes mais caro. Ele não é uma opção de classificação em massa. A comparação certa é com os modelos de agentes e de código. Veja o guia das APIs de IA mais baratas para a faixa econômica.

O que os benchmarks dizem

A StepFun testou o Step 5 em esforço alto, e os concorrentes em esforço máximo. Os números abaixo são da própria empresa.

Código e agentes

BenchmarkStep 5GLM 5.3Kimi K3GPT-6 AstraClaude Opus 5
DeepSWE v1.167,766,967,574,174,0
Terminal-Bench v433,341,912,657,952,3
ProgramBench80,572,077,885,482,3

Finanças, ciência e pesquisa na web

BenchmarkStep 5GLM 5.3Kimi K3GPT-6 AstraClaude Opus 5
FrontierFinance66,464,162,655,069,7
GPQA Diamond93,5%91,7%93,5%96,1%93,2%
BrowseComp88,7%n/d91,2%91,5%90,2%

Em negrito, o melhor resultado de cada linha. Em poucas palavras: DeepSWE e ProgramBench medem programação e engenharia de software; o Terminal-Bench mede tarefas executadas no terminal; o FrontierFinance, trabalho de finanças; o GPQA Diamond, perguntas de ciência em nível de pós-graduação; e o BrowseComp, pesquisa na web.

Como ler esses números:

  • Em código, o Step 5 fica no nível do GLM 5.3 e do Kimi K3 (DeepSWE) e atrás do GPT-6 Astra e do Claude Opus 5, como era de se esperar.
  • No Terminal-Bench, que mede trabalho no terminal, ele perde para o GLM 5.3 e para os dois modelos de ponta. Para agentes de linha de comando, é um ponto fraco.
  • Parte dos benchmarks da StepFun foi criada pela própria empresa, como o StepCodeBench (49,0, contra 40,2 do GLM 5.3 e 43,9 do Kimi K3).
  • Na Artificial Analysis, uma avaliadora independente, o índice de inteligência é 44 (versão 4.3.2), na posição 40 de 227 modelos.
  • É fraco em trabalho multimodal com documentos (14,8%, contra 31,0% do GPT-6 Astra).

A StepFun também afirma custar cerca de 65% menos que o GLM 5.3 e o Kimi K3 na mesma faixa de inteligência. Isso vem de um gráfico da própria empresa e não foi verificado de forma independente.

Como testar com custo baixo

1. Pela OpenRouter, com o modelo stepfun/step-5-preview:

curl https://openrouter.ai/api/v1/chat/completions \
  -H "Authorization: Bearer $OPENROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "stepfun/step-5-preview",
    "messages": [{"role": "user", "content": "Crie um jogo Doom simples em Three.js, em um único arquivo HTML."}],
    "reasoning": {"effort": "medium"},
    "max_tokens": 16000
  }'

2. Escolha o esforço com critério. Como os tokens de raciocínio são cobrados como saída, comece em low ou medium e só suba para high se a tarefa exigir. Defina sempre max_tokens, porque um modelo verboso pode gastar muito antes de responder.

3. Aproveite o cache. A entrada em cache custa 5% do preço normal. Em agentes com um prompt de sistema grande e repetido, isso derruba o custo.

4. Camada gratuita. Segundo a documentação da StepFun, citada por uma das fontes, há uma camada gratuita (V0) com 5 requisições simultâneas e 10 por minuto, útil para uma avaliação inicial.

Exemplo de uso: gerar jogos com um comando reutilizável

O vídeo que motivou este texto usa o Step 5 para gerar jogos prontos, e a técnica serve para qualquer modelo. O apresentador mantém um prompt genérico guardado em um comando com argumentos: ele digita o comando "criar jogo" e informa o jogo e a tecnologia (por exemplo, "Mario Kart" e "Three.js"), e o comando monta o prompt completo substituindo as palavras-chave. Isso padroniza as exigências e permite comparar modelos com o mesmo pedido.

O que o apresentador observou (impressões dele, não medições):

  • Doom: rodou de primeira, com movimento de arma convincente, mas com portas orientadas na direção errada e uma serra elétrica que atirava. O modelo corrigiu sozinho depois de rodar os próprios testes e conseguiu passar pelas portas.
  • Resident Evil (em Three.js): o melhor resultado que ele já viu nesse tipo de teste, com colisão boa e um bug de tiro para cima.
  • Mario Kart: jogável, mas com controle invertido ao virar. Ele considerou melhor que as versões anteriores.
  • Crash: funcionou, mas as fases eram idênticas e sem inimigos novos.

Vale ler isso como um teste informal. Ele mostra que o modelo gera jogos completos em um único pedido e se corrige quando consegue rodar testes. Não mede a qualidade de código em um projeto real.

E rodar local?

Hoje (10/10/2026) o quadro é este:

  • Pesos oficiais: prometidos para 15 de outubro. Na data desta consulta, a StepFun não havia publicado repositório oficial nem licença.
  • Cuidado com cópias: existem repositórios no Hugging Face com nomes como "Step-5-Preview-BF16", "GGUF" e "NVFP4", criados antes da data oficial, de contas sem relação confirmada com a StepFun. Não baixe nem rode nada disso. Espere o repositório oficial.
  • Tamanho: pelo número de parâmetros, 600B exigem cerca de 1,2 TB em BF16 (estimativa de fonte secundária), algo na casa de 600 GB em FP8 e de 300 GB em 4 bits (cálculo aproximado, sem contar o cache de contexto). Não cabe em uma máquina comum, e com 27B ativos a velocidade será baixa sem memória rápida suficiente.
  • Ferramentas de inferência (versões em 10/10/2026): vLLM v0.31.0 (05/10), SGLang v0.5.21 (02/10), llama.cpp v0.6.0 (05/10) e Ollama v0.40.2 (08/10). Os materiais do modelo citam vLLM e SGLang, mas o suporte ao Step 5 em qualquer uma delas ainda não está confirmado. No llama.cpp existem relatos de uso da família anterior (Step-3.7-Flash), mas nada sobre o Step 5. Confirme nas notas de versão depois de 15 de outubro.

Limitações e pontos de atenção

  • Preview: a versão pode mudar, e o preço também.
  • Verbosidade: comentários de usuários apontam que o modelo "raciocina demais e por muito tempo", o que encarece a saída.
  • Benchmarks sem confirmação independente: parte deles é da própria StepFun, com esforço diferente do dos concorrentes.
  • Sem relatório técnico até agora.
  • Um único provedor: na OpenRouter, só a StepFun serve o modelo, então não há alternativa de provedor nem de preço.

Conclusão

O Step 5 Preview é um modelo competitivo para agentes de código e trabalho profissional, no nível do GLM 5.3 e do Kimi K3 nos benchmarks da própria StepFun, por um preço intermediário (US$ 1 / 2,70). Ele não substitui os modelos baratos de fluxo e atendimento, e não é o melhor em terminal. Vale testar na API com esforço baixo e max_tokens definido, e esperar o 15 de outubro para saber a licença e se dá para rodar local.

Fontes

PUBLICIDADE
Este post foi útil para você?

Leitura recomendada

💬 Comentários

Nenhum comentário ainda. Conte o que achou, tire uma dúvida ou discorde. Seja o primeiro!

Deixe seu comentário
O e-mail não aparece. Serve só para avisar quando responderem você.
Os comentários passam por aprovação antes de aparecer. Crie uma conta de leitor e, depois do primeiro aprovado, os próximos saem na hora.
Apoie o ConexãoTC

O ConexãoTC é independente e gratuito. Se as notícias fazem parte do seu dia, contribua com qualquer valor pelo PIX e ajude a manter o blog no ar.

QR code PIX para apoiar o ConexãoTC
Aponte a câmera do app do banco
Favorecido: Jean Dgardany C. Lima, editor do ConexãoTC
🗳️ O que você quer ler aqui?

Marque os assuntos que te interessam. Os mais pedidos viram os próximos artigos.

Leitores cadastrados têm as sugestões atendidas primeiro e recebem um aviso quando o artigo sai.
Fique por dentro

Os destaques do dia no seu e-mail, todo dia às 8h.

PUBLICIDADE