A StepFun lançou em 20 de setembro de 2026 o Step 5 Preview, seu novo modelo principal para trabalho com agentes, com foco em engenharia de software e tarefas profissionais, com destaque para finanças. Desde 8 de outubro ele também está disponível na OpenRouter. Este guia reúne o que a documentação e as fontes dizem, o que ainda é só alegação da empresa e como testar com custo baixo. Os dados foram consultados em 10/10/2026.
Atenção: quase todos os benchmarks abaixo são divulgados pela própria StepFun. Não há relatório técnico nem avaliação independente completa. Trate os números como indicação, e não como veredito.
O que é o Step 5 Preview
- Arquitetura: mistura esparsa de especialistas (MoE), com 600 bilhões de parâmetros no total e 27 bilhões ativos por token (cerca de 4,5%). Só uma fração dos pesos trabalha a cada token, o que reduz o custo de execução.
- Contexto: 1 milhão de tokens, com saída de até 64 mil.
- Entrada: texto, imagens (até 60 por requisição) e vídeo. A saída é só texto.
- Raciocínio: parâmetro
reasoning_effortcom os níveislow,mediumehigh. - Recursos de API: chamada de ferramentas (tool calling), streaming, JSON Mode e JSON Schema, e cache de prompt.
- Disponibilidade: API da StepFun (
step-5-preview) e OpenRouter (stepfun/step-5-preview, servido só pela StepFun em fp8). O nome "Preview" indica versão em avaliação, sujeita a mudanças. - Licença: proprietário por enquanto. A StepFun prometeu abrir os pesos em 15 de outubro de 2026, sem informar a licença.
Quanto custa
| Item | Preço por 1M de tokens |
|---|---|
| Entrada (sem cache) | US$ 1,00 |
| Entrada com cache | US$ 0,05 |
| Saída (inclui o raciocínio) | US$ 2,70 |
O custo de saída conta os tokens de raciocínio. Isso importa porque o Step 5 é verboso: na Artificial Analysis ele gerou 160 milhões de tokens de saída para completar o índice, contra uma mediana de 82 milhões. Uma tarefa completa do índice custou cerca de US$ 1,03. A velocidade medida foi de 87 tokens por segundo, e o primeiro token chega em 2,8 segundos.
Um exemplo simples: uma tarefa de código com 20 mil tokens de entrada e 8 mil de saída (com raciocínio) custa cerca de US$ 0,04. Em volume alto isso pesa. Comparado aos modelos baratos de fluxo, como o Claude Haiku 5.5 (US$ 0,10 / 0,50) e o Gemini 2.5 Flash-Lite (US$ 0,10 / 0,40), o Step 5 é dez vezes mais caro. Ele não é uma opção de classificação em massa. A comparação certa é com os modelos de agentes e de código. Veja o guia das APIs de IA mais baratas para a faixa econômica.
O que os benchmarks dizem
A StepFun testou o Step 5 em esforço alto, e os concorrentes em esforço máximo. Os números abaixo são da própria empresa.
Código e agentes
| Benchmark | Step 5 | GLM 5.3 | Kimi K3 | GPT-6 Astra | Claude Opus 5 |
|---|---|---|---|---|---|
| DeepSWE v1.1 | 67,7 | 66,9 | 67,5 | 74,1 | 74,0 |
| Terminal-Bench v4 | 33,3 | 41,9 | 12,6 | 57,9 | 52,3 |
| ProgramBench | 80,5 | 72,0 | 77,8 | 85,4 | 82,3 |
Finanças, ciência e pesquisa na web
| Benchmark | Step 5 | GLM 5.3 | Kimi K3 | GPT-6 Astra | Claude Opus 5 |
|---|---|---|---|---|---|
| FrontierFinance | 66,4 | 64,1 | 62,6 | 55,0 | 69,7 |
| GPQA Diamond | 93,5% | 91,7% | 93,5% | 96,1% | 93,2% |
| BrowseComp | 88,7% | n/d | 91,2% | 91,5% | 90,2% |
Em negrito, o melhor resultado de cada linha. Em poucas palavras: DeepSWE e ProgramBench medem programação e engenharia de software; o Terminal-Bench mede tarefas executadas no terminal; o FrontierFinance, trabalho de finanças; o GPQA Diamond, perguntas de ciência em nível de pós-graduação; e o BrowseComp, pesquisa na web.
Como ler esses números:
- Em código, o Step 5 fica no nível do GLM 5.3 e do Kimi K3 (DeepSWE) e atrás do GPT-6 Astra e do Claude Opus 5, como era de se esperar.
- No Terminal-Bench, que mede trabalho no terminal, ele perde para o GLM 5.3 e para os dois modelos de ponta. Para agentes de linha de comando, é um ponto fraco.
- Parte dos benchmarks da StepFun foi criada pela própria empresa, como o StepCodeBench (49,0, contra 40,2 do GLM 5.3 e 43,9 do Kimi K3).
- Na Artificial Analysis, uma avaliadora independente, o índice de inteligência é 44 (versão 4.3.2), na posição 40 de 227 modelos.
- É fraco em trabalho multimodal com documentos (14,8%, contra 31,0% do GPT-6 Astra).
A StepFun também afirma custar cerca de 65% menos que o GLM 5.3 e o Kimi K3 na mesma faixa de inteligência. Isso vem de um gráfico da própria empresa e não foi verificado de forma independente.
Como testar com custo baixo
1. Pela OpenRouter, com o modelo stepfun/step-5-preview:
curl https://openrouter.ai/api/v1/chat/completions \
-H "Authorization: Bearer $OPENROUTER_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "stepfun/step-5-preview",
"messages": [{"role": "user", "content": "Crie um jogo Doom simples em Three.js, em um único arquivo HTML."}],
"reasoning": {"effort": "medium"},
"max_tokens": 16000
}'
2. Escolha o esforço com critério. Como os tokens de raciocínio são cobrados como saída, comece em low ou medium e só suba para high se a tarefa exigir. Defina sempre max_tokens, porque um modelo verboso pode gastar muito antes de responder.
3. Aproveite o cache. A entrada em cache custa 5% do preço normal. Em agentes com um prompt de sistema grande e repetido, isso derruba o custo.
4. Camada gratuita. Segundo a documentação da StepFun, citada por uma das fontes, há uma camada gratuita (V0) com 5 requisições simultâneas e 10 por minuto, útil para uma avaliação inicial.
Exemplo de uso: gerar jogos com um comando reutilizável
O vídeo que motivou este texto usa o Step 5 para gerar jogos prontos, e a técnica serve para qualquer modelo. O apresentador mantém um prompt genérico guardado em um comando com argumentos: ele digita o comando "criar jogo" e informa o jogo e a tecnologia (por exemplo, "Mario Kart" e "Three.js"), e o comando monta o prompt completo substituindo as palavras-chave. Isso padroniza as exigências e permite comparar modelos com o mesmo pedido.
O que o apresentador observou (impressões dele, não medições):
- Doom: rodou de primeira, com movimento de arma convincente, mas com portas orientadas na direção errada e uma serra elétrica que atirava. O modelo corrigiu sozinho depois de rodar os próprios testes e conseguiu passar pelas portas.
- Resident Evil (em Three.js): o melhor resultado que ele já viu nesse tipo de teste, com colisão boa e um bug de tiro para cima.
- Mario Kart: jogável, mas com controle invertido ao virar. Ele considerou melhor que as versões anteriores.
- Crash: funcionou, mas as fases eram idênticas e sem inimigos novos.
Vale ler isso como um teste informal. Ele mostra que o modelo gera jogos completos em um único pedido e se corrige quando consegue rodar testes. Não mede a qualidade de código em um projeto real.
E rodar local?
Hoje (10/10/2026) o quadro é este:
- Pesos oficiais: prometidos para 15 de outubro. Na data desta consulta, a StepFun não havia publicado repositório oficial nem licença.
- Cuidado com cópias: existem repositórios no Hugging Face com nomes como "Step-5-Preview-BF16", "GGUF" e "NVFP4", criados antes da data oficial, de contas sem relação confirmada com a StepFun. Não baixe nem rode nada disso. Espere o repositório oficial.
- Tamanho: pelo número de parâmetros, 600B exigem cerca de 1,2 TB em BF16 (estimativa de fonte secundária), algo na casa de 600 GB em FP8 e de 300 GB em 4 bits (cálculo aproximado, sem contar o cache de contexto). Não cabe em uma máquina comum, e com 27B ativos a velocidade será baixa sem memória rápida suficiente.
- Ferramentas de inferência (versões em 10/10/2026): vLLM v0.31.0 (05/10), SGLang v0.5.21 (02/10), llama.cpp v0.6.0 (05/10) e Ollama v0.40.2 (08/10). Os materiais do modelo citam vLLM e SGLang, mas o suporte ao Step 5 em qualquer uma delas ainda não está confirmado. No llama.cpp existem relatos de uso da família anterior (Step-3.7-Flash), mas nada sobre o Step 5. Confirme nas notas de versão depois de 15 de outubro.
Limitações e pontos de atenção
- Preview: a versão pode mudar, e o preço também.
- Verbosidade: comentários de usuários apontam que o modelo "raciocina demais e por muito tempo", o que encarece a saída.
- Benchmarks sem confirmação independente: parte deles é da própria StepFun, com esforço diferente do dos concorrentes.
- Sem relatório técnico até agora.
- Um único provedor: na OpenRouter, só a StepFun serve o modelo, então não há alternativa de provedor nem de preço.
Conclusão
O Step 5 Preview é um modelo competitivo para agentes de código e trabalho profissional, no nível do GLM 5.3 e do Kimi K3 nos benchmarks da própria StepFun, por um preço intermediário (US$ 1 / 2,70). Ele não substitui os modelos baratos de fluxo e atendimento, e não é o melhor em terminal. Vale testar na API com esforço baixo e max_tokens definido, e esperar o 15 de outubro para saber a licença e se dá para rodar local.
Fontes
- OpenRouter: StepFun Step 5 Preview
- Artificial Analysis: Step 5 Preview
- StepFun: anúncio do Step 5 Preview
- MarkTechPost: lançamento do Step 5 Preview
- eesel: especificações e preços do Step 5 Preview
- cellcog: Step 5 Preview, especificações, preço e lacunas
- Vídeo do canal AI ProgBr sobre o Step 5 Preview