A OrcaRouter anunciou o lançamento do OrcaCyber Zero 1.5, um modelo de inteligência artificial dedicado à pesquisa autorizada de vulnerabilidades. Trata-se do sucessor do OrcaCyber Zero 1.0, lançado em 17 de setembro de 2026. O novo sistema foi pós-treinado para reprodução de vulnerabilidades, desenvolvimento de exploits e testes de intrusão, e chega com uma mensagem direta para equipes de segurança: menos relatórios e mais falhas validadas e corrigidas.
Em termos técnicos, o modelo opera com janela de contexto de 1 milhão de tokens, saída máxima de 128 mil tokens, chamada nativa de funções e saídas estruturadas. Ele aceita texto na entrada e produz texto na saída. A contagem de parâmetros não foi divulgada, e o funcionamento ocorre exclusivamente por meio de uma API hospedada pela própria OrcaRouter, sem liberação dos pesos do modelo ou de variantes quantizadas, que seriam versões comprimidas para execução em outras plataformas.
Segundo a equipe da Orca, o modelo foi construído com três objetivos de projeto. O primeiro é encontrar o que outros deixam passar, incluindo falhas desconhecidas como execução remota de código, escapes de sandbox, desvios de autenticação, escalonamento de privilégios e cadeias de ataque. O segundo é ir além da detecção, com capacidade de raciocinar sobre caminhos de ataque, desafiar as próprias hipóteses e classificar as falhas pela explorabilidade que pode ser demonstrada. O terceiro é servir a agentes autônomos, combinando o contexto longo e o raciocínio estendido necessários para lidar com grandes bases de código.
Os resultados de desempenho divulgados pela empresa, avaliados pela última vez em 10 de outubro de 2026, incluem quatro números. No Cybench, ambiente com 40 tarefas profissionais do tipo competição de captura de bandeira, o modelo alcançou 100%, resolvendo 39 de 39 tarefas com execução irrestrita de agente. No CVE-Bench, construído sobre 40 vulnerabilidades críticas de aplicações web catalogadas publicamente, obteve 95,8% em um subconjunto de 24 tarefas avaliáveis. No HumanEval+, métrica de programação, marcou 93,9%. Já no SWE-bench Pro V2 registrou 76,5%, sua menor pontuação publicada, e a própria empresa alerta que esse número não é diretamente comparável aos resultados do SWE-bench Pro padrão.
Na comparação com outros modelos de segurança, o quadro apresentado pela reportagem mostra diferenças relevantes de preço e acesso. O Claude Mythos Preview, da Anthropic, lançado em 7 de abril de 2026, alcançou 83,1% no CyberGym e 77,8% no SWE-bench Pro, com preço de 25 dólares por milhão de tokens de entrada e 125 dólares de saída após créditos, e acesso restrito a parceiros do programa Glasswing. O GPT-5.5-Cyber, da OpenAI, disponível em versão completa desde 22 de junho de 2026, marcou 85,6% no CyberGym e é oferecido apenas a defensores verificados. O Fugu-Cyber, da Sakana AI, lançado em 21 de julho de 2026 com orquestração multiagente, obteve 86,9% no CyberGym e 72,1% no CTI-REALM, com acesso mediante revisão de aplicação.
O OrcaCyber Zero 1.0, antecessor do novo modelo, havia registrado 98,07% no CyberGym na primeira tentativa, porém dentro da própria estrutura de avaliação da Orca. A reportagem destaca que todos os números dos concorrentes vêm dos anúncios dos próprios fornecedores e que não há replicações independentes de nenhum deles. Essa ressalva se soma ao fato de o CVE-Bench ter sido aplicado apenas ao subconjunto de 24 tarefas avaliáveis.
Para desenvolvedores, o acesso ao novo modelo é feito por uma API compatível com o formato da OpenAI, configurando o endereço de base da API e chamando o modelo identificado como orca/orcacyber-zero-1.5. A liberação é controlada pelo nível de acesso denominado Security Research, que exige um engajamento, uma chave de acesso e a aceitação dos termos de uso. O nível é voltado a pesquisadores de segurança confiáveis, equipes de simulação de ataques conhecidas como red teams e testes autorizados.
O preço praticado é de 3 dólares por milhão de tokens de entrada e 7,50 dólares por milhão de tokens de saída, com leituras de cache a 0,75 dólar por milhão de tokens. Nos sete dias anteriores à publicação, o tempo mediano até o primeiro token foi de 500 milissegundos e o percentil 95 alcançou 2,36 segundos, embora a amostra seja pequena, com cerca de 1,3 mil tokens de tráfego. O Zero 1.0 havia registrado 3,43 segundos de mediana em uma janela de tráfego muito maior, o que impede uma comparação limpa entre as duas medições.
O OrcaCyber Zero 1.5 chega como um modelo de acesso controlado, com contexto de 1 milhão de tokens, 100% no Cybench, 95,8% no subconjunto do CVE-Bench e preço muito inferior ao do Claude Mythos Preview. Todos os resultados, porém, são autodeclarados pela empresa, e ainda não há relatório técnico publicado. Quem quiser consultar os detalhes pode acessar a página oficial do modelo no site da OrcaRouter.