PUBLICIDADE

NVIDIA Apresenta o AIPerf: A Nova Ferramenta Open Source Que Promete Revolucionar os Testes de Desempenho da IA Generativa

19/09/2026
8 visualizações
2 min de leitura
Imagem principal do post

NVIDIA lança AIPerf, nova ferramenta de benchmarking para inferência de modelos de linguagem em larga escala

A NVIDIA apresentou o AIPerf, uma nova ferramenta de código aberto destinada a medir o desempenho da inferência de grandes modelos de linguagem em ambientes de alta concorrência. O lançamento marca a substituição do GenAI-Perf, que até então era a referência da empresa para testes de performance em sistemas de IA generativa. A novidade foi descrita em um artigo técnico publicado no blog de desenvolvedores da companhia, assinado pelos engenheiros Anthony Casagrande, Harshini Komali e Matthew Kotila.

Imagem complementar

A principal mudança em relação ao GenAI-Perf está na arquitetura multiprocesso do cliente de medição. Em testes tradicionais, o software que dispara requisições contra o modelo acaba se tornando um gargalo, já que um único processo não consegue gerar carga suficiente para estressar servidores de inferência modernos. O AIPerf resolve esse problema distribuindo a geração de carga entre múltiplos processos, o que evita que a própria ferramenta limite a avaliação. Segundo a NVIDIA, esse desenho permite reproduzir cenários com alto grau de concorrência sem que os números medidos sejam distorcidos pela capacidade do cliente.

PUBLICIDADE

O AIPerf também amplia de forma significativa a cobertura de endpoints compatíveis. A ferramenta suporta mais de quinze tipos de pontos de acesso, incluindo serviços que seguem a especificação da API da OpenAI, amplamente adotada no setor. Isso permite que desenvolvedores avaliem não apenas implementações proprietárias da NVIDIA, mas também servidores de inferência de terceiros, tornando possível comparar diferentes pilhas de software sob as mesmas condições.

Para tornar os testes mais próximos do uso real, o AIPerf incorpora conjuntos de dados públicos bastante conhecidos, como o ShareGPT, além de formatos de reprodução de traces originados de plataformas como Mooncake, Baseten e WEKA AgentX. Esses traces registram o comportamento de tráfego de sistemas em produção, possibilitando que a ferramenta reproduza padrões de chegada de requisições, tamanhos variados de prompts e respostas, bem como picos de demanda observados em ambientes reais.

Outro diferencial da ferramenta está no controle do formato da carga aplicada. O AIPerf oferece suporte a padrões de chegada do tipo constante, Poisson e gama, todos com ajustes de rajada. Além disso, permite aplicar rampas graduais tanto na concorrência quanto na taxa de requisições, recurso útil para evitar que o sistema sob teste seja avaliado apenas em condições extremas e irreais. A ferramenta também trabalha com distribuições sintéticas, incluindo a proporção de variação entre comprimento de sequência de entrada e saída, conhecida como range-ratio, herdada dos motores vLLM e SGLang.

Combinando a arquitetura multiprocesso, a ampla compatibilidade de endpoints e a diversidade de cargas sintéticas e realistas, o AIPerf se posiciona como uma solução de referência para quem precisa avaliar com precisão o desempenho de sistemas de inferência de grandes modelos de linguagem. A publicação da NVIDIA reforça a importância de medições confiáveis em um cenário em que a eficiência da inferência é cada vez mais determinante para o custo e a qualidade de aplicações baseadas em IA generativa.

PUBLICIDADE

Leitura recomendada

Comentários

Nenhum comentário ainda. Seja o primeiro a comentar!