PUBLICIDADE

Gradium AI redefine a síntese de voz: novo modelo atinge 81% de precisão nos casos mais difíceis e deixa concorrentes para trás

01/09/2026
73 visualizações
4 min de leitura
Imagem principal do post

Gradium AI lança novo modelo padrão de síntese de voz com taxa de acerto de 81% em casos difíceis

A Gradium AI disponibilizou um novo modelo de conversão de texto em fala, conhecido como TTS (do inglês Text-to-Speech), e o tornou a opção padrão em sua API e no Studio a partir do dia 31 de agosto de 2026. A empresa afirma que o sistema alcança uma taxa de aprovação de 81% em avaliações humanas realizadas sobre um conjunto de 500 frases consideradas difíceis para assistentes de voz, resultado superior ao de concorrentes diretos testados no mesmo cenário.

O foco do desenvolvimento está nos trechos das chamadas em que os agentes de voz costumam falhar, como a pronúncia de números de pedido, dígitos de retorno, endereços de e-mail e códigos de referência. Segundo a Gradium, o novo modelo consegue ler esses elementos sem que o desenvolvedor precise aplicar nenhum tipo de pré-processamento ou normalização textual antes do envio do conteúdo.

Imagem complementar

Para medir o desempenho, a empresa construiu um conjunto de avaliação com 500 frases, distribuídas em 100 itens por idioma, contemplando cinco línguas: inglês, alemão, francês, espanhol e português. O material foi organizado em dez critérios, sendo sete atômicos, que cobrem ortografia, siglas, tokens alfanuméricos, datas, números comuns, números extensos e de ponto flutuante, além de endereços de e-mail. Os outros três critérios são compostos e simulam situações reais de atendimento, como pedidos, tickets de TI e reclamações, reunindo vários elementos em um único turno de fala.

A avaliação foi conduzida por avaliadores humanos nativos de cada idioma, sob regras rígidas: uma frase só é considerada aprovada quando todos os elementos são pronunciados de forma correta e completa. Isso significa que um único dígito omitido já reprova a frase inteira. Os áudios foram normalizados em volume, a ordem de apresentação foi randomizada e cada avaliador teve limite de 40 comparações por sessão, com pausa obrigatória. O conjunto completo de testes foi disponibilizado publicamente no Hugging Face sob licença Creative Commons BY 4.0.

PUBLICIDADE

Nos resultados agregados, o novo modelo da Gradium atingiu 81% de aprovação, seguido pelo Cartesia Sonic 3.6, com 75,1%, e pelo ElevenLabs v3 Conversational, com 65,4%. Mais atrás aparecem o Fish Audio S2.1 Pro, com 49,5%, e o Inworld TTS 1.5 Max, com 46,5%. Todas as amostras foram geradas em agosto de 2026, utilizando as configurações padrão de cada plataforma.

Além da precisão na pronúncia, a empresa destaca o desempenho em latência. No benchmark de TTS da Coval, o modelo registrou um tempo até o primeiro áudio, chamado de TTFA (Time To First Audio), de 216 milissegundos no percentil 50, o que representa uma redução de 170 milissegundos em relação ao modelo anterior. O intervalo interquartil, que mede a dispersão entre os percentis 25 e 75 ao longo de 480 execuções, ficou em 30 milissegundos, o mais estreito entre os cinco modelos avaliados.

Para efeito de comparação, o Cartesia Sonic 3.6 apresentou mediana de 454 milissegundos com dispersão de 165 milissegundos, o equivalente a 36% do próprio valor mediano. O Inworld TTS 2 registrou 166 milissegundos de mediana, sendo o mais rápido nesse indicador, mas a Gradium opta por destacar a combinação de baixa latência e alta precisão, e não apenas a velocidade bruta. Fish Audio S2.1 Pro e ElevenLabs v3 Conversational ficaram em 291 e 329 milissegundos, respectivamente.

A implantação do novo modelo ocorre de forma automática. Clientes que já utilizam a plataforma não precisam realizar migração, e vozes previamente configuradas, incluindo clones personalizados, continuam funcionando sem alterações. Para novos usuários, a empresa indica a instalação do SDK em Python e o uso do endpoint WebSocket de TTS, mantendo os identificadores de voz já criados.

Como parte do processo de aprimoramento, a Gradium está oferecendo um milhão de créditos para desenvolvedores que enviarem relatórios completos de falhas em casos difíceis por meio do seu servidor no Discord. A empresa reconhece que o benchmark foi conduzido por ela mesma, mas argumenta que a abertura do conjunto de testes permite que a comunidade reproduza e verifique os resultados de forma independente.

Com o lançamento, a Gradium reforça a aposta em modelos de síntese de voz voltados para cenários de atendimento automatizado, nos quais a pronúncia correta de dados alfanuméricos costuma ser determinante para a experiência do usuário. A combinação entre taxa de aprovação superior à dos concorrentes avaliados, baixa latência e estabilidade nos tempos de resposta coloca o novo modelo como referência para aplicações em produção que dependem de comunicação por voz em múltiplos idiomas.

PUBLICIDADE
Este post foi útil para você?

Leitura recomendada

💬 Comentários

Nenhum comentário ainda. Conte o que achou, tire uma dúvida ou discorde. Seja o primeiro!

Deixe seu comentário
O e-mail não aparece. Serve só para avisar quando responderem você.
Os comentários passam por aprovação antes de aparecer. Crie uma conta de leitor e, depois do primeiro aprovado, os próximos saem na hora.
Apoie o ConexãoTC

O ConexãoTC é independente e gratuito. Se as notícias fazem parte do seu dia, contribua com qualquer valor pelo PIX e ajude a manter o blog no ar.

QR code PIX para apoiar o ConexãoTC
Aponte a câmera do app do banco
Favorecido: Jean Dgardany C. Lima, editor do ConexãoTC
🗳️ O que você quer ler aqui?

Marque os assuntos que te interessam. Os mais pedidos viram os próximos artigos.

Leitores cadastrados têm as sugestões atendidas primeiro e recebem um aviso quando o artigo sai.
Fique por dentro

Os destaques do dia no seu e-mail, todo dia às 8h.

PUBLICIDADE