PUBLICIDADE

Adeus, Clonagem: Voice Design da Gradium Cria Vozes Sintéticas Inéditas a Partir de Simples Descrições em Texto

09/09/2026
7 visualizações
4 min de leitura
Imagem principal do post

Gradium lança Voice Design e permite criar vozes sintéticas a partir de descrições em texto

A empresa francesa de inteligência artificial voltada para voz Gradium, originada do laboratório de pesquisa Kyutai, anunciou o lançamento do Voice Design, uma ferramenta capaz de gerar vozes sintéticas completamente novas a partir de uma descrição textual, sem necessidade de áudio de referência ou clonagem de um falante real. A solução já está disponível na API da plataforma e no ambiente Studio, gratuitamente em todos os planos, incluindo a camada gratuita, e opera no mesmo endpoint de Text-to-Speech utilizado pelas vozes do catálogo tradicional.

Imagem complementar

A proposta do Voice Design parte de um problema recorrente no desenvolvimento de agentes de voz. Segundo a própria empresa, os catálogos disponíveis, mesmo os mais extensos, não conseguem cobrir a totalidade de perfis exigidos pelos casos de uso. Uma recepcionista quebequense para uma concessionária em Montreal, por exemplo, ou um narrador na faixa dos sessenta anos com a autoridade de um anfiteatro universitário são tipos de demanda que extrapolam qualquer biblioteca de vozes pré-fabricadas. A alternativa usual, a clonagem a partir de áudios de referência, exige lidar com questões de licenciamento e consentimento a cada novo falante adicionado.

PUBLICIDADE

O Voice Design resolve essa questão ao transformar a descrição em texto na única entrada do modelo. De acordo com a documentação da Gradium, o sistema responde a atributos como gênero, faixa etária, sotaque ou origem, tom, ritmo, energia, timbre e ressonância, além do registro e da função que a voz deve desempenhar. As descrições podem ter entre um e 500 caracteres e podem ser escritas em inglês, francês, espanhol, português ou alemão. A empresa recomenda encerrar o comando com o uso pretendido, pois isso influencia não apenas a coloração da voz, mas a maneira como ela será entregue.

Cada requisição retorna entre um e cinco candidatos, geralmente prontos em três a cinco segundos. Os candidatos são variações de um mesmo personagem descrito, de modo que obter um caráter diferente exige uma nova descrição, e não novas amostragens do mesmo comando. O fluxo de adoção segue quatro chamadas na API. A primeira, POST /voice-generator/generate, gera identificadores de candidatos com status pronto igual a falso. A segunda, GET /voice-generator/embeddings, consulta os identificadores até que mudem de estado. Em seguida, cada candidato é testado pelo endpoint padrão de Text-to-Speech, usando o identificador como voice_id. Por fim, a chamada POST /voices/from-embedding converte o candidato escolhido em uma voz definitiva.

Durante a fase de testes, os candidatos carregam três restrições que deixam de existir após a conversão. O texto de audição é limitado a cem caracteres, o uso é exclusivo via REST e os endpoints de Text-to-Speech por WebSocket e de Speech-to-Speech não aceitam esses candidatos. Candidatos não convertidos são excluídos após trinta dias. A conversão é gratuita, elimina o prazo de expiração e consome um dos slots de voz personalizada compartilhados com a clonagem. O plano gratuito comporta cinco vozes personalizadas, enquanto os planos pagos suportam até mil.

A amostragem é intencionalmente não determinística. A equipe da Gradium expande a descrição antes do processamento, e essa expansão varia a cada requisição, de modo que o mesmo comando com uma semente fixa ainda gera uma voz diferente. Na prática, isso significa que um candidato descartado e perdido não pode ser recuperado.

A empresa também apresentou resultados de benchmarking interno. Um teste cego de comparação pareada foi aplicado a comandos de sotaque em seis sistemas de design de voz acessíveis por APIs públicas, distribuídos em cinco idiomas. Ouvintes nativos ouviam dois clipes sem rótulo e escolhiam o mais próximo da descrição ou declaravam empate. Ao todo, foram realizadas 7.627 comparações, nas quais o Voice Design da Gradium teria alcançado taxa de vitória de 72,6%, contra 59,0% do ElevenLabs eleven_ttv_v3, 44,8% da Inworld, 36,7% da Fish Audio e 31,7% da MiniMax. A taxa de vitória inclui vitórias totais mais a metade dos empates, de modo que 50% representa paridade. A Gradium ficou em primeiro lugar em todos os cinco idiomas avaliados.

As maiores margens ocorreram em sotaques regionais que costumam ser achatados pelos catálogos. O francês quebequense atingiu 97%, o espanhol rioplatense 86%, o alemão bávaro 85%, enquanto o espanhol colombiano e o português africano alcançaram 83%. Um juiz automatizado, o Gemini 3.1 Pro, avaliou clipes individuais sem rótulo em uma escala de um a cinco e produziu a mesma ordenação: Gradium com 4,06, ElevenLabs com 3,86, Inworld com 3,64 e Fish Audio com 3,51. A página do produto também menciona 83,4% de aderência ao comando na divisão em inglês do InstructTTSEval, referência acadêmica para acompanhamento de instruções em Text-to-Speech.

A própria reportagem destaca que todos esses números foram desenhados e executados pela própria fornecedora. Mesmo assim, o lançamento aponta para uma mudança significativa no fluxo de criação de vozes para agentes conversacionais, ao dispensar etapas de coleta, licenciamento e clonagem e ao disponibilizar o recurso de forma gratuita em todos os planos da Gradium.

PUBLICIDADE

Leitura recomendada

Comentários

Nenhum comentário ainda. Seja o primeiro a comentar!