PUBLICIDADE

Adeus, Clonagem: Voice Design da Gradium Cria Vozes Sintéticas Inéditas a Partir de Simples Descrições em Texto

09/09/2026
65 visualizações
4 min de leitura
Imagem principal do post

Gradium lança Voice Design e permite criar vozes sintéticas a partir de descrições em texto

A empresa francesa de inteligência artificial voltada para voz Gradium, originada do laboratório de pesquisa Kyutai, anunciou o lançamento do Voice Design, uma ferramenta capaz de gerar vozes sintéticas completamente novas a partir de uma descrição textual, sem necessidade de áudio de referência ou clonagem de um falante real. A solução já está disponível na API da plataforma e no ambiente Studio, gratuitamente em todos os planos, incluindo a camada gratuita, e opera no mesmo endpoint de Text-to-Speech utilizado pelas vozes do catálogo tradicional.

A proposta do Voice Design parte de um problema recorrente no desenvolvimento de agentes de voz. Segundo a própria empresa, os catálogos disponíveis, mesmo os mais extensos, não conseguem cobrir a totalidade de perfis exigidos pelos casos de uso. Uma recepcionista quebequense para uma concessionária em Montreal, por exemplo, ou um narrador na faixa dos sessenta anos com a autoridade de um anfiteatro universitário são tipos de demanda que extrapolam qualquer biblioteca de vozes pré-fabricadas. A alternativa usual, a clonagem a partir de áudios de referência, exige lidar com questões de licenciamento e consentimento a cada novo falante adicionado.

Imagem complementar

O Voice Design resolve essa questão ao transformar a descrição em texto na única entrada do modelo. De acordo com a documentação da Gradium, o sistema responde a atributos como gênero, faixa etária, sotaque ou origem, tom, ritmo, energia, timbre e ressonância, além do registro e da função que a voz deve desempenhar. As descrições podem ter entre um e 500 caracteres e podem ser escritas em inglês, francês, espanhol, português ou alemão. A empresa recomenda encerrar o comando com o uso pretendido, pois isso influencia não apenas a coloração da voz, mas a maneira como ela será entregue.

Cada requisição retorna entre um e cinco candidatos, geralmente prontos em três a cinco segundos. Os candidatos são variações de um mesmo personagem descrito, de modo que obter um caráter diferente exige uma nova descrição, e não novas amostragens do mesmo comando. O fluxo de adoção segue quatro chamadas na API. A primeira, POST /voice-generator/generate, gera identificadores de candidatos com status pronto igual a falso. A segunda, GET /voice-generator/embeddings, consulta os identificadores até que mudem de estado. Em seguida, cada candidato é testado pelo endpoint padrão de Text-to-Speech, usando o identificador como voice_id. Por fim, a chamada POST /voices/from-embedding converte o candidato escolhido em uma voz definitiva.

PUBLICIDADE

Durante a fase de testes, os candidatos carregam três restrições que deixam de existir após a conversão. O texto de audição é limitado a cem caracteres, o uso é exclusivo via REST e os endpoints de Text-to-Speech por WebSocket e de Speech-to-Speech não aceitam esses candidatos. Candidatos não convertidos são excluídos após trinta dias. A conversão é gratuita, elimina o prazo de expiração e consome um dos slots de voz personalizada compartilhados com a clonagem. O plano gratuito comporta cinco vozes personalizadas, enquanto os planos pagos suportam até mil.

A amostragem é intencionalmente não determinística. A equipe da Gradium expande a descrição antes do processamento, e essa expansão varia a cada requisição, de modo que o mesmo comando com uma semente fixa ainda gera uma voz diferente. Na prática, isso significa que um candidato descartado e perdido não pode ser recuperado.

A empresa também apresentou resultados de benchmarking interno. Um teste cego de comparação pareada foi aplicado a comandos de sotaque em seis sistemas de design de voz acessíveis por APIs públicas, distribuídos em cinco idiomas. Ouvintes nativos ouviam dois clipes sem rótulo e escolhiam o mais próximo da descrição ou declaravam empate. Ao todo, foram realizadas 7.627 comparações, nas quais o Voice Design da Gradium teria alcançado taxa de vitória de 72,6%, contra 59,0% do ElevenLabs eleven_ttv_v3, 44,8% da Inworld, 36,7% da Fish Audio e 31,7% da MiniMax. A taxa de vitória inclui vitórias totais mais a metade dos empates, de modo que 50% representa paridade. A Gradium ficou em primeiro lugar em todos os cinco idiomas avaliados.

As maiores margens ocorreram em sotaques regionais que costumam ser achatados pelos catálogos. O francês quebequense atingiu 97%, o espanhol rioplatense 86%, o alemão bávaro 85%, enquanto o espanhol colombiano e o português africano alcançaram 83%. Um juiz automatizado, o Gemini 3.1 Pro, avaliou clipes individuais sem rótulo em uma escala de um a cinco e produziu a mesma ordenação: Gradium com 4,06, ElevenLabs com 3,86, Inworld com 3,64 e Fish Audio com 3,51. A página do produto também menciona 83,4% de aderência ao comando na divisão em inglês do InstructTTSEval, referência acadêmica para acompanhamento de instruções em Text-to-Speech.

A própria reportagem destaca que todos esses números foram desenhados e executados pela própria fornecedora. Mesmo assim, o lançamento aponta para uma mudança significativa no fluxo de criação de vozes para agentes conversacionais, ao dispensar etapas de coleta, licenciamento e clonagem e ao disponibilizar o recurso de forma gratuita em todos os planos da Gradium.

PUBLICIDADE
Este post foi útil para você?

Leitura recomendada

💬 Comentários

Nenhum comentário ainda. Conte o que achou, tire uma dúvida ou discorde. Seja o primeiro!

Deixe seu comentário
O e-mail não aparece. Serve só para avisar quando responderem você.
Os comentários passam por aprovação antes de aparecer. Crie uma conta de leitor e, depois do primeiro aprovado, os próximos saem na hora.
Apoie o ConexãoTC

O ConexãoTC é independente e gratuito. Se as notícias fazem parte do seu dia, contribua com qualquer valor pelo PIX e ajude a manter o blog no ar.

QR code PIX para apoiar o ConexãoTC
Aponte a câmera do app do banco
Favorecido: Jean Dgardany C. Lima, editor do ConexãoTC
🗳️ O que você quer ler aqui?

Marque os assuntos que te interessam. Os mais pedidos viram os próximos artigos.

Leitores cadastrados têm as sugestões atendidas primeiro e recebem um aviso quando o artigo sai.
Fique por dentro

Os destaques do dia no seu e-mail, todo dia às 8h.

PUBLICIDADE