PUBLICIDADE

NVIDIA Apresenta Modelo de Voz Multilíngue Revolucionário em 12 Idiomas

10/08/2026
7 visualizações
3 min de leitura
Imagem principal do post

NVIDIA apresenta modelo MagpieTTS Multilingual para agentes de voz em 12 idiomas

A NVIDIA disponibilizou o MagpieTTS Multilingual, um modelo de conversão de texto em fala projetado para desenvolvedores, pesquisadores e equipes de produto que trabalham com aplicações de voz multilíngue. O modelo foi publicado na plataforma Hugging Face e tem como foco principal manter a consistência das vozes dos falantes em diferentes idiomas, atendendo a uma demanda crescente por sistemas de fala natural em múltiplas línguas.

Imagem complementar

O MagpieTTS Multilingual é um modelo neural de texto para fala de ponta a ponta que sintetiza áudio a partir de cinco vozes de falantes em inglês, chamadas Aria, Jason, Leo, Sofia e John Van Stan. Essas vozes podem ser utilizadas para gerar fala em doze idiomas diferentes, abrangendo árabe, chinês, inglês, francês, alemão, hindi, italiano, japonês, coreano, português, espanhol e vietnamita. A variedade linguística inclui não apenas línguas europeias, mas também asiáticas, ampliando o alcance das aplicações que podem ser desenvolvidas com o modelo.

PUBLICIDADE

Em termos de arquitetura técnica, o MagpieTTS Multilingual adota uma estrutura de codificador e decodificador baseada em transformers, um tipo de arquitetura de rede neural amplamente utilizada em modelos de inteligência artificial generativa. O modelo prevê de forma autorregressiva, ou seja, gerando saída passo a passo com base em entradas anteriores, tokens discretos de codec de áudio, que são representações numéricas comprimidas do sinal sonoro. Essa abordagem permite a síntese de fala com qualidade consistente entre os idiomas suportados.

Entre os recursos disponíveis, o modelo oferece suporte ao sistema IPA de conversão grafema para fonema, processo que transforma a escrita de uma palavra em sua pronúncia fonética. Esse recurso permite a criação de dicionários personalizados e facilita o code-switching, que é a alternância entre dois ou mais idiomas dentro de uma mesma frase. O modelo também oferece suporte específico para a conversão de inglês para katakana, sistema de escrita japonês usado principalmente para representar palavras estrangeiras. Esse conjunto de funcionalidades viabiliza a produção de conteúdo multilíngue misto e aplicações voltadas para domínios específicos.

O MagpieTTS Multilingual foi concebido para atuar como uma camada dedicada de geração de fala que se integra a pipelines de inteligência artificial já existentes, sem exigir alterações nos modelos de linguagem upstream nem no tratamento de áudio downstream. Em configurações de agentes de voz em cascata, onde diferentes módulos de IA são encadeados para processar solicitações dos usuários, o modelo converte o texto gerado por grandes modelos de linguagem em fala natural em tempo real para reprodução ao usuário final.

A versão disponibilizada na plataforma Hugging Face, chamada nvidia/magpie_tts_multilingual_357m, possui cerca de 357 milhões de parâmetros, que são os valores internos que o modelo ajusta durante o treinamento para aprender padrões de linguagem e fala. O modelo gera áudio com taxa de amostragem de 22 quilohertz e ocupa aproximadamente 1,4 gigabyte de memória de vídeo durante a execução. No modo de streaming, em que o áudio é gerado e entregue continuamente conforme o processamento avança, o primeiro trecho de áudio chega cerca de 370 milissegundos após o recebimento da primeira frase, com os blocos seguintes sendo entregues ainda mais rapidamente à medida que o modelo processa a entrada. O modelo é distribuído sob a licença aberta da NVIDIA, a Open Model License.

As aplicações típicas do MagpieTTS Multilingual incluem agentes de voz em cascata, narração de audiolivros e conteúdos, ferramentas de acessibilidade, pipelines de dublagem e localização, além de mídias interativas. A capacidade de manter vozes consistentes em múltiplos idiomas abre caminho para experiências de voz mais integradas em produtos que atendem públicos globalizados, sem a necessidade de treinar modelos separados para cada língua.

Com o lançamento do MagpieTTS Multilingual, a NVIDIA amplia seu portfólio de modelos de fala voltados para aplicações empresariais e de produção. A combinação de cobertura multilíngue ampla, suporte a personalização fonética e integração com pipelines de inteligência artificial já existentes posiciona o modelo como uma opção relevante para equipes que buscam implementar interfaces de voz naturais e multilingues em seus produtos.

PUBLICIDADE

Leitura recomendada

Comentários

Nenhum comentário ainda. Seja o primeiro a comentar!