PUBLICIDADE

NVIDIA ensina IA a dominar dialetos sauditas sem esquecer os outros 40 idiomas que já falava

01/10/2026
7 visualizações
3 min de leitura
A NVIDIA adaptou o modelo de reconhecimento de fala Nemotron 3.5 ASR aos dialetos sauditas Najdi e Hijazi, reduzindo a taxa de erro de 55,05% para 29,96% sem degradar os 40 idiomas suportados.
Imagem principal do post

NVIDIA detalha método para ajustar reconhecimento de fala aos dialetos sauditas preservando outros idiomas

A NVIDIA apresentou um fluxo de trabalho voltado ao ajuste fino do modelo Nemotron 3.5 de reconhecimento automático de fala para os dialetos sauditas Najdi e Hijazi, mantendo o suporte aos demais idiomas já presentes no sistema. A abordagem, descrita em publicação técnica da empresa, combina curadoria mínima de dados, mistura ponderada de exemplos, agrupamento por duração e descongelamento parcial das camadas do codificador para adaptar o modelo sem comprometer suas capacidades multilíngues.

O Nemotron 3.5 ASR é um modelo de transcrição em streaming, ou seja, capaz de converter fala em texto quase em tempo real, que já oferece suporte a quarenta variantes de idiomas em um único conjunto de pesos com seiscentos milhões de parâmetros. Entre os idiomas contemplados estão inglês americano e britânico, espanhol, alemão, francês, italiano, árabe, japonês, coreano, português do Brasil e de Portugal, russo, hindi, turco, vietnamita, holandês, ucraniano, polonês, finlandês, mandarim, tchecoslovaco, búlgaro, sueco, croata, romeno, estoniano, dinamarquês, húngaro, norueguês, hebraico, grego, lituano, letão, maltês e tailandês.

Imagem complementar

Apesar dessa cobertura ampla, a empresa reconhece que dialetos regionais e condições locais de gravação costumam ficar sub-representados nos dados usados no treinamento inicial. O árabe saudita serve como exemplo concreto dessa limitação. Um modelo pode transcrever bem o árabe padrão moderno, falado em contextos formais, ou o inglês, mas encontrar dificuldades ao lidar com variantes regionais como o Najdi e o Hijazi, ou com áudios captados em condições específicas do ambiente local.

Para enfrentar esse desafio, a NVIDIA utilizou o framework NeMo, que é o conjunto de ferramentas da própria empresa voltado ao desenvolvimento de modelos de inteligência artificial baseados em redes neurais profundas. O processo de ajuste fino empregou 133,7 horas de gravações em Najdi e Hijazi, combinadas com dados do conjunto FLEURS por meio de uma técnica chamada mistura ponderada com repetição, que visa evitar que o modelo esqueça os idiomas previamente aprendidos. Também foram aplicadas estratégias de agrupamento por duração dos áudios e descongelamento parcial do codificador, a parte do modelo responsável por transformar o sinal de áudio em representações internas.

PUBLICIDADE

Os resultados apresentados indicam redução da taxa de erro por palavra de 55,05% para 29,96% no conjunto de teste dos dialetos alvo. Ao mesmo tempo, o desempenho em inglês passou de 11,04% para 10,42% de taxa de erro, sem degradação perceptível nos demais dialetos árabes avaliados. A NVIDIA destaca que atualizar todas as 24 camadas do codificador produziu os menores índices de erro, ao custo de 230,4 milhões de parâmetros treináveis. Como alternativa, congelar parte das camadas reduz a necessidade de poder computacional e de memória em cenários com recursos limitados.

A publicação também oferece orientações práticas para desenvolvedores interessados em aplicar o mesmo método a outros idiomas, sotaques ou domínios. O áudio de entrada deve estar em formato wav mono-canal, e os dados precisam ser organizados em arquivos de manifesto no formato JSON-lines, próprios do NeMo, contendo o caminho do arquivo, a duração e a transcrição de referência. A inferência pode ser feita especificando o idioma desejado ou permitindo que o próprio modelo o identifique automaticamente.

A proposta da NVIDIA se insere em um esforço mais amplo da indústria para tornar os sistemas de reconhecimento de fala mais inclusivos diante da diversidade linguística real. Ao disponibilizar um fluxo de trabalho replicável, a empresa busca permitir que organizações adaptem modelos multilíngues a contextos locais específicos, sem abrir mão do suporte aos demais idiomas cobertos pelo modelo original. O ajuste fino de modelos como o Nemotron 3.5 ASR para dialetos sub-representados surge como caminho possível para reduzir falhas em aplicações práticas, como atendimento ao cliente,legendagem automática e assistentes de voz implantados em regiões com características linguísticas próprias.

PUBLICIDADE
Este post foi útil para você?

Leitura recomendada

💬 Comentários

Nenhum comentário ainda. Conte o que achou, tire uma dúvida ou discorde. Seja o primeiro!

Deixe seu comentário
O e-mail não aparece. Serve só para avisar quando responderem você.
Os comentários passam por aprovação antes de aparecer. Crie uma conta de leitor e, depois do primeiro aprovado, os próximos saem na hora.
Apoie o ConexãoTC

O ConexãoTC é independente e gratuito. Se as notícias fazem parte do seu dia, contribua com qualquer valor pelo PIX e ajude a manter o blog no ar.

QR code PIX para apoiar o ConexãoTC
Aponte a câmera do app do banco
Favorecido: Jean Dgardany C. Lima, editor do ConexãoTC
🗳️ O que você quer ler aqui?

Marque os assuntos que te interessam. Os mais pedidos viram os próximos artigos.

Leitores cadastrados têm as sugestões atendidas primeiro e recebem um aviso quando o artigo sai.
Fique por dentro

Os destaques do dia no seu e-mail, todo dia às 8h.

PUBLICIDADE