NVIDIA detalha método para ajustar reconhecimento de fala aos dialetos sauditas preservando outros idiomas
A NVIDIA apresentou um fluxo de trabalho voltado ao ajuste fino do modelo Nemotron 3.5 de reconhecimento automático de fala para os dialetos sauditas Najdi e Hijazi, mantendo o suporte aos demais idiomas já presentes no sistema. A abordagem, descrita em publicação técnica da empresa, combina curadoria mínima de dados, mistura ponderada de exemplos, agrupamento por duração e descongelamento parcial das camadas do codificador para adaptar o modelo sem comprometer suas capacidades multilíngues.
O Nemotron 3.5 ASR é um modelo de transcrição em streaming, ou seja, capaz de converter fala em texto quase em tempo real, que já oferece suporte a quarenta variantes de idiomas em um único conjunto de pesos com seiscentos milhões de parâmetros. Entre os idiomas contemplados estão inglês americano e britânico, espanhol, alemão, francês, italiano, árabe, japonês, coreano, português do Brasil e de Portugal, russo, hindi, turco, vietnamita, holandês, ucraniano, polonês, finlandês, mandarim, tchecoslovaco, búlgaro, sueco, croata, romeno, estoniano, dinamarquês, húngaro, norueguês, hebraico, grego, lituano, letão, maltês e tailandês.
Apesar dessa cobertura ampla, a empresa reconhece que dialetos regionais e condições locais de gravação costumam ficar sub-representados nos dados usados no treinamento inicial. O árabe saudita serve como exemplo concreto dessa limitação. Um modelo pode transcrever bem o árabe padrão moderno, falado em contextos formais, ou o inglês, mas encontrar dificuldades ao lidar com variantes regionais como o Najdi e o Hijazi, ou com áudios captados em condições específicas do ambiente local.
Para enfrentar esse desafio, a NVIDIA utilizou o framework NeMo, que é o conjunto de ferramentas da própria empresa voltado ao desenvolvimento de modelos de inteligência artificial baseados em redes neurais profundas. O processo de ajuste fino empregou 133,7 horas de gravações em Najdi e Hijazi, combinadas com dados do conjunto FLEURS por meio de uma técnica chamada mistura ponderada com repetição, que visa evitar que o modelo esqueça os idiomas previamente aprendidos. Também foram aplicadas estratégias de agrupamento por duração dos áudios e descongelamento parcial do codificador, a parte do modelo responsável por transformar o sinal de áudio em representações internas.
Os resultados apresentados indicam redução da taxa de erro por palavra de 55,05% para 29,96% no conjunto de teste dos dialetos alvo. Ao mesmo tempo, o desempenho em inglês passou de 11,04% para 10,42% de taxa de erro, sem degradação perceptível nos demais dialetos árabes avaliados. A NVIDIA destaca que atualizar todas as 24 camadas do codificador produziu os menores índices de erro, ao custo de 230,4 milhões de parâmetros treináveis. Como alternativa, congelar parte das camadas reduz a necessidade de poder computacional e de memória em cenários com recursos limitados.
A publicação também oferece orientações práticas para desenvolvedores interessados em aplicar o mesmo método a outros idiomas, sotaques ou domínios. O áudio de entrada deve estar em formato wav mono-canal, e os dados precisam ser organizados em arquivos de manifesto no formato JSON-lines, próprios do NeMo, contendo o caminho do arquivo, a duração e a transcrição de referência. A inferência pode ser feita especificando o idioma desejado ou permitindo que o próprio modelo o identifique automaticamente.
A proposta da NVIDIA se insere em um esforço mais amplo da indústria para tornar os sistemas de reconhecimento de fala mais inclusivos diante da diversidade linguística real. Ao disponibilizar um fluxo de trabalho replicável, a empresa busca permitir que organizações adaptem modelos multilíngues a contextos locais específicos, sem abrir mão do suporte aos demais idiomas cobertos pelo modelo original. O ajuste fino de modelos como o Nemotron 3.5 ASR para dialetos sub-representados surge como caminho possível para reduzir falhas em aplicações práticas, como atendimento ao cliente,legendagem automática e assistentes de voz implantados em regiões com características linguísticas próprias.