NVIDIA apresenta preview do Nemotron 3 Diarization, modelo de IA para identificação de falantes em áudio
A NVIDIA disponibilizou na plataforma Hugging Face o modelo Nemotron 3 Diarization em versão preview, voltado para a tarefa de diarização de falantes em áudio. A diarização consiste em identificar quem está falando em cada trecho de uma gravação, separando e rotulando as vozes de diferentes participantes em arquivos sonoros, especialmente em conversas com múltiplos interlocutores.
O lançamento faz parte da coleção Nemotron Speech, que reúne modelos abertos da NVIDIA dedicados ao processamento de fala. A iniciativa engloba tecnologias para reconhecimento automático de fala, também chamado de ASR, síntese de voz, conhecida como TTS, e conversão de fala em fala, além da própria diarização de falantes. A coleção inclui modelos como o Nemotron Speech Streaming em inglês, com 600 milhões de parâmetros, o Parakeet Unified, o Magpie TTS Multilingual e o PersonaPlex, entre outros.
O modelo de diarização é executado no framework NeMo, a biblioteca de código aberto da NVIDIA para desenvolvimento de modelos de inteligência artificial voltados a aplicações de fala. Pelo NeMo, é possível realizar tanto a inferência, ou seja, usar o modelo já treinado para gerar resultados, quanto o ajuste fino em conjuntos de dados próprios, processo conhecido como fine-tuning. Para instalar a ferramenta, é necessário ter uma versão recente do PyTorch e o pacote Cython.
A arquitetura utilizada no modelo de diarização da NVIDIA é chamada Sortformer, já presente em versões anteriores como o diar_sortformer_4spk-v1, preparado para identificar até quatro falantes distintos em um mesmo áudio. Essa arquitetura representa a base técnica sobre a qual o novo preview foi construído, mantendo a proposta de separar automaticamente as vozes em gravações com múltiplos participantes.
O acesso ao Nemotron 3 Diarization preview é feito por meio de um programa de acesso antecipado destinado exclusivamente a testes e avaliações internas. Os usuários precisam confirmar que são maiores de idade e que concordam com os termos da NVIDIA Software and Model Evaluation License. O modelo só pode ser utilizado em sistemas equipados com GPUs de GPU da própria NVIDIA, ficando proibida a redistribuição do modelo ou de versões derivadas, bem como o uso de seus resultados ou artefatos para treinar ou aprimorar outros modelos de inteligência artificial.
Também não é permitido divulgar resultados de testes ou avaliações sem autorização prévia por escrito da NVIDIA. O modelo não pode ser empregado em ambientes de produção, sendo restrito a atividades experimentais e de pesquisa. Essas limitações reforçam o caráter preliminar do preview, voltado a coletar feedback antes de uma eventual liberação mais ampla.
A disponibilização do modelo na Hugging Face segue a estratégia da NVIDIA de manter uma presença ativa na plataforma, onde outros modelos da linha Nemotron também estão hospedados. A empresa tem ampliado seu portfólio de modelos abertos voltados a aplicações empresariais de fala, com foco em soluções consideradas prontas para uso em ambientes produtivos.
Com o preview do Nemotron 3 Diarization, a NVIDIA amplia as opções disponíveis no ecossistema de código aberto para quem precisa trabalhar com áudios que envolvem múltiplos falantes, como transcrições de reuniões, entrevistas, podcasts e central de atendimento. A expectativa é que o modelo evolua a partir dos testes da comunidade antes de ganhar uma versão definitiva com uso liberado fora do programa de acesso antecipado.