PUBLICIDADE

NVIDIA libera preview do Nemotron 3 Diarization: a IA que identifica quem está falando em cada trecho de áudio

23/09/2026
51 visualizações
3 min de leitura
Imagem principal do post

NVIDIA apresenta preview do Nemotron 3 Diarization, modelo de IA para identificação de falantes em áudio

A NVIDIA disponibilizou na plataforma Hugging Face o modelo Nemotron 3 Diarization em versão preview, voltado para a tarefa de diarização de falantes em áudio. A diarização consiste em identificar quem está falando em cada trecho de uma gravação, separando e rotulando as vozes de diferentes participantes em arquivos sonoros, especialmente em conversas com múltiplos interlocutores.

O lançamento faz parte da coleção Nemotron Speech, que reúne modelos abertos da NVIDIA dedicados ao processamento de fala. A iniciativa engloba tecnologias para reconhecimento automático de fala, também chamado de ASR, síntese de voz, conhecida como TTS, e conversão de fala em fala, além da própria diarização de falantes. A coleção inclui modelos como o Nemotron Speech Streaming em inglês, com 600 milhões de parâmetros, o Parakeet Unified, o Magpie TTS Multilingual e o PersonaPlex, entre outros.

Imagem complementar

O modelo de diarização é executado no framework NeMo, a biblioteca de código aberto da NVIDIA para desenvolvimento de modelos de inteligência artificial voltados a aplicações de fala. Pelo NeMo, é possível realizar tanto a inferência, ou seja, usar o modelo já treinado para gerar resultados, quanto o ajuste fino em conjuntos de dados próprios, processo conhecido como fine-tuning. Para instalar a ferramenta, é necessário ter uma versão recente do PyTorch e o pacote Cython.

A arquitetura utilizada no modelo de diarização da NVIDIA é chamada Sortformer, já presente em versões anteriores como o diar_sortformer_4spk-v1, preparado para identificar até quatro falantes distintos em um mesmo áudio. Essa arquitetura representa a base técnica sobre a qual o novo preview foi construído, mantendo a proposta de separar automaticamente as vozes em gravações com múltiplos participantes.

PUBLICIDADE

O acesso ao Nemotron 3 Diarization preview é feito por meio de um programa de acesso antecipado destinado exclusivamente a testes e avaliações internas. Os usuários precisam confirmar que são maiores de idade e que concordam com os termos da NVIDIA Software and Model Evaluation License. O modelo só pode ser utilizado em sistemas equipados com GPUs de GPU da própria NVIDIA, ficando proibida a redistribuição do modelo ou de versões derivadas, bem como o uso de seus resultados ou artefatos para treinar ou aprimorar outros modelos de inteligência artificial.

Também não é permitido divulgar resultados de testes ou avaliações sem autorização prévia por escrito da NVIDIA. O modelo não pode ser empregado em ambientes de produção, sendo restrito a atividades experimentais e de pesquisa. Essas limitações reforçam o caráter preliminar do preview, voltado a coletar feedback antes de uma eventual liberação mais ampla.

A disponibilização do modelo na Hugging Face segue a estratégia da NVIDIA de manter uma presença ativa na plataforma, onde outros modelos da linha Nemotron também estão hospedados. A empresa tem ampliado seu portfólio de modelos abertos voltados a aplicações empresariais de fala, com foco em soluções consideradas prontas para uso em ambientes produtivos.

Com o preview do Nemotron 3 Diarization, a NVIDIA amplia as opções disponíveis no ecossistema de código aberto para quem precisa trabalhar com áudios que envolvem múltiplos falantes, como transcrições de reuniões, entrevistas, podcasts e central de atendimento. A expectativa é que o modelo evolua a partir dos testes da comunidade antes de ganhar uma versão definitiva com uso liberado fora do programa de acesso antecipado.

PUBLICIDADE
Este post foi útil para você?

Leitura recomendada

💬 Comentários

Nenhum comentário ainda. Conte o que achou, tire uma dúvida ou discorde. Seja o primeiro!

Deixe seu comentário
O e-mail não aparece. Serve só para avisar quando responderem você.
Os comentários passam por aprovação antes de aparecer. Crie uma conta de leitor e, depois do primeiro aprovado, os próximos saem na hora.
Apoie o ConexãoTC

O ConexãoTC é independente e gratuito. Se as notícias fazem parte do seu dia, contribua com qualquer valor pelo PIX e ajude a manter o blog no ar.

QR code PIX para apoiar o ConexãoTC
Aponte a câmera do app do banco
Favorecido: Jean Dgardany C. Lima, editor do ConexãoTC
🗳️ O que você quer ler aqui?

Marque os assuntos que te interessam. Os mais pedidos viram os próximos artigos.

Leitores cadastrados têm as sugestões atendidas primeiro e recebem um aviso quando o artigo sai.
Fique por dentro

Os destaques do dia no seu e-mail, todo dia às 8h.

PUBLICIDADE