PUBLICIDADE

Quem falou o quê? NVIDIA libera modelo aberto que identifica oito vozes simultâneas em tempo real e domina rankings de diarização

23/09/2026
8 visualizações
5 min de leitura
Imagem principal do post

NVIDIA apresenta Nemotron 3 Diarization, modelo aberto que identifica até oito falantes em tempo real

A NVIDIA disponibilizou o Nemotron 3 Diarization, um modelo de diarização de falantes com pesos abertos e cem milhões de parâmetros publicado na plataforma Hugging Face. A diarização é a tarefa de separar automaticamente as vozes presentes em um áudio, indicando quem falou e em que momento. O modelo responde a uma pergunta central em qualquer conversa registrada: quem falou quando, inclusive em trechos com falas sobrepostas. O sistema acompanha até oito interlocutores simultaneamente e utiliza um único checkpoint, isto é, um arquivo de pesos capaz de operar tanto em gravações offline quanto em transmissões em tempo real.

Imagem complementar

A principal evolução em relação ao modelo anterior da empresa, o Streaming Sortformer, é o dobro da capacidade de identificação de falantes, que passou de quatro para oito. Segundo a NVIDIA, o foco do lançamento é o áudio de reuniões com múltiplos participantes, cenário em que as pessoas frequentemente falam ao mesmo tempo e o conteúdo se torna caótico para sistemas automáticos. Os pesos são distribuídos sob a licença OpenMDW 1.1, que permite uso comercial, e o modelo roda em Linux por meio do framework NVIDIA NeMo, com suporte às arquiteturas de GPU Ampere, Ada Lovelace, Hopper e Blackwell.

PUBLICIDADE

A relevância da diarização está em uma limitação que os sistemas de reconhecimento automático de fala não resolvem sozinhos. Os modelos de ASR transcrevem as palavras, mas não informam quem as disse. Sem essa atribuição, uma ferramenta de resumo automático não consegue identificar quem fez um compromisso ou quem levantou uma objeção durante uma reunião. A diarização gera os intervalos de tempo em que cada falante está ativo, e esses intervalos são combinados com a saída do ASR para produzir uma transcrição com falantes atribuídos. Aplicações como gravadores de reunião, análise de chamadas, pipelines de podcasts e memórias de agentes de voz dependem dessa etapa para funcionar corretamente.

Do ponto de vista arquitetural, o modelo recebe áudio monoamazônico de dezesseis quilohertz nos formatos wav, flac, opus ou mp3. O áudio é convertido em features de mel-espectrograma, uma representação matemática das frequências sonoras, com passo de dez milissegundos, que são empilhadas em grupos de oito para gerar quadros de oitenta milissegundos no codificador. Um codificador Transformer de trinta e uma camadas com embeddings posicionais rotativos (RoPE, técnica que permite ao modelo entender a ordem dos elementos na sequência) processa esses quadros. Em seguida, uma camada convolucional unidimensional reconverte as previsões para resolução de dez milissegundos. O resultado é um tensor de dimensão [T, 8], em que cada coluna representa a probabilidade de atividade de um dos oito falantes em cada instante.

Quando duas pessoas falam ao mesmo tempo, dois canais se ativam no mesmo quadro, o que permite ao modelo lidar diretamente com a sobreposição de vozes. O sistema adota a abordagem Sortformer, que ordena os falantes pelo momento de chegada: a primeira voz nova ocupa o canal um, a segunda ocupa o canal dois e assim por diante. Essa ordem é mantida estável entre os blocos de transmissão, evitando que o modelo precise reassociar falantes e canais a cada novo trecho. O processamento em streaming utiliza dois mecanismos de memória: o Arrival-Order Speaker Cache (AOSC), que preserva informações de falantes de blocos anteriores, e uma fila FIFO, que fornece contexto dos quadros mais recentes. Os rótulos gerados são anônimos, e o mapeamento para identidades reais é responsabilidade de aplicações externas.

O modelo oferece quatro pontos de latência configuráveis. No modo offline, a latência de buffer é de 30,4 segundos, com taxa de erro DER de 12,73% no conjunto DIHARD III e fator de velocidade RTFx de 15.113 vezes em lote de 32 amostras compiladas. Na latência baixa, o buffer cai para 1,04 segundo, com DER de 13,18% e RTFx de 865 vezes. Na latência muito baixa, os números são 0,64 segundo, 13,28% e 579 vezes. Por fim, na latência ultra baixa, o modelo opera com buffer de 0,32 segundo, DER de 13,55% e RTFx de 292 vezes. Esses valores de latência não incluem o tempo de computação, rede e reconhecimento de fala.

Nos resultados publicados no Diarization-Bench da Voice Arena, plataforma colaborativa de comparação de modelos, o Nemotron 3 Diarization ficou em primeiro lugar entre doze sistemas e dezessete configurações avaliadas. O teste cobriu 139 conversas em inglês totalizando cerca de 22 horas, e o modelo alcançou DER de 14,72%, contra 19,3% do segundo colocado, uma redução relativa de aproximadamente 24%. Em comparação com a versão anterior de quatro falantes na latência de 1,04 segundo, o DER diminuiu em todas as oito condições avaliadas, com reduções relativas variando entre 9,0% no CALLHOME-Part2 e 65,2% no NOTSOFAR1 MHM. O vazamento médio entre as condições foi de 41,0%. O throughput também subiu de forma expressiva, chegando a 15.113 vezes o tempo real no modo offline, contra 2.619 vezes da versão anterior.

O treinamento combinou cerca de dez mil horas de conversas reais com 82.611 horas de misturas simuladas com múltiplos falantes. Parte dos dados reais foi licenciada da empresa David AI, e a inclusão desse material reduziu o DER composto de 11,19% para 10,42%. O áudio original usado nas misturas simuladas abrange 21 idiomas. O modelo pode ser instalado por meio do comando pip do Python 3.12 ou superior e carregado a partir do repositório nvidia/Nemotron-3-Diarization. Para obter também a transcrição das palavras, o sistema pode ser combinado com o modelo Parakeet TDT 0.6B v3. O suporte para implantação em produção está disponível nas plataformas Baseten e DigitalOcean, e o uso em dispositivos locais é viabilizado pelo Argmax Pro SDK 3.

O modelo apresenta limitações conhecidas. Gravações com mais de oito falantes podem produzir falhas de detecção ou atribuição incorreta. Ruídos intensos, reverberação e captação à distância também elevam as taxas de erro.

PUBLICIDADE

Leitura recomendada

Comentários

Nenhum comentário ainda. Seja o primeiro a comentar!