Notícia

    Nvidia lança modelo de inteligência artificial para identificar até oito vozes simultâneas

    O Nemotron-3 Diarization possui 100 milhões de parâmetros e organiza falas individuais em tempo real sob licença aberta.

    Leandro Vieira

    CEO e founder | IA.com.br

    · 4 min de leitura

    Pessoas reunidas ao redor de uma mesa de conferência clara com microfones direcionais, conversando durante uma reunião de negócios em ambiente corporativo iluminado.
    Reuniões com múltiplos participantes exigem sistemas avançados de diarização para distinguir e transcrever cada voz individualmente.

    A Nvidia lançou em 23 de setembro de 2026 o Nemotron-3 Diarization (abre em nova aba), um modelo de inteligência artificial com pesos abertos voltado a responder uma pergunta comum em conversas: quem falou em qual momento. Embora a data oficial de lançamento seja 23 de setembro, detalhes e análises adicionais foram publicados nos dias 24 e 27 de setembro de 2026. A ferramenta é gratuita para uso comercial e pessoal e consegue distinguir até oito vozes diferentes, mesmo quando as pessoas falam por cima umas das outras.

    O processo de separar quem está falando em uma gravação recebe o nome técnico de diarização de áudio. É como se a tecnologia atuasse como um secretário em uma reunião movimentada: em vez de apenas ouvir o som como um bloco único, o modelo coloca uma etiqueta em cada participante para registrar o instante exato em que cada voz começou e terminou.

    Mesa de estúdio com microfone profissional, fones de ouvido e monitor exibindo múltiplas faixas de ondas sonoras coloridas em ambiente de produção de áudio.
    Processamento e separação de múltiplas faixas de áudio em ambiente de produção digital.

    Na ocasião do anúncio oficial em 23 de setembro de 2026, a equipe da Nvidia AI destacou nas redes sociais o objetivo de organizar conversas caóticas:

    Quando várias pessoas falam ao mesmo tempo, uma transcrição pode ficar confusa rapidamente. Nosso novo modelo Nemotron 3 Diarization rastreia quem falou quando, mesmo quando as vozes se sobrepõem. Ele lida com até oito falantes, tem 100M de parâmetros e já está disponível no @huggingface 🤗

    — NVIDIA AI (@NVIDIAAI), 23 de set. de 2026, no X

    Como a tecnologia funciona

    Para entender o modelo, pense em uma fila de atendimento onde cada novo visitante recebe um crachá de identificação de acordo com a ordem de chegada. O Nemotron-3 Diarization faz algo semelhante com o som. Baseado na arquitetura Sortformer, ele organiza os canais de resposta conforme as vozes aparecem no áudio.

    O sistema recebe áudio monofônico gravado a 16 kHz e calcula as probabilidades de fala a cada 10 milissegundos. Para que o modelo não se perca quando alguém faz uma pausa ou é interrompido, ele adota dois componentes especiais herdados do Streaming Sortformer:

    • Arrival-Order Speaker Cache (AOSC): uma memória temporária que guarda a identidade da voz entre os blocos de áudio.
    • Fila FIFO: uma estrutura de dados de entrada e saída rápida que mantém o contexto sonoro recente para que o mesmo participante não receba um crachá diferente ao voltar a falar.

    Graças a esse processamento em pedaços contínuos, as gravações longas não têm limite fixo de duração.

    Desempenho e precisão

    Na avaliação Diarization-Bench da plataforma VoiceArena, com 139 conversas em inglês totalizando cerca de 22 horas, o Nemotron-3 alcançou o primeiro lugar entre 12 sistemas testados. A métrica padrão do setor é a Taxa de Erro de Diarização (conhecida pela sigla DER, onde pontuações menores indicam melhor desempenho).

    Cenário de TesteTaxa de Erro (DER)Observações
    VoiceArena Diarization-Bench14,72%Primeiro lugar (o segundo melhor sistema obteve 19,3%)
    Teste DIHARD III (1 a 4 falantes)9,13%Alta precisão com poucos participantes
    Teste DIHARD III (5 a 9 falantes)27,58%Aumento de erros com grupos maiores
    Transmissão ao vivo (buffer de 0,32 s)13,55%Modo em tempo real
    Modo offline (buffer de 30,4 s)12,73%Processamento após a gravação

    Em oito cenários avaliados com intervalo de 1,04 segundo, o novo sistema reduziu a taxa de erro em uma média de 41% em comparação direta com o seu antecessor, o Streaming Sortformer. A precisão, no entanto, pode cair diante de ruído de fundo excessivo, reverberação no ambiente ou grupos muito numerosos.

    Vantagens do tamanho compacto e requisitos

    O Nemotron-3 Diarization foi projetado com 99,2 milhões de parâmetros (aproximadamente 100 milhões). Em inteligência artificial, parâmetros são como as engrenagens internas de um mecanismo: modelos com bilhões de engrenagens exigem computadores gigantescos, enquanto modelos compactos rodam com agilidade surpreendente.

    Com esse tamanho reduzido, o modelo atinge velocidade até 15.113 vezes superior ao tempo real em processamento em lote de 32 itens em uma placa gráfica moderna. Ele exige o sistema operacional Linux e opera por meio da biblioteca NVIDIA NeMo, sendo compatível com placas de arquitetura Ampere, Ada Lovelace, Hopper ou Blackwell.

    O modelo permite configurar o atraso de resposta (chamado de latência do buffer) em quatro níveis recomendados:

    1. 30,4 segundos: voltado para arquivos salvos e trabalhos em lote offline.
    2. 1,04 segundo: equilíbrio intermediário de processamento.
    3. 0,64 segundo: transmissão acelerada.
    4. 0,32 segundo: recomendação oficial para legendagem e transmissões ao vivo. Em casos críticos de baixa latência, o sistema suporta entradas a partir de 80 milissegundos.

    Licença e casos de uso no dia a dia

    Os pesos da tecnologia estão publicados na plataforma Hugging Face sob os termos da licença OpenMDW 1.1, que autoriza formalmente a exploração comercial e o uso em projetos de código aberto.

    Na prática, o modelo não identifica nomes de pessoas por conta própria; ele apenas rotula os participantes como vozes anônimas, a exemplo de "falante 1" ou "falante 2". Quando integrado a sistemas de reconhecimento de voz, como o Parakeet, ele viabiliza a criação de transcrições completas para chamadas de vídeo, reuniões corporativas e geração de legendas em tempo real com indicação precisa de quem está falando.

    0 comentários

    Comentários

    Faça login para comentar nesta notícia.

    Nenhum comentário ainda. Seja o primeiro!