ia.com.bria.com.br

    SpaceXAI lança Grok Voice Transcribe 2.0, modelo de voz em texto que promete o dobro de precisão por US$ 0,10 a hora

    A SpaceXAI anunciou, em 18 de setembro de 2026, o Grok Voice Transcribe 2.0, modelo de conversão de fala em texto com preço inalterado em relação à versão 1.0 e alegada precisão duas vezes maior, enquanto analistas levantam dúvidas sobre os dados usados no treinamento.

    SpaceXAI lança Grok Voice Transcribe 2.0, modelo de voz em texto que promete o dobro de precisão por US$ 0,10 a hora
    Filipe Mendes

    20 de setembro de 2026

    Imagine transcrever uma reunião em que várias pessoas falam ao mesmo tempo, a ligação está falhando e alguém dita um número de telefone no meio da conversa. É exatamente esse tipo de áudio difícil que a SpaceXAI diz ter resolvido com seu novo modelo de voz. Nesta notícia, explicamos o que foi anunciado, o que é fato e o que é promessa, em linguagem simples.

    O que aconteceu

    Em 18 de setembro de 2026, a SpaceXAI anunciou o Grok Voice Transcribe 2.0, seu mais novo modelo de speech-to-text (fala para texto, a tecnologia que transforma áudio gravado em texto escrito, como quando um aplicativo escreve automaticamente a fala de alguém). A empresa afirma que o modelo tem o dobro da precisão da versão anterior, a 1.0, no mesmo preço. Essa afirmação é da própria companhia e, portanto, deve ser lida como alegação, não como fato comprovado de forma independente.

    Uma observação importante para o leitor: segundo o site daily.dev, a empresa antes se chamava xAI e agora opera como SpaceXAI, após a SpaceX adquiri-la em fevereiro. Já a notícia foi publicada por veículos como o MarkTechPost em 19 de setembro de 2026, um dia depois do anúncio original.

    Quanto custa e como usar

    De acordo com o daily.dev, o preço é de US$ 0,10 por hora de áudio na modalidade batch (quando você envia um arquivo já gravado e recebe a transcrição depois, como entregar uma fita para alguém passar a limpo) e US$ 0,20 por hora na modalidade streaming (transcrição em tempo real, como um legendista que escreve enquanto a pessoa fala). O preço não mudou em relação à versão 1.0.

    Atendente falando ao telefone em ambiente ruidoso de call center
    Ligações de suporte com linha instável e vozes competindo são o teste real para modelos de transcrição.

    O modelo está disponível como uma API hospedada — ou seja, um serviço na internet que os programadores chamam por meio de código, sem precisar instalar nada — sob o identificador grok-voice-transcribe-2.0. A MarkTechPost destaca que a SpaceXAI não anunciou open weights (os arquivos internos do modelo abertos para download), então não é possível hospedá-lo por conta própria.

    Por que importar: a precisão em áudio real

    Como explica o próprio anúncio, a maioria dos modelos de transcrição funciona bem com áudio limpo, de uma única pessoa. Já o áudio do mundo real é mais difícil: linhas de telefone instáveis, vozes competindo, sotaques regionais e números de telefone ou e-mails ditados em voz alta. A SpaceXAI diz que construiu o 2.0 justamente para essas condições.

    Como medida de precisão, usa-se a WER (Word Error Rate, ou taxa de erro de palavras): a porcentagem de palavras transcritas errado. Quanto menor, melhor — é como contar erratas em um texto passado a limpo.

    • Segundo a SpaceXAI, o Grok Voice Transcribe 2.0 fica em primeiro lugar em precisão entre 32 modelos de streaming no ranking público da Artificial Analysis.
    • Na maior melhora relatada, em comandos curtos em vários idiomas, a taxa de erro caiu de 20,6% para 6,8% em comparação com a versão 1.0.
    • Em avaliações internas com quatro conjuntos de dados de tráfego real (ligações de suporte, conversas com o Grok, credenciais faladas e comandos curtos em 19 idiomas), a empresa diz que o novo modelo supera o 1.0 em todos.

    Como funciona, em termos simples

    O modelo foi construído sobre a mesma base de áudio que alimenta o Grok Voice, que segundo a SpaceXAI já atende dezenas de milhares de chamadas de suporte por dia, transcreve milhões de horas de narração de vídeo e opera o assistente de voz Grok em veículos Tesla. O treinamento usou um conjunto de áudio ao vivo, com ruído e multilíngue, gravado em ambientes variados, depois refinado com post-training (um ajuste extra após o treino inicial, como revisar um rascunho).

    Entre os recursos anunciados estão: transcrição em lote e em tempo real; marcas de tempo por palavra; speaker diarization (identificar e rotular quem é quem na conversa, sem custo extra); até 8 canais independentes; até 100 termos próprios por requisição (nomes de produtos ou vocabulário médico); formatação de números, datas e e-mails; remoção de palavras de enchimento como "é" e "ahn"; e detecção do fim da fala para agentes de voz. Para quem já usa a API de versões anteriores, a empresa afirma que a melhora chega sem mudanças no código.

    Quem já adotou e o que vem a seguir

    A Atlassian, que mantém o Loom — ferramenta muito usada para gravar e compartilhar gravações de tela —, teria trocado seu pipeline de transcrição pelo novo modelo após considerá-lo mais preciso que a solução anterior. O daily.dev informa ainda que a versão 1.0 será descontinuada em poucas semanas, com possibilidade de fixar a versão antiga na API durante a transição. Equipes que usam o modelo devem planejar a migração.

    Controvérsias e opiniões

    Além dos números, o daily.dev levanta uma questão relevante: os dados de avaliação vêm de tráfego de produção, incluindo usuários lendo em voz alta códigos de conta, telefones e endereços. O anúncio não explica como esses dados de credenciais faladas são coletados, armazenados ou consentidos, o que, segundo o veículo, levanta dúvidas sob as regras europeias de proteção de dados. Essa é uma análise editorial, não uma acusação comprovada.

    Na comunidade, a recepção foi mista: 30% das reações positivas, 45% mistas e 25% céticas, com críticas de que recursos como diarização seriam padrão de mercado, não novidade, e ceticismo sobre a metodologia do ranking.

    Em resumo: o preço é fato, a liderança no ranking público é verificável, e a precisão "duas vezes maior" continua sendo alegação da fabricante — cabe aos usuários testar com seus próprios áudios.

    Fontes

    0 comentários

    Comentários

    Faça login para comentar nesta notícia.

    Nenhum comentário ainda. Seja o primeiro!