SpaceXAI lança Grok Voice Transcribe 2.0, modelo de voz em texto que promete o dobro de precisão por US$ 0,10 a hora
A SpaceXAI anunciou, em 18 de setembro de 2026, o Grok Voice Transcribe 2.0, modelo de conversão de fala em texto com preço inalterado em relação à versão 1.0 e alegada precisão duas vezes maior, enquanto analistas levantam dúvidas sobre os dados usados no treinamento.

20 de setembro de 2026
Imagine transcrever uma reunião em que várias pessoas falam ao mesmo tempo, a ligação está falhando e alguém dita um número de telefone no meio da conversa. É exatamente esse tipo de áudio difícil que a SpaceXAI diz ter resolvido com seu novo modelo de voz. Nesta notícia, explicamos o que foi anunciado, o que é fato e o que é promessa, em linguagem simples.
O que aconteceu
Em 18 de setembro de 2026, a SpaceXAI anunciou o Grok Voice Transcribe 2.0, seu mais novo modelo de speech-to-text (fala para texto, a tecnologia que transforma áudio gravado em texto escrito, como quando um aplicativo escreve automaticamente a fala de alguém). A empresa afirma que o modelo tem o dobro da precisão da versão anterior, a 1.0, no mesmo preço. Essa afirmação é da própria companhia e, portanto, deve ser lida como alegação, não como fato comprovado de forma independente.
Uma observação importante para o leitor: segundo o site daily.dev, a empresa antes se chamava xAI e agora opera como SpaceXAI, após a SpaceX adquiri-la em fevereiro. Já a notícia foi publicada por veículos como o MarkTechPost em 19 de setembro de 2026, um dia depois do anúncio original.
Quanto custa e como usar
De acordo com o daily.dev, o preço é de US$ 0,10 por hora de áudio na modalidade batch (quando você envia um arquivo já gravado e recebe a transcrição depois, como entregar uma fita para alguém passar a limpo) e US$ 0,20 por hora na modalidade streaming (transcrição em tempo real, como um legendista que escreve enquanto a pessoa fala). O preço não mudou em relação à versão 1.0.

O modelo está disponível como uma API hospedada — ou seja, um serviço na internet que os programadores chamam por meio de código, sem precisar instalar nada — sob o identificador grok-voice-transcribe-2.0. A MarkTechPost destaca que a SpaceXAI não anunciou open weights (os arquivos internos do modelo abertos para download), então não é possível hospedá-lo por conta própria.
Por que importar: a precisão em áudio real
Como explica o próprio anúncio, a maioria dos modelos de transcrição funciona bem com áudio limpo, de uma única pessoa. Já o áudio do mundo real é mais difícil: linhas de telefone instáveis, vozes competindo, sotaques regionais e números de telefone ou e-mails ditados em voz alta. A SpaceXAI diz que construiu o 2.0 justamente para essas condições.
Como medida de precisão, usa-se a WER (Word Error Rate, ou taxa de erro de palavras): a porcentagem de palavras transcritas errado. Quanto menor, melhor — é como contar erratas em um texto passado a limpo.
- Segundo a SpaceXAI, o Grok Voice Transcribe 2.0 fica em primeiro lugar em precisão entre 32 modelos de streaming no ranking público da Artificial Analysis.
- Na maior melhora relatada, em comandos curtos em vários idiomas, a taxa de erro caiu de 20,6% para 6,8% em comparação com a versão 1.0.
- Em avaliações internas com quatro conjuntos de dados de tráfego real (ligações de suporte, conversas com o Grok, credenciais faladas e comandos curtos em 19 idiomas), a empresa diz que o novo modelo supera o 1.0 em todos.
Como funciona, em termos simples
O modelo foi construído sobre a mesma base de áudio que alimenta o Grok Voice, que segundo a SpaceXAI já atende dezenas de milhares de chamadas de suporte por dia, transcreve milhões de horas de narração de vídeo e opera o assistente de voz Grok em veículos Tesla. O treinamento usou um conjunto de áudio ao vivo, com ruído e multilíngue, gravado em ambientes variados, depois refinado com post-training (um ajuste extra após o treino inicial, como revisar um rascunho).
Entre os recursos anunciados estão: transcrição em lote e em tempo real; marcas de tempo por palavra; speaker diarization (identificar e rotular quem é quem na conversa, sem custo extra); até 8 canais independentes; até 100 termos próprios por requisição (nomes de produtos ou vocabulário médico); formatação de números, datas e e-mails; remoção de palavras de enchimento como "é" e "ahn"; e detecção do fim da fala para agentes de voz. Para quem já usa a API de versões anteriores, a empresa afirma que a melhora chega sem mudanças no código.
Quem já adotou e o que vem a seguir
A Atlassian, que mantém o Loom — ferramenta muito usada para gravar e compartilhar gravações de tela —, teria trocado seu pipeline de transcrição pelo novo modelo após considerá-lo mais preciso que a solução anterior. O daily.dev informa ainda que a versão 1.0 será descontinuada em poucas semanas, com possibilidade de fixar a versão antiga na API durante a transição. Equipes que usam o modelo devem planejar a migração.
Controvérsias e opiniões
Além dos números, o daily.dev levanta uma questão relevante: os dados de avaliação vêm de tráfego de produção, incluindo usuários lendo em voz alta códigos de conta, telefones e endereços. O anúncio não explica como esses dados de credenciais faladas são coletados, armazenados ou consentidos, o que, segundo o veículo, levanta dúvidas sob as regras europeias de proteção de dados. Essa é uma análise editorial, não uma acusação comprovada.
Na comunidade, a recepção foi mista: 30% das reações positivas, 45% mistas e 25% céticas, com críticas de que recursos como diarização seriam padrão de mercado, não novidade, e ceticismo sobre a metodologia do ranking.
Em resumo: o preço é fato, a liderança no ranking público é verificável, e a precisão "duas vezes maior" continua sendo alegação da fabricante — cabe aos usuários testar com seus próprios áudios.
Fontes
Comentários
Faça login para comentar nesta notícia.
Nenhum comentário ainda. Seja o primeiro!
