Notícia

    Gemini 3.8 Live ganha avatar em vídeo para atendimento em empresas

    O Google apresentou o Gemini 3.8 Live with Live Avatar, recurso que une vídeo em tempo quase real e fala para criar uma persona visual em conversas com clientes. A novidade está disponível apenas no Gemini Enterprise, a versão para organizações.

    Filipe Mendes

    Gemini 3.8 Live ganha avatar em vídeo para atendimento em empresas
    Ilustração gerada por IA

    O Google apresentou em 24 de setembro de 2026 o Gemini 3.8 Live with Live Avatar, recurso que adiciona uma presença visual em vídeo aos modelos de conversa por voz. A novidade chega uma semana depois do lançamento do Gemini 3.8 Live e está disponível apenas no Gemini Enterprise, a versão voltada a organizações. Não se trata, portanto, de um produto para o consumidor final, e sim de uma ferramenta que empresas podem usar em atendimento e em apresentações guiadas. Os registros do anúncio trazem horários diferentes conforme o fuso horário de cada publicação, mas todos apontam o mesmo dia.

    O que é um avatar ao vivo

    Um avatar, aqui, é uma persona virtual: uma figura gerada por computador que aparece em vídeo enquanto conversa. No Live Avatar, esse personagem ouve, vê e fala. Segundo a descrição da empresa, a geração de vídeo em streaming de baixa latência é combinada à fala. Streaming, em termos simples, é o envio contínuo de dados em vez de um arquivo entregue de uma só vez; latência é o atraso entre um pedido e a resposta. Baixa latência significa que a resposta chega quase junto com a pergunta, o que evita aquela pausa incômoda de videoconferências travadas.

    Por que isso importa

    Conversar envolve mais do que palavras. Escutamos, olhamos, falamos e usamos expressões faciais. A empresa afirma que o recurso processa entradas visuais e de áudio ao mesmo tempo, com sincronia labial precisa, expressões naturais e troca de turno fluida. Ou seja, a fala de cada participante termina e a do outro começa sem sobreposição estranha. Na prática, isso pode deixar atendimentos automáticos e visitas guiadas menos mecânicos. Vale separar o que é fato do que é promessa: o lançamento e a disponibilidade são fatos anunciados; a avaliação de que a experiência ficará mais natural é alegação da empresa, que só o uso real permite medir.

    Como funciona, em passos simples

    1. A pessoa fala e aparece para o avatar, que recebe áudio e vídeo.
    2. O sistema interpreta o pedido e decide se precisa buscar informação em outro programa.
    3. Essa busca acontece em segundo plano, enquanto a conversa continua.
    4. A resposta volta como áudio e vídeo, com a boca e as expressões ajustadas ao que está sendo dito.

    O terceiro passo tem nome técnico: execução assíncrona de ferramentas. Assíncrono quer dizer que uma tarefa não precisa terminar para que outra comece. Em vez de pedir que a pessoa espere em silêncio, o avatar dispara a consulta e mantém o diálogo. O exemplo usado é a recepção de um hotel: o hóspede conversa sobre outros assuntos enquanto o sistema faz o check-in, ou seja, o registro de entrada.

    Recepção de hotel com monitor mostrando avatar ao vivo que faz o check-in do hóspede
    O sistema consulta dados em segundo plano enquanto a conversa segue, como no check-in de um hotel.

    Idiomas e identidade visual

    A empresa informa que o Live Avatar faz sincronização de fala para fala. Isso significa que o áudio entra em um idioma e sai em outro, sem conversão intermediária para texto. São 97 idiomas, com troca no meio da conversa, e a alegação é que a qualidade do vídeo não cai nem ocorre desvio visual, aquele desalinhamento em que lábios e fala perdem a correspondência. Organizações podem escolher avatares prontos ou criar os próprios a partir de uma imagem de referência de alta qualidade para combinar com a marca. A criação personalizada é restrita ao uso empresarial.

    Transparência e limites

    Segundo informações divulgadas junto ao anúncio, todo áudio e vídeo gerados recebem marca d'água SynthID, um sinal embutido que permite detectar que o conteúdo foi produzido por inteligência artificial. É um ponto relevante para quem acompanha a discussão sobre conteúdo sintético. Ainda não há, nas informações disponíveis, detalhes sobre preços, volume de uso ou adoção por empresas.

    O que observar daqui para frente

    Uma análise de mercado publicada no mesmo dia observa que anúncios de recursos como esse costumam mexer pouco no valor das ações, a menos que alterem a equação de receita, como um novo canal de cobrança, uma mudança de preço ou um ganho de distribuição. A avaliação é de que o efeito aqui é mais de narrativa do que de números, porque se trata de um recurso acrescentado a uma família de modelos já existente. A mesma análise lembra que a empresa tem histórico de anunciar a capacidade primeiro e detalhar a comercialização depois, normalmente em eventos próprios ou na divulgação de resultados. Para o leitor não técnico, os sinais a acompanhar são simples: se o recurso chegar a mais tipos de plano, se surgirem relatos de uso por empresas e se houver números de adoção.

    A distinção prática, por ora, é esta. Um assistente que responde por texto é uma ferramenta de conversa; um avatar ao vivo é essa mesma conversa com rosto, voz e tempo de resposta coordenados. O ganho depende menos do efeito visual e mais de a conversa não travar quando o sistema precisa consultar dados em outro lugar.

    Fontes

    0 comentários

    Comentários

    Faça login para comentar nesta notícia.

    Nenhum comentário ainda. Seja o primeiro!