Muitos usuários e desenvolvedores assumem que sistemas capazes de cruzar múltiplos formatos de mídia exigem servidores colossais na nuvem. A ideia predominante sempre foi a de que relacionar textos, gravações sonoras e gravações em vídeo demanda uma infraestrutura pesada demais para caber no bolso.
O Google (abre em nova aba) apresentou o EmbeddingGemma 2 para confrontar esse pressuposto. Trata-se de um modelo aberto com 740 milhões de parâmetros totais voltado para a criação de embeddings, que funcionam como representações numéricas do significado das coisas. Em vez de depender de servidores remotos para interpretar comandos, a ferramenta roda diretamente em dispositivos do cotidiano, como notebooks e telefones celulares.
Modelos tradicionais costumam analisar apenas termos literais ou se limitam ao texto. No EmbeddingGemma 2, construído sobre a arquitetura do Gemma 4, dados visuais, sonoros e textuais convivem em um único espaço matemático de 768 dimensões. O sistema permite encontrar um trecho de vídeo a partir de uma gravação em áudio ou localizar uma foto com perguntas em linguagem natural, tudo sem enviar os arquivos para fora do dispositivo.

A engenharia interna foi desenhada de forma modular. Nem todas as funções precisam estar ativas ao mesmo tempo. A base para leitura de textos e código de programação carrega 270 milhões de parâmetros. O codificador de visão soma 170 milhões e processa fotos, quadros de vídeos ou páginas em formato PDF. Um componente próprio de áudio acrescenta 300 milhões de parâmetros para decodificar sons e falas brutas.
Essa modularidade enxuga a memória necessária. Em um smartphone Google Pixel 11 Pro com técnicas de compressão de dados, o módulo apenas de texto exige aproximadamente 191 megabytes de memória RAM ativa. Já o pacote completo com suporte a áudio e vídeo ocupa cerca de 567 megabytes. Aparelhos modestos dão conta do recado.
Diante do tamanho reduzido, seria plausível esperar uma queda acentuada na capacidade analítica. Os resultados medidos revelam o oposto. A hipótese de que modelos compactos sacrificam a precisão cai por terra nos testes formais. No indicador MTEB Code, focado em lógica e programação de software, o novo modelo atingiu 78,68 pontos, superando com folga os 68,76 pontos da geração original. Na avaliação com mais de uma centena de línguas diferentes, o índice ficou em 61,36 pontos, empatando tecnicamente com a versão anterior.
A flexibilidade alcança o método chamado de recuperação aumentada por geração, conhecido pelo termo RAG. Essa técnica permite que assistentes virtuais consultem documentos guardados no próprio computador do usuário antes de elaborar uma resposta, preservando o sigilo das informações pessoais. Com a técnica de aprendizado de representações em camadas Matryoshka, os vetores podem ser reduzidos de 768 para 512, 256 ou 128 dimensões. Essa compressão encolhe os custos de armazenamento em bancos de dados em até seis vezes, permitindo buscas ágeis mesmo em discos rígidos com pouco espaço livre.
Os arquivos técnicos foram colocados à disposição no repositório Hugging Face (abre em nova aba), acompanhados por manuais técnicos publicados no portal Google AI for Developers (abre em nova aba). A distribuição utiliza a licença comercial permissiva Apache 2.0, o que garante a programadores e empresas a liberdade de construir produtos comerciais baseados nessa estrutura. Sistemas de inteligência artificial de alta complexidade deixam de ser privilégio exclusivo dos data centers e passam a funcionar isoladamente nas mãos dos usuários.

