A Google DeepMind lançou o EmbeddingGemma 2 (abre em nova aba), um modelo de inteligência artificial aberto criado para transformar diferentes formatos de mídia em uma representação matemática comum. O sistema tem 740 milhões de parâmetros e foi projetado para operar diretamente em aparelhos do cotidiano, como celulares e computadores pessoais, sem depender do envio constante de dados para servidores externos.
Parâmetros funcionam como a estrutura interna de pesos que define a capacidade de aprendizado do modelo. Modelos de representação vetorial, conhecidos na área de inteligência artificial como modelos de embeddings, não geram respostas em texto corrido como assistentes convencionais. O objetivo dessa tecnologia é traduzir informações em listas de números chamadas de vetores. Quando dois conteúdos têm significados semelhantes, seus números ficam próximos em um espaço matemático compartilhado de 768 dimensões.
O novo modelo faz essa aproximação de forma nativa para cinco formatos diferentes: textos, linhas de programação, imagens, vídeos e arquivos de áudio. Isso permite realizar buscas cruzadas entre mídias variadas, como localizar um trecho de vídeo por meio de uma gravação de voz ou encontrar áudios a partir de uma consulta em texto comum.

A estrutura do modelo utiliza a arquitetura Gemma 4 e adota um formato modular. Em vez de carregar todos os componentes de uma vez na memória, o sistema permite que desenvolvedores selecionem apenas as funções necessárias para cada aplicativo.
| Componente modular | Quantidade de parâmetros | Função principal |
|---|---|---|
| Base de texto e código | 270 milhões | Processa linguagem escrita e programação |
| Codificador de visão | 170 milhões | Analisa imagens estáticas e quadros de vídeo |
| Codificador de áudio | 300 milhões | Reconhece gravações de voz e sons |
Essa divisão reduz o consumo de memória em aparelhos móveis. Com o uso de quantização, técnica que simplifica a precisão matemática dos dados para deixá-los mais leves, o modelo exige cerca de 191 megabytes de memória RAM ativa para funcionar apenas com texto em um aparelho Google Pixel 11 Pro. Caso o aplicativo precise processar todas as mídias simultaneamente, o consumo fica em torno de 567 megabytes.
Para diminuir custos de armazenamento, o sistema inclui um recurso chamado Matryoshka Representation Learning. Inspirada nas bonecas russas que se encaixam umas dentro das outras, a técnica possibilita encurtar os vetores gerados pelo modelo de 768 dimensões para tamanhos menores, como 512, 256 ou 128 dimensões. A redução pode diminuir o espaço ocupado em bancos de dados em até seis vezes, permitindo escolher entre máxima fidelidade ou economia de armazenamento conforme a capacidade do dispositivo.
Em capacidade de leitura, o modelo quadruplicou o limite de processamento em relação ao antecessor. A janela de contexto agora suporta 8.192 tokens, unidade básica que divide palavras e símbolos digitais. Esse volume permite analisar textos longos em mais de 100 idiomas ou carregar até 5,5 minutos de áudio contínuo, 29 imagens ou 58 quadros de vídeo de uma só vez.
Na interpretação de código de software, a avaliação no teste de referência MTEB Code registrou um avanço de 9,92 pontos, saltando de 68,76 na primeira versão da ferramenta para 78,68 no modelo atual, o que representa uma melhoria de cerca de 14%.
A distribuição foi feita sob a licença de código aberto Apache 2.0, formato permissivo que autoriza o uso gratuito inclusive em projetos comerciais. Os arquivos de pesos do modelo foram publicados nas plataformas Hugging Face (abre em nova aba) e Kaggle, acompanhados de adaptações para ferramentas de execução local como Ollama, llama.cpp e LiteRT.

