O Google DeepMind (abre em nova aba) lançou o EmbeddingGemma 2 em 6 de outubro de 2026. Trata-se de um modelo aberto criado para transformar texto, programação, imagens, áudio e vídeo em representações matemáticas diretamente no aparelho do usuário, sem depender de conexão contínua com servidores externos.
Representações desse tipo funcionam como coordenadas numéricas, chamadas de embeddings, que posicionam conteúdos diferentes em um mesmo mapa conceitual de 768 dimensões. Quando uma foto de cachorro e a palavra escrita correspondente entram no sistema, o modelo gera sequências de números próximas para ambas. Essa proximidade permite que um aplicativo encontre um trecho exato de um podcast ou localize uma cena em um vídeo caseiro usando apenas uma pergunta digitada em texto.
Esse mapa conceitual unificado é operado por uma estrutura modular de 740 milhões de parâmetros baseada na arquitetura Gemma 4. Em inteligência artificial, parâmetros funcionam como pequenos pesos ajustáveis que determinam a capacidade de compreensão da rede. Em vez de obrigar o aparelho a carregar todo o pacote de uma vez, a engenharia do projeto dividiu o sistema em partes independentes. O núcleo voltado apenas para textos e código de programação requer 270 milhões de parâmetros. Caso a tarefa envolva imagens ou sons, módulos opcionais de 170 milhões e 300 milhões de parâmetros podem ser ativados em conjunto.

Os módulos reduzem o consumo de memória de trabalho. Em aparelhos como o Google Pixel 11 Pro, a versão restrita a texto exige cerca de 191 megabytes de memória RAM ativa durante a execução, enquanto o pacote multimodal completo ocupa por volta de 567 megabytes. Ele funciona offline. Ao processar consultas no próprio aparelho, fluxos de trabalho conhecidos como geração aumentada por recuperação (RAG, na sigla em inglês) conseguem ler arquivos locais mantendo os dados protegidos contra tráfego externo de rede.
A proteção local de dados é combinada com uma janela de contexto de 8.192 unidades de leitura, os chamados tokens. Essa capacidade, quatro vezes maior que a da primeira edição do sistema, permite analisar arquivos de áudio de até cinco minutos e meio, 29 fotografias em sequência ou gravações contendo 58 quadros de vídeo em uma única consulta.
O suporte a arquivos longos traz desafios para o espaço de armazenamento de telefones e computadores portáteis. Para conter o crescimento das bases de busca, o projeto adotou a técnica de Aprendizado de Representação Matryoshka. Essa abordagem permite fatiar os vetores de saída de 768 dimensões para tamanhos menores, como 512, 256 ou 128 dimensões, sem que seja necessário treinar a inteligência artificial novamente. De acordo com a documentação publicada no Google AI for Developers (abre em nova aba), a compressão dos vetores possibilita reduzir em até seis vezes o espaço ocupado pelo banco de dados em disco.
A redução de tamanho preserva grande parte da precisão observada nos testes de desempenho. O avanço mais expressivo ocorreu no processamento de linguagem de programação, em que o modelo atingiu 78,68 pontos na avaliação MTEB Code v1, ante 68,76 pontos da versão lançada no ano anterior. O sistema mantém suporte a mais de uma centena de idiomas e superou ferramentas especializadas com o dobro do seu tamanho em medições visuais e sonoras, como os testes MIEB lite e MAEB.
Os arquivos com os pesos do modelo foram distribuídos sob a licença de código aberto Apache 2.0 em plataformas como o Hugging Face (abre em nova aba) e o Kaggle, acompanhados de formatos compatíveis com ferramentas de execução local como llama.cpp e LiteRT. A distribuição livre facilita a adoção por criadores de software que buscam privacidade completa em ferramentas de pesquisa pessoal.
Essa proposta de privacidade repousa na promessa de manter dados sensíveis confinados ao próprio celular. A busca em mídias ricas, no entanto, continua exigindo aparelhos com especificações modernas para suportar o processamento sem lentidão, transferindo a barreira dos custos de nuvem diretamente para os limites físicos do dispositivo que o usuário carrega no bolso.

