Um computador doméstico comum conseguiu gerar texto com a qualidade de um modelo tradicional de 114 milhões de parâmetros gastando apenas uma fração da memória de vídeo habitual. A façanha técnica foi documentada no projeto de código aberto sparse-memory-lm (abre em nova aba), desenvolvido pelo pesquisador independente identificado como re133. Em vez de depender de hardware corporativo de dezenas de milhares de dólares para manter redes neurais inteiras na memória de vídeo, o teste utilizou um modelo de base com apenas 21 milhões de parâmetros conectado a uma gigantesca tabela externa de consulta guardada diretamente em um disco de estado sólido comum do tipo NVMe.
Normalmente, modelos de linguagem convencionais exigem que todos os seus parâmetros fiquem carregados na memória de vídeo da placa gráfica, conhecida como VRAM. Quando uma inteligência artificial cresce para armazenar mais conhecimento sobre o mundo, o consumo dessa memória veloz dispara na mesma proporção. No experimento, a solução adotada foi dividir o trabalho: o raciocínio central permaneceu em uma estrutura compacta no estilo Llama de 21 milhões de parâmetros, enquanto o repertório factual foi transferido para uma memória externa estruturada.
Essa memória externa funciona como uma tabela de consulta que armazena até 16,8 milhões de vetores aprendidos durante o treinamento, o equivalente a cerca de 6,4 bilhões de parâmetros. Para cada palavra ou pedaço de texto gerado, o modelo não lê a tabela inteira. Ele consulta apenas algumas centenas de linhas relevantes por etapa.

A arquitetura utiliza a técnica chamada Product-Key Memory, descrita originalmente no artigo Large Memory Layers with Product Keys (abre em nova aba). O mecanismo funciona como um sistema de índice duplo de biblioteca. Em vez de verificar milhões de registros um por um a cada fração de segundo, o algoritmo combina duas chaves menores para encontrar diretamente a posição exata da informação desejada. Essa abordagem matemática torna a busca exata rápida o suficiente para que os dados possam ser recuperados direto de um SSD NVMe ou da memória RAM convencional do computador, sem travar o processamento da placa gráfica.
O relatório técnico publicado no repositório REPORT.md (abre em nova aba) detalha o desempenho das variações avaliadas. Todos os modelos foram treinados do zero com o mesmo volume de 500 milhões de tokens extraídos da Wikipédia e avaliados nos mesmos artigos de teste. A versão básica de 21 milhões de parâmetros, sem acesso à tabela de suporte, obteve perplexidade de validação de 25,67 na Wikipédia, métrica em que valores menores indicam melhor capacidade de previsão de texto.
Conforme a tabela de consulta foi expandida, os resultados melhoraram progressivamente:
- Modelo B-1M: tabela de 1,05 milhão de entradas (400 milhões de parâmetros), perplexidade de 21,84, equivalente a um modelo denso de 60 milhões de parâmetros.
- Modelo B-4M: tabela de 4,19 milhões de entradas (1,6 bilhão de parâmetros), perplexidade de 20,80, equivalente a um modelo denso de 83 milhões de parâmetros.
- Modelo B-16M: tabela de 16,8 milhões de entradas (6,4 bilhões de parâmetros), perplexidade de 19,96, equivalente a um modelo denso tradicional entre 106 e 123 milhões de parâmetros.
A versão topo de linha B-16M usou cerca de 33 milhões de parâmetros de cálculo ativo por token. Esse arranjo realizou aproximadamente um terço das operações computacionais por token na comparação com o modelo denso convencional equivalente. A taxa de acerto foi mantida enquanto o consumo de VRAM em geração de texto despencou para modestos 0,4 gigabytes em quantização de 4 bits, com a tabela mapeada diretamente do drive NVMe.
A velocidade de geração de texto permaneceu prática para o uso cotidiano. No computador do desenvolvedor equipado com uma placa de vídeo AMD Radeon RX 9070, o sistema produziu entre 114 e 154 tokens por segundo, mantendo cerca de 140 tokens por segundo na versão quantizada.
Essa taxa de transferência foi sustentada por otimizações nos núcleos computacionais do sistema. De acordo com o documento sobre kernels do projeto (abre em nova aba), o autor reescreveu rotinas críticas na linguagem Triton. O mesmo código foi validado sem alterações em hardwares distintos, incluindo chips profissionais AMD Instinct MI350X e aceleradores NVIDIA H100 e H200. Na nuvem, o treinamento completo da maior versão consumiu 25,51 dólares em uma instância H200.
O método apresenta vantagens palpáveis para computação com poucos recursos, mas carrega limites evidentes. O autor tentou acoplar uma dessas tabelas de memória a um modelo pré-treinado existente, o Qwen3.5-0.8B, sem obter ganho superior a um simples ajuste convencional denso. A técnica só exibiu sua capacidade total ao ser ensinada desde o início do treinamento. A expansão de conhecimento torna-se acessível para quem precisa rodar modelos eficientes em hardware modesto, contudo a dependência de treinar arquiteturas personalizadas do zero impede a adaptação imediata dos grandes modelos comerciais já prontos no mercado.

