Pular para o conteúdo
    Notícia

    Amazon AGI lança ALoDLM: IA de difusão aberta gera texto 2,7 vezes mais rápido

    Pesquisadores da Amazon AGI apresentaram o ALoDLM, modelo aberto de difusão que ajusta o esforço computacional por palavra e supera arquiteturas tradicionais.

    Foto de Leandro Vieira

    Leandro Vieira

    CEO e founder | IA.com.br

    7 de out. de 2026 · 3 min de leitura

    Seguir no Google
    Sequência de prismas de quartzo translúcido sobre bancada óptica de grafite, com blocos límpidos e estruturas intermediárias contendo vórtices luminosos em tons de âmbar e azul sob feixes de luz fria.
    Arquitetura de difusão latente ajusta o esforço computacional em etapas seletivas para acelerar o processamento de texto.

    "Modelos de difusão de linguagem permitem geração rápida ao prever múltiplos tokens em paralelo, mas sua adoção prática continuava limitada por uma persistente defasagem de qualidade em relação a modelos autorregressivos de tamanho similar."

    A observação dos pesquisadores Zhuowei Li, Liancheng Fang e colegas da equipe de inteligência artificial da Amazon AGI (abre em nova aba) resume o problema central que motivou a criação do ALoDLM (Adaptively Looped Diffusion Language Models). Documentado em artigo no repositório arXiv (abre em nova aba), o trabalho propõe uma mudança na mecânica de geração de texto em inteligência artificial. Em vez de prever uma palavra após a outra em fila indiana, o sistema elabora sentenças inteiras simultaneamente, dosando o tempo de processamento de acordo com a dificuldade de cada trecho.

    A imensa maioria dos assistentes de texto atuais funciona de maneira autorregressiva: o modelo calcula um token (termo técnico para um pedaço de palavra ou caractere) de cada vez, sempre consultando o que acabou de escrever. Essa abordagem gera respostas coerentes, mas exige que o computador execute uma nova passagem completa de processamento para cada novo elemento gerado. Modelos de difusão tentam cortar esse caminho prevendo vários tokens ao mesmo tempo. O obstáculo histórico dessa alternativa residia na rigidez matemática. Por que gastar a mesma energia mental em uma vírgula óbvia e em uma dedução lógica complexa? Sistemas de difusão anteriores aplicavam exatamente o mesmo volume de cálculo a todas as posições desconhecidas da frase.

    Bancada técnica de laboratório com osciloscópios exibindo ondas de tensão elétrica, cabos trançados e dissipadores de alumínio sob iluminação âmbar e azul.
    Monitoramento de sinais e fluxo de carga em bancada de engenharia computacional de alta precisão.

    O ALoDLM introduz a chamada recorrência latente adaptativa para eliminar essa limitação. O modelo reaproveita as mesmas camadas internas de cálculo em sucessivos ciclos de refinamento. Tokens fáceis e previsíveis atingem certeza rapidamente e são consolidados como contexto definitivo do texto. Já as palavras difíceis continuam retidas em estado latente por ciclos adicionais, como rascunhos que recebem mais camadas de tinta antes de irem para a folha final. O equilíbrio entre acertar a palavra e calcular apenas o tempo necessário foi calibrado de forma conjunta por meio de uma formulação matemática chamada limite inferior da evidência negativa condicional (NELBO).

    Testes controlados mediram o impacto desse mecanismo em duas escalas de tamanho, com 1,7 bilhão e 8 bilhões de parâmetros, treinadas sobre a base Qwen3 com um volume de 5 bilhões de tokens. As avaliações englobaram onze conjuntos padronizados de tarefas, reunindo testes de exatidão em linguagem comum e execução direta de código de programação.

    ModeloTipo de arquiteturaEscala 1.7B (média %)Escala 8B (média %)
    Qwen3Autorregressivo tradicional63,878,5
    SDAR / WeDLMDifusão convencional61,075,1
    ALoDLMDifusão adaptativa em loop65,580,3

    80,3% de média foi a marca cravada pelo ALoDLM na escala de 8 bilhões de parâmetros nas onze tarefas analisadas. No teste de raciocínio matemático GSM8K, a variante atingiu 94,2% de acerto, acompanhada de 87,8% na avaliação de programação HumanEval. O desempenho situa a versão de 8 bilhões como o maior modelo de linguagem por difusão em loop avaliado na literatura recente.

    A elevação de precisão manteve o ganho de velocidade típico da difusão paralela. Medições de fluxo contínuo em uma placa gráfica NVIDIA B200 para a resolução de problemas do conjunto GSM8K indicaram que o ALoDLM-8B alcançou taxa de geração cerca de 2,7 vezes superior à do Qwen3-8B executado sobre o motor de inferência vLLM.

    Os recursos completos do projeto foram disponibilizados publicamente para a comunidade científica. A equipe publicou o código de pesquisa e os motores de inferência otimizada no GitHub (abre em nova aba). Os parâmetros treinados das versões de 1,7 bilhão e 8 bilhões de parâmetros podem ser baixados no Hugging Face (abre em nova aba), sob os termos da licença Creative Commons Attribution-NonCommercial 4.0 (CC BY-NC 4.0), que restringe o uso a pesquisas não comerciais.

    Foto de Leandro Vieira

    Leandro Vieira

    CEO e founder | IA.com.br

    Ver perfil completo