2,5 vezes: essa é a aceleração no ritmo de treinamento obtida pelo Prism (abre em nova aba), uma nova arquitetura voltada para a geração conjunta de vídeo e som em alta definição. O método foi concebido pela equipe do Tencent Hunyuan em parceria com pesquisadores da Universidade Fudan e da Universidade de Zhejiang.
Em modelos convencionais de inteligência artificial, ensinar um sistema a criar imagens em movimento junto com seus respectivos sons costuma exigir um volume imenso de cálculos. Quando a resolução visual sobe para 2K (2560×1440 pixels), o mecanismo tradicional de atenção plena tenta calcular a correlação entre cada pequeno pedaço de imagem e áudio com todos os outros pedaços existentes. Esse processo espalha o processamento sobre áreas repetitivas, enfraquece o aprendizado de detalhes importantes e torna o custo de treinamento proibitivo.
Antes de aplicar qualquer regra uniforme de processamento, o Prism avalia as particularidades de cada cena. A estrutura organiza a sequência de informações em macrozonas no espaço e no tempo, adaptando a atenção ao conteúdo local.
Como funciona a atenção esparsa dinâmica
Modelos de difusão processam arquivos dividindo o conteúdo em pequenas unidades chamadas tokens, que funcionam como peças de um mosaico visual e sonoro. A atenção esparsa atua selecionando apenas as combinações de peças que realmente influenciam o resultado final, dispensando as conexões irrelevantes.
O som guia.
Para definir onde concentrar o esforço, o Prism mede a variação interna dos dados visuais ao longo dos canais e calcula as normas de atenção cruzada entre áudio e vídeo. Essa leitura identifica a direção em que a imagem se altera e revela com que intensidade o som está associado a cada região da tela.
A sincronia importa.
Com base nesses indicadores, o sistema divide cada macrozona em blocos com formatos adaptados. Regiões com mudanças visuais rápidas ou com forte ligação ao áudio recebem uma divisão mais detalhada. Um objeto que emite ruído ao cair, por exemplo, concentra maior densidade de cálculo ao redor da colisão, enquanto áreas homogêneas e silenciosas de fundo demandam blocos mais amplos. Uma estratégia híbrida escolhe dinamicamente quais blocos devem interagir em cada consulta matemática.

Resolução nativa e capacidades técnicas
Pesquisadores do projeto submeteram o relatório técnico (abre em nova aba) em 4 de outubro de 2026, documentando que o modelo suporta o treinamento nativo direto em resoluções que escalam de 480p, 720p e 1080p (1920×1080) até 2K (2560×1440).
A avaliação experimental comparou o método contra sistemas de difusão densos e outras abordagens de aceleração. Em testes de ablação técnica, o Prism foi contrastado com variações como SVG-2, Sol-Attn, Full Attn, SSTA, VMoBA, SpargeAttn2, MOVA, UltraGen, PyramidFlow, T3 e LUVE. A equipe também avaliou resultados visuais diante de referências do setor, como Ovi, LTX-2.3, MOVA, MagiHuman, Kling3, MinMaxH3, Wan3.0 e Seedance-2.5.
| Característica | Atenção Plena Tradicional | Arquitetura Prism |
|---|---|---|
| Resolução nativa conjunta | Custos quadráticos limitantes | Suporte nativo até 2K (2560×1440) |
| Estrutura de blocos | Fixa e uniforme | Zonas dinâmicas moldadas por áudio e vídeo |
| Velocidade de treino | Padrão de referência (1,0×) | Aceleração de 2,5× |
| Aproveitamento de sinais | Diluição em áreas redundantes | Foco guiado em regiões geradoras de som |
Mesmo com um consumo computacional inferior, o treinamento resultou em qualidade visual e dinâmica de movimento superiores às do método denso integral.
Disponibilidade do código
O lançamento do código ocorreu no repositório no GitHub (abre em nova aba), mantido pela divisão de modelos de fundação Tencent Hunyuan e atualizado em 6 de outubro de 2026. O pacote de distribuição pública inclui:
- O código-fonte completo para treinamento e inferência.
- O relatório técnico detalhado com a formulação matemática.
- A página oficial do projeto com demonstrações sintetizadas em 2K.
- Um ponto de verificação prévio (checkpoint) para testes do modelo.
Ao transformar o cálculo bruto em um processo seletivo guiado pela relação entre imagem e som, o projeto demonstra a viabilidade de treinar modelos audiovisuais em resolução 2K mantendo a aceleração de 2,5 vezes observada no início dos experimentos.

