Pular para o conteúdo
    Notícia

    Tencent lança Prism para gerar vídeo e áudio sincronizados em 2K

    Estrutura aberta desenvolvida pela Tencent Hunyuan e universidades parceiras reduz custos de computação e acelera a criação multimídia.

    Foto de Leandro Vieira

    Leandro Vieira

    CEO e founder | IA.com.br

    6 de out. de 2026 · 3 min de leitura

    Equipamento de captação audiovisual com microfone shotgun direcional acoplado a uma câmera cinematográfica com lente de foco manual, posicionados em ambiente acústico iluminado para gravação simultânea de som e imagem
    Captura sincronizada de alta fidelidade: o alinhamento preciso entre dinâmicas sonoras e movimento visual é a base da nova estrutura da Tencent para processamento em 2K.

    2,5 vezes: essa é a aceleração no ritmo de treinamento obtida pelo Prism (abre em nova aba), uma nova arquitetura voltada para a geração conjunta de vídeo e som em alta definição. O método foi concebido pela equipe do Tencent Hunyuan em parceria com pesquisadores da Universidade Fudan e da Universidade de Zhejiang.

    Em modelos convencionais de inteligência artificial, ensinar um sistema a criar imagens em movimento junto com seus respectivos sons costuma exigir um volume imenso de cálculos. Quando a resolução visual sobe para 2K (2560×1440 pixels), o mecanismo tradicional de atenção plena tenta calcular a correlação entre cada pequeno pedaço de imagem e áudio com todos os outros pedaços existentes. Esse processo espalha o processamento sobre áreas repetitivas, enfraquece o aprendizado de detalhes importantes e torna o custo de treinamento proibitivo.

    Antes de aplicar qualquer regra uniforme de processamento, o Prism avalia as particularidades de cada cena. A estrutura organiza a sequência de informações em macrozonas no espaço e no tempo, adaptando a atenção ao conteúdo local.

    Como funciona a atenção esparsa dinâmica

    Modelos de difusão processam arquivos dividindo o conteúdo em pequenas unidades chamadas tokens, que funcionam como peças de um mosaico visual e sonoro. A atenção esparsa atua selecionando apenas as combinações de peças que realmente influenciam o resultado final, dispensando as conexões irrelevantes.

    O som guia.

    Para definir onde concentrar o esforço, o Prism mede a variação interna dos dados visuais ao longo dos canais e calcula as normas de atenção cruzada entre áudio e vídeo. Essa leitura identifica a direção em que a imagem se altera e revela com que intensidade o som está associado a cada região da tela.

    A sincronia importa.

    Com base nesses indicadores, o sistema divide cada macrozona em blocos com formatos adaptados. Regiões com mudanças visuais rápidas ou com forte ligação ao áudio recebem uma divisão mais detalhada. Um objeto que emite ruído ao cair, por exemplo, concentra maior densidade de cálculo ao redor da colisão, enquanto áreas homogêneas e silenciosas de fundo demandam blocos mais amplos. Uma estratégia híbrida escolhe dinamicamente quais blocos devem interagir em cada consulta matemática.

    Câmera de cinema em trilho e microfone direcional montado em haste suspensa apontados para uma superfície de madeira onde uma peça de cerâmica atinge o chão, em estúdio com fundo claro e painéis acústicos neutros.
    Captação física de movimentos de impacto e áudio síncrono em estúdio reflete a lógica de segmentação por áreas de alta densidade visual e sonora.

    Resolução nativa e capacidades técnicas

    Pesquisadores do projeto submeteram o relatório técnico (abre em nova aba) em 4 de outubro de 2026, documentando que o modelo suporta o treinamento nativo direto em resoluções que escalam de 480p, 720p e 1080p (1920×1080) até 2K (2560×1440).

    A avaliação experimental comparou o método contra sistemas de difusão densos e outras abordagens de aceleração. Em testes de ablação técnica, o Prism foi contrastado com variações como SVG-2, Sol-Attn, Full Attn, SSTA, VMoBA, SpargeAttn2, MOVA, UltraGen, PyramidFlow, T3 e LUVE. A equipe também avaliou resultados visuais diante de referências do setor, como Ovi, LTX-2.3, MOVA, MagiHuman, Kling3, MinMaxH3, Wan3.0 e Seedance-2.5.

    CaracterísticaAtenção Plena TradicionalArquitetura Prism
    Resolução nativa conjuntaCustos quadráticos limitantesSuporte nativo até 2K (2560×1440)
    Estrutura de blocosFixa e uniformeZonas dinâmicas moldadas por áudio e vídeo
    Velocidade de treinoPadrão de referência (1,0×)Aceleração de 2,5×
    Aproveitamento de sinaisDiluição em áreas redundantesFoco guiado em regiões geradoras de som

    Mesmo com um consumo computacional inferior, o treinamento resultou em qualidade visual e dinâmica de movimento superiores às do método denso integral.

    Disponibilidade do código

    O lançamento do código ocorreu no repositório no GitHub (abre em nova aba), mantido pela divisão de modelos de fundação Tencent Hunyuan e atualizado em 6 de outubro de 2026. O pacote de distribuição pública inclui:

    • O código-fonte completo para treinamento e inferência.
    • O relatório técnico detalhado com a formulação matemática.
    • A página oficial do projeto com demonstrações sintetizadas em 2K.
    • Um ponto de verificação prévio (checkpoint) para testes do modelo.

    Ao transformar o cálculo bruto em um processo seletivo guiado pela relação entre imagem e som, o projeto demonstra a viabilidade de treinar modelos audiovisuais em resolução 2K mantendo a aceleração de 2,5 vezes observada no início dos experimentos.

    Foto de Leandro Vieira

    Leandro Vieira

    CEO e founder | IA.com.br

    Ver perfil completo