Pular para o conteúdo
    Artigo

    Por que o caso Thomson Reuters v. ROSS derrubou o fair use no treino de IA

    O 3º Circuito dos EUA rejeitou a tese de fair use para IA de busca jurídica concorrente treinada em headnotes da Westlaw, redefinindo riscos de dados técnicos.

    Filipe Mendes

    6 de out. de 2026 · 5 min de leitura

    Compêndios jurídicos abertos sobre escrivaninha de madeira em biblioteca clássica, exibindo notas analíticas em páginas densas ao lado de caderno com anotações manuais.
    Volumes de jurisprudência anotados ilustram o valor editorial dos sumários analíticos no centro da disputa sobre direitos autorais e treino de modelos.

    O Tribunal de Apelações do 3º Circuito dos Estados Unidos decidiu que o treinamento de um sistema de busca jurídica baseado em inteligência artificial utilizando resumos editoriais protegidos da Thomson Reuters não constitui fair use (uso justo). A decisão unânime, redigida pela juíza Tamika Montgomery-Reeves, manteve a sentença sumária de primeira instância contra a falida ROSS Intelligence (abre em nova aba). Foi a primeira vez que uma corte federal de apelações norte-americana julgou o mérito do uso justo aplicado diretamente à ingestão de dados para treinamento de modelos de aprendizado de máquina.

    Para engenheiros de dados e desenvolvedores de aprendizado supervisionado, a análise judicial disseca a anatomia da extração de dados proprietários voltada a criar substitutos comerciais. A tese amplamente difundida no ecossistema técnico de que qualquer processamento intermediário de dados para ajuste de pesos computacionais gera transformação suficiente ruiu diante das particularidades da arquitetura da ROSS.

    O litígio girou em torno de 2.243 headnotes da base Westlaw, da Thomson Reuters. Headnotes são sumários analíticos concisos de pontos de direito redigidos por editores jurídicos e indexados a decisões judiciais públicas. Enquanto os despachos dos juízes pertencem ao domínio público, as sínteses editoriais contêm seleção, estrutura e redação protegidas pela lei de direitos autorais. Após ter o acesso negado à plataforma Westlaw, a ROSS contratou uma intermediária, a LegalEase Solutions, encarregada de redigir cerca de 25.000 memorandos jurídicos com perguntas e respostas. Os redatores dessa prestadora utilizaram os sumários editoriais da Westlaw quase linha por linha para formular as perguntas que balizariam o conjunto de dados de ajuste fino do motor de busca.

    Volume jurídico aberto sobre mesa de madeira escura ao lado de folhas com sumários anotados à tinta e uma caneta-tinteiro clássica em biblioteca jurídica
    Compêndios de jurisprudência e sumários analíticos anotados em biblioteca jurídica, refletindo a disputa sobre a proteção autoral de resumos editoriais.

    A engenharia reversa do conjunto de dados foi evidente. O tribunal distrital de Delaware verificou que o texto dos memorandos reproduzia os headnotes com tanta proximidade que nenhum corpo de jurados razoável descartaria a cópia literal.

    A ausência de caráter transformativo

    A defesa de fair use sob a legislação norte-americana depende de quatro fatores estatutários. O primeiro fator analisa o propósito e o caráter do uso. A ROSS sustentava que converter anotações textuais em vetores ou dados de treinamento para busca semântica constituía um propósito transformativo revolucionário, modernizando a pesquisa jurídica.

    O 3º Circuito rejeitou essa interpretação funcionalista. O tribunal apontou que tanto a Thomson Reuters quanto a ROSS utilizavam os mesmos textos editoriais para o mesmo fim primário: organizar materiais judiciais para responder a consultas de usuários. O motor da ROSS não adicionou comentários críticos, paródia ou nova perspectiva expressiva sobre as notas. Em vez disso, utilizou o investimento intelectual alheio como um atalho de engenharia para indexar e mapear relevância semântica.

    Existe uma tensão evidente entre duas leituras técnicas possíveis deste desfecho. Uma corrente enxerga a decisão como uma barreira rígida contra a extração de dados brutos para construir modelos verticais concorrentes. Outra interpreta o caso como uma condenação restrita ao método desajeitado da ROSS, que copiou material estritamente editorial para replicar uma ferramenta do mesmo nicho de mercado.

    A distinção arquitetural pesou fortemente. O produto da ROSS não utilizava inteligência artificial generativa. A aplicação não sintetizava prosa nova nem produzia raciocínio inédito; seu algoritmo de recuperação devolvia exclusivamente passagens de decisões judiciais pré-existentes. O 3º Circuito pontuou expressamente em notas de rodapé que o sistema era incapaz de criar expressão original, separando o caso de debates em aberto envolvendo grandes modelos de linguagem capazes de gerar código ou prosa autônoma.

    Ao classificar a transformação como minimamente transformativa, o tribunal fixou que a simples conversão de texto humano em representações matemáticas ou pares de treinamento supervisionado não lava a infração de direitos quando o objetivo final é fornecer o mesmo serviço da fonte original.

    Usurpação do mercado de dados de treinamento

    O quarto fator do uso justo avalia o efeito do uso sobre o mercado potencial e sobre o valor da obra protegida. Este segmento da decisão atinge em cheio pipelines contemporâneos de pré-treinamento e alinhamento de modelos.

    A corte identificou prejuízo duplo. Primeiro, a ROSS construiu um produto voltado a concorrer diretamente com a Westlaw, atingindo o valor que os sumários agregam às assinaturas do serviço original. Segundo, o tribunal reconheceu a formação de um mercado específico de licenciamento de textos proprietários destinados expressamente ao treinamento de modelos de inteligência artificial. Ao se apropriar do acervo sem compensação, a ROSS usurpou uma receita emergente e legítima de licenciamento corporativo.

    A criação de conjuntos de dados sintéticos via instruções derivadas de bases proprietárias, prática rotineira em pipelines que utilizam métodos no estilo instruction tuning, ganha contornos de alto risco operacional. O processo pelo qual a LegalEase traduziu sumários da Westlaw em perguntas de memorando assemelha-se estruturalmente à geração de dados de treino a partir de respostas de ferramentas concorrentes para destilar modelos menores.

    A fragilidade da defesa repousou no destino do dado. A ROSS não utilizou o texto para fins puramente acadêmicos, pesquisa de linguística computacional ou indexação web sem fins concorrenciais. O modelo foi financiado e treinado com o propósito de capturar a clientela corporativa da base parasitada.

    As alegações de que a decisão freia a inovação tecnológica no setor jurídico foram neutralizadas com objetividade no acórdão. Conforme ponderou Montgomery-Reeves, as aparências de uma disputa sobre o futuro da inteligência artificial enganam. A lide manteve-se nos trilhos tradicionais do direito de autor: proteção de originalidade humana e reprovação ao enriquecimento comercial sobre ativos editoriais licenciáveis.

    Equipes técnicas que desenham pipelines de dados não podem mais presumir imunidade jurídica com base no jargão da transformação algorítmica. O treinamento de sistemas que competem diretamente no domínio temático do fornecedor dos dados, ancorado em cópias sem licença de material curado, torna o modelo e a infraestrutura comercial adjacente alvos diretos de condenação por infração de direitos autorais.

    Filipe Mendes

    Ver perfil completo