Pular para o conteúdo
    Artigo

    Chaves de API expostas na Hugging Face: o risco está no processo, não na plataforma

    Análise da investigação de Rowland Manthorpe sobre milhares de segredos, incluindo chaves de API da OpenAI, encontrados em arquivos públicos da Hugging Face, separando o que é exposição confirmada do que é risco projetado.

    Filipe Mendes

    8 de out. de 2026 · 6 min de leitura

    Seguir no Google
    Fotografia editorial em 16:9 de um antigo galpão reconvertido em coworking, com luz de fim de tarde entrando lateralmente por janelas altas. No centro, uma estante comunitária com dezenas de ganchos de chaveiro idênticos pendurados em filei
    Chaves deixadas à vista: a investigação que encontrou milhares de segredos expostos na Hugging Face revela que o problema não está na plataforma, mas no processo de quem publica.

    A investigação do correspondente de tecnologia da Sky News, Rowland Manthorpe, sobre segredos expostos na Hugging Face (abre em nova aba) toca num ponto que a comunidade de machine learning prefere não discutir com franqueza: a plataforma que virou infraestrutura de facto para modelos abertos também funciona, na prática, como um repositório gigante de credenciais mal guardadas. Segundo a reportagem, milhares de segredos, incluindo chaves de API da OpenAI, estavam sentados em arquivos públicos que qualquer pessoa podia baixar. Chaves de organizações e de desenvolvedores individuais, em repositórios, notebooks e arquivos ligados a modelos.

    Convém precisar o fato central antes de qualquer interpretação. O achado da investigação é exposição por upload público, não invasão da infraestrutura da Hugging Face. Ninguém quebrou um servidor. Alguém, em grande número e por muito tempo, subiu arquivos contendo credenciais para lugares onde o padrão de visibilidade é aberto. Essa distinção muda tudo na análise: não há vulnerabilidade nova a corrigir no Hub, há uma prática ruim que o design do Hub não impede.

    Como o Hub funciona e por que segredos vazam

    A Hugging Face é, essencialmente, o GitHub do ecossistema de IA. Desenvolvedores versionam pesos de modelos, datasets, notebooks de experimentos e código de treinamento em repositórios que, por padrão, tendem à visibilidade pública. O modelo econômico e cultural da plataforma é a abertura: você publica para que outros usem, reproduzam e construam sobre o seu trabalho. É o que fez do Hub o centro de distribuição de modelos abertos.

    Fotografia em luz dourada de fim de tarde mostra uma estante comunitária de madeira bruta, aberta para a rua em um bairro residencial, com livros usados, um brinquedo de madeira, um rádio antigo e cadernos com anotações nas prateleiras. Ent
    Segredos deixados à mostra: assim como objetos pessoais em uma estante comunitária aberta, chaves de API expostas em repositórios públicos revelam que o problema está menos na plataforma e mais no hábito de compartilhar sem revisar o que se deixa para trás.

    O problema nasce de um descasamento simples. Um notebook de experimento costuma carregar, em célula visível, a chamada à API da OpenAI com a chave inline, porque assim é rápido testar. Um script de treinamento importa o dataset privado com o token de acesso no cabeçalho. O arquivo funciona, o experimento roda, e depois o autor faz upload da pasta inteira, com histórico, sem revisar o que vai junto. A chave de API, no modelo da OpenAI, é uma credencial de faturamento e de acesso a serviços: quem a possui pode consumir os modelos pagos e gerar custo ou extrair dados vinculados à conta, conforme reportado na investigação sobre chaves descritas como ainda válidas no momento da descoberta.

    A documentação oficial da plataforma é explícita sobre isso. A página de segurança e tokens de acesso do Hub (abre em nova aba) trata tokens como segredos, orienta que não sejam commitados em repositórios públicos, descreve como definir escopos, criar tokens fine-grained, revogar e rotacionar quando houver suspeita de exposição. Ou seja: a Hugging Face sabe, documenta e avisa. O contraste entre a orientação oficial e o comportamento observado é o achado mais incômodo da investigação, porque não deixa a plataforma como única responsável e não deixa o usuário como vítima inocente.

    Um arquivo público é um arquivo público.

    Exposição confirmada, exploração presumida

    Aqui vale separar três camadas com rigor, porque é fácil misturá-las.

    • Fato confirmado pela reportagem: milhares de segredos, incluindo chaves da OpenAI, estavam em arquivos públicos baixáveis na plataforma, e pelo menos parte das chaves ainda era válida quando encontrada.
    • Hipótese plausível, não demonstrada: que terceiros tenham coletado e usado essas chaves para consumo indevido de APIs pagas. A reportagem, pelos elementos disponíveis, sustenta a exposição, não a exploração.
    • Projeção de risco: estimativas de custo potencial ou de escala de abuso, que dependem de quantas chaves foram válidas, por quanto tempo ficaram expostas e quem as viu antes de qualquer limpeza.

    Essa separação importa tecnicamente. Uma chave exposta e válida é um incidente de segurança em sentido amplo, independentemente de abuso comprovado, porque a janela de comprometimento não pode ser fechada retroativamente. Mas inverter a ordem, tratar risco projetado como dano ocorrido, destrói a utilidade da análise. Ceticismo, aqui, não é neutralidade diplomática: é o critério que decide o que sua equipe precisa fazer hoje e o que pode apenas monitorar.

    Há um agravante estrutural que a investigação ilumina sem precisar nomear. No ecossistema de modelos abertos, o vetor clássico de preocupação é o código serializado, como arquivos pickle, cuja execução pode carregar comportamento arbitrário, e a prática de carregar modelos de terceiros com confiança implícita. Credenciais expostas são o avesso simétrico desse problema: não é o artefato que ataca quem baixa, é quem baixa que encontra um artefato que entrega acesso à conta de quem publicou. O Hub concentra os dois riscos no mesmo lugar, com a mesma lógica de confiança distribuída.

    A resposta e o que ela revela

    A reportagem de Manthorpe afirma ter contatado a Hugging Face, a OpenAI e organizações afetadas antes da publicação, o procedimento esperado em investigação jornalística desse tipo. O que se pode avaliar publicamente, além disso, é o aparato oficial que já existia: a orientação documentada sobre tokens, a possibilidade de escopos restritos e revogação. A pergunta que fica, e que a reportagem ajuda a colocar sem responder sozinha, é se orientação e mecanismos de revogação bastam quando o padrão de uso da plataforma produz exposição em escala.

    Minha leitura, como inferência e não como fato: não bastam, e não por defeito técnico. Toda plataforma de hospedagem de código já enfrentou esse problema. O GitHub convive há anos com chaves vazias em repositórios, e a resposta que funcionou em parte foi automatizar a detecção, varrendo pushes públicos e notificando provedores de credenciais para revogação proativa. É conhecimento consolidado da área de segurança de plataformas que orientação passiva tem alcance limitado quando o erro é fácil de cometer e invisível para quem o comete. Se a Hugging Face ainda não trata a exposição de segredos em uploads públicos com detecção e alerta sistemáticos, a investigação dá razões para fazê-lo. Se já trata em alguma medida, a escala do achado indica que o alcance é insuficiente. Em ambos os casos, a conclusão prática para quem desenvolve é a mesma.

    O que fazer na prática

    A exposição é barata de prevenir e caríssima de remediar, porque uma chave válida exposta exige assumir que foi usada. Para equipes que publicam modelos, datasets ou notebooks no Hub, o mínimo verificável é o seguinte:

    1. Varrer repositórios públicos, atuais e históricos, por padrões de credenciais antes e depois de cada publicação.
    2. Nunca embutir chaves em notebooks; carregar de variáveis de ambiente ou de um gerenciador de segredos, e limpar saídas de células antes de subir.
    3. Usar tokens com escopo mínimo e, quando disponível no provedor, fine-grained, revogando o que não tem uso imediato.
    4. Tratar qualquer chave que já apareceu em arquivo público como comprometida e rotacioná-la, não apenas removê-la do repositório, porque remoção não apaga cópias e clones.

    O hábito que mais rende é o mais chato: revisar o que entra em um commit. Não há automatização que substitua a pergunta de trinta segundos sobre se aquele notebook precisa mesmo conter a célula com a chave. Parece trivial. É exatamente por parecer trivial que milhares de segredos se acumularam onde qualquer pessoa podia encontrá-los.

    Implicação para o ecossistema aberto

    O risco sistêmico merece uma última camada de análise. A confiança que sustenta o ecossistema de modelos abertos depende de distribuição pública e reprodutibilidade de experimentos, e justamente por isso concentra na Hugging Face um volume de material sensível que plataformas de código tradicional não têm: não apenas código, mas artefatos de pesquisa inteiros, com credenciais, configurações e dados acidentais embutidos. Cada incidente de exposição, mesmo sem exploração comprovada, corrói a premissa de que publicar no Hub é seguro por padrão para quem publica. A pressão resultante pode empurrar a plataforma para mais varredura, mais alertas e defaults mais restritivos, o que seria uma melhoria líquida, mas também pode empurrar equipes para repositórios privados, o que empobrece a reprodutibilidade que dá valor ao ecossistema.

    A investigação de Manthorpe, no fim, documenta menos uma falha da Hugging Face do que uma falha de disciplina coletiva que a Hugging Face tornou visível ao concentrá-la. A plataforma deu a estrutura; a prática de milhares de desenvolvedores preencheu o arquivo errado. Para quem trabalha com IA em produção, a lição operacional é curta: suas credenciais já podem estar públicas sem que você saiba, e o único estado aceitável é aquele em que a rotação é barata, frequente e verificável.

    Filipe Mendes

    Ver perfil completo