A resposta mais custosa para o crescimento da demanda por computação tem sido construir mais data centers: mais energia contratada, mais rede estressada, mais água e mais emissões. A resposta mais barata, segundo o trabalho de Christina Delimitrou (abre em nova aba), professora associada do MIT e líder do grupo SAIL no CSAIL, é usar a capacidade que já está instalada. "Se os data centers não são utilizados da melhor forma possível, vão queimar muito mais energia do que precisam para atender à demanda crescente dos usuários", disse ela ao MIT News (abre em nova aba). O dado que sustenta essa leitura é desconfortável: nos sistemas que seu grupo estudou, a maioria rodava com apenas cerca de 15% da capacidade.
Esse número não mede um parque pequeno ou mal gerido. Mede sistemas de nuvem de grande escala, exatamente o tipo de infraestrutura que a indústria está expandindo às pressas para sustentar treinamento e inferência de modelos de IA. A ironia é dupla: a IA acelera a demanda por data centers e, ao mesmo tempo, é a ferramenta que Delimitrou usa para devolver parte dessa capacidade desperdiçada. "Há muito inchaço, especialmente no lado de software desses sistemas. Se conseguirmos remover esse inchaço sem comprometer o desempenho, não precisaremos construir tantos data centers novos", avalia ela.
Por que hardware caro fica parado
Um servidor de nuvem raramente executa uma única aplicação. Ele compartilha CPU, memória, rede e cache entre dezenas de serviços com perfis de carga distintos. O operador então provisiona para o pior caso: o pico de requisições, a cauda de latência, a interferência imprevisível entre cargas que disputam o mesmo recurso no mesmo instante. Cada margem de segurança multiplicada por milhares de máquinas vira ociosidade em escala. É como refrigerar a casa inteira para usar um quarto.

Boa parte dessa folga existe porque faltam duas coisas: previsão e coordenação. Sem um modelo do comportamento futuro de cada aplicação, o gerenciador conservador segura recursos que ninguém vai usar. Sem sensibilidade a QoS (Quality of Service, os limites de latência e throughput acordados com cada serviço), o gerenciador agressivo degrada aplicações sensíveis ao misturá-las com cargas pesadas. O trabalho de Delimitrou ataca exatamente esse intervalo entre o conservador e o irresponsável, com agendamento e gestão de recursos conscientes de QoS, tema que ela persegue desde o doutorado em Stanford, orientada por Christos Kozyrakis, e continuou como professora em Cornell antes de chegar ao MIT em 2022.
Predição como política de alocação
A intuição central é simples de enunciar e difícil de implementar: se você sabe o que vai acontecer, não precisa reserva preventiva. O grupo desenvolveu ferramentas que transformam essa intuição em mecanismos.
- Seer usa aprendizado profundo para antecipar e prevenir problemas em aplicações web antes que eles aconteçam, permitindo alocação proativa em vez de reação a incidentes.
- Ditto imita a estrutura e as características de desempenho de uma aplicação real, o que permite estudar mudanças de arquitetura e de política de escalonamento sem tocar em produção.
- ReTail, apresentado no HPCA de 2022, aposta em simplicidade de aprendizado para viabilizar gestão de potência consciente de QoS na nuvem: reduzir frequência e tensão quando a aplicação tolera, sem estourar contratos de latência.
A contribuição de ReTail merece atenção separada do resto. Gestão dinâmica de potência (DVFS) é tecnologia madura; o que impede seu uso agressivo em nuvem multi-inquilino é o medo de violar QoS de alguém. Mostrar que um modelo de aprendizado leve consegue distinguir quando é seguro desacelerar, e quando não é, remove justamente o obstáculo que travava uma alavanca de eficiência já existente. A lição de engenharia: muitas vezes falta modelo, não hardware.
Carbono: a métrica errada pode piorar a decisão
Eficiência energética é só metade da conta ambiental. A outra metade é quando e onde a energia é consumida, porque a intensidade de carbono da rede elétrica varia com a hora e a região. Daí o interesse crescente por escalonamento consciente de carbono (carbon-aware scheduling): atrasar cargas tolerantes ou direcioná-las a regiões mais limpas.
O grupo de Delimitrou publica nesse campo uma crítica que importa para quem implementa essas políticas. O artigo "The Sunk Carbon Fallacy", apresentado no Symposium on Cloud Computing em outubro de 2024, questiona como as métricas convencionais de pegada de carbono contabilizam emissões e o efeito disso sobre decisões de escalonamento. A tese, sugerida pelo próprio título, é que atribuir carbono de forma ingênua pode levar o escalonador a decisões que parecem verdes nos relatórios e não são na prática. Qualquer time que vá implementar deslocamento de carga por carbono precisa decidir, antes de otimizar, o que exatamente está medindo; a escolha da métrica não é detalhe contábil, é a função objetivo do sistema.
Limitações honestas
Nenhuma dessas técnicas é energia de graça nem isenta de risco.
- Custo do próprio modelo. Inferência de ML consome CPU e memória. Um preditor que custa mais do que a economia que gera é um passivo disfarçado de otimização; ReTail optou por simplicidade de aprendizado precisamente por isso.
- Erro de predição. Antecipar problemas "antes que eles aconteçam" implica falso positivo (recursos reservados sem necessidade, o desperdício original de volta) e falso negativo (violação de QoS). Os dois modos de falha precisam de orçamento explícito.
- Efeito rebote. Eficiência reduz o custo por unidade de computação, o que pode estimular mais consumo. É a lógica clássica do paradoxo de Jevons, hipótese econômica antiga, não uma previsão para o setor de nuvem. Mas quando a elasticidade da demanda por IA é a incógnita gigante que é hoje, tratá-la como possibilidade real é prudência, não pessimismo.
- Generalização do dado. Os 15% de utilização vêm de estudos conduzidos pelo grupo, não de um censo da indústria. A ordem de grandeza serve para dimensionar o problema; não autoriza presumir que todo data center specific esteja nessa situação, nem que seja uma média global.
Para onde isso caminha
Os sinais institucionais indicam que a agenda ganhou tração e financiamento. O grupo de Delimitrou recebeu em 2025 um prêmio da Google para jovens pesquisadores por contribuições em arquitetura de computadores e eficiência de data centers, e um prêmio da Amazon para melhorar a sustentabilidade de data centers em nuvem. Em 2026 vieram o apoio da Jane Street para depuração de desempenho assistida por IA na nuvem e, do MIT Climate Project, um grant específico para eficiência em data centers de IA. Pesquisa com verba climática institucional é pesquisa com mandato: a expectativa é que os mecanismos migrem do paper para plataformas de produção.
Há também uma pergunta implícita que o trabalho não resolve sozinho: o corte de desperdício acompanha o ritmo do crescimento da demanda ou apenas o diminui? Ninguém sabe. O que os resultados existentes permitem afirmar é mais modesto e mais acionável: há margem enorme de eficiência dentro do hardware já instalado, ela é endereçável com técnicas de software, e ignorá-la significa queimar energia que ninguém usa.
Para o engenheiro de plataformas, a consequência prática é direta. Alocar sob demanda com sensibilidade a QoS, medir interferência entre cargas antes de consolidar, auditar inchaço de software no caminho crítico e escolher métricas de carbono defensáveis são tarefas de sistemas, não de política ambiental. Fazê-las bem não substitui energia limpa nem novas construções onde a demanda de fato existe. Mas enquanto um cluster roda a 15% enquanto outro é construído, há energia e dinheiro indo pelo ralo, e as ferramentas para fechar essa torneira já estão, em boa parte, publicadas.
