A aplicação de modelos de linguagem de grande porte na fronteira das ciências exatas alcançou um patamar inédito de escala e velocidade. Matthew D. Schwartz, professor de física na Universidade de Harvard e pesquisador visitante na Anthropic, documentou a elaboração de 36 manuscritos científicos cobrindo 18 disciplinas distintas ao longo de apenas três meses. Apoiado em interações com o modelo Claude e na colaboração com 19 coautores especialistas, o pesquisador explorou uma metodologia centrada em selecionar problemas altamente quantitativos que se ajustam às capacidades operacionais das redes neurais generativas atuais.
O experimento desafia as convenções tradicionais da rotina acadêmica ao demonstrar que cálculos teóricos que demandariam meses de trabalho manual podem ser concluídos em dias. Contudo, essa aceleração extrema expõe limitações substanciais sobre o significado de autoria, a maturidade metodológica dos modelos e a capacidade de absorção do sistema de revisão por pares frente a uma torrente de estudos produzidos por máquinas sob supervisão humana.
Do rascunho em física teórica ao framework BootLoops
O caminho até essa produção em larga escala iniciou-se com uma experiência isolada em física de altas energias. Em março de 2026, Schwartz relatou a utilização do Claude Opus 4.5 (abre em nova aba) para conduzir um cálculo completo em teoria quântica de campos. O projeto resultou no artigo disponibilizado no repositório arXiv sob o identificador 2601.02484, intitulado "Resummation of the C-Parameter Sudakov Shoulder Using Effective Field Theory".
Naquela ocasião, o físico atuou exclusivamente como orientador e supervisor de alto nível, abstendo-se de manipular diretamente os arquivos de código ou equações intermediárias. A execução técnica total coube ao assistente digital. Para concluir a análise numérica e a redação integral do manuscrito, o processo consumiu mais de 110 versões preliminares, 36 milhões de tokens de processamento e mais de 40 horas de computação em unidade central de processamento (CPU local). O ciclo total de trabalho durou apenas duas semanas, contrastando com o prazo típico de cerca de um ano habitualmente exigido para investigações com esse nível de densidade matemática.
A partir desse resultado, o pesquisador formulou uma abordagem descrita no artigo Claude-shaped science (abre em nova aba). Em vez de tentar forçar o modelo a emular integralmente a intuição científica humana, o objetivo passou a ser a identificação de problemas com formatos compatíveis com as capacidades nativas dos modelos de linguagem: tarefas que dependem de deduções simbólicas sistemáticas, estruturas algébricas repetitivas e manipulação extensiva de rotinas computacionais.
Essa diretriz culminou na criação do BootLoops, um conjunto de ferramentas de código aberto (toolkit) projetado para conduzir cálculos analíticos e numéricos exatos em disciplinas quantitativas. Por meio desse software, o modelo conseguiu extrapolar o domínio restrito da física pura, identificando equivalências matemáticas subjacentes entre cenários teóricos muito distantes entre si.

Mapeamento de problemas e resultados em múltiplas disciplinas
O esforço conjunto entre Schwartz, 19 pesquisadores convidados e o sistema de inteligência artificial partiu de uma triagem ampla. Ao todo, cerca de 400 problemas candidatos foram analisados, dos quais 36 foram selecionados e desenvolvidos até o estágio de manuscrito completo em um intervalo de noventa dias.
As frentes abordadas envolveram problemas pendentes de alta complexidade em diversas áreas do conhecimento:
- Física de partículas: O modelo operou no cálculo de diagramas de Feynman, que são representações matemáticas e pictóricas das interações entre partículas subatômicas. O Claude reproduziu com precisão 15 integrais elípticas de Feynman conhecidas na literatura e computou de forma autônoma 15 novas integrais que permaneciam inéditas na área teórica, totalizando 30 integrais complexas.
- Ecologia matemática: O framework resolveu numericamente a equação formulada por Etienne em 2005 a respeito da mistura de espécies em ecossistemas florestais, uma formulação que permaneceu vinte anos sem solução aplicável em larga escala. Processando os dados ecológicos da Ilha de Barro Colorado, no Panamá, a análise apontou que a dinâmica de substituição de espécies ocorre 4,5 vezes mais rápido do que as estimativas da teoria neutra de biodiversidade.
- Genética de populações: A ferramenta processou uma base de 5,7 bilhões de pares de mutações genéticas oriundas do Projeto 1000 Genomas, conseguindo estruturar evidências empíricas sobre mecanismos de conversão gênica, caracterizados pela transferência não recíproca de informação genética entre alelos.
- Economia quantitativa: Construiu-se um sistema com papel equivalente ao de um editor de dados baseado em inteligência artificial. Essa rotina converteu pacotes de replicação empírica para ambientes de código aberto em um conjunto de 4.452 artigos científicos distribuídos em cinco periódicos acadêmicos renomados.
- Linguística estrutural: O modelo desenvolveu uma base padronizada de acentuação prosódica (word stress) com cobertura de 6.072 idiomas, catalogando padrões fonéticos dispersos.
A tabela a seguir sistematiza as aplicações centrais desenvolvidas nessa rodada de projetos:
| Disciplina | Problema ou Conjunto de Dados Abordado | Resultado Quantitativo Obtido |
|---|---|---|
| Física de Partículas | Integrais elípticas de Feynman | 15 integrais reproduzidas e 15 novas integrais computadas |
| Ecologia | Equação de Etienne (2005) e dados de Barro Colorado | Solução escalada; dinâmica 4,5 vezes mais rápida que a teoria neutra |
| Genética | Base do Projeto 1000 Genomas | Análise de 5,7 bilhões de pares de mutações com evidência de conversão |
| Economia | Pacotes de replicação de 5 revistas especializadas | Migração para padrões de código aberto em 4.452 papers |
| Linguística | Fonética comparada de sistemas de estresse tonal | Catálogo estruturado abrangendo 6.072 línguas |
Além desses ramos, os manuscritos envolveram estudos em cosmologia, ciências da terra e a resolução do que Schwartz denominou como o problema final de Watson.
O papel da IA e a necessidade do filtro de domínio
A atuação do Claude nesses projetos revelou um perfil de competência bem definido: alta eficiência sintática e baixa autonomia na valoração científica. O pesquisador de Harvard observou que, ao operar isoladamente na exploração de conexões multidisciplinares, o assistente produzia resultados que eram tecnicamente impecáveis no aspecto algébrico, mas cientificamente desinteressantes ou redundantes sob a ótica dos problemas reais enfrentados pelos especialistas.
O modelo é eficaz em executar passos lógicos, implementar algoritmos, resolver integrais difíceis e organizar tabelas complexas, mas carece de discernimento epistemológico para identificar quais perguntas são de fato cruciais para o avanço de uma área. Por essa razão, a participação dos 19 pesquisadores humanos foi o componente decisivo. Os coautores atuaram delimitando os parâmetros relevantes de pesquisa, apontando hipóteses frutíferas e calibrando os objetivos do BootLoops para evitar o processamento extensivo de deduções que não trariam valor para as respectivas comunidades acadêmicas.
Essa dinâmica expõe uma distinção fundamental: o modelo demonstra excelência em executar etapas de ciência quantitativa, mas não desempenha o papel substantivo de um cientista, o qual exige formulação crítica de questões inéditas e contextualização conceitual de prioridades teóricas.
Limitações metodológicas e o gargalo da revisão por pares
Embora o volume de 36 estudos em um trimestre impressione pelas métricas de produtividade, o caso traz incertezas metodológicas e institucionais que precisam ser dimensionadas de modo prudente.
O primeiro aspecto diz respeito ao estado dessas publicações. Os documentos foram descritos como manuscritos (preprints), e não há registro consolidado de quantos deles já foram submetidos, avaliados e formalmente aceitos através do escrutínio cego por pares (peer review). A integridade de derivações matemáticas densas geradas por aprendizado de máquina demanda uma conferência linha por linha que impõe sobrecarga incomum aos revisores humanos, gerando dúvidas sobre a viabilidade operacional do fluxo tradicional das revistas acadêmicas diante de publicações massivas.
O segundo ponto de cautela envolve a posição institucional do pesquisador. Além de integrar o corpo docente de Harvard e atuar como investigador principal no NSF Institute for Artificial Intelligence and Fundamental Interactions (IAIFI), Matthew Schwartz conduziu essa fase de trabalhos como pesquisador visitante na própria Anthropic. Esse vínculo direto com os criadores da arquitetura utilizada reforça o caráter pioneiro do acesso aos recursos, mas exige atenção analítica redobrada quanto à reprodutibilidade das métricas em ambientes acadêmicos desprovidos de suporte técnico direto dos desenvolvedores do modelo.
O impacto na formação de pesquisadores
A transformação imposta por sistemas capazes de conduzir análises de alto nível repercute de forma imediata na didática e na capacitação dos futuros pós-graduandos em ciências quantitativas. Schwartz destacou uma alteração profunda em seu posicionamento pedagógico: se dois anos antes a recomendação primária para qualquer jovem cientista envolvia o domínio da programação instrumental na linguagem Python, essa habilidade técnica passa a perder relevância como diferencial competitivo.
Com a capacidade de orquestrar modelos generativos para sintetizar pacotes numéricos, converter sintaxes computacionais e derivar cálculos algébricos fechados a partir de instruções em linguagem natural, o foco do treinamento científico desloca-se. As qualificações preponderantes passam a ser a habilidade de conceber formulações de problemas com alta consistência lógica, a capacidade de identificar anomalias conceituais nos dados gerados e o discernimento crítico necessário para direcionar agentes computacionais rumo a problemas que o maquinário matemático sozinho não saberia eleger como relevantes.
