Em 30 de setembro de 2026, o Google oficializou a introdução de seu novo modelo de fronteira de inteligência artificial, batizado de Gemini 4 Argon (abre em nova aba). Desenvolvido para sustentar raciocínio profundo em fluxos de trabalho extensos e de longo horizonte, o sistema marca uma mudança na nomenclatura tradicional da família de modelos da empresa e assume o papel de substituto do Gemini 3.5 Pro, cujos planos de desenvolvimento haviam sido anunciados na conferência Google I/O de maio antes de serem cancelados em favor do foco no 3.8 Flash.
A arquitetura do Gemini 4 Argon traz uma modificação substancial em sua capacidade de geração: o limite de saída por requisição foi ampliado de 64 mil tokens nos modelos anteriores para 1 milhão de tokens. Tokens representam as menores unidades de texto e dados processadas e geradas por redes neurais artificiais, correspondendo frequentemente a frações de palavras ou caracteres de código. Embora janelas de contexto com 1 milhão de tokens de entrada já façam parte do padrão atual de grandes modelos de linguagem, a paridade permitindo 1 milhão de tokens de saída viabiliza a execução de tarefas contínuas e estruturadas em etapa única sem a fragmentação de respostas.
Desempenho e métricas em benchmarks
O modelo foi submetido a testes técnicos voltados para engenharia de software real, tarefas corporativas e ciberdefesa. No teste DeepSWE v1.1, voltado para a avaliação de resolução autônoma de problemas de engenharia de software de longo prazo, o Gemini 4 Argon alcançou a pontuação de 77,9%. No índice Vals, métrica desenhada para quantificar o impacto econômico em finanças, codificação, tarefas fiscais e direito, a solução registrou 68,9%.
A tabela a seguir compara o desempenho divulgado para o Gemini 4 Argon com métricas de sistemas concorrentes no setor:
| Benchmark / Métrica | Gemini 4 Argon | Claude Opus 5.5 | GPT-6 Astra | Claude Fable 5.1 |
|---|---|---|---|---|
| DeepSWE v1.1 | 77,9% | 74,2% | 74,1% | 67,4% |
| Vals Index | 68,9% | 67,0% | 63,1% | 65,8% |
| Vals Finance Agent v2 | 65,4% | 58,6% | 53,5% | 58,9% |
| AutomationBench | 51,3% | 42,5% | 41,4% | 31,4% |
| Harvey's Legal Agent Benchmark | 19,6% | 3,8% | 5,4% | 6,7% |
| FrontierSWE v2 | 55,0% | 62,3% | 65,5% | 56,3% |
No processamento e compreensão de vídeo longo, mensurado pelo LVBench, o modelo atingiu a marca de 91,7%. No entanto, as avaliações também revelam limites técnicos claros: no benchmark FrontierSWE v2, o Gemini 4 Argon marcou 55,0%, ficando atrás do GPT-6 Astra com 65,5% e do Claude Opus 5.5 com 62,3%. No teste de identificação de falhas de segurança CWE-bench v1, o Argon empatou na liderança registrando 68%.
Foco em cibersegurança e validação em etapas
Diferente de lançamentos com liberação irrestrita e imediata, a estratégia adotada baseia-se em distribuição gradual. A capacidade anunciada de identificar, validar e aplicar correções de vulnerabilidades críticas de software de maneira autônoma orientou o direcionamento primário do modelo para defesa cibernética. O acesso inicial ocorre exclusivamente por meio do Programa Fairwind, iniciado em 3 de setembro de 2026 com o modelo menor Gemini 3.8 Flash Cyber, contando com a adesão de mais de 650 organizações especializadas, incluindo CrowdStrike Holdings Inc. e Palo Alto Networks Inc. A empresa de segurança Wiz utilizou o sistema para identificar uma falha crítica capaz de expor dados pessoais em softwares operados por hospitais internacionalmente.
O processo de liberação envolve também o engajamento voluntário da desenvolvedora nos procedimentos do governo dos Estados Unidos para acesso prévio a modelos em fase pré-lançamento.
A equipe técnica responsável pelo desenvolvimento contextualizou o papel do suporte a grandes volumes de saída e as etapas de validação:
Com um limite de saída de 1M de tokens, o Argon adiciona um nível mais profundo de raciocínio para lidar com problemas longos e de várias etapas de uma só vez. O feedback dos primeiros testadores nos ajudará a fortalecer nossos sistemas antes de realizarmos uma distribuição mais ampla para desenvolvedores, empresas e consumidores em breve.
Internamente, a ferramenta já é utilizada por funcionários do próprio Google para acelerar escrita de código especializado, condução de pesquisas aprofundadas e redação técnica.
Custos de processamento e cronograma de disponibilidade
No quesito comercial para consumo via interface de programação de aplicações (API), o Google estipulou uma taxa de lançamento de US$ 2 por milhão de tokens de entrada e US$ 10 por milhão de tokens de saída. O mecanismo de tokens em cache, que reduz o processamento repetitivo de blocos de contexto previamente lidos, conta com desconto de 95% em relação ao preço do token de entrada.
Após o término da janela promocional introdutória, os valores sobem para US$ 4 por milhão de tokens de entrada e US$ 20 por milhão de tokens de saída, equiparando-se à precificação praticada para o Claude Opus 5.5.
A respeito do cronograma de lançamento para usuários finais e programadores em geral, a empresa não fixou datas exatas de calendário. O acesso geral está previsto para ocorrer progressivamente, priorizando clientes pagantes da API e assinantes do plano Google AI Ultra, antes de atingir de forma integral os clientes corporativos e o público consumidor.
