COMPARATIVO DE MODELOS DE IA

    Melhores IAs

    Compare desempenho, preço e velocidade em testes de inteligência artificial. Cada índice mede uma capacidade diferente.

    17 testes e benchmarks155 modelos nos índices gerais3 rankings por capacidade

    DADOS ATUALIZADOS

    26 de setembro de 2026 às 21:06

    Horário de Brasília · atualização automática

    OpenRouter · Design Arena · Artificial Analysis

    RANKING GERAL

    Classificação completa

    Os cinco primeiros do índice selecionado abaixo. Expanda para ver todos os modelos com pontuação, preços e velocidade.

    97 resultados
    Ranking de modelos por pontuação, com preços em dólar por milhão de tokens
    #ModeloEmpresaPontuaçãoEntrada / 1 miSaída / 1 mi
    1Logo AnthropicClaude Opus 5.5 (Adaptive Reasoning, Max Effort, Default Fallback)Anthropic57,6US$ 4,40US$ 22,00
    2Logo AnthropicClaude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)Anthropic53,4US$ 5,00US$ 25,00
    3Logo Alibaba / QwenQwen3.8 MaxAlibaba / Qwen53,4——
    4Logo OpenAIGPT-6 Astra (max)OpenAI52,7US$ 11,00US$ 55,00
    5Logo AnthropicClaude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic50,8US$ 5,50US$ 27,50

    BENCHMARKS

    Resultados dos 17 testes

    Os melhores resultados de cada teste, com custo e velocidade quando disponíveis.

    Atualizado em 26/09/2026

    GPQA Diamond

    Perguntas difíceis de conhecimento científico.

    ACERTO

    Melhor resultado

    Logo Sakana AIFugu UltraSakana AI
    94,6%

    Menor custo / tarefa

    Sao10K: Llama 3 8B LunarisSao10k
    US$ 0,0001

    Mais rápido

    —
    —
    Sobre o teste
    Fonte
    OpenRouter
    Escala
    ACERTO
    Modelos
    147
    Tarefas
    4332
    Atualização
    26/09/2026

    τ²-Bench Airline

    Agentes que atendem tarefas de companhia aérea usando ferramentas.

    ACERTO

    Melhor resultado

    Logo GoogleGoogle: Gemini 3.7 FlashGoogle
    80,6%

    Menor custo / tarefa

    inclusionAI: Ling 3.0 Flash VLInclusion AI
    US$ 0,0037

    Mais rápido

    —
    —
    Sobre o teste
    Fonte
    OpenRouter
    Escala
    ACERTO
    Modelos
    133
    Tarefas
    1300
    Atualização
    26/09/2026

    Imagem

    Geração de imagens a partir de uma instrução.

    ELO

    Melhor resultado

    Riverflow 2.5 ProSourceful
    1.375

    Menor custo / tarefa

    —
    —

    Mais rápido

    Logo Black Forest LabsFLUX.2 Klein 4BBlack Forest Labs
    5 s
    Sobre o teste
    Fonte
    Design Arena
    Escala
    ELO
    Modelos
    12
    Tarefas
    Não informado
    Atualização
    Dados recebidos em 26/09/2026; data individual não informada

    Sites

    Criação de páginas e experiências para a web.

    ELO

    Melhor resultado

    Logo MetaMuse Spark 1.3 (xhigh)Meta
    1.362

    Menor custo / tarefa

    —
    —

    Mais rápido

    Logo Mistral AICodestral 2 (2501)Mistral AI
    6 s
    Sobre o teste
    Fonte
    Design Arena
    Escala
    ELO
    Modelos
    134
    Tarefas
    Não informado
    Atualização
    Dados recebidos em 26/09/2026; data individual não informada

    Custos e duração só aparecem quando a fonte os fornece. Design Arena usa Elo; os demais mostram taxa de acerto ou F1. Resultados de testes diferentes não são comparáveis diretamente.

    BENCHMARKS

    Por tipo de capacidade

    Pontuações da Artificial Analysis

    Inteligência

    Desempenho geral em raciocínio e conhecimento.

    97 modelos avaliados

    1. 1
      Logo AnthropicClaude Opus 5.5 (Adaptive Reasoning, Max Effort, Default Fallback)Anthropic
      Pontuação57,6
    2. 2
      Logo AnthropicClaude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)Anthropic
      Pontuação53,4
    3. 3
      Logo Alibaba / QwenQwen3.8 MaxAlibaba / Qwen
      Pontuação53,4
    4. 4
      Logo OpenAIGPT-6 Astra (max)OpenAI
      Pontuação52,7
    5. 5
      Logo AnthropicClaude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic
      Pontuação50,8

    Programação

    Desempenho em tarefas de programação.

    148 modelos avaliados

    1. 1
      Logo AnthropicClaude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)Anthropic
      Pontuação81,6
    2. 2
      Logo AnthropicClaude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic
      Pontuação78
    3. 3
      Logo OpenAIGPT-5.6 Sol (max)OpenAI
      Pontuação77,4
    4. 4
      Logo OpenAIGPT-6 Astra (max)OpenAI
      Pontuação76,9
    5. 5
      Logo xAIGrok 4.6 (high)xAI
      Pontuação76,8

    Agentes

    Desempenho em tarefas executadas por agentes.

    100 modelos avaliados

    1. 1
      Logo AnthropicClaude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)Anthropic
      Pontuação57,9
    2. 2
      Logo AnthropicClaude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic
      Pontuação56,5
    3. 3
      Logo Alibaba / QwenQwen3.8 Max (0902)Alibaba / Qwen
      Pontuação56
    4. 4
      GLM-5.3 (max)Z.ai
      Pontuação53,1
    5. 5
      Logo xAIGrok 4.6 (high)xAI
      Pontuação53

    COMPARAÇÃO

    Desempenho dos modelos

    97 modelos avaliados

    Pontuação × preço

    20 primeiros + modelos fixados · preço de entrada por milhão de tokens (US$)

    A fronteira destaca modelos sem alternativa simultaneamente mais barata e com maior pontuação. Índices e preços da Artificial Analysis.