Atualizado todo dia

As melhores IAs pra cada tarefa

Todo mundo pergunta qual IA usar. Depende da tarefa, e a resposta muda toda semana. Aqui está o ranking de texto, imagem, vídeo e voz, e o painel se atualiza sozinho todo dia.

Atualizado em 28 de setembro de 2026

Escolha pela tarefa

Cada quadro mostra o pódio de uma tarefa, com a nota de cada modelo.

Melhor no geral

Se você só quer saber qual é a mais inteligente hoje, é essa.

1Claude Opus 5.5Anthropic57.6
2Claude Fable 5.1Anthropic53.4
3GPT-6 AstraOpenAI52.7

Índice de inteligência, a média de todos os testes

Agente que usa ferramenta

Chamar API, seguir regra de negócio e fechar a tarefa sozinha. É a que importa pra automação.

1JT-35B-FlashChina Mobile99%
2Step 3.7 FlashStepFun99%
3Gemini 3.1 Pro PreviewGoogle96%

tau2-bench

Programar

Resolver uma tarefa de código inteira no terminal, do começo ao fim, sem alguém do lado.

1Claude Opus 5.5Anthropic60%
2GPT-6 AstraOpenAI60%
3Claude Fable 5.1Anthropic55%

Terminal-Bench 4.0

Escrever código científico

Programar cálculo, simulação e análise em cima de problema real de pesquisa.

1Claude Opus 5.5Anthropic67%
2Claude Fable 5.1Anthropic63%
3MiMo-V2.6-ProXiaomi61%

SciCode

Documento longo

Achar e cruzar informação dentro de muito texto sem perder o fio.

1Kimi K3Kimi89%
2Step 5 PreviewStepFun88%
3MiMo-V2.6-ProXiaomi86%

Raciocínio em contexto longo

Seguir instrução à risca

Obedecer formato, limite de palavra e regra chata sem inventar por conta própria.

1MiniMax-M3MiniMax83%
2Nemotron 3 Ultra 550B A55BNVIDIA81%
3Nemotron Cascade 2 30B A3BNVIDIA80%

IFBench

Inventa menos

Prefere dizer que não sabe a responder errado com cara de certeza.

1MiniMax-M3MiniMax82%
2Quasar 438BMultiverse Computing79%
3Grok 4.6SpaceXAI76%

Omniscience, parte de não alucinação, só entre modelos com índice acima de 25.9

Ler imagem e print

Entender gráfico, print de tela, foto de documento e diagrama.

1Claude Opus 5.5Anthropic88%
2GPT-6 AstraOpenAI87%
3Gemini 3.8 FlashGoogle86%

MMMU-Pro

Análise de dados

Pegar a base crua, analisar e chegar na conclusão sozinha.

1Claude Fable 5.1Anthropic57%
2GPT-6 AstraOpenAI51%
3Claude Sonnet 5Anthropic46%

Analyst Agent

Ciência e raciocínio pesado

Pergunta técnica de nível de doutorado, onde chutar não resolve.

1GPT-6 AstraOpenAI96%
2Gemini 3.8 FlashGoogle95%
3Grok 4.6SpaceXAI95%

GPQA Diamond

Pergunta quase impossível

O teto do que existe hoje: o exame em que os melhores modelos ainda erram a maioria.

1Claude Opus 5.5Anthropic61%
2Claude Fable 5.1Anthropic59%
3GPT-6 AstraOpenAI55%

Humanity's Last Exam

Melhor custo-benefício

Quanta inteligência você leva por dólar. O ponto de partida pra rodar automação em escala.

1MiMo-V2.6-FlashXiaomi216 pts por dólar
2GPT-6 LunaOpenAI186 pts por dólar
3GLM 5.3 FlashZ AI176 pts por dólar

Índice de inteligência dividido pelo preço por 1M de tokens, só entre modelos com índice acima de 25.9

Mais barata

O menor preço entre as que ainda são boas o bastante pra usar em produção.

1MiMo-V2.6-FlashXiaomi$0.18 / 1M
2GPT-6 LunaOpenAI$0.20 / 1M
3Qwen3.8-Flash-NextAlibaba$0.23 / 1M

Preço por 1M de tokens, misturando entrada e saída em 3 pra 1, só entre modelos com índice acima de 25.9

Gasta menos por tarefa

O custo real de cada tarefa, contando o quanto ela pensa antes de responder. Preço por token barato engana quando o modelo gasta o triplo de token.

1GPT-6 LunaOpenAI$0.02 / tarefa
2MiMo-V2.5-ProXiaomi$0.05 / tarefa
3MiMo-V2.6-FlashXiaomi$0.06 / tarefa

Custo médio por tarefa do índice de inteligência, em dólar, só entre modelos com índice acima de 25.9

Escreve mais rápido

Quantas palavras por segundo ela cospe. Conta quando a resposta é longa ou aparece na tela do cliente.

1Gemini 3.8 FlashGoogle306 tokens/s
2Muse Spark 1.3Meta252 tokens/s
3DeepSeek V4.1 FlashDeepSeek232 tokens/s

Mediana de tokens por segundo na saída, só entre modelos com índice acima de 25.9

Menor espera

Tempo até a primeira palavra da resposta aparecer. Em modelo que raciocina, inclui o tempo pensando.

1GPT-6 SolOpenAI1.1s
2GPT-5.6 TerraOpenAI1.7s
3Claude Sonnet 5Anthropic1.9s

Mediana de segundos até o primeiro token de resposta, só entre modelos com índice acima de 25.9

Melhor open source

A mais inteligente entre as de peso aberto, que você pode rodar no seu próprio servidor.

1MiMo-V2.6-ProXiaomi46.3
2GLM-5.3Z AI44.8
3Kimi K3Kimi43.6

Índice de inteligência, só entre modelos de peso aberto

Todas as IAs de texto

A lista inteira, com índice de inteligência, preço, velocidade e janela de contexto.

ModeloCriadorÍndicePreço / 1MVelocidadeContexto
Anthropic57.6$8.00?1M
Anthropic53.4$20.0069 t/s1M
OpenAI52.7$20.0064 t/s1M
Anthropic50.8$10.0060 t/s1M
Anthropic49.6$20.0067 t/s1M
Meta48.1$2.00214 t/s1M
OpenAI47.5$4.0086 t/s872K
OpenAI47.0$8.0096 t/s1M
SpaceXAI46.5$3.0082 t/s500K
Xiaomi46.3$0.5444 t/s1M
Alibaba45.4$3.0039 t/s984K
Z AI44.8$2.1584 t/s1M
SpaceXAI44.3$3.0066 t/s500K
StepFun43.7$1.4366 t/s1M
Kimi43.6$6.0035 t/s1M
OpenAI42.1$4.50101 t/s1M
Z AI41.8$0.2456 t/s1M
Anthropic41.8$10.0053 t/s1M
Google40.9$1.50306 t/s1M
Anthropic40.7$10.0052 t/s1M
Alibaba40.1$3.0039 t/s1M
Alibaba39.9$3.0039 t/s984K
Alibaba39.8$0.2357 t/s256K
Google39.6$1.50309 t/s1M
Meta39.6$2.00256 t/s1M
DeepSeek39.5$0.52232 t/s1M
OpenAI39.0$5.63140 t/s1.1M
SpaceXAI38.8$3.0063 t/s500K
OpenAI38.4$11.25108 t/s922K
Anthropic38.2$4.0084 t/s1M
Xiaomi37.9$0.1862 t/s1M
OpenAI37.3$0.45129 t/s1M
OpenAI37.3$0.20163 t/s1M
DeepSeek36.0$1.98100 t/s1M
DeepSeek34.8$0.66223 t/s1M
DeepSeek34.3$0.66227 t/s1M
Google34.0$1.50212 t/s1M
Meta33.7$2.00?1M
Z AI33.7$2.1588 t/s1M
Alibaba33.7$1.1346 t/s256K

Mostrando 40 de 489 modelos. Toque num modelo pra ver todos os números dele.

Como ler essa aba

O índice é uma nota de 0 a 100 que junta todos os testes. O preço mistura entrada e saída em 3 pra 1, que é mais ou menos como um caso real consome. Cada pódio mostra uma linha por modelo base: quando um modelo tem versões de esforço diferentes (max, high, low), fica a melhor delas, com o nível do lado.

Nas tarefas de preço e velocidade entra só quem passa de índice 25.9, senão a resposta seria sempre um modelo minúsculo que não serve pro trabalho. Modelo marcado como anterior já foi trocado por uma versão nova do mesmo criador: continua na lista pra comparação, mas não entra em pódio.