Todo mundo pergunta qual IA usar. Depende da tarefa, e a resposta muda toda semana. Aqui está o ranking de texto, imagem, vídeo e voz, e o painel se atualiza sozinho todo dia.
Atualizado em 28 de setembro de 2026
Cada quadro mostra o pódio de uma tarefa, com a nota de cada modelo.
Se você só quer saber qual é a mais inteligente hoje, é essa.
Índice de inteligência, a média de todos os testes
Chamar API, seguir regra de negócio e fechar a tarefa sozinha. É a que importa pra automação.
tau2-bench
Resolver uma tarefa de código inteira no terminal, do começo ao fim, sem alguém do lado.
Terminal-Bench 4.0
Programar cálculo, simulação e análise em cima de problema real de pesquisa.
SciCode
Achar e cruzar informação dentro de muito texto sem perder o fio.
Raciocínio em contexto longo
Obedecer formato, limite de palavra e regra chata sem inventar por conta própria.
IFBench
Prefere dizer que não sabe a responder errado com cara de certeza.
Omniscience, parte de não alucinação, só entre modelos com índice acima de 25.9
Entender gráfico, print de tela, foto de documento e diagrama.
MMMU-Pro
Pegar a base crua, analisar e chegar na conclusão sozinha.
Analyst Agent
Pergunta técnica de nível de doutorado, onde chutar não resolve.
GPQA Diamond
O teto do que existe hoje: o exame em que os melhores modelos ainda erram a maioria.
Humanity's Last Exam
Quanta inteligência você leva por dólar. O ponto de partida pra rodar automação em escala.
Índice de inteligência dividido pelo preço por 1M de tokens, só entre modelos com índice acima de 25.9
O menor preço entre as que ainda são boas o bastante pra usar em produção.
Preço por 1M de tokens, misturando entrada e saída em 3 pra 1, só entre modelos com índice acima de 25.9
O custo real de cada tarefa, contando o quanto ela pensa antes de responder. Preço por token barato engana quando o modelo gasta o triplo de token.
Custo médio por tarefa do índice de inteligência, em dólar, só entre modelos com índice acima de 25.9
Quantas palavras por segundo ela cospe. Conta quando a resposta é longa ou aparece na tela do cliente.
Mediana de tokens por segundo na saída, só entre modelos com índice acima de 25.9
Tempo até a primeira palavra da resposta aparecer. Em modelo que raciocina, inclui o tempo pensando.
Mediana de segundos até o primeiro token de resposta, só entre modelos com índice acima de 25.9
A mais inteligente entre as de peso aberto, que você pode rodar no seu próprio servidor.
Índice de inteligência, só entre modelos de peso aberto
A lista inteira, com índice de inteligência, preço, velocidade e janela de contexto.
| Modelo | Criador | Índice | Preço / 1M | Velocidade | Contexto |
|---|---|---|---|---|---|
| Anthropic | 57.6 | $8.00 | ? | 1M | |
| Anthropic | 53.4 | $20.00 | 69 t/s | 1M | |
| OpenAI | 52.7 | $20.00 | 64 t/s | 1M | |
| Anthropic | 50.8 | $10.00 | 60 t/s | 1M | |
| Anthropic | 49.6 | $20.00 | 67 t/s | 1M | |
| Meta | 48.1 | $2.00 | 214 t/s | 1M | |
| OpenAI | 47.5 | $4.00 | 86 t/s | 872K | |
| OpenAI | 47.0 | $8.00 | 96 t/s | 1M | |
| SpaceXAI | 46.5 | $3.00 | 82 t/s | 500K | |
| Xiaomi | 46.3 | $0.54 | 44 t/s | 1M | |
| Alibaba | 45.4 | $3.00 | 39 t/s | 984K | |
| Z AI | 44.8 | $2.15 | 84 t/s | 1M | |
| SpaceXAI | 44.3 | $3.00 | 66 t/s | 500K | |
| StepFun | 43.7 | $1.43 | 66 t/s | 1M | |
| Kimi | 43.6 | $6.00 | 35 t/s | 1M | |
| OpenAI | 42.1 | $4.50 | 101 t/s | 1M | |
| Z AI | 41.8 | $0.24 | 56 t/s | 1M | |
| Anthropic | 41.8 | $10.00 | 53 t/s | 1M | |
| 40.9 | $1.50 | 306 t/s | 1M | ||
| Anthropic | 40.7 | $10.00 | 52 t/s | 1M | |
| Alibaba | 40.1 | $3.00 | 39 t/s | 1M | |
| Alibaba | 39.9 | $3.00 | 39 t/s | 984K | |
| Alibaba | 39.8 | $0.23 | 57 t/s | 256K | |
| 39.6 | $1.50 | 309 t/s | 1M | ||
| Meta | 39.6 | $2.00 | 256 t/s | 1M | |
| DeepSeek | 39.5 | $0.52 | 232 t/s | 1M | |
| OpenAI | 39.0 | $5.63 | 140 t/s | 1.1M | |
| SpaceXAI | 38.8 | $3.00 | 63 t/s | 500K | |
| OpenAI | 38.4 | $11.25 | 108 t/s | 922K | |
| Anthropic | 38.2 | $4.00 | 84 t/s | 1M | |
| Xiaomi | 37.9 | $0.18 | 62 t/s | 1M | |
| OpenAI | 37.3 | $0.45 | 129 t/s | 1M | |
| OpenAI | 37.3 | $0.20 | 163 t/s | 1M | |
| DeepSeek | 36.0 | $1.98 | 100 t/s | 1M | |
| DeepSeek | 34.8 | $0.66 | 223 t/s | 1M | |
| DeepSeek | 34.3 | $0.66 | 227 t/s | 1M | |
| 34.0 | $1.50 | 212 t/s | 1M | ||
| Meta | 33.7 | $2.00 | ? | 1M | |
| Z AI | 33.7 | $2.15 | 88 t/s | 1M | |
| Alibaba | 33.7 | $1.13 | 46 t/s | 256K |
Mostrando 40 de 489 modelos. Toque num modelo pra ver todos os números dele.
O índice é uma nota de 0 a 100 que junta todos os testes. O preço mistura entrada e saída em 3 pra 1, que é mais ou menos como um caso real consome. Cada pódio mostra uma linha por modelo base: quando um modelo tem versões de esforço diferentes (max, high, low), fica a melhor delas, com o nível do lado.
Nas tarefas de preço e velocidade entra só quem passa de índice 25.9, senão a resposta seria sempre um modelo minúsculo que não serve pro trabalho. Modelo marcado como anterior já foi trocado por uma versão nova do mesmo criador: continua na lista pra comparação, mas não entra em pódio.