Un contrôle des connaissances factuelles sur des questions qui n'ont qu'une seule bonne réponse. À la différence des sélections voisines, le modèle ne raisonne pas et n'écrit pas de code ici — il se souvient. Le second regard sur le même sujet vient des votes humains à l'aveugle.
Une question, deux façons d'y répondre. Les deux indicateurs mesurent des choses différentes et ne s'additionnent pas en un seul score.
Tous les modèles ne sont pas mesurés ici. Sur les dix premiers de l’onglet « Par votes humains », il en manque 1 dans ce tableau — MiMo V2.5 Pro. Ils n'ont aucun score sur les jeux de tâches de cet onglet : une place vide signifie « non mesuré », et non « mauvais résultat ». Le modèle le plus récent atteint par ce jeu de tâches est sorti le 27 juillet 2026.
| # | Modèle | Développeur | Score sur les tâches 0–100, ajusté selon la couverture | Connexion$ / 1M | Sortie$ / 1M | Contextetokens | GPQA Diamond | SimpleQA Verified | CritPt | Humanity’s Last Exam | Jeux de tâchesmesuré |
|---|---|---|---|---|---|---|---|---|---|---|---|
| 1 | Gemini 3 Flash Preview | Google DeepMind | 55,84 72,51 | $0,5 | $3 | 1 049K | 77,6 | 67,4 | — | — | 2 |
| 2 | Qwen3.6 Max Preview | Alibaba (Qwen) | 55,18 71,19 | $1,3 | $7,8 | 262K | 85,4 | 56,9 | — | — | 2 |
| 3 | GPT-5.6 Sol | OpenAI | 54,72 65,08 | $5 | $30 | 1 050K | 91,3 | 71,6 | 32,3 | — | 3 |
| 4 | Qwen3 Max 2025-09-23 | Alibaba (Qwen) | 52,32 65,47 | $0,86 | $3,43 | 258K | 63,5 | 67,5 | — | — | 2 |
| 5 | Grok 4 | xAI | 52,23 65,29 | $3 | $15 | 256K | 82,7 | 47,9 | — | — | 2 |
| 6 | Gemini 3.1 Pro Preview | Google DeepMind | 51,54 57,72 | $2 | $12 | 1 049K | 92,1 | 77,3 | 17,7 | 43,7 | 4 |
| 7 | Claude Opus 5 | Anthropic | 51,21 59,23 | $5 | $25 | 1 000K | 91,8 | 56,7 | 29,1 | — | 3 |
| 8 | Gemini 3.5 Flash | Google DeepMind | 50,06 57,31 | $1,5 | $9 | 1 049K | 90,4 | 68,4 | 13,1 | — | 3 |
| 9 | Grok 4.20 (Reasoning) | xAI | 49,81 60,44 | $1,25 | $2,5 | 1 000K | 85,8 | 35,1 | — | — | 2 |
| 10 | Claude Opus 4.6 | Anthropic | 48,67 55 | $5 | $25 | 1 000K | 87,4 | 46,5 | — | 31,1 | 3 |
| 11 | GPT-5.6 Terra | OpenAI | 48,51 54,73 | $2 | $12 | 1 050K | 91,1 | 43,1 | 30 | — | 3 |
| 12 | GPT 5.4 Pro 2026-03-05 | OpenAI | 48,41 53,03 | $30 | $180 | 1 050K | 92,8 | 47,8 | 30 | 41,5 | 4 |
| 13 | Qwen3.7 Max | Alibaba (Qwen) | 47,82 53,59 | $2,5 | $7,5 | 1 000K | 88,8 | 58,5 | 13,4 | — | 3 |
| 14 | Grok 4.5 | xAI | 47,71 53,39 | $2 | $6 | 500K | 91,3 | 53,5 | 15,4 | — | 3 |
| 15 | Kimi K2 Thinking Turbo | Moonshot AI (Kimi) | 47,23 55,28 | $1,15 | $8 | 262K | 79 | 31,6 | — | — | 2 |
| 16 | Gemini 3 Pro Preview | Google DeepMind | 47,11 51,08 | $2 | $12 | 1 049K | 90,2 | 72,9 | 6,9 | 34,4 | 4 |
| 17 | Kimi K3 | Moonshot AI (Kimi) | 47,06 52,31 | $2 | $8 | 1 049K | 90,8 | 42,7 | 23,4 | — | 3 |
| 18 | GLM 4.7 | Zhipu AI / Z.ai | 46,91 54,64 | $0,15 | $0,8 | 205K | 77,8 | 31,5 | — | — | 2 |
| 19 | DeepSeek V4 Pro | DeepSeek | 46,88 52,02 | $0,44 | $0,87 | 1 049K | 86,2 | 57 | 12,9 | — | 3 |
| 20 | DeepSeek Reasoner | DeepSeek | 45,94 52,7 | $0,14 | $0,28 | 1 000K | 77,9 | 27,5 | — | — | 2 |
| 21 | GPT-5.6 Luna | OpenAI | 45,89 50,37 | $0,2 | $1,2 | 1 050K | 88,8 | 41,7 | 20,6 | — | 3 |
| 22 | Qwen3.5 Plus | Alibaba (Qwen) | 45,81 52,44 | $0,4 | $2,4 | 1 000K | 78,9 | 26 | — | — | 2 |
| 23 | Claude Opus 4.8 | Anthropic | 45,35 49,47 | $5 | $25 | 1 000K | 88,1 | 39,5 | 20,9 | — | 3 |
| 24 | GLM 5.2 | Zhipu AI / Z.ai | 45,29 49,37 | $0,42 | $1,32 | 1 049K | 89,1 | 38,1 | 20,9 | — | 3 |
| 25 | GPT 5.4 2026-03-05 | OpenAI | 45,12 48,09 | $2,5 | $15 | 1 050K | 91,1 | 44,8 | 23,4 | 33 | 4 |
| 26 | Qwen3.6 Flash | Alibaba (Qwen) | 44,69 50,2 | $0,19 | $1,13 | 1 000K | 79,2 | 21,2 | — | — | 2 |
| 27 | Claude 4.5 Opus | Anthropic | 44,6 48,21 | $5 | $25 | 200K | 81,4 | 41,8 | — | 21,4 | 3 |
| 28 | Qwen3.5 Flash | Alibaba (Qwen) | 44,14 49,11 | $0,09 | $0,36 | 1 000K | 78,5 | 19,8 | — | — | 2 |
| 29 | Claude Fable 5 | Anthropic | 43,81 48,44 | $10 | $50 | 1 000K | — | 68,3 | 28,6 | — | 2 |
| 30 | DeepSeek R1 0528 | DeepSeek | 43,55 47,92 | $0,25 | $0,25 | 164K | 68,4 | 27,4 | — | — | 2 |
| 31 | Claude Opus 4.7 | Anthropic | 43,47 45,61 | $5 | $25 | 1 000K | 86,9 | 50,6 | 12 | 33 | 4 |
| 32 | Gemini 2.5 Pro | Google DeepMind | 43,35 46,13 | $1,25 | $10 | 1 049K | 80,4 | 56 | 2 | — | 3 |
| 33 | Kimi K2.5 | Moonshot AI (Kimi) | 43,26 45,98 | $0,35 | $1,7 | 262K | 83,5 | 33,9 | — | 20,6 | 3 |
| 34 | Kimi K2.7 Code | Moonshot AI (Kimi) | 42,72 45,08 | $0,28 | $1,1 | 262K | 86 | 39,2 | 10 | — | 3 |
| 35 | Gemini 2.5 Pro Experimental 0325 | Google DeepMind | 42,71 46,24 | $2,5 | $10 | 1 049K | 78,5 | — | — | 14 | 2 |
| 36 | Qwen3.6 Plus | Alibaba (Qwen) | 42,7 45,04 | $0,5 | $3 | 1 000K | 83,2 | 49,1 | 2,9 | — | 3 |
| 37 | Kimi K2.6 | Moonshot AI (Kimi) | 42,55 44,8 | $0,22 | $1,14 | 262K | 87,7 | 38,7 | 8 | — | 3 |
| 38 | Grok 3 Mini | xAI | 41,95 44,73 | $0,3 | $0,5 | 131K | 68,4 | 21,1 | — | — | 2 |
| 39 | Grok 4.3 | xAI | 41,89 43,7 | $1,25 | $2,5 | 1 000K | 85,1 | 38 | 8 | — | 3 |
| 40 | Claude Sonnet 5 | Anthropic | 41,52 43,08 | $2 | $10 | 1 000K | 87,4 | 25 | 16,9 | — | 3 |
| 41 | GPT 5 2025-08-07 | OpenAI | 40,78 41,58 | $1,25 | $10 | 272K | 81,6 | 50,6 | 12,6 | 21,6 | 4 |
| 42 | Qwen3 235B A22B Thinking-2507 | Alibaba (Qwen) | 40,37 41,17 | $0,1 | $0,1 | 262K | 73,4 | 50,1 | 0 | — | 3 |
| 43 | GLM 5.1 | Zhipu AI / Z.ai | 40,17 40,83 | $0,06 | $0,22 | 205K | 80,6 | 37,3 | 4,6 | — | 3 |
| 44 | GPT 5.4 Mini 2026-03-17 | OpenAI | 39,01 38,9 | $0,75 | $4,5 | 272K | 78,1 | 28,6 | 10 | — | 3 |
| 45 | Claude Sonnet 4.6 | Anthropic | 38,73 38,44 | $3 | $15 | 1 000K | 83,2 | 29 | 3,1 | — | 3 |
| 46 | Claude Sonnet 3.7 | Anthropic | 38,68 38,19 | $3 | $15 | 200K | 73 | — | — | 3,4 | 2 |
| 47 | Claude 4.1 Opus | Anthropic | 37,98 37,19 | $15 | $75 | 200K | 69,7 | 34,8 | — | 7,1 | 3 |
| 48 | o1 2024-12-17 | OpenAI | 37,67 36,17 | $15 | $60 | 200K | 69 | — | — | 3,3 | 2 |
| 49 | o3 2025-04-16 | OpenAI | 37,47 36,62 | $2 | $8 | 200K | 75,8 | 53 | 1,4 | 16,3 | 4 |
| 50 | GPT 5 Nano 2025-08-07 | OpenAI | 37,45 35,73 | $0,05 | $0,4 | 272K | 59,3 | 12,2 | — | — | 2 |
| 51 | Gemini 2.5 Pro Preview 0506 | Google DeepMind | 36,89 34,61 | $1,25 | $10 | 1 049K | 55,6 | — | — | 13,7 | 2 |
| 52 | DeepSeek Reasoner | DeepSeek | 35,44 31,7 | $0,55 | $2,19 | 164K | 62,3 | — | 1,1 | — | 2 |
| 53 | GPT 4.5 Preview | OpenAI | 34,32 29,46 | $75 | $150 | 128K | 58,3 | — | — | 0,7 | 2 |
| 54 | GPT 5.4 Nano 2026-03-17 | OpenAI | 34,18 30,85 | $0,2 | $1,25 | 272K | 71,3 | 12 | 9,3 | — | 3 |
| 55 | DeepSeek Chat 0324 | DeepSeek | 33,79 28,41 | $0,2 | $0,6 | 164K | 56,8 | — | 0 | — | 2 |
| 56 | GPT 4.1 2025-04-14 | OpenAI | 33,72 28,26 | $2 | $8 | 1 048K | 55,9 | — | — | 0,6 | 2 |
| 57 | OpenAI GPT-4.1 Mini | OpenAI | 33,2 27,23 | $0,4 | $1,6 | 1 048K | 54,5 | — | 0 | — | 2 |
| 58 | GPT OSS 120B | OpenAI | 32,21 27,57 | $0,03 | $0,14 | 131K | 67,7 | 13,9 | 1,1 | — | 3 |
| 59 | o4 Mini 2025-04-16 | OpenAI | 31,6 27,82 | $1,1 | $4,4 | 200K | 72,8 | 23,9 | 0,6 | 14 | 4 |
| 60 | Claude Sonnet 4.5 | Anthropic | 31,48 27,64 | $3 | $15 | 1 000K | 76,4 | 23,6 | 1,1 | 9,4 | 4 |
| 61 | Mistral Medium 3 | Mistral AI | 31,1 23,02 | $0,4 | $2 | 131K | 46 | — | — | 0 | 2 |
| 62 | Claude 4 Sonnet | Anthropic | 30,8 25,22 | $3 | $15 | 1 000K | 72,3 | — | 0,3 | 3,1 | 3 |
| 63 | Gemini 2.0 Flash Thinking 0121 | Google DeepMind | 30,74 22,31 | $0,31 | $1 | 1 000K | 42,8 | — | — | 1,9 | 2 |
| 64 | Claude 4 Opus | Anthropic | 30,64 24,96 | $15 | $75 | 200K | 68,4 | — | 0,3 | 6,2 | 3 |
| 65 | GPT 5 Mini 2025-08-07 | OpenAI | 30,23 25,76 | $0,25 | $2 | 272K | 66,7 | 21 | 0 | 15,4 | 4 |
| 66 | DeepSeek V3 | DeepSeek | 30,1 21,03 | $0,27 | $1,1 | 164K | 42,1 | — | 0 | — | 2 |
| 67 | Claude 3.5 Sonnet 2024-10-22 | Anthropic | 29,69 20,2 | $3 | $15 | 200K | 40,4 | — | — | 0 | 2 |
| 68 | Claude Haiku 4.5 | Anthropic | 29,17 22,51 | $1 | $5 | 200K | 61,6 | 5,9 | 0 | — | 3 |
| 69 | Llama 4 Scout 17B 16E Instruct | Meta AI | 28,53 17,89 | $0,05 | $0,1 | 10 000K | 35,8 | — | 0 | — | 2 |
| 70 | GPT 4.1 Nano 2025-04-14 | OpenAI | 27,56 15,95 | $0,1 | $0,4 | 1 048K | 31,9 | — | 0 | — | 2 |
| 71 | Gemma 3 27B | Google DeepMind | 27,54 15,91 | $0,03 | $0,11 | 131K | 31,8 | — | 0 | — | 2 |
| 72 | Mistral Small 3.1 | Mistral AI | 27,08 14,99 | $0,1 | $0,3 | 128K | 30 | — | 0 | — | 2 |
| 73 | Llama 3.3 70B Instruct | Meta AI | 27,07 14,96 | $0,05 | $0,23 | 131K | 29,9 | — | 0 | — | 2 |
| 74 | Llama 4 Maverick 17b 128e Instruct | Meta AI | 27,05 18,97 | $0,05 | $0,1 | 1 049K | 56 | — | 0 | 0,9 | 3 |
| 75 | Gemma 4 31B | Google DeepMind | 22,34 5,5 | $0,1 | $0,3 | 262K | — | 9,6 | 1,4 | — | 2 |
| 76 | GPT-4o (2024-11-20) | OpenAI | 21,77 10,17 | $2,5 | $10 | 128K | 30,5 | — | 0 | 0 | 3 |
| 77 | Gemini 3.1 Flash Lite | Google DeepMind | 20,88 2,59 | $0,25 | $1,5 | 1 049K | — | — | 1,1 | 4 | 2 |
| 78 | Claude 3.5 Haiku | Anthropic | 20,51 8,07 | $0,25 | $1,25 | 200K | 17,5 | 6,7 | 0 | — | 3 |
| 79 | Llama 3.1 8B | Meta AI | 19,9 0,63 | $0,02 | $0,03 | 131K | 1,3 | — | 0 | — | 2 |
Le tableau défile latéralement : toutes les colonnes ne tiennent pas.
Les colonnes de droite sont les composantes du score, ramenées à une échelle commune de 0 à 100 selon la dispersion réelle parmi les modèles mesurés. Additionnées avec les poids indiqués, elles donnent le nombre de la colonne principale : on y voit sur quoi exactement un modèle en a devancé un autre. Un tiret signifie « non mesuré », et non zéro.
La colonne « jeux de tâches » indique sur combien de jeux le score de ce modèle est calculé. Plus il y en a, plus le chiffre est fiable : un score sur deux jeux est plus dispersé que sur six, et l'ajustement de couverture tient compte précisément de cela.
Le prix est le plus bas parmi les fournisseurs du modèle, tarif de base, hors tarifs par lots ou réduits. L'entrée et la sortie sont affichées séparément à dessein : chez la plupart des modèles, la sortie coûte plusieurs fois plus cher que l'entrée, et la facture finale dépend de ce qui domine dans la tâche.
Epoch AI
— licence CC-BY · source primaire
По данным Epoch AI
Tous les modèles ne sont pas mesurés ici. Sur les dix premiers de l’onglet « Par tâches résolues », il en manque 2 dans ce tableau — Gemini 3 Flash Preview, Grok 4.20 (Reasoning). Ils n'ont aucun score sur les jeux de tâches de cet onglet : une place vide signifie « non mesuré », et non « mauvais résultat ». Le modèle le plus récent atteint par ce jeu de tâches est sorti le 27 juillet 2026.
| # | Modèle | Développeur | Arena Score, questions expertes | Connexion$ / 1M | Sortie$ / 1M | Contextetokens |
|---|---|---|---|---|---|---|
| 1 | Claude Opus 4.6 | Anthropic | 1 536,69 1 528–1 545 | $5 | $25 | 1 000K |
| 2 | Claude Fable 5 ≈ | Anthropic | 1 526,12 1 511–1 541 | $10 | $50 | 1 000K |
| 3 | Claude Opus 5 ≈ | Anthropic | 1 524,59 1 486–1 563 | $5 | $25 | 1 000K |
| 4 | Claude Opus 4.7 ≈ | Anthropic | 1 522,22 1 513–1 531 | $5 | $25 | 1 000K |
| 5 | Gemini 3.5 Flash ≈ | Google DeepMind | 1 509,47 1 491–1 528 | $1,5 | $9 | 1 049K |
| 6 | GPT-5.6 Terra ≈ | OpenAI | 1 505,83 1 486–1 525 | $2 | $12 | 1 050K |
| 7 | GPT-5.6 Sol ≈ | OpenAI | 1 505,25 1 484–1 526 | $5 | $30 | 1 050K |
| 8 | MiMo V2.5 Pro ≈ | Xiaomi | 1 503,38 1 493–1 514 | $0,44 | $0,87 | 1 050K |
| 9 | Gemini 3.6 Flash ≈ | Google DeepMind | 1 502,8 1 479–1 527 | $1,5 | $7,5 | 1 049K |
| 10 | Claude Sonnet 4.6 ≈ | Anthropic | 1 501,16 1 492–1 510 | $3 | $15 | 1 000K |
| 11 | Claude Sonnet 5 ≈ | Anthropic | 1 495,95 1 481–1 511 | $2 | $10 | 1 000K |
| 12 | Kimi K3 ≈ | Moonshot AI (Kimi) | 1 495,53 1 462–1 529 | $2 | $8 | 1 049K |
| 13 | Kimi K2.6 ≈ | Moonshot AI (Kimi) | 1 489,72 1 479–1 500 | $0,22 | $1,14 | 262K |
| 14 | Claude Opus 4.8 ≈ | Anthropic | 1 489,04 1 478–1 500 | $5 | $25 | 1 000K |
| 15 | ERNIE 5.1 ≈ | Baidu (Ernie) | 1 486,57 1 476–1 498 | $0,75 | $3 | 119K |
| 16 | Gemini 3.1 Pro Preview ≈ | Google DeepMind | 1 486,42 1 479–1 494 | $2 | $12 | 1 049K |
| 17 | Claude 4.5 Opus ≈ | Anthropic | 1 486,32 1 477–1 495 | $5 | $25 | 200K |
| 18 | Muse Spark 1.1 ≈ | Meta AI | 1 485,93 1 467–1 504 | $1,25 | $4,25 | 1 049K |
| 19 | GLM 5.1 ≈ | Zhipu AI / Z.ai | 1 483,37 1 472–1 494 | $0,06 | $0,22 | 205K |
| 20 | GPT-5.6 Luna ≈ | OpenAI | 1 480,28 1 460–1 500 | $0,2 | $1,2 | 1 050K |
| 21 | Gemini 3 Pro ≈ | Google DeepMind | 1 479,99 1 468–1 492 | $1,6 | $9,6 | 1 049K |
| 22 | MiMo V2 Pro ≈ | Xiaomi | 1 478,6 1 465–1 492 | $0,44 | $0,87 | 1 049K |
| 23 | Grok 4.5 ≈ | xAI | 1 477,5 1 459–1 496 | $2 | $6 | 500K |
| 24 | Qwen3.6 Max Preview ≈ | Alibaba (Qwen) | 1 473,55 1 448–1 500 | $1,3 | $7,8 | 262K |
| 25 | Claude Sonnet 4.5 ≈ | Anthropic | 1 472,22 1 464–1 481 | $3 | $15 | 1 000K |
| 26 | GLM 5.2 ≈ | Zhipu AI / Z.ai | 1 469,73 1 456–1 483 | $0,42 | $1,32 | 1 049K |
| 27 | MiniMax M3 ≈ | MiniMax | 1 468,91 1 458–1 480 | $0,3 | $1,2 | 1 049K |
| 28 | Qwen3.7 Plus ≈ | Alibaba (Qwen) | 1 468,58 1 456–1 481 | $0,5 | $3 | 1 000K |
| 29 | Inkling ≈ | Thinking Machines Lab | 1 468,48 1 447–1 490 | $1,87 | $4,68 | 1 049K |
| 30 | Qwen3.5 397B-A17B ≈ | Alibaba (Qwen) | 1 467,1 1 459–1 476 | $0,6 | $3,6 | 262K |
| 31 | Kimi K2.5 Thinking TEE ≈ | Moonshot AI (Kimi) | 1 466,31 1 458–1 475 | $0,3 | $1,9 | 256K |
| 32 | DeepSeek V4 Pro ≈ | DeepSeek | 1 464,63 1 455–1 474 | $0,44 | $0,87 | 1 049K |
| 33 | Gemini 3 Flash ≈ | Google DeepMind | 1 463,04 1 450–1 476 | $0,4 | $2,4 | 1 049K |
| 34 | MiMo V2.5 ≈ | Xiaomi | 1 461,91 1 452–1 472 | $0,14 | $0,28 | 1 050K |
| 35 | Hy3 ≈ | Tencent (Hunyuan) | 1 461,49 1 429–1 494 | $0,13 | $0,53 | 262K |
| 36 | Qwen3 Max Preview ≈ | Alibaba (Qwen) | 1 460,52 1 444–1 477 | $1,2 | $6 | 256K |
| 37 | Qwen3.6 Plus ≈ | Alibaba (Qwen) | 1 457,59 1 448–1 467 | $0,5 | $3 | 1 000K |
| 38 | GLM 5 ≈ | Zhipu AI / Z.ai | 1 456,83 1 444–1 469 | $0,48 | $1,9 | 205K |
| 39 | Qwen3 235B A22B Thinking-2507 ≈ | Alibaba (Qwen) | 1 456,35 1 428–1 485 | $0,1 | $0,1 | 262K |
| 40 | Gemini 2.5 Pro ≈ | Google DeepMind | 1 454,85 1 448–1 462 | $1,25 | $10 | 1 049K |
| 41 | Gemma 4 31B ≈ | Google DeepMind | 1 451,71 1 425–1 478 | $0,14 | $0,4 | 262K |
| 42 | GLM 5V Turbo ≈ | Zhipu AI / Z.ai | 1 450,03 1 431–1 469 | $0,7 | $3,1 | 203K |
| 43 | Gemma 4 26B-A4B ≈ | Google DeepMind | 1 448,38 1 421–1 475 | $0,05 | $0,29 | 262K |
| 44 | Qwen3 VL 235B A22B Instruct ≈ | Alibaba (Qwen) | 1 446,72 1 422–1 472 | $0,4 | $1,6 | 262K |
| 45 | Grok 4.20 Multi Agent Beta 0309 ≈ | xAI | 1 446,27 1 438–1 455 | $2 | $6 | 2 000K |
| 46 | MiMo V2 Omni ≈ | Xiaomi | 1 445,37 1 431–1 459 | $0,14 | $0,28 | 262K |
| 47 | Qwen3 235B A22B Instruct 2507 ≈ | Alibaba (Qwen) | 1 444,43 1 436–1 452 | $0,1 | $0,1 | 262K |
| 48 | DeepSeek V4 Flash ≈ | DeepSeek | 1 444 1 434–1 454 | $0,14 | $0,28 | 1 049K |
| 49 | Claude Haiku 4.5 ≈ | Anthropic | 1 443,71 1 437–1 451 | $1 | $5 | 200K |
| 50 | Seed 2.0 Pro ≈ | ByteDance (Doubao) | 1 440,78 1 432–1 449 | $0,5 | $3 | 131K |
| 51 | Grok 4.20 (Reasoning) ≈ | xAI | 1 439,3 1 431–1 448 | $2 | $6 | 2 000K |
| 52 | GPT-5.2 Chat ≈ | OpenAI | 1 438,99 1 427–1 451 | $1,75 | $14 | 128K |
| 53 | Longcat Flash Chat ≈ | Meituan | 1 438,56 1 413–1 464 | — | — | 131K |
| 54 | Kimi K2 Thinking Turbo ≈ | Moonshot AI (Kimi) | 1 438,16 1 429–1 448 | $1,15 | $8 | 262K |
| 55 | MiniMax M2.7 ≈ | MiniMax | 1 437,81 1 428–1 447 | $0,3 | $1,2 | 205K |
| 56 | DeepSeek V3.2 ≈ | DeepSeek | 1 435,41 1 425–1 446 | $0,28 | $0,4 | 164K |
| 57 | Gemini 3.5 Flash Lite ≈ | Google DeepMind | 1 435,08 1 411–1 460 | $0,3 | $2,5 | 1 049K |
| 58 | Mistral Medium 3.5 ≈ | Mistral AI | 1 434,79 1 417–1 453 | $1,5 | $7,5 | 262K |
| 59 | Qwen3.5 122B-A10B ≈ | Alibaba (Qwen) | 1 434,47 1 422–1 447 | $0,4 | $3,2 | 262K |
| 60 | GLM 4.6 ≈ | Zhipu AI / Z.ai | 1 434,38 1 421–1 448 | $0,29 | $1,14 | 205K |
| 61 | GLM 4.5 ≈ | Zhipu AI / Z.ai | 1 428,11 1 410–1 446 | $0,2 | $0,8 | 131K |
| 62 | MiMo V2 Flash ≈ | Xiaomi | 1 426,96 1 417–1 437 | $0,14 | $0,28 | 262K |
| 63 | Qwen3.5 27B ≈ | Alibaba (Qwen) | 1 425,5 1 413–1 438 | $0,3 | $2,4 | 262K |
| 64 | 2025) ≈ | Google DeepMind | 1 425,27 1 411–1 440 | $0,3 | $2,5 | 1 049K |
| 65 | Claude 4.1 Opus ≈ | Anthropic | 1 425,18 1 415–1 435 | $15 | $75 | 200K |
| 66 | Gemini 2.5 Flash ≈ | Google DeepMind | 1 425,15 1 418–1 432 | $0,3 | $2,5 | 1 049K |
| 67 | Step 3.5 Flash ≈ | StepFun | 1 423,33 1 414–1 432 | $0,1 | $0,3 | 262K |
| 68 | Qwen3 VL 235B A22B Thinking ≈ | Alibaba (Qwen) | 1 420,37 1 390–1 450 | $0,4 | $4 | 262K |
| 69 | GLM 4.7 ≈ | Zhipu AI / Z.ai | 1 420,1 1 398–1 442 | $0,15 | $0,8 | 205K |
| 70 | Mistral Large 3 ≈ | Mistral AI | 1 419,83 1 410–1 429 | $0,5 | $1,5 | 256K |
| 71 | Grok 4 ≈ | xAI | 1 417,67 1 404–1 431 | $3 | $15 | 256K |
| 72 | GPT-5.5 Instant ≈ | OpenAI | 1 415,65 1 403–1 428 | $5 | $30 | 400K |
| 73 | Grok 4.1 ≈ | xAI | 1 414,21 1 405–1 423 | $2 | $10 | 200K |
| 74 | Qwen3.5 Flash ≈ | Alibaba (Qwen) | 1 411,36 1 402–1 420 | $0,09 | $0,36 | 1 000K |
| 75 | Qwen3 Next 80B A3B Instruct ≈ | Alibaba (Qwen) | 1 410,5 1 392–1 429 | $0,15 | $1,2 | 262K |
| 76 | Mistral Medium 3.1 ≈ | Mistral AI | 1 409,62 1 402–1 418 | $0,4 | $2 | 262K |
| 77 | Grok 4 Fast Reasoning ≈ | xAI | 1 407,49 1 388–1 427 | $0,2 | $0,5 | 2 000K |
| 78 | GPT 5 Chat ≈ | OpenAI | 1 407,22 1 392–1 423 | $1,25 | $10 | 128K |
| 79 | Qwen3.5 35B A3B ≈ | Alibaba (Qwen) | 1 407,1 1 395–1 419 | $0,25 | $2 | 262K |
| 80 | DeepSeek V3.1 ≈ | DeepSeek | 1 403,19 1 381–1 425 | $0,2 | $0,7 | 164K |
| 81 | MiMo V2 Flash (Thinking) ≈ | Xiaomi | 1 403,08 1 382–1 424 | $0,1 | $0,31 | 256K |
| 82 | Grok 4.1 Fast Reasoning ≈ | xAI | 1 401,39 1 392–1 411 | $0,2 | $0,5 | 2 000K |
| 83 | DeepSeek V3.2 Exp ≈ | DeepSeek | 1 400,8 1 377–1 424 | $0,22 | $0,33 | 164K |
| 84 | o3 2025-04-16 ≈ | OpenAI | 1 400,18 1 389–1 412 | $2 | $8 | 200K |
| 85 | ChatGPT 4o Latest ≈ | OpenAI | 1 399,56 1 391–1 409 | $5 | $15 | 128K |
| 86 | Gemini 3.1 Flash Lite Preview ≈ | Google DeepMind | 1 398,48 1 390–1 407 | $0,25 | $1,5 | 1 049K |
| 87 | Qwen3 Max 2025-09-23 ≈ | Alibaba (Qwen) | 1 397,86 1 371–1 425 | $0,86 | $3,43 | 258K |
| 88 | DeepSeek R1 0528 ≈ | DeepSeek | 1 397,35 1 378–1 417 | $0,25 | $0,25 | 164K |
| 89 | Nemotron 3 Super ≈ | NVIDIA | 1 397,25 1 374–1 420 | $0,2 | $0,8 | 1 000K |
| 90 | NVIDIA Nemotron 3 Super 120B A12B ≈ | NVIDIA | 1 397,25 1 374–1 420 | $0,15 | $0,65 | 262K |
| 91 | GPT-5.3 Chat (latest) ≈ | OpenAI | 1 396,44 1 385–1 408 | $1,75 | $14 | 128K |
| 92 | GPT 4.5 Preview ≈ | OpenAI | 1 393,91 1 371–1 417 | $75 | $150 | 128K |
| 93 | Qwen3 30B A3B Instruct 2507 ≈ | Alibaba (Qwen) | 1 391,18 1 374–1 408 | $0,05 | $0,19 | 262K |
| 94 | Hunyuan T1 ≈ | Tencent (Hunyuan) | 1 388 1 350–1 426 | — | — | 131K |
| 95 | Grok 4.3 ≈ | xAI | 1 387,07 1 377–1 397 | $1,25 | $2,5 | 1 000K |
| 96 | MiniMax M2.5 ≈ | MiniMax | 1 374 1 363–1 385 | $0,3 | $1,2 | 1 000K |
| 97 | Claude 4 Opus ≈ | Anthropic | 1 371,29 1 359–1 384 | $15 | $75 | 200K |
| 98 | GLM 4.5 Air ≈ | Zhipu AI / Z.ai | 1 369,4 1 354–1 385 | $0,11 | $0,29 | 131K |
| 99 | Qwen3 Next 80B A3B Thinking ≈ | Alibaba (Qwen) | 1 368,94 1 345–1 393 | $0,15 | $1,2 | 262K |
| 100 | Nemotron 3 Nano 30B A3B ≈ | NVIDIA | 1 367,68 1 348–1 387 | $0,05 | $0,2 | 262K |
Le tableau défile latéralement : toutes les colonnes ne tiennent pas.
Le prix est le plus bas parmi les fournisseurs du modèle, tarif de base, hors tarifs par lots ou réduits. L'entrée et la sortie sont affichées séparément à dessein : chez la plupart des modèles, la sortie coûte plusieurs fois plus cher que l'entrée, et la facture finale dépend de ce qui domine dans la tâche.
Le signe ≈ marque les modèles dont l'intervalle de confiance recoupe celui de la ligne du dessus. Il y en a ici 99 modèles — leur ordre entre eux n'est pas déterminé par les données disponibles.
L'intervalle de confiance de la moitié des modèles dépasse 25,4 points — soit environ 15 lignes voisines du tableau. À l'intérieur d'un tel groupe, l'ordre est fixé non par les données mais par ceux qui ont voté cette fois-ci ; les données soutiennent l'écart entre le début et la fin de la liste, mais pas le voisinage des places. Votes par modèle ici — médiane 2 265: moins il y en a, plus l'intervalle est large.
Arena (LMArena)
— licence CC-BY-4.0 · source primaire
По данным Arena (LMArena)