Le classement général : cinq capacités ramenées à un seul score, pour comparer les modèles dans leur ensemble plutôt que sur une seule tâche. Il est construit sur des comparaisons à l'aveugle par de vraies personnes : il dit donc quelles réponses sont préférées le plus souvent, pas combien de tâches ont été résolues. Pour un savoir-faire précis, la sélection dédiée est plus juste.
| # | Modèle | Développeur | Score global | Connexion$ / 1M | Sortie$ / 1M | Contextetokens | code25 % | langue20 % | mathématiques15 % | connaissances20 % | raisonnement20 % |
|---|---|---|---|---|---|---|---|---|---|---|---|
| 1 | Claude Opus 5 | Anthropic | 99,55 94–100 | $5 | $25 | 1 000K | 99,9 | 100 | 100 | 97,9 | 100 |
| 2 | Claude Fable 5 ≈ | Anthropic | 97,78 95–99 | $10 | $50 | 1 000K | 97 | 99,6 | 98,1 | 98,2 | 96,4 |
| 3 | Claude Opus 4.6 ≈ | Anthropic | 97,74 96–99 | $5 | $25 | 1 000K | 100 | 95,8 | 93,2 | 100 | 98,1 |
| 4 | Claude Opus 4.7 ≈ | Anthropic | 95,04 93–97 | $5 | $25 | 1 000K | 96,5 | 96,2 | 89,6 | 97,5 | 93,7 |
| 5 | Gemini 3.6 Flash ≈ | Google DeepMind | 93,16 89–97 | $1,5 | $7,5 | 1 049K | 92,6 | 94,4 | 93,3 | 94,2 | 91,6 |
| 6 | Gemini 3.5 Flash ≈ | Google DeepMind | 92,6 89–96 | $1,5 | $9 | 1 049K | 91,9 | 89,3 | 96,2 | 95,3 | 91,3 |
| 7 | Kimi K3 ≈ | Moonshot AI (Kimi) | 92,55 89–96 | $2 | $8 | 1 049K | 93,4 | — | — | 92,9 | 91,2 |
| 8 | MiMo V2.5 Pro ≈ | Xiaomi | 92,4 91–94 | $0,44 | $0,87 | 1 050K | 93,1 | 94,4 | 87,6 | 94,3 | 91,3 |
| 9 | Muse Spark 1.1 ≈ | Meta AI | 91,89 89–95 | $1,25 | $4,25 | 1 049K | 92,6 | 96,4 | 86,3 | 91,3 | 91,4 |
| 10 | GPT-5.6 Terra ≈ | OpenAI | 91,77 88–95 | $2 | $12 | 1 050K | 91,3 | 96,7 | 86,6 | 94,7 | 88,4 |
| 11 | Gemini 3.1 Pro Preview ≈ | Google DeepMind | 91,37 90–93 | $2 | $12 | 1 049K | 90,4 | 94,1 | 89,7 | 91,4 | 91,1 |
| 12 | Claude Sonnet 4.6 ≈ | Anthropic | 91,18 90–93 | $3 | $15 | 1 000K | 93,9 | 90 | 84,5 | 93,9 | 91,2 |
| 13 | ERNIE 5.1 ≈ | Baidu (Ernie) | 91,01 89–93 | $0,75 | $3 | 119K | 91,3 | 93,3 | 87,8 | 91,4 | 90,4 |
| 14 | Gemini 3 Pro ≈ | Google DeepMind | 90,89 89–93 | $1,6 | $9,6 | 1 049K | 90,2 | 95,3 | 87,3 | 90,3 | 90,7 |
| 15 | GLM 5.1 ≈ | Zhipu AI / Z.ai | 90,62 89–93 | $0,06 | $0,22 | 205K | 92,1 | 91,8 | 87,8 | 90,9 | 89,5 |
| 16 | Claude 4.5 Opus ≈ | Anthropic | 90,48 89–92 | $5 | $25 | 200K | 93,1 | 92,2 | 84,2 | 91,4 | 89,4 |
| 17 | Kimi K2.6 ≈ | Moonshot AI (Kimi) | 90,04 88–92 | $0,22 | $1,14 | 262K | 91 | 90,9 | 87 | 92 | 88,4 |
| 18 | GPT-5.6 Sol ≈ | OpenAI | 90,02 86–94 | $5 | $30 | 1 050K | 90,8 | 90,2 | 83 | 94,6 | 89,6 |
| 19 | Claude Opus 4.8 ≈ | Anthropic | 89,95 88–92 | $5 | $25 | 1 000K | 90,7 | 91,3 | 85,5 | 91,8 | 89,1 |
| 20 | Claude Sonnet 5 ≈ | Anthropic | 89,41 87–92 | $2 | $10 | 1 000K | 90,7 | 90 | 84,8 | 93 | 87 |
| 21 | GLM 5.2 ≈ | Zhipu AI / Z.ai | 89,16 87–92 | $0,42 | $1,32 | 1 049K | 89,2 | 92,2 | 86,4 | 88,5 | 88,9 |
| 22 | Qwen3.7 Plus ≈ | Alibaba (Qwen) | 88,91 87–91 | $0,5 | $3 | 1 000K | 90 | 91,9 | 86 | 88,3 | 87,3 |
| 23 | Grok 4.5 ≈ | xAI | 88,79 85–92 | $2 | $6 | 500K | 89,5 | 88,3 | 88,8 | 89,9 | 87,3 |
| 24 | Gemini 3 Flash ≈ | Google DeepMind | 88,54 86–91 | $0,4 | $2,4 | 1 049K | 86,4 | 94,6 | 86,9 | 87,4 | 87,5 |
| 25 | MiMo V2 Pro ≈ | Xiaomi | 87,93 86–90 | $0,44 | $0,87 | 1 049K | 89 | 90,6 | 82 | 90 | 86,3 |
| 26 | Inkling ≈ | Thinking Machines Lab | 87,44 84–91 | $1,87 | $4,68 | 1 049K | 87,3 | 88,9 | 87,7 | 88,3 | 85,1 |
| 27 | Kimi K2.5 Thinking TEE ≈ | Moonshot AI (Kimi) | 87,39 86–89 | $0,3 | $1,9 | 256K | 88,5 | 88,1 | 86,3 | 87,9 | 85,6 |
| 28 | Qwen3.6 Max Preview ≈ | Alibaba (Qwen) | 87,23 83–92 | $1,3 | $7,8 | 262K | 87,3 | 88,4 | 84,7 | 89,2 | 85,9 |
| 29 | Claude Sonnet 4.5 ≈ | Anthropic | 87,17 86–89 | $3 | $15 | 1 000K | 90,7 | 88,8 | 77,1 | 89 | 87 |
| 30 | DeepSeek V4 Pro ≈ | DeepSeek | 87,03 85–89 | $0,44 | $0,87 | 1 049K | 87,9 | 90,1 | 81 | 87,6 | 86,8 |
| 31 | Hy3 ≈ | Tencent (Hunyuan) | 86,42 83–90 | $0,13 | $0,53 | 262K | 87,3 | — | — | 87,1 | 84,6 |
| 32 | Qwen3.5 397B-A17B ≈ | Alibaba (Qwen) | 86,39 85–88 | $0,6 | $3,6 | 262K | 87 | 88,8 | 82,2 | 88,1 | 84,7 |
| 33 | GPT-5.6 Luna ≈ | OpenAI | 86,35 83–90 | $0,2 | $1,2 | 1 050K | 88,1 | 84,1 | 82,4 | 90,3 | 85,4 |
| 34 | Grok 4.20 (Reasoning) ≈ | xAI | 86,12 85–88 | $2 | $6 | 2 000K | 85,7 | 92,2 | 83,7 | 83,3 | 85,2 |
| 35 | Gemini 2.5 Pro ≈ | Google DeepMind | 86,06 85–87 | $1,25 | $10 | 1 049K | 84,5 | 91,1 | 82,5 | 86 | 85,7 |
| 36 | MiniMax M3 ≈ | MiniMax | 86,02 84–88 | $0,3 | $1,2 | 1 049K | 88,3 | 86 | 80,9 | 88,4 | 84,6 |
| 37 | Seed 2.0 Pro ≈ | ByteDance (Doubao) | 85,93 84–87 | $0,5 | $3 | 131K | 88 | 90,3 | 80,3 | 83,6 | 85,6 |
| 38 | Qwen3 Max Preview ≈ | Alibaba (Qwen) | 85,84 83–88 | $1,2 | $6 | 256K | 85,4 | 89,2 | 82,4 | 86,9 | 84,6 |
| 39 | Qwen3.6 Plus ≈ | Alibaba (Qwen) | 85,84 84–88 | $0,5 | $3 | 1 000K | 87 | 87,6 | 82,6 | 86,4 | 84,5 |
| 40 | GLM 5V Turbo ≈ | Zhipu AI / Z.ai | 85,72 82–89 | $0,7 | $3,1 | 203K | 87,3 | 88,2 | 83,2 | 85,1 | 83,7 |
| 41 | MiMo V2.5 ≈ | Xiaomi | 85,67 84–87 | $0,14 | $0,28 | 1 050K | 87,7 | 86,4 | 80,5 | 87,2 | 84,8 |
| 42 | GLM 5 ≈ | Zhipu AI / Z.ai | 85,56 83–88 | $0,48 | $1,9 | 205K | 86 | 88,8 | 80,2 | 86,3 | 85,1 |
| 43 | Grok 4.20 Multi Agent Beta 0309 ≈ | xAI | 85,39 84–87 | $2 | $6 | 2 000K | 85,5 | 90,7 | 80,4 | 84,5 | 84,6 |
| 44 | Gemma 4 26B-A4B ≈ | Google DeepMind | 85,19 81–89 | $0,05 | $0,29 | 262K | 82,9 | 90,4 | 85,5 | 84,9 | 82,9 |
| 45 | Gemma 4 31B ≈ | Google DeepMind | 85,02 81–89 | $0,14 | $0,4 | 262K | 85 | 85,4 | 85,4 | 85,4 | 84 |
| 46 | Longcat Flash Chat ≈ | Meituan | 84,74 81–89 | — | — | 131K | 87,4 | 89,1 | 80,7 | 83,2 | 81,7 |
| 47 | MiMo V2 Omni ≈ | Xiaomi | 84,54 82–87 | $0,14 | $0,28 | 262K | 86,9 | 86,9 | 79 | 84,3 | 83,6 |
| 48 | GLM 4.6 ≈ | Zhipu AI / Z.ai | 83,86 82–86 | $0,29 | $1,14 | 205K | 83,9 | 89,5 | 79,1 | 82,5 | 83,1 |
| 49 | Mistral Medium 3.5 ≈ | Mistral AI | 83,85 81–87 | $1,5 | $7,5 | 262K | 86 | 87,4 | 79,3 | 82,5 | 82,4 |
| 50 | DeepSeek V4 Flash ≈ | DeepSeek | 83,53 82–85 | $0,14 | $0,28 | 1 049K | 85,2 | 84,7 | 78,2 | 84,1 | 83,7 |
| 51 | Gemini 3.5 Flash Lite ≈ | Google DeepMind | 83,46 79–88 | $0,3 | $2,5 | 1 049K | 85,1 | 88,2 | 75,8 | 82,6 | 83,3 |
| 52 | GPT-5.2 Chat ≈ | OpenAI | 83,45 81–85 | $1,75 | $14 | 128K | 83,4 | 86,2 | 79,4 | 83,3 | 84 |
| 53 | Qwen3 235B A22B Instruct 2507 ≈ | Alibaba (Qwen) | 83,29 82–85 | $0,1 | $0,1 | 262K | 83,1 | 87,5 | 78,9 | 84,2 | 81,8 |
| 54 | Qwen3 VL 235B A22B Instruct ≈ | Alibaba (Qwen) | 83,23 79–87 | $0,4 | $1,6 | 262K | 82,2 | 89,2 | 77,9 | 84,6 | 81,2 |
| 55 | Claude 4.1 Opus ≈ | Anthropic | 83,21 82–85 | $15 | $75 | 200K | 88,4 | 83,6 | 77,1 | 80,9 | 83,2 |
| 56 | DeepSeek V3.2 ≈ | DeepSeek | 82,67 81–84 | $0,28 | $0,4 | 164K | 83,8 | 84,4 | 79,8 | 82,6 | 81,8 |
| 57 | Mistral Large 3 ≈ | Mistral AI | 82,37 81–84 | $0,5 | $1,5 | 256K | 82,9 | 90,1 | 75,9 | 80 | 81,2 |
| 58 | GLM 4.7 ≈ | Zhipu AI / Z.ai | 82,32 79–86 | $0,15 | $0,8 | 205K | 85,1 | 83,5 | 77,4 | 80 | 83,7 |
| 59 | Kimi K2 Thinking Turbo ≈ | Moonshot AI (Kimi) | 82,31 81–84 | $1,15 | $8 | 262K | 84,7 | 83,1 | 78,5 | 83,1 | 80,7 |
| 60 | Grok 4.1 ≈ | xAI | 81,83 80–83 | $2 | $10 | 200K | 83 | 86,9 | 76,3 | 79 | 82,3 |
| 61 | Qwen3.5 122B-A10B ≈ | Alibaba (Qwen) | 81,78 80–84 | $0,4 | $3,2 | 262K | 81,4 | 86,2 | 78,4 | 82,5 | 79,6 |
| 62 | MiniMax M2.7 ≈ | MiniMax | 81,65 80–83 | $0,3 | $1,2 | 205K | 84,3 | 82,5 | 76,8 | 83,1 | 79,7 |
| 63 | Mistral Medium 3.1 ≈ | Mistral AI | 81,21 80–83 | $0,4 | $2 | 262K | 81,2 | 89,5 | 75 | 78,2 | 80,6 |
| 64 | GLM 4.5 ≈ | Zhipu AI / Z.ai | 81,04 78–84 | $0,2 | $0,8 | 131K | 80,9 | 83,2 | 78,1 | 81,4 | 80,9 |
| 65 | Qwen3 Next 80B A3B Instruct ≈ | Alibaba (Qwen) | 80,91 78–84 | $0,15 | $1,2 | 262K | 82,4 | 81,7 | 80,9 | 78,4 | 80,8 |
| 66 | GPT-5.5 Instant ≈ | OpenAI | 80,57 78–83 | $5 | $30 | 400K | 81,1 | 83,6 | 77,4 | 79,2 | 80,6 |
| 67 | DeepSeek V3.2 Exp ≈ | DeepSeek | 80,46 77–84 | $0,22 | $0,33 | 164K | 80,9 | 85,2 | 77,6 | 76,7 | 81,1 |
| 68 | Claude Haiku 4.5 ≈ | Anthropic | 80,4 79–82 | $1 | $5 | 200K | 84,2 | 80 | 71,7 | 84,1 | 78,9 |
| 69 | Qwen3 235B A22B Thinking-2507 ≈ | Alibaba (Qwen) | 80,06 77–83 | $0,1 | $0,1 | 262K | 79,1 | — | 75,5 | 86,2 | 78,5 |
| 70 | Gemini 2.5 Flash ≈ | Google DeepMind | 80,01 79–81 | $0,3 | $2,5 | 1 049K | 79,1 | 84,4 | 75 | 80,9 | 79,8 |
| 71 | MiMo V2 Flash ≈ | Xiaomi | 79,84 78–82 | $0,14 | $0,28 | 262K | 82,4 | 81,6 | 72,3 | 81,2 | 79,3 |
| 72 | Qwen3 Max 2025-09-23 ≈ | Alibaba (Qwen) | 79,78 77–83 | $0,86 | $3,43 | 258K | 82 | — | 80,3 | 76,2 | 80,2 |
| 73 | DeepSeek V3.1 ≈ | DeepSeek | 79,69 76–83 | $0,2 | $0,7 | 164K | 77,4 | 88,4 | 77 | 77,1 | 78,4 |
| 74 | Step 3.5 Flash ≈ | StepFun | 79,65 78–81 | $0,1 | $0,3 | 262K | 81,6 | 82,2 | 74,3 | 80,6 | 77,8 |
| 75 | Qwen3.5 27B ≈ | Alibaba (Qwen) | 79,48 77–82 | $0,3 | $2,4 | 262K | 79,3 | 79,7 | 79,3 | 80,9 | 78,1 |
| 76 | ChatGPT 4o Latest ≈ | OpenAI | 79,12 78–81 | $5 | $15 | 128K | 77,4 | 86,7 | 74,1 | 76,5 | 80,2 |
| 77 | 2025) ≈ | Google DeepMind | 78,85 77–81 | $0,3 | $2,5 | 1 049K | 75 | 85,3 | 76,1 | 80,9 | 77,3 |
| 78 | Grok 4 ≈ | xAI | 78,72 77–81 | $3 | $15 | 256K | 76,3 | 83,2 | 77,6 | 79,6 | 77,2 |
| 79 | o3 2025-04-16 ≈ | OpenAI | 78,53 77–80 | $2 | $8 | 200K | 76,2 | 86,6 | 77,6 | 76,6 | 76 |
| 80 | Qwen3 VL 235B A22B Thinking ≈ | Alibaba (Qwen) | 78,45 75–82 | $0,4 | $4 | 262K | 79,9 | — | 75,8 | 80,1 | 77,1 |
| 81 | DeepSeek R1 0528 ≈ | DeepSeek | 78,4 75–82 | $0,25 | $0,25 | 164K | 79,7 | 82,4 | 73,8 | 76,1 | 78,5 |
| 82 | Grok 4 Fast Reasoning ≈ | xAI | 78,33 75–81 | $0,2 | $0,5 | 2 000K | 78,1 | 84,7 | 73,7 | 77,9 | 76,2 |
| 83 | Gemini 3.1 Flash Lite Preview ≈ | Google DeepMind | 77,65 76–79 | $0,25 | $1,5 | 1 049K | 74,6 | 82,7 | 78,9 | 76,3 | 76,9 |
| 84 | Qwen3.5 Flash ≈ | Alibaba (Qwen) | 77,6 76–79 | $0,09 | $0,36 | 1 000K | 77,2 | 80,6 | 74,8 | 78,5 | 76,4 |
| 85 | Grok 4.1 Fast Reasoning ≈ | xAI | 77,42 76–79 | $0,2 | $0,5 | 2 000K | 76,9 | 81,6 | 74 | 76,8 | 77,1 |
| 86 | MiMo V2 Flash (Thinking) ≈ | Xiaomi | 77,24 74–81 | $0,1 | $0,31 | 256K | 77,9 | 83,4 | 69,1 | 77,1 | 76,5 |
| 87 | Qwen3.5 35B A3B ≈ | Alibaba (Qwen) | 77,23 75–79 | $0,25 | $2 | 262K | 76,4 | 81,7 | 74 | 77,8 | 75,7 |
| 88 | GPT 5 Chat ≈ | OpenAI | 76,95 74–79 | $1,25 | $10 | 128K | 74,7 | 81 | 74,7 | 77,8 | 76,6 |
| 89 | Qwen3 30B A3B Instruct 2507 ≈ | Alibaba (Qwen) | 76,82 74–80 | $0,05 | $0,19 | 262K | 77,9 | 82,4 | 72,1 | 75,1 | 75,2 |
| 90 | GPT 4.5 Preview ≈ | OpenAI | 76,57 72–81 | $75 | $150 | 128K | 74,1 | 82 | 75,3 | 75,5 | 76,3 |
| 91 | Grok 4.3 ≈ | xAI | 76,14 74–78 | $1,25 | $2,5 | 1 000K | 77,6 | 80,2 | 71,4 | 74,4 | 75,6 |
| 92 | GPT-5.3 Chat (latest) ≈ | OpenAI | 75,44 73–77 | $1,75 | $14 | 128K | 75,8 | 78,7 | 70,2 | 76 | 75,1 |
| 93 | DeepSeek V3.1 Terminus ≈ | DeepSeek | 75,4 71–80 | $0,21 | $0,79 | 164K | 75,9 | — | 72,8 | — | 76,7 |
| 94 | Nemotron 3 Super ≈ | NVIDIA | 75,39 72–79 | $0,2 | $0,8 | 1 000K | 75,8 | 80,3 | 69,8 | 76,1 | 73,5 |
| 95 | NVIDIA Nemotron 3 Super 120B A12B ≈ | NVIDIA | 74,16 71–77 | $0,15 | $0,65 | 262K | 75,8 | — | 69,8 | 76,1 | 73,5 |
| 96 | Hunyuan T1 ≈ | Tencent (Hunyuan) | 74,09 69–79 | — | — | 131K | 72,3 | — | 74,9 | 74,5 | 75,4 |
| 97 | GLM 4.5 Air ≈ | Zhipu AI / Z.ai | 74,02 72–77 | $0,11 | $0,29 | 131K | 74 | 80,3 | 72,6 | 71,3 | 71,6 |
| 98 | Kimi K2 0905 Preview ≈ | Moonshot AI (Kimi) | 73,21 69–77 | $0,6 | $2,5 | 262K | 74,6 | 75,1 | 72,6 | 70,9 | 72,4 |
| 99 | Claude 4 Opus ≈ | Anthropic | 72,06 70–74 | $15 | $75 | 200K | 75 | 72,7 | 68,1 | 71,6 | 71,2 |
| 100 | Qwen3 Coder 480B A35B ≈ | Alibaba (Qwen) | 72,06 69–75 | $1,5 | $7,5 | 262K | 77 | 77,8 | 66,7 | 65,8 | 70,5 |
Le tableau défile latéralement : toutes les colonnes ne tiennent pas.
Les colonnes de droite sont les composantes du score, ramenées à une échelle commune de 0 à 100 selon la dispersion réelle parmi les modèles mesurés. Additionnées avec les poids indiqués, elles donnent le nombre de la colonne principale : on y voit sur quoi exactement un modèle en a devancé un autre. Un tiret signifie « non mesuré », et non zéro.
Le prix est le plus bas parmi les fournisseurs du modèle, tarif de base, hors tarifs par lots ou réduits. L'entrée et la sortie sont affichées séparément à dessein : chez la plupart des modèles, la sortie coûte plusieurs fois plus cher que l'entrée, et la facture finale dépend de ce qui domine dans la tâche.
Le signe ≈ marque les modèles dont l'intervalle de confiance recoupe celui de la ligne du dessus. Il y en a ici 99 modèles — leur ordre entre eux n'est pas déterminé par les données disponibles.
L'intervalle de confiance de la moitié des modèles dépasse 4,4 points — soit environ 16 lignes voisines du tableau. À l'intérieur d'un tel groupe, l'ordre est fixé non par les données mais par ceux qui ont voté cette fois-ci ; les données soutiennent l'écart entre le début et la fin de la liste, mais pas le voisinage des places.