Combien de tâches de programmation le modèle a réellement résolues sur des jeux d'épreuves fixes — un résultat vérifiable, pas une opinion. La sélection a un second regard, fondé sur des votes humains à l'aveugle : l'ordre y est différent, et l'écart entre les deux listes en dit plus que chacune prise séparément.
Une question, deux façons d'y répondre. Les deux indicateurs mesurent des choses différentes et ne s'additionnent pas en un seul score.
Tous les modèles ne sont pas mesurés ici. Sur les dix premiers de l’onglet « Par votes humains », il en manque 3 dans ce tableau — MiMo V2.5 Pro, Gemini 3.6 Flash, Muse Spark 1.1. Ils n'ont aucun score sur les jeux de tâches de cet onglet : une place vide signifie « non mesuré », et non « mauvais résultat ». Le modèle le plus récent atteint par ce jeu de tâches est sorti le 24 juillet 2026.
| # | Modèle | Développeur | Score sur les tâches 0–100, ajusté selon la couverture | Connexion$ / 1M | Sortie$ / 1M | Contextetokens | Aider Polyglot | Terminal-Bench | SWE-bench Verified | GSO-Bench | FrontierCode | Jeux de tâchesmesuré |
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 1 | Claude Opus 4.7 | Anthropic | 59,79 64,22 | $5 | $25 | 1 000K | — | 90,2 | 83,5 | 44,1 | 38,5 | 5 |
| 2 | Claude Opus 4.6 | Anthropic | 59,43 66,57 | $5 | $25 | 1 000K | — | 79,8 | 78,7 | 41,2 | — | 3 |
| 3 | GPT 5.4 2026-03-05 | OpenAI | 57,49 63,34 | $2,5 | $15 | 1 050K | — | 81,8 | 76,9 | 31,4 | — | 3 |
| 4 | Gemini 3.5 Flash | Google DeepMind | 56,64 64,57 | $1,5 | $9 | 1 049K | — | — | 79,3 | — | — | 2 |
| 5 | Claude Fable 5 | Anthropic | 55,96 63,2 | $10 | $50 | 1 000K | — | — | — | — | 53,5 | 2 |
| 6 | GLM 5 | Zhipu AI / Z.ai | 55,48 62,24 | $0,48 | $1,9 | 205K | — | 52,4 | 72,1 | — | — | 2 |
| 7 | Kimi K2.6 | Moonshot AI (Kimi) | 55,42 62,13 | $0,22 | $1,14 | 262K | — | — | 76,7 | — | — | 2 |
| 8 | Claude Opus 5 | Anthropic | 55,21 61,7 | $5 | $25 | 1 000K | — | — | — | — | 53,4 | 2 |
| 9 | Claude Sonnet 4.6 | Anthropic | 55,01 59,2 | $3 | $15 | 1 000K | — | 53,4 | 75,2 | — | — | 3 |
| 10 | o3 2025-04-16 | OpenAI | 53,98 56,61 | $2 | $8 | 200K | 81,3 | — | 62,3 | 8,8 | — | 4 |
| 11 | o1 2024-12-17 | OpenAI | 53,78 58,85 | $15 | $60 | 200K | 61,7 | — | — | — | — | 2 |
| 12 | GPT-5.6 Sol | OpenAI | 53,03 57,35 | $5 | $30 | 1 050K | — | — | — | — | 47,5 | 2 |
| 13 | Claude 4.5 Opus | Anthropic | 52,74 55,42 | $5 | $25 | 200K | — | 63,1 | 76,7 | 26,5 | — | 3 |
| 14 | GPT 5 2025-08-07 | OpenAI | 52,58 54,51 | $1,25 | $10 | 272K | 88 | 49,6 | 73,6 | 6,9 | — | 4 |
| 15 | Claude 4.1 Opus | Anthropic | 52,2 55,68 | $15 | $75 | 200K | — | 38 | 73,4 | — | — | 2 |
| 16 | Gemini 3 Pro Preview | Google DeepMind | 51,67 53,64 | $2 | $12 | 1 049K | — | 69,4 | 72,9 | 18,6 | — | 3 |
| 17 | Grok 4 | xAI | 51,06 53,4 | $3 | $15 | 256K | 79,6 | 27,2 | — | — | — | 2 |
| 18 | GLM 5.2 | Zhipu AI / Z.ai | 51,05 52,6 | $0,42 | $1,32 | 1 049K | — | — | 78,7 | — | 24,5 | 3 |
| 19 | Claude Opus 4.8 | Anthropic | 50,96 52,45 | $5 | $25 | 1 000K | — | — | — | 47,1 | 46,5 | 3 |
| 20 | Gemini 3.1 Pro Preview | Google DeepMind | 50,05 51,38 | $2 | $12 | 1 049K | — | 80,2 | — | 22,6 | — | 2 |
| 21 | Claude 4 Opus | Anthropic | 49,4 49,85 | $15 | $75 | 200K | 72 | — | 70,7 | 6,9 | — | 3 |
| 22 | Gemini 3 Flash Preview | Google DeepMind | 49,39 49,84 | $0,5 | $3 | 1 049K | — | 64,3 | 75,4 | 9,8 | — | 3 |
| 23 | Kimi K2.5 | Moonshot AI (Kimi) | 49,26 49,62 | $0,35 | $1,7 | 262K | — | 43,2 | 73,8 | — | — | 3 |
| 24 | GPT 5 Mini 2025-08-07 | OpenAI | 49,23 49,74 | $0,25 | $2 | 272K | — | 34,8 | 64,7 | — | — | 2 |
| 25 | DeepSeek V4 Pro | DeepSeek | 48,17 47,62 | $0,44 | $0,87 | 1 049K | — | — | 77,6 | — | 17,6 | 2 |
| 26 | GPT 4.1 2025-04-14 | OpenAI | 48,07 47,65 | $2 | $8 | 1 048K | 52,4 | — | 48,5 | — | — | 3 |
| 27 | Claude Sonnet 5 | Anthropic | 47,72 47,05 | $2 | $10 | 1 000K | — | — | — | 37,3 | 42,7 | 3 |
| 28 | o4 Mini 2025-04-16 | OpenAI | 47,01 45,87 | $1,1 | $4,4 | 200K | 72 | — | — | 3,6 | — | 3 |
| 29 | Gemini 2.5 Pro | Google DeepMind | 46,9 45,08 | $1,25 | $10 | 1 049K | — | 32,6 | 57,6 | — | — | 2 |
| 30 | Claude Sonnet 3.7 | Anthropic | 46,85 45,91 | $3 | $15 | 200K | 64,9 | — | 61 | 3,8 | — | 4 |
| 31 | Gemini 2.5 Pro Preview 0605 | Google DeepMind | 46,11 43,51 | $1,13 | $9 | 1 049K | 83,1 | — | — | 3,9 | — | 2 |
| 32 | Claude Sonnet 4.5 | Anthropic | 45,98 44,16 | $3 | $15 | 1 000K | — | 46,5 | 71,3 | 14,7 | — | 3 |
| 33 | o3 Mini 2025-01-31 | OpenAI | 42,63 38,57 | $1,1 | $4,4 | 200K | 60,4 | — | — | 1,3 | — | 3 |
| 34 | Claude 4 Sonnet | Anthropic | 40,91 33,1 | $3 | $15 | 1 000K | 61,3 | — | — | 4,9 | — | 2 |
| 35 | Claude 3.5 Sonnet 2024-10-22 | Anthropic | 40,33 34,73 | $3 | $15 | 200K | 51,6 | — | — | 4,6 | — | 3 |
| 36 | GPT OSS 120B | OpenAI | 39,48 30,25 | $0,03 | $0,14 | 131K | 41,8 | 18,7 | — | — | — | 2 |
| 37 | Claude 3.5 Haiku | Anthropic | 39,36 30 | $0,25 | $1,25 | 200K | 28 | — | — | — | — | 2 |
| 38 | Kimi K2 Instruct | Moonshot AI (Kimi) | 37,85 30,6 | $0,1 | $2 | 131K | 59,1 | 27,8 | — | 4,9 | — | 3 |
| 39 | GPT-4o (2024-08-06) | OpenAI | 36,63 24,55 | $2,5 | $10 | 128K | 23,1 | — | — | — | — | 2 |
| 40 | OpenAI GPT-4.1 Mini | OpenAI | 36,46 24,2 | $0,4 | $1,6 | 1 048K | 32,4 | — | — | — | — | 2 |
| 41 | GPT-4o (2024-11-20) | OpenAI | 29,32 16,4 | $2,5 | $10 | 128K | 18,2 | — | 31 | 0 | — | 3 |
Le tableau défile latéralement : toutes les colonnes ne tiennent pas.
Les colonnes de droite sont les composantes du score, ramenées à une échelle commune de 0 à 100 selon la dispersion réelle parmi les modèles mesurés. Additionnées avec les poids indiqués, elles donnent le nombre de la colonne principale : on y voit sur quoi exactement un modèle en a devancé un autre. Un tiret signifie « non mesuré », et non zéro. Affichage des cinq jeux de tâches les plus complets sur 7; les autres sont sur la fiche du modèle.
La colonne « jeux de tâches » indique sur combien de jeux le score de ce modèle est calculé. Plus il y en a, plus le chiffre est fiable : un score sur deux jeux est plus dispersé que sur six, et l'ajustement de couverture tient compte précisément de cela.
Le prix est le plus bas parmi les fournisseurs du modèle, tarif de base, hors tarifs par lots ou réduits. L'entrée et la sortie sont affichées séparément à dessein : chez la plupart des modèles, la sortie coûte plusieurs fois plus cher que l'entrée, et la facture finale dépend de ce qui domine dans la tâche.
Epoch AI
— licence CC-BY · source primaire
По данным Epoch AI
Tous les modèles ne sont pas mesurés ici. Sur les dix premiers de l’onglet « Par tâches résolues », il en manque 1 dans ce tableau — GPT 5.4 2026-03-05. Ils n'ont aucun score sur les jeux de tâches de cet onglet : une place vide signifie « non mesuré », et non « mauvais résultat ». Le modèle le plus récent atteint par ce jeu de tâches est sorti le 27 juillet 2026.
| # | Modèle | Développeur | Arena Score, code | Connexion$ / 1M | Sortie$ / 1M | Contextetokens |
|---|---|---|---|---|---|---|
| 1 | Claude Opus 4.6 | Anthropic | 1 534,96 1 529–1 541 | $5 | $25 | 1 000K |
| 2 | Claude Opus 5 ≈ | Anthropic | 1 534,15 1 510–1 559 | $5 | $25 | 1 000K |
| 3 | Claude Fable 5 ≈ | Anthropic | 1 518,95 1 509–1 529 | $10 | $50 | 1 000K |
| 4 | Claude Opus 4.7 ≈ | Anthropic | 1 516,56 1 510–1 523 | $5 | $25 | 1 000K |
| 5 | Claude Sonnet 4.6 | Anthropic | 1 502,48 1 497–1 508 | $3 | $15 | 1 000K |
| 6 | Kimi K3 ≈ | Moonshot AI (Kimi) | 1 499,63 1 480–1 519 | $2 | $8 | 1 049K |
| 7 | MiMo V2.5 Pro ≈ | Xiaomi | 1 498,44 1 492–1 505 | $0,44 | $0,87 | 1 050K |
| 8 | Claude 4.5 Opus ≈ | Anthropic | 1 498,02 1 493–1 503 | $5 | $25 | 200K |
| 9 | Gemini 3.6 Flash ≈ | Google DeepMind | 1 495,38 1 481–1 510 | $1,5 | $7,5 | 1 049K |
| 10 | Muse Spark 1.1 ≈ | Meta AI | 1 495,35 1 484–1 507 | $1,25 | $4,25 | 1 049K |
| 11 | GLM 5.1 ≈ | Zhipu AI / Z.ai | 1 493,04 1 486–1 500 | $0,06 | $0,22 | 205K |
| 12 | Gemini 3.5 Flash ≈ | Google DeepMind | 1 492,01 1 480–1 504 | $1,5 | $9 | 1 049K |
| 13 | ERNIE 5.1 ≈ | Baidu (Ernie) | 1 488,69 1 482–1 496 | $0,75 | $3 | 119K |
| 14 | GPT-5.6 Terra ≈ | OpenAI | 1 488,59 1 476–1 501 | $2 | $12 | 1 050K |
| 15 | Kimi K2.6 ≈ | Moonshot AI (Kimi) | 1 486,74 1 480–1 494 | $0,22 | $1,14 | 262K |
| 16 | GPT-5.6 Sol ≈ | OpenAI | 1 486,07 1 473–1 499 | $5 | $30 | 1 050K |
| 17 | Claude Opus 4.8 ≈ | Anthropic | 1 485,6 1 478–1 493 | $5 | $25 | 1 000K |
| 18 | Claude Sonnet 5 ≈ | Anthropic | 1 485,59 1 476–1 495 | $2 | $10 | 1 000K |
| 19 | Claude Sonnet 4.5 ≈ | Anthropic | 1 485,37 1 480–1 490 | $3 | $15 | 1 000K |
| 20 | Gemini 3.1 Pro Preview ≈ | Google DeepMind | 1 483,89 1 479–1 489 | $2 | $12 | 1 049K |
| 21 | Gemini 3 Pro ≈ | Google DeepMind | 1 482,68 1 476–1 490 | $1,6 | $9,6 | 1 049K |
| 22 | Qwen3.7 Plus ≈ | Alibaba (Qwen) | 1 481,93 1 474–1 490 | $0,5 | $3 | 1 000K |
| 23 | Grok 4.5 ≈ | xAI | 1 479,12 1 468–1 491 | $2 | $6 | 500K |
| 24 | GLM 5.2 ≈ | Zhipu AI / Z.ai | 1 477,24 1 469–1 486 | $0,42 | $1,32 | 1 049K |
| 25 | MiMo V2 Pro ≈ | Xiaomi | 1 476,32 1 469–1 484 | $0,44 | $0,87 | 1 049K |
| 26 | Kimi K2.5 Thinking TEE ≈ | Moonshot AI (Kimi) | 1 473,6 1 468–1 479 | $0,3 | $1,9 | 256K |
| 27 | Claude 4.1 Opus ≈ | Anthropic | 1 473,09 1 468–1 478 | $15 | $75 | 200K |
| 28 | MiniMax M3 ≈ | MiniMax | 1 472,57 1 465–1 480 | $0,3 | $1,2 | 1 049K |
| 29 | GPT-5.6 Luna ≈ | OpenAI | 1 471,79 1 460–1 484 | $0,2 | $1,2 | 1 050K |
| 30 | Seed 2.0 Pro ≈ | ByteDance (Doubao) | 1 471,1 1 465–1 477 | $0,5 | $3 | 131K |
| 31 | DeepSeek V4 Pro ≈ | DeepSeek | 1 470,43 1 464–1 477 | $0,44 | $0,87 | 1 049K |
| 32 | MiMo V2.5 ≈ | Xiaomi | 1 469,48 1 463–1 476 | $0,14 | $0,28 | 1 050K |
| 33 | Longcat Flash Chat ≈ | Meituan | 1 467,98 1 455–1 481 | — | — | 131K |
| 34 | GLM 5V Turbo ≈ | Zhipu AI / Z.ai | 1 467,51 1 456–1 479 | $0,7 | $3,1 | 203K |
| 35 | Hy3 ≈ | Tencent (Hunyuan) | 1 467,42 1 448–1 487 | $0,13 | $0,53 | 262K |
| 36 | Qwen3.6 Max Preview ≈ | Alibaba (Qwen) | 1 467,25 1 452–1 483 | $1,3 | $7,8 | 262K |
| 37 | Inkling ≈ | Thinking Machines Lab | 1 467,21 1 454–1 480 | $1,87 | $4,68 | 1 049K |
| 38 | Qwen3.6 Plus ≈ | Alibaba (Qwen) | 1 465,74 1 459–1 472 | $0,5 | $3 | 1 000K |
| 39 | Qwen3.5 397B-A17B ≈ | Alibaba (Qwen) | 1 465,71 1 460–1 471 | $0,6 | $3,6 | 262K |
| 40 | MiMo V2 Omni ≈ | Xiaomi | 1 465,04 1 456–1 474 | $0,14 | $0,28 | 262K |
| 41 | Gemini 3 Flash ≈ | Google DeepMind | 1 462,61 1 455–1 470 | $0,4 | $2,4 | 1 049K |
| 42 | GLM 5 ≈ | Zhipu AI / Z.ai | 1 460,36 1 453–1 468 | $0,48 | $1,9 | 205K |
| 43 | Mistral Medium 3.5 ≈ | Mistral AI | 1 460,3 1 449–1 471 | $1,5 | $7,5 | 262K |
| 44 | Grok 4.20 (Reasoning) ≈ | xAI | 1 458,81 1 453–1 465 | $2 | $6 | 2 000K |
| 45 | Grok 4.20 Multi Agent Beta 0309 ≈ | xAI | 1 457,78 1 452–1 464 | $2 | $6 | 2 000K |
| 46 | Qwen3 Max Preview ≈ | Alibaba (Qwen) | 1 456,92 1 449–1 465 | $1,2 | $6 | 256K |
| 47 | DeepSeek V4 Flash ≈ | DeepSeek | 1 456,12 1 450–1 463 | $0,14 | $0,28 | 1 049K |
| 48 | GLM 4.7 ≈ | Zhipu AI / Z.ai | 1 455,74 1 444–1 468 | $0,15 | $0,8 | 205K |
| 49 | Gemini 3.5 Flash Lite ≈ | Google DeepMind | 1 455,6 1 441–1 470 | $0,3 | $2,5 | 1 049K |
| 50 | Gemma 4 31B ≈ | Google DeepMind | 1 454,93 1 440–1 470 | $0,14 | $0,4 | 262K |
| 51 | Kimi K2 Thinking Turbo ≈ | Moonshot AI (Kimi) | 1 453,31 1 448–1 459 | $1,15 | $8 | 262K |
| 52 | Gemini 2.5 Pro ≈ | Google DeepMind | 1 452,45 1 448–1 457 | $1,25 | $10 | 1 049K |
| 53 | MiniMax M2.7 ≈ | MiniMax | 1 451,3 1 445–1 457 | $0,3 | $1,2 | 205K |
| 54 | Claude Haiku 4.5 ≈ | Anthropic | 1 450,74 1 446–1 455 | $1 | $5 | 200K |
| 55 | GLM 4.6 ≈ | Zhipu AI / Z.ai | 1 449,4 1 442–1 457 | $0,29 | $1,14 | 205K |
| 56 | DeepSeek V3.2 ≈ | DeepSeek | 1 448,64 1 442–1 455 | $0,28 | $0,4 | 164K |
| 57 | GPT-5.2 Chat ≈ | OpenAI | 1 446,66 1 440–1 454 | $1,75 | $14 | 128K |
| 58 | Qwen3 235B A22B Instruct 2507 ≈ | Alibaba (Qwen) | 1 444,78 1 440–1 449 | $0,1 | $0,1 | 262K |
| 59 | Grok 4.1 ≈ | xAI | 1 444,4 1 439–1 450 | $2 | $10 | 200K |
| 60 | Gemma 4 26B-A4B ≈ | Google DeepMind | 1 444,01 1 429–1 459 | $0,05 | $0,29 | 262K |
| 61 | Mistral Large 3 ≈ | Mistral AI | 1 443,94 1 438–1 450 | $0,5 | $1,5 | 256K |
| 62 | Qwen3 Next 80B A3B Instruct ≈ | Alibaba (Qwen) | 1 441,15 1 433–1 450 | $0,15 | $1,2 | 262K |
| 63 | MiMo V2 Flash ≈ | Xiaomi | 1 441,11 1 435–1 447 | $0,14 | $0,28 | 262K |
| 64 | Qwen3 VL 235B A22B Instruct ≈ | Alibaba (Qwen) | 1 440,09 1 427–1 453 | $0,4 | $1,6 | 262K |
| 65 | Qwen3 Max 2025-09-23 ≈ | Alibaba (Qwen) | 1 439,19 1 426–1 452 | $0,86 | $3,43 | 258K |
| 66 | Step 3.5 Flash ≈ | StepFun | 1 436,75 1 431–1 443 | $0,1 | $0,3 | 262K |
| 67 | Qwen3.5 122B-A10B ≈ | Alibaba (Qwen) | 1 436,07 1 429–1 443 | $0,4 | $3,2 | 262K |
| 68 | Mistral Medium 3.1 ≈ | Mistral AI | 1 434,76 1 430–1 439 | $0,4 | $2 | 262K |
| 69 | GPT-5.5 Instant ≈ | OpenAI | 1 434,45 1 427–1 442 | $5 | $30 | 400K |
| 70 | GLM 4.5 ≈ | Zhipu AI / Z.ai | 1 433,35 1 425–1 442 | $0,2 | $0,8 | 131K |
| 71 | DeepSeek V3.2 Exp ≈ | DeepSeek | 1 433,29 1 422–1 445 | $0,22 | $0,33 | 164K |
| 72 | Qwen3 VL 235B A22B Thinking ≈ | Alibaba (Qwen) | 1 427,7 1 413–1 442 | $0,4 | $4 | 262K |
| 73 | DeepSeek R1 0528 ≈ | DeepSeek | 1 426,99 1 416–1 438 | $0,25 | $0,25 | 164K |
| 74 | Qwen3.5 27B ≈ | Alibaba (Qwen) | 1 424,82 1 417–1 432 | $0,3 | $2,4 | 262K |
| 75 | Qwen3 235B A22B Thinking-2507 ≈ | Alibaba (Qwen) | 1 423,79 1 409–1 438 | $0,1 | $0,1 | 262K |
| 76 | Gemini 2.5 Flash ≈ | Google DeepMind | 1 423,41 1 419–1 428 | $0,3 | $2,5 | 1 049K |
| 77 | Grok 4 Fast Reasoning ≈ | xAI | 1 418,56 1 409–1 428 | $0,2 | $0,5 | 2 000K |
| 78 | Qwen3 30B A3B Instruct 2507 ≈ | Alibaba (Qwen) | 1 417,48 1 409–1 426 | $0,05 | $0,19 | 262K |
| 79 | MiMo V2 Flash (Thinking) ≈ | Xiaomi | 1 417,25 1 405–1 429 | $0,1 | $0,31 | 256K |
| 80 | Grok 4.3 ≈ | xAI | 1 415,7 1 409–1 422 | $1,25 | $2,5 | 1 000K |
| 81 | DeepSeek V3.1 ≈ | DeepSeek | 1 414,76 1 403–1 426 | $0,2 | $0,7 | 164K |
| 82 | ChatGPT 4o Latest ≈ | OpenAI | 1 414,41 1 409–1 419 | $5 | $15 | 128K |
| 83 | Qwen3.5 Flash ≈ | Alibaba (Qwen) | 1 413,61 1 408–1 419 | $0,09 | $0,36 | 1 000K |
| 84 | Qwen3 Coder 480B A35B ≈ | Alibaba (Qwen) | 1 412,31 1 403–1 421 | $1,5 | $7,5 | 262K |
| 85 | Grok 4.1 Fast Reasoning ≈ | xAI | 1 411,95 1 406–1 418 | $0,2 | $0,5 | 2 000K |
| 86 | Qwen3.5 35B A3B ≈ | Alibaba (Qwen) | 1 409,26 1 402–1 417 | $0,25 | $2 | 262K |
| 87 | Grok 4 ≈ | xAI | 1 408,98 1 402–1 416 | $3 | $15 | 256K |
| 88 | o3 2025-04-16 ≈ | OpenAI | 1 408,19 1 402–1 414 | $2 | $8 | 200K |
| 89 | DeepSeek V3.1 Terminus ≈ | DeepSeek | 1 406,59 1 386–1 427 | $0,21 | $0,79 | 164K |
| 90 | GPT-5.3 Chat (latest) ≈ | OpenAI | 1 406,23 1 399–1 413 | $1,75 | $14 | 128K |
| 91 | Nemotron 3 Super ≈ | NVIDIA | 1 405,97 1 392–1 420 | $0,2 | $0,8 | 1 000K |
| 92 | NVIDIA Nemotron 3 Super 120B A12B ≈ | NVIDIA | 1 405,97 1 392–1 420 | $0,15 | $0,65 | 262K |
| 93 | Claude 4 Opus ≈ | Anthropic | 1 401,8 1 395–1 409 | $15 | $75 | 200K |
| 94 | 2025) ≈ | Google DeepMind | 1 401,55 1 394–1 409 | $0,3 | $2,5 | 1 049K |
| 95 | GPT 5 Chat ≈ | OpenAI | 1 400,27 1 392–1 408 | $1,25 | $10 | 128K |
| 96 | Kimi K2 0905 Preview ≈ | Moonshot AI (Kimi) | 1 399,71 1 387–1 412 | $0,6 | $2,5 | 262K |
| 97 | Gemini 3.1 Flash Lite Preview ≈ | Google DeepMind | 1 399,63 1 394–1 406 | $0,25 | $1,5 | 1 049K |
| 98 | GPT 4.5 Preview ≈ | OpenAI | 1 397,05 1 384–1 410 | $75 | $150 | 128K |
| 99 | GLM 4.5 Air ≈ | Zhipu AI / Z.ai | 1 396,36 1 389–1 404 | $0,11 | $0,29 | 131K |
| 100 | Mercury 2 ≈ | Inception Labs | 1 392,87 1 372–1 413 | $0,25 | $0,75 | 128K |
Le tableau défile latéralement : toutes les colonnes ne tiennent pas.
Le prix est le plus bas parmi les fournisseurs du modèle, tarif de base, hors tarifs par lots ou réduits. L'entrée et la sortie sont affichées séparément à dessein : chez la plupart des modèles, la sortie coûte plusieurs fois plus cher que l'entrée, et la facture finale dépend de ce qui domine dans la tâche.
Le signe ≈ marque les modèles dont l'intervalle de confiance recoupe celui de la ligne du dessus. Il y en a ici 98 modèles — leur ordre entre eux n'est pas déterminé par les données disponibles.
L'intervalle de confiance de la moitié des modèles dépasse 15,2 points — soit environ 11 lignes voisines du tableau. À l'intérieur d'un tel groupe, l'ordre est fixé non par les données mais par ceux qui ont voté cette fois-ci ; les données soutiennent l'écart entre le début et la fin de la liste, mais pas le voisinage des places. Votes par modèle ici — médiane 7 317: moins il y en a, plus l'intervalle est large.
Arena (LMArena)
— licence CC-BY-4.0 · source primaire
По данным Arena (LMArena)