grok-4-0709| Fournisseur | Entrée, $ par 1M | Sortie, $ par 1M | Dans nos données depuis |
|---|---|---|---|
| Jiekou.AI | $2,7 | $13,5 | 31 juil. 2026 |
| Abacus.AI | $3 | $15 | 31 juil. 2026 |
| xAI | $3 | $15 | 31 juil. 2026 |
Seul le tarif de base et uniquement les prix au token sont affichés. Les tarifs par lots, réduits ou mis en cache, ainsi que les prix par image ou par seconde de vidéo, n'entrent pas dans ce tableau : ils ne peuvent pas figurer dans la même colonne qu'un prix par million de tokens.
La date de la dernière colonne est le jour où ce prix est entré pour la première fois dans notre collecte. Le prix peut être plus ancien : avant ce jour, nous ne l'enregistrions tout simplement pas. Il n'a pas changé depuis — sinon une nouvelle ligne avec une nouvelle date figurerait à sa place.
| Jeu de tâches | Résultat | Conditions d'exécution | Mesuré par |
|---|---|---|---|
| Arena Score en français | 1 425,25 1 399–1 452 | — | — |
| Arena Score, mathématiques | 1 424,24 1 412–1 437 | — | — |
| Arena Score en anglais | 1 418,4 1 413–1 423 | — | — |
| Arena Score, questions d'expert | 1 417,67 1 404–1 431 | — | — |
| Arena Score, dialogue à plusieurs tours | 1 415,59 1 408–1 423 | — | — |
| Arena Score en espagnol | 1 413,5 1 394–1 433 | — | — |
| Arena Score en russe | 1 412,96 1 401–1 425 | — | — |
| Arena Score, requêtes longues | 1 410,19 1 404–1 417 | — | — |
| Arena Score, classement général | 1 409,91 1 406–1 414 | — | — |
| Arena Score, programmation | 1 408,98 1 402–1 416 | — | — |
| Arena Score, requêtes difficiles | 1 408,55 1 404–1 414 | — | — |
| Arena Score, écriture créative | 1 398,43 1 390–1 407 | — | — |
| Arena Score, respect des consignes | 1 387,31 1 381–1 393 | — | — |
| Arena Score, travail sur images | 1 208,77 1 201–1 216 | — | — |
| Arena Score, compréhension de schémas | 1 203,03 1 190–1 216 | — | — |
| Arena Score, reconnaissance de texte sur image | 1 194,52 1 186–1 203 | — | — |
| Fiction.LiveBench — maintien d'un contexte long | 94,4 % | — | Fiction.live leaderboard |
| Mock AIME 2024–2025 — problèmes d'olympiade | 83,98 % | · avec un harnais ajusté | Epoch evaluations |
| GPQA Diamond — questions de niveau doctorat | 82,67 % | · avec un harnais ajusté | Epoch evaluations |
| Aider Polyglot — modifications de code dans six langages | 79,6 % | · avec un harnais ajusté | Aider LLM Leaderboards |
| Écriture créative (évaluation de Lech Mazur) | 76,9 % | — | lechmazur/writing Github repository |
| ARC-AGI — généralisation à des motifs inédits | 66,67 % | · avec un harnais ajusté | — |
| SimpleBench — questions pièges | 52,6 % | — | SimpleBench Leaderboard |
| SimpleQA Verified — exactitude factuelle | 47,9 % | — | Epoch evaluations |
| DeepResearch Bench — recherche approfondie | 47,9 % | — | DeepResearchBench Leaderboard |
| WeirdML — tâches d'apprentissage automatique inhabituelles | 45,73 % | — | WeirdML Leaderboard |
| GeoBench — localisation d'un lieu à partir d'une photo | 45 % | — | GeoBench leaderboard |
| BALROG — environnements de jeu | 43,6 % | — | Balrog Leaderboard |
| Cybench — tâches de cybersécurité | 43 % | · avec un harnais ajusté | Grok 4 Model Card auto-déclaré |
| Terminal-Bench — travail en ligne de commande | 27,2 % | · avec un harnais ajusté | Terminal-Bench v2 Leaderboard |
| Problèmes d'échecs | 24,24 % | — | Epoch evaluations |
| GDPval — tâches de métiers réels | 21,1 % | effort : high | — |
| ARC-AGI-2 | 15,98 % | — | — |
| APEX-Agents | 15,2 % | — | — |