OpenAI

OpenAI: GPT-4o-mini (2024-07-18)

Type
modèle de langue
Contexte
128K tokens
Sortie maximale
16K
Sortie le
18 juillet 2024
Connaissances jusqu'à
octobre 2023
Chaîne pour l'API
openai/gpt-4o-mini-2024-07-18

Prix par fournisseur

Fournisseur Entrée, $ par 1M Sortie, $ par 1M Dans nos données depuis
Kilo Code $0,15 $0,6 31 juil. 2026
OpenAI $0,15 $0,6 31 juil. 2026
OpenRouter $0,15 $0,6 31 juil. 2026
Microsoft Foundry $0,165 $0,66 31 juil. 2026
Venice AI $0,188 $0,75 1 août 2026

Seul le tarif de base et uniquement les prix au token sont affichés. Les tarifs par lots, réduits ou mis en cache, ainsi que les prix par image ou par seconde de vidéo, n'entrent pas dans ce tableau : ils ne peuvent pas figurer dans la même colonne qu'un prix par million de tokens.

La date de la dernière colonne est le jour où ce prix est entré pour la première fois dans notre collecte. Le prix peut être plus ancien : avant ce jour, nous ne l'enregistrions tout simplement pas. Il n'a pas changé depuis — sinon une nouvelle ligne avec une nouvelle date figurerait à sa place.

Résultats des mesures

Jeu de tâches Résultat Conditions d'exécution Mesuré par
Arena Score en anglais 1 300,59 1 296–1 305
Arena Score en français 1 295,68 1 271–1 320
Arena Score, programmation 1 290,12 1 284–1 297
Arena Score, requêtes longues 1 288,94 1 282–1 296
Arena Score, classement général 1 286,57 1 283–1 290
Arena Score, dialogue à plusieurs tours 1 285,04 1 278–1 292
Arena Score en espagnol 1 278,34 1 255–1 302
Arena Score en russe 1 274,29 1 267–1 282
Arena Score, écriture créative 1 268,26 1 261–1 275
Arena Score, mathématiques 1 267,33 1 260–1 274
Arena Score, requêtes difficiles 1 267,19 1 262–1 272
Arena Score, respect des consignes 1 258,81 1 254–1 264
Arena Score, questions d'expert 1 233,87 1 223–1 245
Arena Score, travail sur images 1 065,76 1 058–1 074
Écriture créative (évaluation de Lech Mazur) 67,2 % lechmazur/writing Github repository
GeoBench — localisation d'un lieu à partir d'une photo 64 % GeoBench leaderboard
MATH, niveau de difficulté cinq 52,63 % · avec un harnais ajusté Epoch evaluations
BALROG — environnements de jeu 17,4 % Balrog Leaderboard
GPQA Diamond — questions de niveau doctorat 16,96 % · avec un harnais ajusté Epoch evaluations
WeirdML — tâches d'apprentissage automatique inhabituelles 11,76 % WeirdML Leaderboard
Mock AIME 2024–2025 — problèmes d'olympiade 6,85 % · avec un harnais ajusté Epoch evaluations
Aider Polyglot — modifications de code dans six langages 3,6 % · avec un harnais ajusté Aider LLM Leaderboards
ARC-AGI-2 0 %
SimpleBench — questions pièges 0 % SimpleBench Leaderboard
Problèmes d'échecs 0 % Epoch evaluations