Anthropic

Claude 4 Sonnet

Type
modèle de langue
Contexte
1 000K tokens
Sortie maximale
64K
Sortie le
29 septembre 2025
Connaissances jusqu'à
mars 2025
Chaîne pour l'API
claude-sonnet-4-20250514

Prix par fournisseur

Fournisseur Entrée, $ par 1M Sortie, $ par 1M Dans nos données depuis
Jiekou.AI $2,7 $13,5 31 juil. 2026
NanoGPT $2,992 $14,994 31 juil. 2026
302.AI $3 $15 31 juil. 2026
Abacus.AI $3 $15 31 juil. 2026
Amazon Bedrock $3 $15 2 août 2026
Anthropic $3 $15 1 août 2026
Merge Gateway $3 $15 31 juil. 2026

Seul le tarif de base et uniquement les prix au token sont affichés. Les tarifs par lots, réduits ou mis en cache, ainsi que les prix par image ou par seconde de vidéo, n'entrent pas dans ce tableau : ils ne peuvent pas figurer dans la même colonne qu'un prix par million de tokens.

La date de la dernière colonne est le jour où ce prix est entré pour la première fois dans notre collecte. Le prix peut être plus ancien : avant ce jour, nous ne l'enregistrions tout simplement pas. Il n'a pas changé depuis — sinon une nouvelle ligne avec une nouvelle date figurerait à sa place.

Résultats des mesures

Jeu de tâches Résultat Conditions d'exécution Mesuré par
Arena Score, requêtes longues 1 379,71 1 372–1 387
Arena Score, programmation 1 379,68 1 372–1 387
Arena Score en français 1 363,66 1 337–1 390
Arena Score, dialogue à plusieurs tours 1 363,52 1 356–1 371
Arena Score, mathématiques 1 357,74 1 346–1 369
Arena Score, requêtes difficiles 1 354,2 1 349–1 360
Arena Score en espagnol 1 350,72 1 329–1 373
Arena Score, respect des consignes 1 350,14 1 343–1 357
Arena Score en anglais 1 345,71 1 340–1 351
Arena Score en russe 1 344,73 1 333–1 356
Arena Score, écriture créative 1 339,09 1 330–1 348
Arena Score, classement général 1 337,9 1 334–1 342
Arena Score, questions d'expert 1 333,62 1 320–1 347
Arena Score, compréhension de schémas 1 178,16 1 150–1 207
Arena Score, travail sur images 1 175,73 1 162–1 190
Arena Score, reconnaissance de texte sur image 1 173,12 1 156–1 191
MATH, niveau de difficulté cinq 84,37 % · avec un harnais ajusté Epoch evaluations
Écriture créative (évaluation de Lech Mazur) 81,4 % budget de réflexion : 16K lechmazur/writing Github repository
GPQA Diamond — questions de niveau doctorat 72,25 % budget de réflexion : 59K · avec un harnais ajusté Epoch evaluations
Mock AIME 2024–2025 — problèmes d'olympiade 71,08 % budget de réflexion : 59K · avec un harnais ajusté Epoch evaluations
Aider Polyglot — modifications de code dans six langages 61,3 % · avec un harnais ajusté Aider LLM Leaderboards
DeepResearch Bench — recherche approfondie 47,8 % budget de réflexion : 2K DeepResearchBench Leaderboard
Fiction.LiveBench — maintien d'un contexte long 46,9 % Fiction.live leaderboard
WeirdML — tâches d'apprentissage automatique inhabituelles 46,11 % budget de réflexion : 16K WeirdML Leaderboard
OSWorld — travail dans un système d'exploitation, première version 43,9 % · avec un harnais ajusté OS World Website
ARC-AGI — généralisation à des motifs inédits 40 % budget de réflexion : 16K · avec un harnais ajusté ARC Prize Leaderboard
GeoBench — localisation d'un lieu à partir d'une photo 37 % GeoBench leaderboard
Cybench — tâches de cybersécurité 35 % · avec un harnais ajusté Cybench leaderboard
SimpleBench — questions pièges 34,6 % budget de réflexion : 12K SimpleBench Leaderboard
The Agent Company — tâches de travail en environnement de bureau 33,1 % TheAgentCompany leaderboard
APEX-Agents 9,3 %
ARC-AGI-2 5,93 % budget de réflexion : 16K
GSO-Bench — optimisation de code 4,9 % GSO Leaderboard
Humanity’s Last Exam — questions d'expert 3,11 %
CritPt — problèmes de physique 0,29 %