Anthropic

Claude 3.5 Sonnet 2024-10-22

Type
modèle de langue
Contexte
200K tokens
Sortie maximale
8K
Chaîne pour l'API
vercel_ai_gateway/anthropic/claude-3-5-sonnet-20241022

Prix par fournisseur

Fournisseur Entrée, $ par 1M Sortie, $ par 1M Dans nos données depuis
vercel_ai_gateway $3 $15 1 août 2026
Amazon Bedrock $3 $15 2 août 2026

Seul le tarif de base et uniquement les prix au token sont affichés. Les tarifs par lots, réduits ou mis en cache, ainsi que les prix par image ou par seconde de vidéo, n'entrent pas dans ce tableau : ils ne peuvent pas figurer dans la même colonne qu'un prix par million de tokens.

La date de la dernière colonne est le jour où ce prix est entré pour la première fois dans notre collecte. Le prix peut être plus ancien : avant ce jour, nous ne l'enregistrions tout simplement pas. Il n'a pas changé depuis — sinon une nouvelle ligne avec une nouvelle date figurerait à sa place.

Résultats des mesures

Jeu de tâches Résultat Conditions d'exécution Mesuré par
Arena Score, programmation 1 342,87 1 337–1 348
Arena Score, dialogue à plusieurs tours 1 325,58 1 320–1 331
Arena Score, requêtes longues 1 311,8 1 306–1 317
Arena Score en anglais 1 307,74 1 304–1 312
Arena Score, mathématiques 1 306,76 1 300–1 313
Arena Score, requêtes difficiles 1 305,53 1 301–1 310
Arena Score en russe 1 304,29 1 297–1 311
Arena Score en français 1 301,79 1 280–1 323
Arena Score, classement général 1 297,79 1 295–1 301
Arena Score, respect des consignes 1 297,5 1 293–1 302
Arena Score, écriture créative 1 291,87 1 286–1 298
Arena Score en espagnol 1 283,4 1 264–1 303
Arena Score, questions d'expert 1 264,39 1 255–1 274
Arena Score, reconnaissance de texte sur image 1 138,75 1 120–1 158
Arena Score, compréhension de schémas 1 132,28 1 101–1 164
Arena Score, travail sur images 1 125,48 1 118–1 133
Écriture créative (évaluation de Lech Mazur) 80,3 % lechmazur/writing Github repository
GeoBench — localisation d'un lieu à partir d'une photo 62 % GeoBench leaderboard
MATH, niveau de difficulté cinq 56,95 % · avec un harnais ajusté Epoch evaluations
Aider Polyglot — modifications de code dans six langages 51,6 % · avec un harnais ajusté Aider LLM Leaderboards
CadEval — construction de modèles CAO par le code 48 % CadEval Dashboard
GPQA Diamond — questions de niveau doctorat 40,4 % · avec un harnais ajusté Epoch evaluations
WeirdML — tâches d'apprentissage automatique inhabituelles 39,97 % WeirdML Leaderboard
BALROG — environnements de jeu 32,6 % Balrog Leaderboard
SimpleBench — questions pièges 29,68 % SimpleBench Leaderboard
The Agent Company — tâches de travail en environnement de bureau 24 % TheAgentCompany experiment results github
Mock AIME 2024–2025 — problèmes d'olympiade 8,38 % · avec un harnais ajusté Epoch evaluations
GSO-Bench — optimisation de code 4,6 % GSO Leaderboard
Humanity’s Last Exam — questions d'expert 0 %