Classement IA

Les meilleures IA pour les tâches d'agent

Ici le modèle ne répond pas à une question, il fait le travail : il modifie des fichiers dans un système d'exploitation, mène des recherches, accomplit des tâches dans un environnement de travail. C'est pourquoi les pourcentages sont bas même pour les modèles forts, et ils ne se comparent pas aux scores de la sélection sur les connaissances — c'est un travail différent, pas une force différente.

32 modèles dans le tableau
32 pris en compte dans le calcul
9 juin 2026 sortie du modèle le plus récent ici
7 août 2026 dernier recalcul
# Modèle Développeur Score sur les tâches 0–100, ajusté selon la couverture Connexion$ / 1M Sortie$ / 1M Contextetokens APEX-Agents DeepResearch Bench BALROG Cybench The Agent Company Jeux de tâchesmesuré
1 Claude Opus 4.6 Anthropic 40,67 46,22 $5 $25 1 000K 32,4 55,3 93 4
2 Claude 4.5 Opus Anthropic 40,11 43,63 $5 $25 200K 20,7 43,5 82 6
3 Claude Sonnet 4.5 Anthropic 39,89 44,02 $3 $15 1 000K 52,6 60 5
4 Claude 4.1 Opus Anthropic 38,89 45,1 $15 $75 200K 49,7 42 3
5 Gemini 3.1 Pro Preview Google DeepMind 37,42 45,25 $2 $12 1 049K 33,5 57 2
6 Claude 4 Opus Anthropic 36,54 43,5 $15 $75 200K 49 38 2
7 Claude Sonnet 4.6 Anthropic 36,52 39,99 $3 $15 1 000K 23,7 54,9 4
8 Kimi K2.5 Moonshot AI (Kimi) 34,22 38,85 $0,35 $1,7 262K 14,4 2
9 Grok 4 xAI 32,85 34,16 $3 $15 256K 15,2 47,9 43,6 43 5
10 Gemini 3 Flash Preview Google DeepMind 32,82 36,05 $0,5 $3 1 049K 24 48,1 2
11 Claude 4 Sonnet Anthropic 32,61 33,82 $3 $15 1 000K 9,3 47,8 35 33,1 5
12 GPT 5.4 2026-03-05 OpenAI 32,56 35,55 $2,5 $15 1 050K 36 35,1 2
13 Gemini 3 Pro Preview Google DeepMind 31,72 32,79 $2 $12 1 049K 31,5 58,1 4
14 Claude Sonnet 3.7 Anthropic 31,58 32,58 $3 $15 200K 43,6 20 30,9 4
15 Gemini 2.5 Pro Preview 0506 Google DeepMind 30,34 31,1 $1,25 $10 1 049K 31,9 30,3 2
16 Claude Opus 4.8 Anthropic 30,14 30,42 $5 $25 1 000K 42,5 50,2 4
17 Claude Fable 5 Anthropic 30,07 30,55 $10 $50 1 000K 45 2
18 GPT 5.4 Mini 2026-03-17 OpenAI 30,01 30,43 $0,75 $4,5 272K 24,6 36,3 2
19 o3 2025-04-16 OpenAI 29,46 29,4 $2 $8 200K 17,2 46,6 4
20 Claude 3.5 Sonnet 2024-10-22 Anthropic 28,94 28,3 $3 $15 200K 32,6 24 2
21 GPT 5 2025-08-07 OpenAI 28,84 28,54 $1,25 $10 272K 18,3 55,1 32,8 5
22 Claude Opus 4.7 Anthropic 27,82 26,05 $5 $25 1 000K 33,9 2
23 Gemini 2.5 Pro Google DeepMind 27,75 26,54 $1,25 $10 1 049K 6,6 49,7 3
24 Gemini 3.1 Flash Lite Google DeepMind 27,14 24,7 $0,25 $1,5 1 049K 13 36,4 2
25 Claude Haiku 4.5 Anthropic 24,82 20,05 $1 $5 200K 8,9 31,2 2
26 Gemini 2.5 Flash Google DeepMind 23,62 17,65 $0,3 $2,5 1 049K 1,8 33,5 2
27 Llama 3.1 70B Meta AI 23,49 17,4 $0,12 $0,3 131K 27,9 6,9 2
28 Grok 3 xAI 22,69 15,8 $3 $15 131K 2,1 29,5 2
29 Kimi K2.6 Moonshot AI (Kimi) 20,67 11,75 $0,22 $1,14 262K 18,9 2
30 Qwen2.5 72B Instruct Alibaba (Qwen) 20,27 10,95 $1,4 $5,6 131K 16,2 5,7 2
31 Llama 3.1 405B Instruct Meta AI 18,52 7,45 $0,12 $0,3 128K 7,5 7,4 2
32 GPT-4o (2024-11-20) OpenAI 15,21 8,03 $2,5 $10 128K 1,1 12,5 8,6 4

Le tableau défile latéralement : toutes les colonnes ne tiennent pas.

Les colonnes de droite sont les composantes du score, ramenées à une échelle commune de 0 à 100 selon la dispersion réelle parmi les modèles mesurés. Additionnées avec les poids indiqués, elles donnent le nombre de la colonne principale : on y voit sur quoi exactement un modèle en a devancé un autre. Un tiret signifie « non mesuré », et non zéro. Affichage des cinq jeux de tâches les plus complets sur 9; les autres sont sur la fiche du modèle.

Ce que vérifie chaque jeu de tâches
APEX-Agents
modèles mesurés : 47
BALROG
environnements de jeu modèles mesurés : 22
Cybench
tâches de cybersécurité modèles mesurés : 19
DeepResearch Bench
recherche approfondie modèles mesurés : 22
GDPval
tâches de métiers réels modèles mesurés : 11
OSWorld
travail dans un système d'exploitation, première version modèles mesurés : 8
OSWorld 2.0
travail dans un système d'exploitation modèles mesurés : 6
Remote Labor Index
missions issues d'une plateforme de freelance modèles mesurés : 10
The Agent Company
tâches de travail en environnement de bureau modèles mesurés : 13

La colonne « jeux de tâches » indique sur combien de jeux le score de ce modèle est calculé. Plus il y en a, plus le chiffre est fiable : un score sur deux jeux est plus dispersé que sur six, et l'ajustement de couverture tient compte précisément de cela.

Le prix est le plus bas parmi les fournisseurs du modèle, tarif de base, hors tarifs par lots ou réduits. L'entrée et la sortie sont affichées séparément à dessein : chez la plupart des modèles, la sortie coûte plusieurs fois plus cher que l'entrée, et la facture finale dépend de ce qui domine dans la tâche.

Epoch AI — licence CC-BY · source primaire
По данным Epoch AI