Les meilleures IA
Score global
-
1
Claude Opus 5
99,55
-
2
Claude Fable 5
97,78
-
3
Claude Opus 4.6
97,74
Le classement général : cinq capacités ramenées à un seul score, pour comparer les modèles dans leur ensemble plutôt que sur une seule tâche. Il est construit sur des comparaisons à l'aveugle par de vraies personnes : il dit donc quelles réponses sont préférées le plus souvent, pas combien de tâches ont été résolues. Pour un savoir-faire précis, la sélection dédiée est plus juste.
sur 235 modèles
99 sans différence significative
IA pour la programmation
Score sur les tâches
-
1
Claude Opus 4.7
59,79
-
2
Claude Opus 4.6
59,43
-
3
GPT 5.4 2026-03-05
57,49
Combien de tâches de programmation le modèle a réellement résolues sur des jeux d'épreuves fixes — un résultat vérifiable, pas une opinion. La sélection a un second regard, fondé sur des votes humains à l'aveugle : l'ordre y est différent, et l'écart entre les deux listes en dit plus que chacune prise séparément.
sur 41 modèles
IA pour le raisonnement
Score sur les tâches
-
1
GPT-5.6 Sol
71,53
-
2
Claude Opus 5
65,91
-
3
Gemini 3.1 Pro Preview
64,89
Des tâches de raisonnement où la réponse est juste ou fausse : on compte la part de problèmes résolus, pas les réponses qui plaisent. À côté, un second regard fondé sur des votes humains à l'aveugle. La logique est le terrain où préférence et problème résolu divergent le plus : un raisonnement bien tourné plaît même quand sa conclusion est fausse.
sur 91 modèles
IA par étendue des connaissances
Score sur les tâches
-
1
Gemini 3 Flash Preview
55,84
-
2
Qwen3.6 Max Preview
55,18
-
3
GPT-5.6 Sol
54,72
Un contrôle des connaissances factuelles sur des questions qui n'ont qu'une seule bonne réponse. À la différence des sélections voisines, le modèle ne raisonne pas et n'écrit pas de code ici — il se souvient. Le second regard sur le même sujet vient des votes humains à l'aveugle.
sur 79 modèles
IA pour les mathématiques
Score sur les tâches
-
1
Claude Fable 5
74,77
-
2
GPT-5.6 Sol
72,1
-
3
Claude Opus 5
71,39
La part de problèmes mathématiques résolus, du niveau olympiade au niveau recherche. Les pourcentages sont plus bas qu'ailleurs, et c'est une propriété des problèmes, pas des modèles : les comparer aux chiffres de la sélection sur les connaissances n'a pas de sens. Le second regard vient des votes humains à l'aveugle.
sur 88 modèles
IA pour les tâches d'agent
Score sur les tâches
-
1
Claude Opus 4.6
40,67
-
2
Claude 4.5 Opus
40,11
-
3
Claude Sonnet 4.5
39,89
Ici le modèle ne répond pas à une question, il fait le travail : il modifie des fichiers dans un système d'exploitation, mène des recherches, accomplit des tâches dans un environnement de travail. C'est pourquoi les pourcentages sont bas même pour les modèles forts, et ils ne se comparent pas aux scores de la sélection sur les connaissances — c'est un travail différent, pas une force différente.
sur 32 modèles
IA pour le français
Arena Score, français
-
1
Claude Opus 5
1 522,24
-
2
Claude Fable 5
1 519,66
-
3
GPT-5.6 Terra
1 503,02
Comment les modèles répondent en français précisément : le score est construit sur des comparaisons à l'aveugle où des personnes ont choisi la meilleure réponse en français. C'est une sélection sur la langue, pas sur les capacités — un modèle fort au classement général peut céder ici face à un autre qui tient mieux la formulation française.
sur 185 modèles
99 sans différence significative
IA pour l'anglais
Arena Score, anglais
-
1
Claude Opus 4.6
1 505,8
-
2
Claude Opus 5
1 500,16
-
3
Claude Fable 5
1 498,82
La même comparaison à l'aveugle, mais en anglais. Elle se lit surtout à côté du volet français : l'écart entre les deux places d'un même modèle montre ce qu'il perd hors de la langue sur laquelle il a été le plus entraîné.
sur 233 modèles
99 sans différence significative
IA pour l'espagnol
Arena Score, espagnol
-
1
Claude Opus 4.6
1 511,71
-
2
Claude Fable 5
1 504,09
-
3
Gemini 3.1 Pro Preview
1 479,93
Comparaison à l'aveugle des réponses en espagnol. Comme pour les autres volets linguistiques, l'intérêt n'est pas le score lui-même mais la place du modèle par rapport à sa propre position dans les autres langues : la constance d'une langue à l'autre en dit plus qu'une seule ligne élevée.
sur 184 modèles
99 sans différence significative
Les IA les moins chères
Prix, $ par 1M de tokens
-
1
Llama 3.2 1b Instruct
0,01
-
2
Ling 2.6 Flash
0,02
-
3
Google Gemma 2
0,02
Le prix de l'accès par API pour un million de jetons, en dollars, selon l'offre la moins chère parmi les fournisseurs. Entrée et sortie sont ramenées à un seul chiffre : la sortie coûte d'ordinaire plusieurs fois plus cher, et classer les modèles sur le seul prix d'entrée mettrait en tête autre chose que le moins cher.
sur 1508 modèles
IA à long contexte
Contexte, tokens
-
1
Qwen Long 10M
10 000 000
-
2
Llama 4 Scout 17B 16E Instruct
10 000 000
-
3
Llama 4 Scout 17B 128e Instruct
10 000 000
La quantité de texte que le modèle accepte en une seule requête. Le chiffre est déclaré par le développeur et ne se vérifie pas encore chez nous : sur les longues fenêtres, la qualité baisse d'habitude bien avant la limite. La sélection répond donc à « est-ce que ça rentre », pas à « est-ce qu'il comprendra ».
sur 1666 modèles
IA multimodales
Arena Score, images
-
1
Claude Fable 5
1 334,18
-
2
Claude Opus 5
1 328,68
-
3
Gemini 3.6 Flash
1 315,75
Dans quelle mesure le modèle comprend une image accompagnée de texte : comparaison à l'aveugle des réponses à des requêtes auxquelles une image est jointe. À ne pas confondre avec la génération d'images — là le modèle dessine, ici il regarde.
sur 90 modèles
84 sans différence significative
IA pour la génération d'images
Arena Score, génération
-
1
GPT Image 2
1 384,81
-
2
Mai Image 2.5
1 256,56
-
3
Nano Banana 2 Lite
1 249,66
Comparaison à l'aveugle d'images finies : des personnes choisissent la meilleure sans savoir quel modèle l'a dessinée. C'est un jugement du résultat à l'œil, pas une vérification sur consigne ; la différence entre places voisines est donc le plus souvent statistiquement non significative.
sur 33 modèles
19 sans différence significative
IA pour la génération de vidéo
Arena Score, vidéo
-
1
Sora 2 Pro
1 365,62
-
2
Sora 2
1 337,11
-
3
Seedance v1.5 Pro
1 256,99
La même comparaison à l'aveugle que pour les images, mais pour la vidéo. Les modèles y sont dix fois moins nombreux que dans les sélections de texte, et les premières places se détachent plus nettement du reste — simplement parce qu'il y a peu de participants.
sur 7 modèles
2 sans différence significative
IA pour le développement web
Arena Score, web
-
1
Claude Opus 5
1 704,67
-
2
Kimi K3
1 675,56
-
3
Claude Fable 5
1 630,02
Des requêtes sur la mise en page et les applications web, jugées à l'aveugle par des personnes. La différence avec la sélection programmation tient à la mesure : là-bas on compte les tâches résolues, ici le résultat que les gens ont préféré. Pour le web c'est plus parlant, car l'aspect du résultat fait partie de ce qui est jugé.
sur 77 modèles
70 sans différence significative
IA pour l'écriture
Arena Score, texte
-
1
Claude Opus 5
1 510,88
-
2
Claude Fable 5
1 498,96
-
3
Gemini 3 Pro
1 481,7
Textes littéraires et écriture libre, jugés à l'aveugle par des personnes : ce travail n'a pas de bonne réponse, la préférence est donc la mesure la plus honnête disponible. Il existe aussi un second regard, issu d'un passage de tâches notées ; il mesure autre chose et donne un autre ordre.
sur 236 modèles
99 sans différence significative
Les meilleures IA ouvertes
Score global
-
1
MiMo V2.5 Pro
99,9
-
2
Kimi K3
99,5
-
3
GLM 5.1
97,78
Le même score global que le classement général, mais restreint aux modèles à poids ouverts — ceux qu'on peut télécharger et exécuter sur son propre matériel. La sélection montre le retard des modèles ouverts sur les fermés, et les tâches où il n'y a pas de retard du tout.
sur 106 modèles
99 sans différence significative