Ressources

Classement des IA

Les modèles d'IA, les prix de leurs fournisseurs et des classements issus de mesures indépendantes. Sous chaque tableau est indiqué d'où vient le chiffre, qui l'a mesuré, quand, et dans quelle mesure on peut s'y fier.

2219modèles
144développeurs
257fournisseurs d'API
9sources de données

Dernier recalcul : 7 août 2026

Les meilleures IA

Score global

  1. 1 Claude Opus 5 99,55
  2. 2 Claude Fable 5 97,78
  3. 3 Claude Opus 4.6 97,74

Le classement général : cinq capacités ramenées à un seul score, pour comparer les modèles dans leur ensemble plutôt que sur une seule tâche. Il est construit sur des comparaisons à l'aveugle par de vraies personnes : il dit donc quelles réponses sont préférées le plus souvent, pas combien de tâches ont été résolues. Pour un savoir-faire précis, la sélection dédiée est plus juste.

sur 235 modèles 99 sans différence significative

IA pour la programmation

Score sur les tâches

  1. 1 Claude Opus 4.7 59,79
  2. 2 Claude Opus 4.6 59,43
  3. 3 GPT 5.4 2026-03-05 57,49

Combien de tâches de programmation le modèle a réellement résolues sur des jeux d'épreuves fixes — un résultat vérifiable, pas une opinion. La sélection a un second regard, fondé sur des votes humains à l'aveugle : l'ordre y est différent, et l'écart entre les deux listes en dit plus que chacune prise séparément.

sur 41 modèles

IA pour le raisonnement

Score sur les tâches

  1. 1 GPT-5.6 Sol 71,53
  2. 2 Claude Opus 5 65,91
  3. 3 Gemini 3.1 Pro Preview 64,89

Des tâches de raisonnement où la réponse est juste ou fausse : on compte la part de problèmes résolus, pas les réponses qui plaisent. À côté, un second regard fondé sur des votes humains à l'aveugle. La logique est le terrain où préférence et problème résolu divergent le plus : un raisonnement bien tourné plaît même quand sa conclusion est fausse.

sur 91 modèles

IA par étendue des connaissances

Score sur les tâches

  1. 1 Gemini 3 Flash Preview 55,84
  2. 2 Qwen3.6 Max Preview 55,18
  3. 3 GPT-5.6 Sol 54,72

Un contrôle des connaissances factuelles sur des questions qui n'ont qu'une seule bonne réponse. À la différence des sélections voisines, le modèle ne raisonne pas et n'écrit pas de code ici — il se souvient. Le second regard sur le même sujet vient des votes humains à l'aveugle.

sur 79 modèles

IA pour les mathématiques

Score sur les tâches

  1. 1 Claude Fable 5 74,77
  2. 2 GPT-5.6 Sol 72,1
  3. 3 Claude Opus 5 71,39

La part de problèmes mathématiques résolus, du niveau olympiade au niveau recherche. Les pourcentages sont plus bas qu'ailleurs, et c'est une propriété des problèmes, pas des modèles : les comparer aux chiffres de la sélection sur les connaissances n'a pas de sens. Le second regard vient des votes humains à l'aveugle.

sur 88 modèles

IA pour les tâches d'agent

Score sur les tâches

  1. 1 Claude Opus 4.6 40,67
  2. 2 Claude 4.5 Opus 40,11
  3. 3 Claude Sonnet 4.5 39,89

Ici le modèle ne répond pas à une question, il fait le travail : il modifie des fichiers dans un système d'exploitation, mène des recherches, accomplit des tâches dans un environnement de travail. C'est pourquoi les pourcentages sont bas même pour les modèles forts, et ils ne se comparent pas aux scores de la sélection sur les connaissances — c'est un travail différent, pas une force différente.

sur 32 modèles

IA pour le français

Arena Score, français

  1. 1 Claude Opus 5 1 522,24
  2. 2 Claude Fable 5 1 519,66
  3. 3 GPT-5.6 Terra 1 503,02

Comment les modèles répondent en français précisément : le score est construit sur des comparaisons à l'aveugle où des personnes ont choisi la meilleure réponse en français. C'est une sélection sur la langue, pas sur les capacités — un modèle fort au classement général peut céder ici face à un autre qui tient mieux la formulation française.

sur 185 modèles 99 sans différence significative

IA pour l'anglais

Arena Score, anglais

  1. 1 Claude Opus 4.6 1 505,8
  2. 2 Claude Opus 5 1 500,16
  3. 3 Claude Fable 5 1 498,82

La même comparaison à l'aveugle, mais en anglais. Elle se lit surtout à côté du volet français : l'écart entre les deux places d'un même modèle montre ce qu'il perd hors de la langue sur laquelle il a été le plus entraîné.

sur 233 modèles 99 sans différence significative

IA pour l'espagnol

Arena Score, espagnol

  1. 1 Claude Opus 4.6 1 511,71
  2. 2 Claude Fable 5 1 504,09
  3. 3 Gemini 3.1 Pro Preview 1 479,93

Comparaison à l'aveugle des réponses en espagnol. Comme pour les autres volets linguistiques, l'intérêt n'est pas le score lui-même mais la place du modèle par rapport à sa propre position dans les autres langues : la constance d'une langue à l'autre en dit plus qu'une seule ligne élevée.

sur 184 modèles 99 sans différence significative

Les IA les moins chères

Prix, $ par 1M de tokens

  1. 1 Llama 3.2 1b Instruct 0,01
  2. 2 Ling 2.6 Flash 0,02
  3. 3 Google Gemma 2 0,02

Le prix de l'accès par API pour un million de jetons, en dollars, selon l'offre la moins chère parmi les fournisseurs. Entrée et sortie sont ramenées à un seul chiffre : la sortie coûte d'ordinaire plusieurs fois plus cher, et classer les modèles sur le seul prix d'entrée mettrait en tête autre chose que le moins cher.

sur 1508 modèles

IA à long contexte

Contexte, tokens

  1. 1 Qwen Long 10M 10 000 000
  2. 2 Llama 4 Scout 17B 16E Instruct 10 000 000
  3. 3 Llama 4 Scout 17B 128e Instruct 10 000 000

La quantité de texte que le modèle accepte en une seule requête. Le chiffre est déclaré par le développeur et ne se vérifie pas encore chez nous : sur les longues fenêtres, la qualité baisse d'habitude bien avant la limite. La sélection répond donc à « est-ce que ça rentre », pas à « est-ce qu'il comprendra ».

sur 1666 modèles

IA multimodales

Arena Score, images

  1. 1 Claude Fable 5 1 334,18
  2. 2 Claude Opus 5 1 328,68
  3. 3 Gemini 3.6 Flash 1 315,75

Dans quelle mesure le modèle comprend une image accompagnée de texte : comparaison à l'aveugle des réponses à des requêtes auxquelles une image est jointe. À ne pas confondre avec la génération d'images — là le modèle dessine, ici il regarde.

sur 90 modèles 84 sans différence significative

IA pour la génération d'images

Arena Score, génération

  1. 1 GPT Image 2 1 384,81
  2. 2 Mai Image 2.5 1 256,56
  3. 3 Nano Banana 2 Lite 1 249,66

Comparaison à l'aveugle d'images finies : des personnes choisissent la meilleure sans savoir quel modèle l'a dessinée. C'est un jugement du résultat à l'œil, pas une vérification sur consigne ; la différence entre places voisines est donc le plus souvent statistiquement non significative.

sur 33 modèles 19 sans différence significative

IA pour la génération de vidéo

Arena Score, vidéo

  1. 1 Sora 2 Pro 1 365,62
  2. 2 Sora 2 1 337,11
  3. 3 Seedance v1.5 Pro 1 256,99

La même comparaison à l'aveugle que pour les images, mais pour la vidéo. Les modèles y sont dix fois moins nombreux que dans les sélections de texte, et les premières places se détachent plus nettement du reste — simplement parce qu'il y a peu de participants.

sur 7 modèles 2 sans différence significative

IA pour le développement web

Arena Score, web

  1. 1 Claude Opus 5 1 704,67
  2. 2 Kimi K3 1 675,56
  3. 3 Claude Fable 5 1 630,02

Des requêtes sur la mise en page et les applications web, jugées à l'aveugle par des personnes. La différence avec la sélection programmation tient à la mesure : là-bas on compte les tâches résolues, ici le résultat que les gens ont préféré. Pour le web c'est plus parlant, car l'aspect du résultat fait partie de ce qui est jugé.

sur 77 modèles 70 sans différence significative

IA pour l'écriture

Arena Score, texte

  1. 1 Claude Opus 5 1 510,88
  2. 2 Claude Fable 5 1 498,96
  3. 3 Gemini 3 Pro 1 481,7

Textes littéraires et écriture libre, jugés à l'aveugle par des personnes : ce travail n'a pas de bonne réponse, la préférence est donc la mesure la plus honnête disponible. Il existe aussi un second regard, issu d'un passage de tâches notées ; il mesure autre chose et donne un autre ordre.

sur 236 modèles 99 sans différence significative

Les meilleures IA ouvertes

Score global

  1. 1 MiMo V2.5 Pro 99,9
  2. 2 Kimi K3 99,5
  3. 3 GLM 5.1 97,78

Le même score global que le classement général, mais restreint aux modèles à poids ouverts — ceux qu'on peut télécharger et exécuter sur son propre matériel. La sélection montre le retard des modèles ouverts sur les fermés, et les tâches où il n'y a pas de retard du tout.

sur 106 modèles 99 sans différence significative

Sources de données

Le catalogue, les prix et les évaluations proviennent de sources ouvertes ; le droit de republication est vérifié dans la licence avant qu'un chiffre n'arrive sur le site. Sous chaque tableau est indiqué qui a mesuré ce qu'il montre et quand. Les chiffres que nous n'avons pas le droit de publier ne servent qu'à la vérification et ne sont pas affichés.