Comparaison à l'aveugle des réponses en espagnol. Comme pour les autres volets linguistiques, l'intérêt n'est pas le score lui-même mais la place du modèle par rapport à sa propre position dans les autres langues : la constance d'une langue à l'autre en dit plus qu'une seule ligne élevée.
| # | Modèle | Développeur | Arena Score, espagnol | Connexion$ / 1M | Sortie$ / 1M | Contextetokens |
|---|---|---|---|---|---|---|
| 1 | Claude Opus 4.6 | Anthropic | 1 511,71 1 497–1 526 | $5 | $25 | 1 000K |
| 2 | Claude Fable 5 ≈ | Anthropic | 1 504,09 1 477–1 531 | $10 | $50 | 1 000K |
| 3 | Gemini 3.1 Pro Preview ≈ | Google DeepMind | 1 479,93 1 467–1 493 | $2 | $12 | 1 049K |
| 4 | Muse Spark 1.1 ≈ | Meta AI | 1 479,03 1 444–1 514 | $1,25 | $4,25 | 1 049K |
| 5 | ERNIE 5.1 ≈ | Baidu (Ernie) | 1 475,26 1 456–1 494 | $0,75 | $3 | 119K |
| 6 | GLM 5.2 ≈ | Zhipu AI / Z.ai | 1 475,02 1 450–1 500 | $0,42 | $1,32 | 1 049K |
| 7 | Claude Opus 4.7 ≈ | Anthropic | 1 473,23 1 457–1 489 | $5 | $25 | 1 000K |
| 8 | Gemini 3.5 Flash ≈ | Google DeepMind | 1 471,19 1 440–1 502 | $1,5 | $9 | 1 049K |
| 9 | Gemini 2.5 Pro ≈ | Google DeepMind | 1 469,59 1 457–1 482 | $1,25 | $10 | 1 049K |
| 10 | Gemini 3 Pro ≈ | Google DeepMind | 1 469,46 1 450–1 489 | $1,6 | $9,6 | 1 049K |
| 11 | Inkling ≈ | Thinking Machines Lab | 1 466,98 1 425–1 509 | $1,87 | $4,68 | 1 049K |
| 12 | MiMo V2.5 Pro ≈ | Xiaomi | 1 463,75 1 446–1 482 | $0,44 | $0,87 | 1 050K |
| 13 | Qwen3 Max Preview ≈ | Alibaba (Qwen) | 1 463,37 1 441–1 486 | $1,2 | $6 | 256K |
| 14 | Kimi K2.6 ≈ | Moonshot AI (Kimi) | 1 463,27 1 446–1 481 | $0,22 | $1,14 | 262K |
| 15 | Claude Sonnet 4.6 ≈ | Anthropic | 1 462,54 1 447–1 478 | $3 | $15 | 1 000K |
| 16 | Qwen3.7 Plus ≈ | Alibaba (Qwen) | 1 461,46 1 439–1 484 | $0,5 | $3 | 1 000K |
| 17 | Gemini 3 Flash ≈ | Google DeepMind | 1 460,41 1 439–1 481 | $0,4 | $2,4 | 1 049K |
| 18 | Seed 2.0 Pro ≈ | ByteDance (Doubao) | 1 458,9 1 445–1 473 | $0,5 | $3 | 131K |
| 19 | Gemma 4 31B ≈ | Google DeepMind | 1 457,33 1 419–1 496 | $0,14 | $0,4 | 262K |
| 20 | GLM 5.1 ≈ | Zhipu AI / Z.ai | 1 456,35 1 437–1 475 | $0,06 | $0,22 | 205K |
| 21 | Claude Sonnet 4.5 ≈ | Anthropic | 1 455,76 1 442–1 470 | $3 | $15 | 1 000K |
| 22 | MiMo V2 Pro ≈ | Xiaomi | 1 454,24 1 432–1 476 | $0,44 | $0,87 | 1 049K |
| 23 | Kimi K2.5 Thinking TEE ≈ | Moonshot AI (Kimi) | 1 453,89 1 439–1 469 | $0,3 | $1,9 | 256K |
| 24 | GPT-5.6 Terra ≈ | OpenAI | 1 453,31 1 413–1 493 | $2 | $12 | 1 050K |
| 25 | Claude 4.5 Opus ≈ | Anthropic | 1 453,21 1 438–1 468 | $5 | $25 | 200K |
| 26 | Qwen3.6 Max Preview ≈ | Alibaba (Qwen) | 1 452,39 1 415–1 490 | $1,3 | $7,8 | 262K |
| 27 | GLM 4.5 ≈ | Zhipu AI / Z.ai | 1 450,57 1 426–1 475 | $0,2 | $0,8 | 131K |
| 28 | DeepSeek V4 Pro ≈ | DeepSeek | 1 450,48 1 433–1 468 | $0,44 | $0,87 | 1 049K |
| 29 | GLM 5V Turbo ≈ | Zhipu AI / Z.ai | 1 450,15 1 412–1 489 | $0,7 | $3,1 | 203K |
| 30 | Qwen3.5 397B-A17B ≈ | Alibaba (Qwen) | 1 449,69 1 434–1 465 | $0,6 | $3,6 | 262K |
| 31 | Grok 4.5 ≈ | xAI | 1 449,5 1 412–1 487 | $2 | $6 | 500K |
| 32 | Claude Opus 4.8 ≈ | Anthropic | 1 449,21 1 429–1 469 | $5 | $25 | 1 000K |
| 33 | Qwen3 Next 80B A3B Instruct ≈ | Alibaba (Qwen) | 1 449,16 1 424–1 474 | $0,15 | $1,2 | 262K |
| 34 | Grok 4.20 (Reasoning) ≈ | xAI | 1 448,44 1 433–1 464 | $2 | $6 | 2 000K |
| 35 | Mistral Large 3 ≈ | Mistral AI | 1 447,3 1 430–1 464 | $0,5 | $1,5 | 256K |
| 36 | Grok 4.20 Multi Agent Beta 0309 ≈ | xAI | 1 446,92 1 431–1 462 | $2 | $6 | 2 000K |
| 37 | GLM 5 ≈ | Zhipu AI / Z.ai | 1 446,57 1 427–1 466 | $0,48 | $1,9 | 205K |
| 38 | Claude 4.1 Opus ≈ | Anthropic | 1 444,59 1 430–1 459 | $15 | $75 | 200K |
| 39 | Longcat Flash Chat ≈ | Meituan | 1 444,1 1 412–1 476 | — | — | 131K |
| 40 | DeepSeek V3.2 Exp ≈ | DeepSeek | 1 441,73 1 408–1 475 | $0,22 | $0,33 | 164K |
| 41 | DeepSeek V4 Flash ≈ | DeepSeek | 1 438,41 1 421–1 456 | $0,14 | $0,28 | 1 049K |
| 42 | GLM 4.6 ≈ | Zhipu AI / Z.ai | 1 436,04 1 416–1 457 | $0,29 | $1,14 | 205K |
| 43 | ChatGPT 4o Latest ≈ | OpenAI | 1 435,92 1 421–1 451 | $5 | $15 | 128K |
| 44 | MiMo V2 Omni ≈ | Xiaomi | 1 435,01 1 410–1 460 | $0,14 | $0,28 | 262K |
| 45 | Qwen3.6 Plus ≈ | Alibaba (Qwen) | 1 432,89 1 416–1 450 | $0,5 | $3 | 1 000K |
| 46 | Claude Sonnet 5 ≈ | Anthropic | 1 432,53 1 404–1 461 | $2 | $10 | 1 000K |
| 47 | GPT-5.6 Luna ≈ | OpenAI | 1 431,67 1 393–1 471 | $0,2 | $1,2 | 1 050K |
| 48 | GPT-5.2 Chat ≈ | OpenAI | 1 431,17 1 412–1 451 | $1,75 | $14 | 128K |
| 49 | GPT-5.5 Instant ≈ | OpenAI | 1 429,62 1 407–1 452 | $5 | $30 | 400K |
| 50 | Mistral Medium 3.1 ≈ | Mistral AI | 1 429,58 1 416–1 443 | $0,4 | $2 | 262K |
| 51 | MiniMax M3 ≈ | MiniMax | 1 428,58 1 407–1 450 | $0,3 | $1,2 | 1 049K |
| 52 | Gemini 3.1 Flash Lite Preview ≈ | Google DeepMind | 1 424,66 1 410–1 440 | $0,25 | $1,5 | 1 049K |
| 53 | Qwen3 235B A22B Instruct 2507 ≈ | Alibaba (Qwen) | 1 424,58 1 412–1 437 | $0,1 | $0,1 | 262K |
| 54 | Grok 4.1 ≈ | xAI | 1 423,99 1 409–1 439 | $2 | $10 | 200K |
| 55 | DeepSeek V3.2 ≈ | DeepSeek | 1 422,11 1 404–1 440 | $0,28 | $0,4 | 164K |
| 56 | Step 3.5 Flash ≈ | StepFun | 1 419,82 1 404–1 435 | $0,1 | $0,3 | 262K |
| 57 | Claude Haiku 4.5 ≈ | Anthropic | 1 419,11 1 406–1 432 | $1 | $5 | 200K |
| 58 | Gemini 2.5 Flash ≈ | Google DeepMind | 1 419,02 1 407–1 431 | $0,3 | $2,5 | 1 049K |
| 59 | Qwen3.5 122B-A10B ≈ | Alibaba (Qwen) | 1 418,53 1 398–1 439 | $0,4 | $3,2 | 262K |
| 60 | MiMo V2 Flash ≈ | Xiaomi | 1 417,54 1 400–1 435 | $0,14 | $0,28 | 262K |
| 61 | Nemotron 3 Super ≈ | NVIDIA | 1 417,52 1 384–1 451 | $0,2 | $0,8 | 1 000K |
| 62 | GLM 4.7 ≈ | Zhipu AI / Z.ai | 1 416,62 1 384–1 449 | $0,15 | $0,8 | 205K |
| 63 | Grok 4 ≈ | xAI | 1 413,5 1 394–1 433 | $3 | $15 | 256K |
| 64 | MiMo V2.5 ≈ | Xiaomi | 1 413,26 1 395–1 431 | $0,14 | $0,28 | 1 050K |
| 65 | Qwen3.5 27B ≈ | Alibaba (Qwen) | 1 412,42 1 391–1 434 | $0,3 | $2,4 | 262K |
| 66 | Grok 4.1 Fast Reasoning ≈ | xAI | 1 412,18 1 396–1 429 | $0,2 | $0,5 | 2 000K |
| 67 | DeepSeek V3.1 ≈ | DeepSeek | 1 412,11 1 380–1 444 | $0,2 | $0,7 | 164K |
| 68 | GPT-5.6 Sol ≈ | OpenAI | 1 411,99 1 374–1 450 | $5 | $30 | 1 050K |
| 69 | Grok 4 Fast Reasoning ≈ | xAI | 1 411,24 1 385–1 437 | $0,2 | $0,5 | 2 000K |
| 70 | MiniMax M2.7 ≈ | MiniMax | 1 409,44 1 393–1 426 | $0,3 | $1,2 | 205K |
| 71 | Qwen3 VL 235B A22B Instruct ≈ | Alibaba (Qwen) | 1 409,22 1 379–1 439 | $0,4 | $1,6 | 262K |
| 72 | Kimi K2 Thinking Turbo ≈ | Moonshot AI (Kimi) | 1 407,87 1 392–1 423 | $1,15 | $8 | 262K |
| 73 | DeepSeek R1 0528 ≈ | DeepSeek | 1 406,14 1 368–1 444 | $0,25 | $0,25 | 164K |
| 74 | Ling Flash 2.0 ≈ | Ant Group (Ling) | 1 402,17 1 364–1 441 | $0,14 | $0,57 | 131K |
| 75 | Grok 4.3 ≈ | xAI | 1 401,89 1 384–1 419 | $1,25 | $2,5 | 1 000K |
| 76 | Mistral Medium 3.5 ≈ | Mistral AI | 1 401,7 1 369–1 434 | $1,5 | $7,5 | 262K |
| 77 | Qwen3.5 Flash ≈ | Alibaba (Qwen) | 1 399,29 1 384–1 415 | $0,09 | $0,36 | 1 000K |
| 78 | 2025) ≈ | Google DeepMind | 1 398,72 1 377–1 420 | $0,3 | $2,5 | 1 049K |
| 79 | Qwen3 Max 2025-09-23 ≈ | Alibaba (Qwen) | 1 397,75 1 368–1 428 | $0,86 | $3,43 | 258K |
| 80 | Qwen3 30B A3B Instruct 2507 ≈ | Alibaba (Qwen) | 1 392,66 1 369–1 417 | $0,05 | $0,19 | 262K |
| 81 | Qwen3.5 35B A3B ≈ | Alibaba (Qwen) | 1 391,67 1 371–1 413 | $0,25 | $2 | 262K |
| 82 | Qwen3 235B A22B Thinking-2507 ≈ | Alibaba (Qwen) | 1 390,57 1 345–1 436 | $0,1 | $0,1 | 262K |
| 83 | GPT 5 Chat ≈ | OpenAI | 1 387,59 1 366–1 410 | $1,25 | $10 | 128K |
| 84 | MiMo V2 Flash (Thinking) ≈ | Xiaomi | 1 385,84 1 354–1 418 | $0,1 | $0,31 | 256K |
| 85 | Qwen3 VL 235B A22B Thinking ≈ | Alibaba (Qwen) | 1 385,04 1 352–1 418 | $0,4 | $4 | 262K |
| 86 | GPT OSS 120B ≈ | OpenAI | 1 384,44 1 362–1 407 | $0,03 | $0,14 | 131K |
| 87 | o3 2025-04-16 ≈ | OpenAI | 1 384,08 1 365–1 403 | $2 | $8 | 200K |
| 88 | Kimi K2 0905 Preview ≈ | Moonshot AI (Kimi) | 1 380,79 1 347–1 415 | $0,6 | $2,5 | 262K |
| 89 | Step 3 ≈ | StepFun | 1 380,53 1 338–1 424 | $0,21 | $0,57 | 66K |
| 90 | DeepSeek Reasoner ≈ | DeepSeek | 1 375,56 1 323–1 429 | $0,55 | $2,19 | 164K |
| 91 | GLM 4.5 Air ≈ | Zhipu AI / Z.ai | 1 372,48 1 350–1 395 | $0,11 | $0,29 | 131K |
| 92 | GPT-5.3 Chat (latest) ≈ | OpenAI | 1 372,21 1 353–1 391 | $1,75 | $14 | 128K |
| 93 | Nemotron 3 Nano 30B A3B ≈ | NVIDIA | 1 369,55 1 336–1 403 | $0,05 | $0,2 | 262K |
| 94 | GPT 4.1 2025-04-14 ≈ | OpenAI | 1 368,54 1 349–1 388 | $2 | $8 | 1 048K |
| 95 | Mistral Medium 3 ≈ | Mistral AI | 1 365,42 1 338–1 393 | $0,4 | $2 | 131K |
| 96 | Qwen 3 235b A22B ≈ | Alibaba (Qwen) | 1 363,03 1 334–1 392 | $0,7 | $2,8 | 131K |
| 97 | Gemini 2.5 Flash Lite Preview ≈ | Google DeepMind | 1 361,88 1 339–1 384 | $0,1 | $0,4 | 1 049K |
| 98 | Nova 2 Lite ≈ | Amazon | 1 361,55 1 319–1 405 | $0,3 | $2,5 | 1 000K |
| 99 | GLM 4.7 Flash ≈ | Zhipu AI / Z.ai | 1 358,45 1 326–1 391 | $0,04 | $0,3 | 203K |
| 100 | Grok 3 Mini ≈ | xAI | 1 355,7 1 322–1 390 | $0,3 | $0,5 | 131K |
Le tableau défile latéralement : toutes les colonnes ne tiennent pas.
Le prix est le plus bas parmi les fournisseurs du modèle, tarif de base, hors tarifs par lots ou réduits. L'entrée et la sortie sont affichées séparément à dessein : chez la plupart des modèles, la sortie coûte plusieurs fois plus cher que l'entrée, et la facture finale dépend de ce qui domine dans la tâche.
Le signe ≈ marque les modèles dont l'intervalle de confiance recoupe celui de la ligne du dessus. Il y en a ici 99 modèles — leur ordre entre eux n'est pas déterminé par les données disponibles.
L'intervalle de confiance de la moitié des modèles dépasse 42,4 points — soit environ 27 lignes voisines du tableau. À l'intérieur d'un tel groupe, l'ordre est fixé non par les données mais par ceux qui ont voté cette fois-ci ; les données soutiennent l'écart entre le début et la fin de la liste, mais pas le voisinage des places. Votes par modèle ici — médiane 842: moins il y en a, plus l'intervalle est large.
Arena (LMArena)
— licence CC-BY-4.0 · source primaire
По данным Arena (LMArena)