qwen-max-2025-01-25Des fournisseurs proposent bien ce modèle, mais nous n'avons pas encore relevé de prix en vigueur. C'est une lacune de notre côté, pas une absence du marché.
| Jeu de tâches | Résultat | Conditions d'exécution | Mesuré par |
|---|---|---|---|
| MATH, niveau de difficulté cinq | 67,18 % | · avec un harnais ajusté | Epoch evaluations |
| Fiction.LiveBench — maintien d'un contexte long | 66,7 % | — | Fiction.live leaderboard |
| GPQA Diamond — questions de niveau doctorat | 41,5 % | · avec un harnais ajusté | Epoch evaluations |
| Aider Polyglot — modifications de code dans six langages | 21,8 % | · avec un harnais ajusté | Aider LLM Leaderboards |
| Mock AIME 2024–2025 — problèmes d'olympiade | 16,03 % | · avec un harnais ajusté | Epoch evaluations |