Desk en direct, mis à jour chaque jour
Classement des modèles d'IA : qui est n°1 en ce moment
Le classement que l'on cite vraiment, le prix de chaque modèle et les sorties du mois, sur une page qui se met à jour toute seule.
Au 13 septembre 2026, Claude Fable 5.1 (max) de Anthropic mène le classement texte de LMArena, suivi de près par Claude Opus 5 (max) et Claude Opus 4.6 (high).
Parmi les modèles de grandes marques, GLM 5.3 Flash est le moins cher à utiliser, à 0,25 $US par million de tokens de sortie, et Claude Fable 5.1 le plus cher, à 50,00 $US.
Le haut du tableau est le plus souvent une égalité statistique : quand les marges de deux modèles se chevauchent, les votes ne peuvent pas les départager.
Le classement
Le classement texte de LMArena : les visiteurs discutent avec deux modèles anonymes côte à côte et votent pour la meilleure réponse. Une ligne par modèle ; les niveaux de raisonnement sont regroupés sur le meilleur.
| # | Modèle | Éditeur | Note | Nb de votes |
|---|---|---|---|---|
| 1 | Claude Fable 5.1 (max) | Anthropic | 1 508 ±9 | 5 783 |
| 2 | Claude Opus 5 (max) | Anthropic | 1 505 ±5 | 20 706 |
| 3 | Claude Opus 4.6 (high) | Anthropic | 1 503 ±4 | 71 993 |
| 4 | Gemini 3.8 Flash (high) | 1 495 ±9 | 5 076 | |
| 5 | Claude Fable 5 | Anthropic | 1 493 ±5 | 30 057 |
| 6 | Gemini 3.7 Flash (high) | 1 490 ±9 | 5 640 | |
| 7 | Claude Opus 4.7 (high) | Anthropic | 1 490 ±4 | 60 002 |
| 8 | Muse Spark 1.3 (max) | Meta | 1 490 ±9 | 4 723 |
| 9 | Muse Spark 1.2 (xhigh) | Meta | 1 489 ±11 | 3 227 |
| 10 | Gemini 3.5 Flash (high) | 1 482 ±4 | 38 257 | |
| 11 | Qwen3.8 (max) | Alibaba | 1 481 ±6 | 16 670 |
| 12 | Muse Spark 1.1 | Meta | 1 480 ±5 | 27 615 |
| 13 | Gemini 3.1 Pro Preview | 1 480 ±3 | 106 951 | |
| 14 | Gemini 3 Pro | 1 479 ±4 | 40 654 | |
| 15 | Gemini 3.6 Flash (high) | 1 476 ±5 | 26 445 | |
| 16 | GLM 5.3 (max)Poids ouverts | Z.ai | 1 475 ±6 | 10 960 |
| 17 | Qwen3.7 Max Preview | Alibaba | 1 474 ±10 | 3 705 |
| 18 | Muse Spark | Meta | 1 473 ±6 | 13 565 |
| 19 | Kimi K3 (max)Poids ouverts | Moonshot | 1 472 ±5 | 20 987 |
| 20 | GLM 5.3 FlashPoids ouverts | Z.ai | 1 472 ±7 | 10 038 |
| 21 | Qwen3.5 Max Preview | Alibaba | 1 471 ±5 | 21 476 |
| 22 | GPT-5.5 (high) | OpenAI | 1 471 ±4 | 64 924 |
| 23 | GPT-5.4 (high) | OpenAI | 1 470 ±4 | 60 537 |
| 24 | ERNIE 5.1 | Baidu | 1 468 ±5 | 37 058 |
| 25 | GLM 5.2 (max)Poids ouverts | Z.ai | 1 467 ±5 | 36 798 |
Classement texte LMArena, publié le 13 septembre 2026. Le score est la note d'arène avec sa marge à 95 % ; les lignes dont les marges se chevauchent sont à égalité statistique.
Meilleurs modèles à poids ouverts
Les mêmes votes LMArena, uniquement les modèles dont vous pouvez télécharger et exécuter les poids vous-même. Le nombre gris est leur place au classement général.
| # | Modèle | Éditeur | Note | Nb de votes |
|---|---|---|---|---|
| 1 | GLM 5.3 (max)n°20 au général | Z.ai | 1 475 ±6 | 10 960 |
| 2 | Kimi K3 (max)n°23 au général | Moonshot | 1 472 ±5 | 20 987 |
| 3 | GLM 5.3 Flashn°24 au général | Z.ai | 1 472 ±7 | 10 038 |
| 4 | GLM 5.2 (max)n°29 au général | Z.ai | 1 467 ±5 | 36 798 |
| 5 | Mimo V2.5 Pron°32 au général | Xiaomi | 1 465 ±4 | 60 919 |
| 6 | GLM 5.1n°33 au général | Z.ai | 1 462 ±4 | 48 901 |
| 7 | Kimi K2.6n°38 au général | Moonshot | 1 455 ±5 | 37 502 |
| 8 | DeepSeek V4 Pron°43 au général | DeepSeek | 1 451 ±4 | 54 130 |
| 9 | GLM 5n°51 au général | Z.ai | 1 446 ±5 | 27 605 |
| 10 | Kimi K2.5 (thinking)n°53 au général | Moonshot | 1 446 ±4 | 70 513 |
| 11 | DeepSeek V4 Pro High Previewn°54 au général | DeepSeek | 1 445 ±4 | 51 485 |
| 12 | Nvidia Nemotron 3 Ultra 550b A55B Nvfp4n°55 au général | Nvidia | 1 445 ±7 | 10 693 |
| 13 | DeepSeek V4 Pro High 20260813n°58 au général | DeepSeek | 1 444 ±7 | 9 008 |
| 14 | Gemma 4 31bn°64 au général | 1 442 ±8 | 5 894 | |
| 15 | Hy3n°65 au général | Tencent | 1 441 ±8 | 8 047 |
Classement texte LMArena, publié le 13 septembre 2026. Le score est la note d'arène avec sa marge à 95 % ; les lignes dont les marges se chevauchent sont à égalité statistique.
Ce que coûte chaque modèle
Prix catalogue par million de tokens du modèle actuel de chaque famille, du moins cher au plus cher. Un million de tokens, c'est environ 750 000 mots de texte, en entrée ou en sortie.
| Modèle | Éditeur | Entrée | Sortie | 1 $ achète | Contexte |
|---|---|---|---|---|---|
| GLM 5.3 Flash | Z.ai | 0,075 $US | 0,25 $US | ≈3 M mots | 1,3 M |
| DeepSeek V4.1 Flash | DeepSeek | 0,15 $US | 0,60 $US | ≈1,3 M mots | 1 M |
| GPT-5.6 Luna | OpenAI | 0,20 $US | 1,20 $US | ≈625 k mots | 1,1 M |
| DeepSeek V4 Pro 0813 | DeepSeek | 0,66 $US | 1,98 $US | ≈378,8 k mots | 1 M |
| Gemini 3.8 Flash | 0,75 $US | 3,75 $US | ≈200 k mots | 1 M | |
| GPT-5.4 Mini | OpenAI | 0,75 $US | 4,50 $US | ≈166,7 k mots | 400 k |
| Claude Haiku 4.5 | Anthropic | 1,00 $US | 5,00 $US | ≈150 k mots | 200 k |
| GLM 5.3 | Z.ai | 1,40 $US | 4,40 $US | ≈170,5 k mots | 1,3 M |
| Grok 4.6 | xAI | 2,00 $US | 6,00 $US | ≈125 k mots | 500 k |
| GPT-5.6 Sol | OpenAI | 2,00 $US | 10,00 $US | ≈75 k mots | 1,1 M |
| Claude Sonnet 5 | Anthropic | 2,00 $US | 10,00 $US | ≈75 k mots | 1 M |
| GPT-5.6 Terra | OpenAI | 2,00 $US | 12,00 $US | ≈62,5 k mots | 1,1 M |
| Gemini 3.1 Pro Preview | 2,00 $US | 12,00 $US | ≈62,5 k mots | 1 M | |
| Kimi K3 | Moonshot | 2,648 $US | 13,283 $US | ≈56,5 k mots | 1 M |
| Claude Opus 5 | Anthropic | 5,00 $US | 25,00 $US | ≈30 k mots | 1 M |
| GPT-6 Astra | OpenAI | 10,00 $US | 50,00 $US | ≈15 k mots | 1,1 M |
| Claude Fable 5.1 | Anthropic | 10,00 $US | 50,00 $US | ≈15 k mots | 1 M |
Dollars US par million de tokens, entrée et sortie. liste publique des modèles d'OpenRouter, vérifiée le 15 septembre 2026. Ce sont des prix catalogue ; vérifiez la page tarifaire de l'éditeur avant de budgéter, et sachez que les modes de réflexion facturent leur raisonnement en sortie.
Nouveau ce mois-ci
Les modèles d'éditeurs connus référencés ces 30 derniers jours, les plus récents d'abord.
| Référencé | Modèle | Éditeur | $/M entrée / sortie |
|---|---|---|---|
| il y a 5 jours10 sept. 2026 | DeepSeek V4.1 Flash | DeepSeek | 0,15 $US / 0,60 $US |
| il y a 11 jours4 sept. 2026 | GPT-6 Astra | OpenAI | 10,00 $US / 50,00 $US |
| il y a 11 jours4 sept. 2026 | GPT-6 Astra Pro | OpenAI | 10,00 $US / 50,00 $US |
| il y a 12 jours3 sept. 2026 | Qwen3.8 Max (0902) | Alibaba | 2,00 $US / 6,00 $US |
| il y a 13 jours2 sept. 2026 | Muse Spark 1.3 Contributor | Meta | 0,10 $US / 0,20 $US |
| il y a 13 jours2 sept. 2026 | Muse Spark 1.3 | Meta | 1,25 $US / 4,25 $US |
| il y a 13 jours2 sept. 2026 | Gemini 3.8 Flash | 0,75 $US / 3,75 $US | |
| il y a 14 jours1 sept. 2026 | Claude Fable 5.1 | Anthropic | 10,00 $US / 50,00 $US |
| il y a 15 jours31 août 2026 | Granite 4.2 8B | IBM | 0,06 $US / 0,25 $US |
| il y a 18 jours28 août 2026 | Hy4 preview | Tencent | 0,834 $US / 2,501 $US |
| il y a 20 jours26 août 2026 | Qwen3.8 Flash | Alibaba | 0,15 $US / 0,47 $US |
| il y a 20 jours26 août 2026 | GLM 5.3 Flash | Z.ai | 0,075 $US / 0,25 $US |
| il y a 25 jours21 août 2026 | Muse Spark 1.2 Contributor | Meta | 0,10 $US / 0,20 $US |
| il y a 25 jours21 août 2026 | DeepSeek V4 Flash Vision Exp | DeepSeek | 0,22 $US / 0,66 $US |
| il y a 26 jours20 août 2026 | Hy-MT2-1.8B | Tencent | 0,044 $US / 0,177 $US |
| il y a 26 jours20 août 2026 | Hy-MT2-30B-A3B | Tencent | 0,074 $US / 0,295 $US |
| il y a 27 jours19 août 2026 | Hy-MT2-7B | Tencent | 0,074 $US / 0,295 $US |
| il y a 28 jours18 août 2026 | GLM 5.3 | Z.ai | 1,40 $US / 4,40 $US |
Aucun nouveau modèle de grand éditeur ces 30 derniers jours.
Référencements des 30 derniers jours par les grands éditeurs, vérifiés le 15 septembre 2026. Source : liste des modèles OpenRouter.
Comment fonctionne le classement
LMArena (l'ancienne Chatbot Arena du groupe LMSYS de l'université de Berkeley) montre à chaque visiteur deux modèles anonymes répondant à la même question et lui demande laquelle des réponses est la meilleure. Des millions de ces votes alimentent une note Bradley-Terry, la même famille de calcul que l'Elo aux échecs : le score d'un modèle dit à quelle fréquence il l'emporte face aux autres. La marge à 95 % à côté de chaque score est l'incertitude : un modèle à 5 000 votes a une marge plus large qu'un modèle à 70 000. Nous affichons le classement texte général par défaut de LMArena, une ligne par modèle. LMArena liste le même modèle plusieurs fois avec différents réglages de raisonnement (« high », « max ») ; nous gardons le mieux classé et indiquons le réglage entre parenthèses.
Comment lire les prix
Les sociétés d'IA facturent au token, et un token vaut environ trois quarts d'un mot anglais : un million de tokens, c'est donc à peu près 750 000 mots. L'entrée, c'est ce que vous envoyez (votre question, le document collé) ; la sortie, c'est ce que le modèle écrit en retour. La sortie est le côté cher, et les modes « réflexion » ou raisonnement facturent aussi leur raisonnement caché en sortie, si bien qu'une question difficile peut coûter plusieurs fois ce que suggère la longueur de la réponse. Les prix affichés sont les prix catalogue du répertoire public d'OpenRouter, qui reflètent les tarifs des éditeurs eux-mêmes ; OpenAI, Anthropic et Google vendent aussi des tarifs par lots à moitié prix pour les travaux qui peuvent attendre. Vérifiez toujours la page tarifaire de l'éditeur avant de budgéter.
Lequel utiliser, concrètement ?
Si vous utilisez l'IA via une application de chat plutôt qu'une API, le classement compte moins qu'il n'y paraît. Les dix premiers se tiennent en quelques points, les offres gratuites de ChatGPT, Claude et Gemini tournent toutes sur des modèles de ce groupe, et les différences qui comptent au quotidien sont les fonctions de l'application : mémoire, gestion des fichiers, voix, et le fait que votre employeur l'autorise ou non. Choisissez selon l'application qui vous plaît et le prix que vous payez. Si vous payez au token, c'est le tableau des coûts qu'il faut lire : l'écart entre le modèle de marque le moins cher et le plus cher dépasse le centuple, et pour le travail courant le bas de l'échelle suffit généralement.
Ce que cette page ne dit pas
Un vote en duel mesure quelle réponse les gens ont préférée dans une fenêtre de chat. Il ne mesure ni la justesse du code, ni le travail sur les longs documents, ni la compréhension des images, ni la vitesse, ni le comportement d'un modèle au sein d'un agent. LMArena tient des classements séparés pour plusieurs de ces points, et des suites de tests comme Artificial Analysis publient leurs propres indices. Voyez ce tableau comme le vote populaire, pas comme toute l'élection.
Les questions qu'on nous pose
Quel est le meilleur modèle d'IA en ce moment ?
D'après les votes en duel à l'aveugle de LMArena, le modèle en tête du tableau de cette page. Regardez la colonne des marges : quand les premiers se chevauchent, ils sont à égalité en pratique, et l'ordre peut s'inverser d'une semaine à l'autre.
À quelle fréquence cette page est-elle mise à jour ?
Une fois par jour. LMArena publie de nouveaux instantanés de son classement tous les quelques jours et la liste de prix d'OpenRouter change dès qu'un éditeur modifie un tarif ou référence un modèle ; le desk récupère les deux à son passage quotidien suivant et indique sous chaque tableau la date de sa dernière vérification.
Que veut dire « poids ouverts » ?
L'éditeur a publié les poids du modèle sous une licence qui vous permet de le télécharger et de l'exécuter vous-même, sur votre propre matériel ou sur un cloud loué, au lieu de passer uniquement par son API. Les modèles propriétaires ne sont utilisables qu'à travers l'entreprise qui les a conçus.
Pourquoi un modèle apparaît-il deux fois sur LMArena et une seule ici ?
LMArena note le même modèle avec différents réglages de raisonnement comme des lignes distinctes. Nous gardons le réglage le mieux classé de chaque modèle pour que le tableau se lise comme une liste de modèles, et nous indiquons le réglage entre parenthèses après le nom.
Le modèle le moins cher suffit-il ?
Pour l'essentiel de la rédaction, des résumés et des questions-réponses du quotidien, oui : l'offre bon marché d'un grand éditeur est généralement une version réduite de son modèle phare. Payez l'offre chère quand il vous faut un raisonnement long et soigné, du code complexe ou la meilleure réponse possible du premier coup.
Pour aller plus loin
- GPT-6 Astra est sorti : ce qui a changé
- Claude Fable 5.1 : le modèle qui traque les bugs
- Pourquoi toutes les IA se ressemblent
- Pourquoi Opus 4.6 a mis fin à l'ère du copilote
- Les modèles de raisonnement expliqués : l'IA qui réfléchit avant de parler
Données de classement : LMArena. Données de prix et de référencement : OpenRouter. Les deux sont crédités sous chaque tableau ; ce site n'est affilié à aucun d'eux.