Live-Desk, täglich aktualisiert
KI-Modell-Rangliste: wer ist gerade die Nr. 1?
Die Rangliste, die tatsächlich zitiert wird, der Preis jedes Modells und die Neuerscheinungen des Monats, auf einer Seite, die sich selbst aktualisiert.
Stand 13. September 2026 führt Claude Fable 5.1 (max) von Anthropic das Text-Leaderboard von LMArena an, dicht gefolgt von Claude Opus 5 (max) und Claude Opus 4.6 (high).
Unter den Markenmodellen ist GLM 5.3 Flash mit 0,25 $ pro Million Ausgabe-Tokens am günstigsten und Claude Fable 5.1 mit 50,00 $ am teuersten.
Die Tabellenspitze ist meist ein statistisches Unentschieden: Überlappen sich die Spannen zweier Modelle, können die Stimmen sie nicht trennen.
Das Leaderboard
LMArenas Text-Leaderboard: Nutzer chatten mit zwei anonymen Modellen nebeneinander und stimmen für die bessere Antwort. Eine Zeile pro Modell; Reasoning-Stufen auf die beste zusammengefasst.
| # | Modell | Hersteller | Punkte | Stimmen |
|---|---|---|---|---|
| 1 | Claude Fable 5.1 (max) | Anthropic | 1.508 ±9 | 5.783 |
| 2 | Claude Opus 5 (max) | Anthropic | 1.505 ±5 | 20.706 |
| 3 | Claude Opus 4.6 (high) | Anthropic | 1.503 ±4 | 71.993 |
| 4 | Gemini 3.8 Flash (high) | 1.495 ±9 | 5.076 | |
| 5 | Claude Fable 5 | Anthropic | 1.493 ±5 | 30.057 |
| 6 | Gemini 3.7 Flash (high) | 1.490 ±9 | 5.640 | |
| 7 | Claude Opus 4.7 (high) | Anthropic | 1.490 ±4 | 60.002 |
| 8 | Muse Spark 1.3 (max) | Meta | 1.490 ±9 | 4.723 |
| 9 | Muse Spark 1.2 (xhigh) | Meta | 1.489 ±11 | 3.227 |
| 10 | Gemini 3.5 Flash (high) | 1.482 ±4 | 38.257 | |
| 11 | Qwen3.8 (max) | Alibaba | 1.481 ±6 | 16.670 |
| 12 | Muse Spark 1.1 | Meta | 1.480 ±5 | 27.615 |
| 13 | Gemini 3.1 Pro Preview | 1.480 ±3 | 106.951 | |
| 14 | Gemini 3 Pro | 1.479 ±4 | 40.654 | |
| 15 | Gemini 3.6 Flash (high) | 1.476 ±5 | 26.445 | |
| 16 | GLM 5.3 (max)Offene Gewichte | Z.ai | 1.475 ±6 | 10.960 |
| 17 | Qwen3.7 Max Preview | Alibaba | 1.474 ±10 | 3.705 |
| 18 | Muse Spark | Meta | 1.473 ±6 | 13.565 |
| 19 | Kimi K3 (max)Offene Gewichte | Moonshot | 1.472 ±5 | 20.987 |
| 20 | GLM 5.3 FlashOffene Gewichte | Z.ai | 1.472 ±7 | 10.038 |
| 21 | Qwen3.5 Max Preview | Alibaba | 1.471 ±5 | 21.476 |
| 22 | GPT-5.5 (high) | OpenAI | 1.471 ±4 | 64.924 |
| 23 | GPT-5.4 (high) | OpenAI | 1.470 ±4 | 60.537 |
| 24 | ERNIE 5.1 | Baidu | 1.468 ±5 | 37.058 |
| 25 | GLM 5.2 (max)Offene Gewichte | Z.ai | 1.467 ±5 | 36.798 |
LMArena-Text-Leaderboard, veröffentlicht am 13. September 2026. Der Score ist die Arena-Wertung mit ihrer 95-%-Spanne; Zeilen mit überlappenden Spannen sind statistisch gleichauf.
Beste Modelle mit offenen Gewichten
Dieselben LMArena-Stimmen, nur Modelle, deren Gewichte Sie selbst herunterladen und betreiben können. Die graue Zahl ist der Platz in der Gesamttabelle.
| # | Modell | Hersteller | Punkte | Stimmen |
|---|---|---|---|---|
| 1 | GLM 5.3 (max)Nr. 20 gesamt | Z.ai | 1.475 ±6 | 10.960 |
| 2 | Kimi K3 (max)Nr. 23 gesamt | Moonshot | 1.472 ±5 | 20.987 |
| 3 | GLM 5.3 FlashNr. 24 gesamt | Z.ai | 1.472 ±7 | 10.038 |
| 4 | GLM 5.2 (max)Nr. 29 gesamt | Z.ai | 1.467 ±5 | 36.798 |
| 5 | Mimo V2.5 ProNr. 32 gesamt | Xiaomi | 1.465 ±4 | 60.919 |
| 6 | GLM 5.1Nr. 33 gesamt | Z.ai | 1.462 ±4 | 48.901 |
| 7 | Kimi K2.6Nr. 38 gesamt | Moonshot | 1.455 ±5 | 37.502 |
| 8 | DeepSeek V4 ProNr. 43 gesamt | DeepSeek | 1.451 ±4 | 54.130 |
| 9 | GLM 5Nr. 51 gesamt | Z.ai | 1.446 ±5 | 27.605 |
| 10 | Kimi K2.5 (thinking)Nr. 53 gesamt | Moonshot | 1.446 ±4 | 70.513 |
| 11 | DeepSeek V4 Pro High PreviewNr. 54 gesamt | DeepSeek | 1.445 ±4 | 51.485 |
| 12 | Nvidia Nemotron 3 Ultra 550b A55B Nvfp4Nr. 55 gesamt | Nvidia | 1.445 ±7 | 10.693 |
| 13 | DeepSeek V4 Pro High 20260813Nr. 58 gesamt | DeepSeek | 1.444 ±7 | 9.008 |
| 14 | Gemma 4 31bNr. 64 gesamt | 1.442 ±8 | 5.894 | |
| 15 | Hy3Nr. 65 gesamt | Tencent | 1.441 ±8 | 8.047 |
LMArena-Text-Leaderboard, veröffentlicht am 13. September 2026. Der Score ist die Arena-Wertung mit ihrer 95-%-Spanne; Zeilen mit überlappenden Spannen sind statistisch gleichauf.
Was jedes Modell kostet
Listenpreis pro Million Tokens für das aktuelle Modell jeder Familie, günstigstes zuerst. Eine Million Tokens sind grob 750.000 Wörter Text, rein oder raus.
| Modell | Hersteller | Eingabe | Ausgabe | 1 $ kauft | Kontext |
|---|---|---|---|---|---|
| GLM 5.3 Flash | Z.ai | 0,075 $ | 0,25 $ | ≈3 Mio. Wörter | 1,3 Mio. |
| DeepSeek V4.1 Flash | DeepSeek | 0,15 $ | 0,60 $ | ≈1,3 Mio. Wörter | 1 Mio. |
| GPT-5.6 Luna | OpenAI | 0,20 $ | 1,20 $ | ≈625.000 Wörter | 1,1 Mio. |
| DeepSeek V4 Pro 0813 | DeepSeek | 0,66 $ | 1,98 $ | ≈378.788 Wörter | 1 Mio. |
| Gemini 3.8 Flash | 0,75 $ | 3,75 $ | ≈200.000 Wörter | 1 Mio. | |
| GPT-5.4 Mini | OpenAI | 0,75 $ | 4,50 $ | ≈166.667 Wörter | 400.000 |
| Claude Haiku 4.5 | Anthropic | 1,00 $ | 5,00 $ | ≈150.000 Wörter | 200.000 |
| GLM 5.3 | Z.ai | 1,40 $ | 4,40 $ | ≈170.455 Wörter | 1,3 Mio. |
| Grok 4.6 | xAI | 2,00 $ | 6,00 $ | ≈125.000 Wörter | 500.000 |
| GPT-5.6 Sol | OpenAI | 2,00 $ | 10,00 $ | ≈75.000 Wörter | 1,1 Mio. |
| Claude Sonnet 5 | Anthropic | 2,00 $ | 10,00 $ | ≈75.000 Wörter | 1 Mio. |
| GPT-5.6 Terra | OpenAI | 2,00 $ | 12,00 $ | ≈62.500 Wörter | 1,1 Mio. |
| Gemini 3.1 Pro Preview | 2,00 $ | 12,00 $ | ≈62.500 Wörter | 1 Mio. | |
| Kimi K3 | Moonshot | 2,648 $ | 13,283 $ | ≈56.463 Wörter | 1 Mio. |
| Claude Opus 5 | Anthropic | 5,00 $ | 25,00 $ | ≈30.000 Wörter | 1 Mio. |
| GPT-6 Astra | OpenAI | 10,00 $ | 50,00 $ | ≈15.000 Wörter | 1,1 Mio. |
| Claude Fable 5.1 | Anthropic | 10,00 $ | 50,00 $ | ≈15.000 Wörter | 1 Mio. |
US-Dollar pro Million Tokens, Eingabe und Ausgabe. Öffentliche Modellliste von OpenRouter, geprüft am 15. September 2026. Das sind Listenpreise; prüfen Sie die Preisseite des Herstellers, bevor Sie budgetieren, und beachten Sie, dass Denkmodi ihr Reasoning als Ausgabe abrechnen.
Neu diesen Monat
Modelle bekannter Hersteller, die in den letzten 30 Tagen gelistet wurden, neueste zuerst.
| Gelistet | Modell | Hersteller | $/M rein / raus |
|---|---|---|---|
| vor 5 Tagen10. Sept. 2026 | DeepSeek V4.1 Flash | DeepSeek | 0,15 $ / 0,60 $ |
| vor 11 Tagen4. Sept. 2026 | GPT-6 Astra | OpenAI | 10,00 $ / 50,00 $ |
| vor 11 Tagen4. Sept. 2026 | GPT-6 Astra Pro | OpenAI | 10,00 $ / 50,00 $ |
| vor 12 Tagen3. Sept. 2026 | Qwen3.8 Max (0902) | Alibaba | 2,00 $ / 6,00 $ |
| vor 13 Tagen2. Sept. 2026 | Muse Spark 1.3 Contributor | Meta | 0,10 $ / 0,20 $ |
| vor 13 Tagen2. Sept. 2026 | Muse Spark 1.3 | Meta | 1,25 $ / 4,25 $ |
| vor 13 Tagen2. Sept. 2026 | Gemini 3.8 Flash | 0,75 $ / 3,75 $ | |
| vor 14 Tagen1. Sept. 2026 | Claude Fable 5.1 | Anthropic | 10,00 $ / 50,00 $ |
| vor 15 Tagen31. Aug. 2026 | Granite 4.2 8B | IBM | 0,06 $ / 0,25 $ |
| vor 18 Tagen28. Aug. 2026 | Hy4 preview | Tencent | 0,834 $ / 2,501 $ |
| vor 20 Tagen26. Aug. 2026 | Qwen3.8 Flash | Alibaba | 0,15 $ / 0,47 $ |
| vor 20 Tagen26. Aug. 2026 | GLM 5.3 Flash | Z.ai | 0,075 $ / 0,25 $ |
| vor 25 Tagen21. Aug. 2026 | Muse Spark 1.2 Contributor | Meta | 0,10 $ / 0,20 $ |
| vor 25 Tagen21. Aug. 2026 | DeepSeek V4 Flash Vision Exp | DeepSeek | 0,22 $ / 0,66 $ |
| vor 26 Tagen20. Aug. 2026 | Hy-MT2-1.8B | Tencent | 0,044 $ / 0,177 $ |
| vor 26 Tagen20. Aug. 2026 | Hy-MT2-30B-A3B | Tencent | 0,074 $ / 0,295 $ |
| vor 27 Tagen19. Aug. 2026 | Hy-MT2-7B | Tencent | 0,074 $ / 0,295 $ |
| vor 28 Tagen18. Aug. 2026 | GLM 5.3 | Z.ai | 1,40 $ / 4,40 $ |
Keine neuen Modelle großer Hersteller in den letzten 30 Tagen.
Listungen der letzten 30 Tage von großen Herstellern, geprüft am 15. September 2026. Quelle: Modellliste von OpenRouter.
So funktioniert die Rangliste
LMArena (die frühere Chatbot Arena der LMSYS-Gruppe an der UC Berkeley) zeigt Besuchern zwei anonyme Modelle, die dieselbe Frage beantworten, und fragt, welche Antwort besser war. Millionen solcher Stimmen fließen in eine Bradley-Terry-Wertung, dieselbe Mathematik-Familie wie die Elo-Zahl im Schach: Der Score eines Modells sagt, wie oft es gegen das Feld gewinnt. Die 95-%-Spanne neben jedem Score ist die Unsicherheit; ein Modell mit 5.000 Stimmen hat eine breitere Spanne als eines mit 70.000. Wir zeigen LMArenas Standard-Gesamttabelle für Text, eine Zeile pro Modell. LMArena listet dasselbe Modell mehrfach mit verschiedenen Reasoning-Einstellungen („high“, „max“); wir behalten die bestplatzierte und nennen die Einstellung in Klammern.
So lesen Sie die Preise
KI-Anbieter rechnen pro Token ab, und ein Token entspricht etwa drei Vierteln eines englischen Wortes; eine Million Tokens sind also grob 750.000 Wörter. Eingabe ist, was Sie senden (Ihre Frage, das eingefügte Dokument); Ausgabe ist, was das Modell zurückschreibt. Die Ausgabe ist die teure Seite, und „Denk“- oder Reasoning-Modi rechnen auch ihr verborgenes Nachdenken als Ausgabe ab, sodass eine schwere Frage ein Vielfaches dessen kosten kann, was die Antwortlänge vermuten lässt. Die Preise hier sind die Listenpreise aus OpenRouters öffentlichem Katalog, die die Tarife der Hersteller spiegeln; OpenAI, Anthropic und Google verkaufen außerdem Batch-Tarife zum halben Preis für Aufträge, die warten können. Prüfen Sie vor dem Budgetieren immer die Preisseite des Herstellers.
Welches sollten Sie tatsächlich nutzen?
Wer KI über eine Chat-App statt über eine API nutzt, für den zählt die Rangliste weniger, als es scheint. Die Top Ten liegen wenige Punkte auseinander, die Gratisstufen von ChatGPT, Claude und Gemini laufen alle mit Modellen aus dieser Gruppe, und die Unterschiede, die im Alltag zählen, sind die Funktionen der App: Gedächtnis, Umgang mit Dateien, Sprache und ob Ihr Arbeitgeber sie erlaubt. Wählen Sie nach der App, die Ihnen gefällt, und dem Preis, den Sie zahlen. Wer pro Token bezahlt, sollte die Kostentabelle lesen: Zwischen dem günstigsten und dem teuersten Markenmodell liegt mehr als der Faktor hundert, und für Routinearbeit reicht das günstige Ende meist aus.
Was diese Seite nicht sagt
Eine Duell-Abstimmung misst, welche Antwort Menschen im Chatfenster bevorzugt haben. Sie misst nicht Programmiergenauigkeit, Arbeit mit langen Dokumenten, Bildverständnis, Geschwindigkeit oder das Verhalten eines Modells in einem Agenten. LMArena führt für einige davon eigene Tabellen, und Benchmark-Sammlungen wie Artificial Analysis veröffentlichen eigene Indizes. Betrachten Sie diese Tabelle als Publikumsvotum, nicht als die ganze Wahl.
Häufige Fragen
Welches KI-Modell ist gerade das beste?
Nach LMArenas blinden Duell-Abstimmungen das Modell ganz oben in der Tabelle auf dieser Seite. Achten Sie auf die Spalte mit der Spanne: Überlappen sich die obersten Einträge, sind sie praktisch gleichauf, und die Reihenfolge kann von Woche zu Woche wechseln.
Wie oft wird diese Seite aktualisiert?
Einmal täglich. LMArena veröffentlicht alle paar Tage neue Momentaufnahmen des Leaderboards, und OpenRouters Preisliste ändert sich, sobald ein Hersteller einen Preis ändert oder ein Modell listet; der Desk übernimmt beides beim nächsten Tageslauf und vermerkt unter jeder Tabelle das Datum der letzten Prüfung.
Was bedeutet „offene Gewichte“?
Der Hersteller hat die Gewichte des Modells unter einer Lizenz veröffentlicht, die es erlaubt, das Modell selbst herunterzuladen und zu betreiben, auf eigener Hardware oder in einer gemieteten Cloud, statt nur über die API des Herstellers. Proprietäre Modelle sind nur über das Unternehmen nutzbar, das sie gebaut hat.
Warum steht ein Modell bei LMArena zweimal, hier aber nur einmal?
LMArena bewertet dasselbe Modell mit verschiedenen Reasoning-Einstellungen als getrennte Zeilen. Wir behalten die bestplatzierte Einstellung jedes Modells, damit die Tabelle als Modellliste lesbar bleibt, und zeigen die Einstellung in Klammern hinter dem Namen.
Reicht das günstigste Modell aus?
Für das meiste alltägliche Schreiben, Zusammenfassen und Beantworten von Fragen ja: Die günstige Stufe eines großen Herstellers ist meist eine kleinere Version seines Flaggschiffs. Zahlen Sie für die teure Stufe, wenn Sie langes, sorgfältiges Reasoning, komplexen Code oder die bestmögliche Antwort im ersten Anlauf brauchen.
Weiterlesen
- GPT-6 Astra ist da: was sich geändert hat
- Claude Fable 5.1: das Modell, das Bugs jagt
- Warum alle KIs gleich klingen
- Warum Opus 4.6 die Copilot-Ära beendet hat
- Reasoning-Modelle erklärt: KI, die vor dem Sprechen denkt
Ranglistendaten: LMArena. Preis- und Listungsdaten: OpenRouter. Beide sind an jeder Tabelle genannt; diese Website ist mit keinem von beiden verbunden.