Live-Desk, täglich aktualisiert

KI-Modell-Rangliste: wer ist gerade die Nr. 1?

Die Rangliste, die tatsächlich zitiert wird, der Preis jedes Modells und die Neuerscheinungen des Monats, auf einer Seite, die sich selbst aktualisiert.

Stand 13. September 2026 führt Claude Fable 5.1 (max) von Anthropic das Text-Leaderboard von LMArena an, dicht gefolgt von Claude Opus 5 (max) und Claude Opus 4.6 (high).

Unter den Markenmodellen ist GLM 5.3 Flash mit 0,25 $ pro Million Ausgabe-Tokens am günstigsten und Claude Fable 5.1 mit 50,00 $ am teuersten.

Die Tabellenspitze ist meist ein statistisches Unentschieden: Überlappen sich die Spannen zweier Modelle, können die Stimmen sie nicht trennen.

Das Leaderboard

LMArenas Text-Leaderboard: Nutzer chatten mit zwei anonymen Modellen nebeneinander und stimmen für die bessere Antwort. Eine Zeile pro Modell; Reasoning-Stufen auf die beste zusammengefasst.

#ModellHerstellerPunkteStimmen
1 Claude Fable 5.1 (max) Anthropic 1.508 ±9 5.783
2 Claude Opus 5 (max) Anthropic 1.505 ±5 20.706
3 Claude Opus 4.6 (high) Anthropic 1.503 ±4 71.993
4 Gemini 3.8 Flash (high) Google 1.495 ±9 5.076
5 Claude Fable 5 Anthropic 1.493 ±5 30.057
6 Gemini 3.7 Flash (high) Google 1.490 ±9 5.640
7 Claude Opus 4.7 (high) Anthropic 1.490 ±4 60.002
8 Muse Spark 1.3 (max) Meta 1.490 ±9 4.723
9 Muse Spark 1.2 (xhigh) Meta 1.489 ±11 3.227
10 Gemini 3.5 Flash (high) Google 1.482 ±4 38.257
11 Qwen3.8 (max) Alibaba 1.481 ±6 16.670
12 Muse Spark 1.1 Meta 1.480 ±5 27.615
13 Gemini 3.1 Pro Preview Google 1.480 ±3 106.951
14 Gemini 3 Pro Google 1.479 ±4 40.654
15 Gemini 3.6 Flash (high) Google 1.476 ±5 26.445
16 GLM 5.3 (max)Offene Gewichte Z.ai 1.475 ±6 10.960
17 Qwen3.7 Max Preview Alibaba 1.474 ±10 3.705
18 Muse Spark Meta 1.473 ±6 13.565
19 Kimi K3 (max)Offene Gewichte Moonshot 1.472 ±5 20.987
20 GLM 5.3 FlashOffene Gewichte Z.ai 1.472 ±7 10.038
21 Qwen3.5 Max Preview Alibaba 1.471 ±5 21.476
22 GPT-5.5 (high) OpenAI 1.471 ±4 64.924
23 GPT-5.4 (high) OpenAI 1.470 ±4 60.537
24 ERNIE 5.1 Baidu 1.468 ±5 37.058
25 GLM 5.2 (max)Offene Gewichte Z.ai 1.467 ±5 36.798

LMArena-Text-Leaderboard, veröffentlicht am 13. September 2026. Der Score ist die Arena-Wertung mit ihrer 95-%-Spanne; Zeilen mit überlappenden Spannen sind statistisch gleichauf.

Beste Modelle mit offenen Gewichten

Dieselben LMArena-Stimmen, nur Modelle, deren Gewichte Sie selbst herunterladen und betreiben können. Die graue Zahl ist der Platz in der Gesamttabelle.

#ModellHerstellerPunkteStimmen
1 GLM 5.3 (max)Nr. 20 gesamt Z.ai 1.475 ±6 10.960
2 Kimi K3 (max)Nr. 23 gesamt Moonshot 1.472 ±5 20.987
3 GLM 5.3 FlashNr. 24 gesamt Z.ai 1.472 ±7 10.038
4 GLM 5.2 (max)Nr. 29 gesamt Z.ai 1.467 ±5 36.798
5 Mimo V2.5 ProNr. 32 gesamt Xiaomi 1.465 ±4 60.919
6 GLM 5.1Nr. 33 gesamt Z.ai 1.462 ±4 48.901
7 Kimi K2.6Nr. 38 gesamt Moonshot 1.455 ±5 37.502
8 DeepSeek V4 ProNr. 43 gesamt DeepSeek 1.451 ±4 54.130
9 GLM 5Nr. 51 gesamt Z.ai 1.446 ±5 27.605
10 Kimi K2.5 (thinking)Nr. 53 gesamt Moonshot 1.446 ±4 70.513
11 DeepSeek V4 Pro High PreviewNr. 54 gesamt DeepSeek 1.445 ±4 51.485
12 Nvidia Nemotron 3 Ultra 550b A55B Nvfp4Nr. 55 gesamt Nvidia 1.445 ±7 10.693
13 DeepSeek V4 Pro High 20260813Nr. 58 gesamt DeepSeek 1.444 ±7 9.008
14 Gemma 4 31bNr. 64 gesamt Google 1.442 ±8 5.894
15 Hy3Nr. 65 gesamt Tencent 1.441 ±8 8.047

LMArena-Text-Leaderboard, veröffentlicht am 13. September 2026. Der Score ist die Arena-Wertung mit ihrer 95-%-Spanne; Zeilen mit überlappenden Spannen sind statistisch gleichauf.

Advertisement

Was jedes Modell kostet

Listenpreis pro Million Tokens für das aktuelle Modell jeder Familie, günstigstes zuerst. Eine Million Tokens sind grob 750.000 Wörter Text, rein oder raus.

ModellHerstellerEingabeAusgabe1 $ kauftKontext
GLM 5.3 Flash Z.ai 0,075 $ 0,25 $ ≈3 Mio. Wörter 1,3 Mio.
DeepSeek V4.1 Flash DeepSeek 0,15 $ 0,60 $ ≈1,3 Mio. Wörter 1 Mio.
GPT-5.6 Luna OpenAI 0,20 $ 1,20 $ ≈625.000 Wörter 1,1 Mio.
DeepSeek V4 Pro 0813 DeepSeek 0,66 $ 1,98 $ ≈378.788 Wörter 1 Mio.
Gemini 3.8 Flash Google 0,75 $ 3,75 $ ≈200.000 Wörter 1 Mio.
GPT-5.4 Mini OpenAI 0,75 $ 4,50 $ ≈166.667 Wörter 400.000
Claude Haiku 4.5 Anthropic 1,00 $ 5,00 $ ≈150.000 Wörter 200.000
GLM 5.3 Z.ai 1,40 $ 4,40 $ ≈170.455 Wörter 1,3 Mio.
Grok 4.6 xAI 2,00 $ 6,00 $ ≈125.000 Wörter 500.000
GPT-5.6 Sol OpenAI 2,00 $ 10,00 $ ≈75.000 Wörter 1,1 Mio.
Claude Sonnet 5 Anthropic 2,00 $ 10,00 $ ≈75.000 Wörter 1 Mio.
GPT-5.6 Terra OpenAI 2,00 $ 12,00 $ ≈62.500 Wörter 1,1 Mio.
Gemini 3.1 Pro Preview Google 2,00 $ 12,00 $ ≈62.500 Wörter 1 Mio.
Kimi K3 Moonshot 2,648 $ 13,283 $ ≈56.463 Wörter 1 Mio.
Claude Opus 5 Anthropic 5,00 $ 25,00 $ ≈30.000 Wörter 1 Mio.
GPT-6 Astra OpenAI 10,00 $ 50,00 $ ≈15.000 Wörter 1,1 Mio.
Claude Fable 5.1 Anthropic 10,00 $ 50,00 $ ≈15.000 Wörter 1 Mio.

US-Dollar pro Million Tokens, Eingabe und Ausgabe. Öffentliche Modellliste von OpenRouter, geprüft am 15. September 2026. Das sind Listenpreise; prüfen Sie die Preisseite des Herstellers, bevor Sie budgetieren, und beachten Sie, dass Denkmodi ihr Reasoning als Ausgabe abrechnen.

Neu diesen Monat

Modelle bekannter Hersteller, die in den letzten 30 Tagen gelistet wurden, neueste zuerst.

GelistetModellHersteller$/M rein / raus
vor 5 Tagen10. Sept. 2026 DeepSeek V4.1 Flash DeepSeek 0,15 $ / 0,60 $
vor 11 Tagen4. Sept. 2026 GPT-6 Astra OpenAI 10,00 $ / 50,00 $
vor 11 Tagen4. Sept. 2026 GPT-6 Astra Pro OpenAI 10,00 $ / 50,00 $
vor 12 Tagen3. Sept. 2026 Qwen3.8 Max (0902) Alibaba 2,00 $ / 6,00 $
vor 13 Tagen2. Sept. 2026 Muse Spark 1.3 Contributor Meta 0,10 $ / 0,20 $
vor 13 Tagen2. Sept. 2026 Muse Spark 1.3 Meta 1,25 $ / 4,25 $
vor 13 Tagen2. Sept. 2026 Gemini 3.8 Flash Google 0,75 $ / 3,75 $
vor 14 Tagen1. Sept. 2026 Claude Fable 5.1 Anthropic 10,00 $ / 50,00 $
vor 15 Tagen31. Aug. 2026 Granite 4.2 8B IBM 0,06 $ / 0,25 $
vor 18 Tagen28. Aug. 2026 Hy4 preview Tencent 0,834 $ / 2,501 $
vor 20 Tagen26. Aug. 2026 Qwen3.8 Flash Alibaba 0,15 $ / 0,47 $
vor 20 Tagen26. Aug. 2026 GLM 5.3 Flash Z.ai 0,075 $ / 0,25 $
vor 25 Tagen21. Aug. 2026 Muse Spark 1.2 Contributor Meta 0,10 $ / 0,20 $
vor 25 Tagen21. Aug. 2026 DeepSeek V4 Flash Vision Exp DeepSeek 0,22 $ / 0,66 $
vor 26 Tagen20. Aug. 2026 Hy-MT2-1.8B Tencent 0,044 $ / 0,177 $
vor 26 Tagen20. Aug. 2026 Hy-MT2-30B-A3B Tencent 0,074 $ / 0,295 $
vor 27 Tagen19. Aug. 2026 Hy-MT2-7B Tencent 0,074 $ / 0,295 $
vor 28 Tagen18. Aug. 2026 GLM 5.3 Z.ai 1,40 $ / 4,40 $

Listungen der letzten 30 Tage von großen Herstellern, geprüft am 15. September 2026. Quelle: Modellliste von OpenRouter.

So funktioniert die Rangliste

LMArena (die frühere Chatbot Arena der LMSYS-Gruppe an der UC Berkeley) zeigt Besuchern zwei anonyme Modelle, die dieselbe Frage beantworten, und fragt, welche Antwort besser war. Millionen solcher Stimmen fließen in eine Bradley-Terry-Wertung, dieselbe Mathematik-Familie wie die Elo-Zahl im Schach: Der Score eines Modells sagt, wie oft es gegen das Feld gewinnt. Die 95-%-Spanne neben jedem Score ist die Unsicherheit; ein Modell mit 5.000 Stimmen hat eine breitere Spanne als eines mit 70.000. Wir zeigen LMArenas Standard-Gesamttabelle für Text, eine Zeile pro Modell. LMArena listet dasselbe Modell mehrfach mit verschiedenen Reasoning-Einstellungen („high“, „max“); wir behalten die bestplatzierte und nennen die Einstellung in Klammern.

So lesen Sie die Preise

KI-Anbieter rechnen pro Token ab, und ein Token entspricht etwa drei Vierteln eines englischen Wortes; eine Million Tokens sind also grob 750.000 Wörter. Eingabe ist, was Sie senden (Ihre Frage, das eingefügte Dokument); Ausgabe ist, was das Modell zurückschreibt. Die Ausgabe ist die teure Seite, und „Denk“- oder Reasoning-Modi rechnen auch ihr verborgenes Nachdenken als Ausgabe ab, sodass eine schwere Frage ein Vielfaches dessen kosten kann, was die Antwortlänge vermuten lässt. Die Preise hier sind die Listenpreise aus OpenRouters öffentlichem Katalog, die die Tarife der Hersteller spiegeln; OpenAI, Anthropic und Google verkaufen außerdem Batch-Tarife zum halben Preis für Aufträge, die warten können. Prüfen Sie vor dem Budgetieren immer die Preisseite des Herstellers.

Advertisement

Welches sollten Sie tatsächlich nutzen?

Wer KI über eine Chat-App statt über eine API nutzt, für den zählt die Rangliste weniger, als es scheint. Die Top Ten liegen wenige Punkte auseinander, die Gratisstufen von ChatGPT, Claude und Gemini laufen alle mit Modellen aus dieser Gruppe, und die Unterschiede, die im Alltag zählen, sind die Funktionen der App: Gedächtnis, Umgang mit Dateien, Sprache und ob Ihr Arbeitgeber sie erlaubt. Wählen Sie nach der App, die Ihnen gefällt, und dem Preis, den Sie zahlen. Wer pro Token bezahlt, sollte die Kostentabelle lesen: Zwischen dem günstigsten und dem teuersten Markenmodell liegt mehr als der Faktor hundert, und für Routinearbeit reicht das günstige Ende meist aus.

Was diese Seite nicht sagt

Eine Duell-Abstimmung misst, welche Antwort Menschen im Chatfenster bevorzugt haben. Sie misst nicht Programmiergenauigkeit, Arbeit mit langen Dokumenten, Bildverständnis, Geschwindigkeit oder das Verhalten eines Modells in einem Agenten. LMArena führt für einige davon eigene Tabellen, und Benchmark-Sammlungen wie Artificial Analysis veröffentlichen eigene Indizes. Betrachten Sie diese Tabelle als Publikumsvotum, nicht als die ganze Wahl.

Häufige Fragen

Welches KI-Modell ist gerade das beste?

Nach LMArenas blinden Duell-Abstimmungen das Modell ganz oben in der Tabelle auf dieser Seite. Achten Sie auf die Spalte mit der Spanne: Überlappen sich die obersten Einträge, sind sie praktisch gleichauf, und die Reihenfolge kann von Woche zu Woche wechseln.

Wie oft wird diese Seite aktualisiert?

Einmal täglich. LMArena veröffentlicht alle paar Tage neue Momentaufnahmen des Leaderboards, und OpenRouters Preisliste ändert sich, sobald ein Hersteller einen Preis ändert oder ein Modell listet; der Desk übernimmt beides beim nächsten Tageslauf und vermerkt unter jeder Tabelle das Datum der letzten Prüfung.

Was bedeutet „offene Gewichte“?

Der Hersteller hat die Gewichte des Modells unter einer Lizenz veröffentlicht, die es erlaubt, das Modell selbst herunterzuladen und zu betreiben, auf eigener Hardware oder in einer gemieteten Cloud, statt nur über die API des Herstellers. Proprietäre Modelle sind nur über das Unternehmen nutzbar, das sie gebaut hat.

Warum steht ein Modell bei LMArena zweimal, hier aber nur einmal?

LMArena bewertet dasselbe Modell mit verschiedenen Reasoning-Einstellungen als getrennte Zeilen. Wir behalten die bestplatzierte Einstellung jedes Modells, damit die Tabelle als Modellliste lesbar bleibt, und zeigen die Einstellung in Klammern hinter dem Namen.

Reicht das günstigste Modell aus?

Für das meiste alltägliche Schreiben, Zusammenfassen und Beantworten von Fragen ja: Die günstige Stufe eines großen Herstellers ist meist eine kleinere Version seines Flaggschiffs. Zahlen Sie für die teure Stufe, wenn Sie langes, sorgfältiges Reasoning, komplexen Code oder die bestmögliche Antwort im ersten Anlauf brauchen.

Weiterlesen

Ranglistendaten: LMArena. Preis- und Listungsdaten: OpenRouter. Beide sind an jeder Tabelle genannt; diese Website ist mit keinem von beiden verbunden.

Advertisement