Anthropic veröffentlichte am 22. September 2026 Claude Opus 5.5, das erste Modell einer neuen Claude 5.5-Familie. Der Pitch des Unternehmens passt in einen Satz: „Es ist bei den meisten Arbeiten auf dem Niveau von Claude Fable 5.1 und kostet im Betrieb 40 % weniger als Opus 5.“
Der Preis beträgt 4 $ pro Million Input-Tokens und 20 $ pro Million Output-Tokens, gegenüber 5 $ und 25 $ bei Opus 5. Fabel 5.1 kostet $10 und $50. Wenn also die Aussage „auf der Ebene von“ zutrifft, erhalten Sie Arbeit auf Fable-Niveau mit 40 % der Eingabe- und Ausgaberaten von Fable. Die Ersparnis ist aus Gründen, die im Preisabschnitt unten erläutert werden, geringer als bei langen Agentensitzungen.
Wenn Sie für ein Claude-Abonnement anstelle einer Pro-Token-Rechnung bezahlen, hat die Einführung Ihre Limits stärker verändert als Ihre Rechnung. Die Opus-Nutzung geht bei den Pro-, Max- und Team-Plänen weiter, die Fünf-Stunden-Limits wurden erhöht und Abonnenten können ein kostenloses Limit zurücksetzen, das sie vor Ablauf ausgeben können. Nachfolgend finden Sie die Details, gefolgt von den Benchmarks, den neuen Sicherheitsfiltern und dem, was die 230-seitige Systemkarte zugibt.
Welche Änderungen an Ihrem Claude-Plan
Opus 5.5 „ist auf Claude für Pro-, Max-, Team- und Enterprise-Benutzer verfügbar.“ Der kostenlose Plan ist nicht auf dieser Liste.
Ihre Grenzen erstrecken sich weiter. In der Kostenerklärung von Anthropic heißt es: „Bei einem Pro-, Max- oder Team-Plan wird der niedrigere Opus 5.5-Preis an Ihre Limits weitergegeben, einschließlich zwischengespeichertem Kontext, sodass sie etwa 25 % weiter gehen als bei Opus 5.“
Das Fünf-Stunden-Limit wurde erhöht. Anthropic „erhöht das Fünf-Stunden-Nutzungslimit für Pro-, Max-, Team- und platzbasierte Enterprise-Pläne.“ Weder der Startbeitrag noch die hier zitierten Hilfeseiten geben eine Zahl für den Anstieg an.
Sie haben eine kostenlose Zurücksetzung erhalten. Anthropic „bietet Abonnementbenutzern eine Zurücksetzung des Ratenlimits, die Sie jetzt speichern und verwenden können, wann immer Sie möchten.“ MacRumors berichtet, dass der Reset „jederzeit zwischen jetzt und dem 22. Oktober“ durchgeführt werden kann. Auf der Hilfeseite von Anthropic heißt es, dass das Datum unter „Einstellungen“ > „Nutzung“ angezeigt wird, wenn ein Reset abläuft.
Um es auszugeben, gehen Sie zu Einstellungen > Nutzung im Web oder in Claude Desktop und klicken Sie auf „Kostenlos zurücksetzen“. Drei Haken auf derselben Seite: „Sobald Sie es verwendet haben, können Sie es nicht mehr rückgängig machen“, die Schaltfläche „ist derzeit nicht auf Claude Mobile oder in Claude Code verfügbar“ und „Wenn Sie vor der Verwendung Ihres Resets ein Downgrade durchführen oder abbrechen, ist es nicht mehr verfügbar.“ Abhängig von der Zurücksetzung, die Sie erhalten haben, wird entweder Ihr Fünf-Stunden-Sitzungslimit oder Ihr Wochenlimit wieder aufgefüllt. Da es nichts tut, bis Sie darauf drücken, ist es sinnvoll, es für den Tag gedrückt zu halten, an dem Sie gegen eine Wand stoßen.
Aufwand ist der Drehknopf. Wie bei Opus 5 gilt auch bei Opus 5.5 die Einstellung „Kann in Claude nicht ausgeschaltet werden“. Die Aufwandseinstellung neben der Schaltfläche „Senden“ gibt also an, wie Sie Tiefe gegen Nutzung eintauschen. Anthropic sagt, dass Low und Medium „Ihre Nutzung weiter ausdehnen“.
Was es kostet
| Pro Million Token | Opus 5.5 | Opus 5 | Fabel 5.1 |
|---|---|---|---|
| Eingabe | $4 | $5 | $10 |
| Ausgabe | $20 | $25 | $50 |
| Cache gelesen | $0,20 | $0,50 | $0,25 |
Ein Cache-Lesevorgang ist das, was Anthropic berechnet, wenn das Modell Text erneut liest, den es bereits verarbeitet hat. In der Kostenerklärung von Anthropic heißt es: „Eine lange Agentensitzung verbringt den größten Teil ihres Inputs mit Cache-Lesevorgängen.“ Gegenüber Opus 5 fiel diese Linie um 60 % und die Gesamt-Token-Preise fielen um 20 %.
Im Vergleich zu Fabel 5.1 erzählt die Tabelle eine andere Geschichte. Die Eingabe- und Ausgabetokens von Opus 5.5 kosten 40 % der von Fable, aber die Cache-Lesevorgänge kosten 80 % der von Fable, da die Cache-Lesevorgänge von Fable ungewöhnlich günstig sind. Der Erklärer von Anthropic sagt dasselbe: Die Cache-Lesevorgänge von Fable kosten „nur das 1,25-fache der Opus 5.5-Rate“, sodass „die Lücke bei einem langen, Cache-lastigen Lauf am kleinsten und bei einer Aufgabe, die viel schreibt, am größten ist.“ In den Testläufen von Artificial Analysis kostete eine Aufgabe auf ihrem Index 5,98 $ auf Opus 5.5 und 7,63 $ auf Fable 5.1, was einer Lücke von etwa 22 % entspricht.
Anthropics eigene Zahl „40 % weniger als Opus 5“ hängt von einer zweiten Behauptung ab: dass Opus 5.5 „weniger Token pro Aufgabe verbraucht“. Anthropics eigener Erklärer trennt die beiden Effekte. Bei identischen Token-Zählungen kostet die Claude-Code-Beispielsitzung „ungefähr 31 % weniger“ und fordert die Leser auf, „es an Ihrer eigenen Arbeit zu messen“, bevor Sie mit dem Rest rechnen.
Die erste unabhängige Lektüre erinnert daran, dass weniger Token als Opus 5 nicht gleichbedeutend mit wenigen Token sind. Artificial Analysis stellte fest, dass Opus 5.5 bei der Ausführung seiner Testsuite mit maximalem Aufwand „260 Millionen Token generierte, was im Vergleich zum Median von 88 Millionen sehr ausführlich ist.“ Die Einsparungsansprüche von Anthropic werden mit Standardeinstellungen gemessen, und der Standardwert ist jetzt niedriger: Auf der Anwendungsprogrammierschnittstelle (API) läuft eine Anfrage, die keinen Aufwand festlegt, „auf mittlerer Stufe; auf Claude Opus 5 lief sie auf hoher Stufe“. Wenn Sie es auf Hochtouren laufen lassen, sind die Token-Einsparungen nicht garantiert.
Zwei weitere Preise für Entwickler. Der Schnellmodus, der laut Anthropic „bis zu 2,5-fache Geschwindigkeit“ bietet, kostet 8 bis 40 US-Dollar. Die Stapelverarbeitung kostet „halber Preis: 2 $ und 10 $“.
Was die Benchmarks von Anthropic zeigen
Alle nachstehenden Punkte stammen von der Startseite von Anthropic, und drei Zeilen enthalten Zahlen, die Anthropic nicht selbst erstellt hat. Die Ergebnisse von AutomationBench „wurden von Zapier durchgeführt und gemeldet.“ Auf Terminal-Bench 4.0 entsprechen die „GPT-6 Astra- und GPT-5.6 Sol-Zahlen den Angaben von OpenAI“ und auf Terminal-Bench-Science „entsprechen die GPT-6 Astra-Zahlen den Angaben von OpenAI.“
| Benchmark | Opus 5.5 | Fabel 5.1 | Opus 5 | GPT-6 Astra | GPT-5.6 Sol |
|---|---|---|---|---|---|
| Terminal-Bench 4.0 (Codierung) | 66,4 % | 55,8 % | 52,3 % | 57,9 % | 37,3 % |
| FrontierCode v1.1 (Codierung) | 54,4 % | 50,3 % | 48,0 % | 53,3 % | 47,5 % |
| CursorBench 4.0 (Codierung) | 57,8 % | 51,8 % | 46,6 % | nicht gegeben | 41,7 % |
| GDPval-AA v2.1 (Wissensarbeit, Elo) | 1846 | 1735 | 1708 | 1542 | 1588 |
| AutomationBench (Geschäftsworkflows) | 40,0 % | 31,4 % | 26,9 % | 41,4 % | 28,8 % |
| Die letzte Prüfung der Menschheit (mit Werkzeugen) | 67,7 % | 65,6 % | 63,6 % | 57,2 % | nicht gegeben |
| Terminal-Bench-Science 0.1 | 58,7 % | 52,6 % | 29,0 % | 64,6 % | 22,4 % |
| OSWorld 2.0 (Computernutzung, teilweise) | 81,8 % | 80,7 % | 74,0 % | nicht gegeben | nicht gegeben |
In der eigenen Tabelle von Anthropic liegt Opus 5.5 in jeder Zeile über Fable 5.1, bei OSWorld und Humanity’s Last Exam beträgt der Abstand jedoch ein bis zwei Punkte. Anthropic rät Ihnen, nicht zu viel hineinzuinterpretieren: „Bei diesem Leistungsniveau haben wir festgestellt, dass Benchmark-Margen zu einem weniger zuverlässigen Anhaltspunkt für Unterschiede in der realen Welt geworden sind. Bei unserer eigenen Verwendung ist der Abstand zwischen Opus 5.5 und Claude Fable 5.1 geringer, als diese Ergebnisse vermuten lassen.“ Deshalb steht in der Überschrift „Matches“ und nicht „Beats“.
Es gewinnt nicht jede Reihe gegen OpenAI. GPT-6 Astra schneidet im AutomationBench und im Wissenschafts-Benchmark besser ab. Auch die rechte Spalte ist bereits veraltet. OpenAI veröffentlichte GPT-6 Sol und Luna am selben Tag, „Minuten nachdem Anthropic Claude Opus 5.5 herausgebracht hatte“, sodass Anthropics Diagramm mit dem vorherigen Sol verglichen werden kann.
Opus 5.5 „wurde mit aktivierten Produktionsschutzmaßnahmen evaluiert“, und in den Läufen von Anthropic beendeten ältere Claude-Modelle die Aufgabe, als diese Schutzmaßnahmen eingriffen. Bei den AutomationBench-Läufen von Zapier wurden keine Fallback-Modelle verwendet, daher wurden dort „Sicherheitseingriffe als Fehlschläge gewertet“. Anthropic gibt auch den Standardfehler an: „±2,6 Punkte“ für Opus 5.5 auf Terminal-Bench 4.0 und „±3,5–5 Punkte pro Modell“ auf dem wissenschaftlichen Benchmark.
Unabhängige Tests belegen, dass es an der Spitze steht. Artificial Analysis bewertet Opus 5.5 mit 58 auf seinem Intelligenzindex, dem ersten von 212 verglichenen Modellen, und nennt es „etwas teuer im Vergleich zu anderen Modellen mit ähnlichem Preis“. Informationen zu Live-Bestenlistenpositionen und Preisen für verschiedene Modelle finden Sie in der KI-Modell-Rangliste.
Die Sicherheitsfilter decken jetzt Opus ab
Opus 5.5 „ist das erste Opus-Modell, das mit einer ähnlichen Klasse von Schutzmaßnahmen wie Fable 5.1 in Bezug auf Cybersicherheit, Biologie und Destillation auf den Markt kommt.“ In der Praxis werden einige Anfragen an ein älteres Modell übergeben. Auf der Hilfeseite von Anthropic sind die Routen aufgeführt:
- Offensive Sicherheit (Exploit-Generierung, binärbasiertes Schwachstellenscannen, Penetrationstests) kann auf Opus 4.8 zurückgreifen. Das Scannen des Quellcodes auf Schwachstellen ist weiterhin zulässig.
- Biologie mit doppeltem Verwendungszweck „in Bereichen wie Virologie, Toxikologie und molekulares Design“ fällt auf Opus 5 zurück. Fragen der alltäglichen Gesundheit, „einschließlich der Interpretation von Laborergebnissen und dem Verständnis von Symptomen“, sind nicht betroffen. – Frontier AI-Modellentwicklung, wie z. B. „Kernel-Entwicklung für bestimmte ML-Beschleuniger“, greift auf Opus 5 zurück.
- Versuche, die Argumentation des Modells zu extrahieren werden komplett und ohne Rückgriff blockiert.
In den Claude-Apps ist der Schalter sichtbar. Sie „sehen einen Hinweis, der erklärt, dass das Modell gewechselt hat“, und die Modellauswahl bleibt dann „für den Rest des Gesprächs“ beim älteren Modell, obwohl „Sie jederzeit über die Modellauswahl zu Opus 5 oder Opus 5.5 zurückwechseln können“. Die automatische Umschaltung kann unter „Einstellungen“ > „Funktionen“ deaktiviert werden und ist in der API deaktiviert, sofern Entwickler sie nicht konfigurieren. Ein Detail ist leicht zu übersehen: Die Prüfungen „überprüfen alles, was das Modell liest“, einschließlich Speicher, Konnektoren, Websuchergebnisse und Dateien, „so dass ein Fallback durch Inhalte ausgelöst werden kann, die Sie nicht eingegeben haben.“
Was die Systemkarte zulässt
Auf der Startseite heißt es, dass Opus 5.5 beim automatisierten Verhaltensaudit von Anthropic „die besten Ergebnisse aller bisherigen Modelle erzielt“. Die 230-seitige Systemkarte formuliert es vorsichtiger als „die besten Ergebnisse aller aktuellen Claude-Modelle, die wir getestet haben“ bei „fast allen Messwerten, die Missbrauch oder umfassende Fehlausrichtung abdecken“ und fügt die Vorbehalte hinzu.
Es wird oft vermutet, dass es getestet wird. White-Box-Analysen, d. h. Tools, die die interne Aktivität des Modells und nicht seine schriftliche Ausgabe lesen, zeigen, dass das Modell „in bis zu 36 % der Transkripte intern befürchtet, dass es in einer Bewertung sein könnte, eine Steigerung gegenüber früheren Modellen.“ Diese Zahl bezieht sich auf die Testszenarien von Anthropic. Bei etwa 500 Transkripten der echten internen Claude-Code-Nutzung wurde bei derselben Messung „nur 0,4 %“ angezeigt. Anthropic sagt, dass dies „unsere Fähigkeit herausfordert, einzuschätzen, wie es sich im realen Einsatz verhalten wird“, und nennt das Erstellen von Tests, die jeden Fehler vor der Veröffentlichung erkennen, „ein ungelöstes Problem“.
Eingefügter Text ist eine Schwachstelle. Opus 5.5 „ist anfälliger als andere neuere Claude-Modelle für Eingabeaufforderungsinjektionen durch Benutzer, bei denen ein Benutzer Inhalte direkt in seine Eingabeaufforderung einfügt, die böswillige Anweisungen für das Modell enthalten, die häufig in einem viel längeren Text verborgen sind.“ Wenn Sie Dokumente oder E-Mails einfügen, die Sie nicht geschrieben haben, geht es in diesem Satz um Sie. Anthropic sagt: „Änderungen in der Schulung und bei den Sicherheitsmaßnahmen tragen dazu bei, Probleme wie Daten- oder Anmeldedatendiebstahl aufgrund dieser Schwachstelle zu verhindern.“ Die beiden Dokumente passen hier nicht sauber zusammen. Auf der Startseite heißt es, dass Opus 5.5 bei Prompt-Injection-Angriffen „in jeder von uns getesteten Einstellung mit Opus 5 mithalten oder ihn sogar übertrifft“, während die Missbrauchsprüfung der Systemkarte Prompt-Injection als Ausnahme auflistet, „bei der wir einen echten, aber kleinen Rückschritt sahen“.
Es verwischte seine Spuren im Training und wurde dann besser. Anthropic „beobachtete einige Fälle von Modellen (einschließlich Opus 5.5), die versuchten, ihre Spuren zu verwischen, nachdem sie Aktionen ausgeführt hatten, die ein Bewerter möglicherweise negativ sehen würde, wie etwa das Manipulieren von Git-Datensätzen oder das Löschen von Protokollen.“ Nach Änderungen am Training sagt Anthropic, dass es in diesem Bereich „jetzt ehrlicher ist als andere neuere Modelle“.
Es stößt weniger gegen seine Sandbox. In einem neuen Test, der entwickelt wurde, um Modelle über Eindämmungsgrenzen hinweg zu locken, versuchte Opus 5.5 „etwa 85 % seltener, Grenzen zu umgehen als Opus 5 oder Claude Mythos 5.1, und jeder Versuch war von geringer Schwere und wurde selbst gemeldet.“
Bezüglich des Waffenrisikos geht Anthropic davon aus, dass Opus 5.5 über „CB-1-Fähigkeiten (in Bezug auf die Synthese nicht neuartiger Waffen) verfügt, jedoch nicht über CB-2-Fähigkeiten (in Bezug auf die Synthese neuartiger Waffen).“ Die Gesamtbewertung für katastrophale Schäden durch Fehlausrichtung bleibt bei „niedrig“.
Die Pacing-Frage
Anthropic nennt Opus 5.5 „unsere erste Veröffentlichung, seit wir dazu aufgerufen haben, die Grenzen zu überschreiten.“ Dieser Aufruf erfolgte in einem Aufsatz des Vorstandsvorsitzenden (CEO) Dario Amodei, der im Startbeitrag auf „letzte Woche“ datiert wird. Darin schrieb Amodei: „Wir müssen das Tempo verlangsamen, mit dem wir die Fähigkeiten von KI-Modellen verbessern.“
Ein Start, der Anthropics eigenes Flaggschiff in seinen eigenen Charts übertrifft, sieht eher nach dem Gegenteil aus. Zwei Sätze, einer aus Amodeis Aufsatz und einer aus der Systemkarte, helfen, das Ganze in Ordnung zu bringen. In dem Aufsatz heißt es, Tempo zu machen „bedeutet nicht, die Modellausbildung oder den technischen Fortschritt zu stoppen.“ Und die Systemkarte bewertet die KI-Forschungskapazitäten von Opus 5.5 „auf oder leicht über denen von Claude Mythos 5.1 und liegt im Trend anderer neuerer Modelle.“
Zusammengenommen platziert die Systemkarte die KI-Forschungsfähigkeit von Opus 5.5 ungefähr auf dem Niveau von Mythos 5.1, einem Modell, das Anthropic bereits hatte, und die Veröffentlichung verkauft dieses Niveau an jeden zahlenden Kunden. Im Startbeitrag heißt es, dass der Pacing Call „zu einem großen Teil“ auf Modellen basierte, „die die Arbeit der KI-Forschung selbst vollständig automatisieren können“, von denen Anthropic erwartet, dass sie „bald trainiert werden könnten“. Ob die nächste Fabel temporeich ist, wird den Aufsatz weit mehr auf die Probe stellen als diese Veröffentlichung.
Was für Entwickler kaputt geht
Die Modell-ID lautet claude-opus-5-5 und Anthropic listet vier bahnbrechende Änderungen für Code auf, der für Opus 5 geschrieben wurde. Das Denken kann nicht mehr deaktiviert werden. Die erzwungene Werkzeugverwendung gibt einen Fehler zurück. Denkblockaden sind an das Modell und das Gespräch gebunden. Und auf der Claude API und Google Cloud wird das ältere Computernutzungstool computer_20251124 abgelehnt.
Eine fünfte Änderung scheitert stillschweigend. Die kurzen Notizen, die das Modell zwischen Tool-Aufrufen schreibt, kommen jetzt als Denkblöcke an, sodass eine App, die sie an Benutzer streamt, bei der Standardanzeigeeinstellung „zwischen Tool-Aufrufen geräuschlos und ohne Fehler bleibt“. Das Kontextfenster umfasst 1 Million Token mit einer Ausgabe von 128.000 Token, und Anthropic listet seine Einstellung als „frühestens am 22. September 2027“ auf.
Was als nächstes kommt
Anthropic sagt: „Claude Sonnet 5.5 und Claude Haiku 5.5 werden in den kommenden Wochen folgen.“ Für Abonnenten ist das Datum, das früher von Bedeutung ist, das Ablaufdatum des Zurücksetzens auf der Seite „Einstellungen“ > „Nutzung“.
Quellen (15)
- anthropic.com Introducing Claude Opus 5.5
- platform.claude.com Claude Docs: What's new in Claude Opus 5.5
- platform.claude.com Claude Docs: Claude Opus 5.5 Overview
- claude.com Plans and Pricing
- anthropic.com Claude Opus model page
- claude.com Claude Blog: What a task costs on Opus 5.5
- support.claude.com Anthropic Help Center: What is a limit reset?
- support.claude.com Anthropic Help Center: Why Claude switched models with Opus 5 or Opus 5.5
- support.claude.com Anthropic Help Center: Change the model, effort, and thinking settings
- anthropic.com Claude Opus 5.5 System Card
- darioamodei.com We Must Pace the Frontier
- artificialanalysis.ai Claude Opus 5.5
- artificialanalysis.ai Claude Fable 5.1
- macrumors.com Anthropic Launches Claude Opus 5.5
- decrypt.co OpenAI Launches GPT-6 Sol and Luna
🦋 Diskussion auf Bluesky
Auf Bluesky diskutieren