Claude Fable 5.1 veröffentlicht: Benchmarks, Preise und erste Reaktionen
Anthropic hat Claude Fable 5.1 vorgestellt. Der Grundpreis bleibt, das Lesen aus dem Cache wird billiger, die Filter greifen seltener. Ein Überblick über Benchmarks, Kosten und erste Reaktionen.

Anthropic hat Claude Fable 5.1 veröffentlicht. Seit dem 1. September 2026 ist das Modell über die API und in den Claude-Apps verfügbar, gemeinsam mit dem Schwestermodell Mythos 5.1. Es ist das erste Update der Reihe seit dem Start von Fable 5 im Juni - und seit der Zwangspause, die die US-Regierung dem Modell kurz darauf verordnet hat.
Der Anspruch ist derselbe wie beim Vorgänger: Anthropic nennt die beiden Modelle "die fortschrittlichsten Modelle der Welt für Coding und Wissensarbeit". Neu ist die Stoßrichtung. Das Modell soll nicht nur mehr können, sondern auch weniger kosten und seltener harmlose Anfragen abweisen. Laut Bloomberg reagiert Anthropic damit auf Rückmeldungen von Kunden.
Zulegen soll Fable 5.1 vor allem bei langen Aufgaben. Anthropic nennt Programmierarbeit über viele Dateien und Stunden, Recherchen in mehreren Schritten, das Lesen dichter Tabellen in PDFs und die Arbeit mit Dokumenten, Tabellenkalkulationen und Präsentationen. Bei der Bedienung von Browser und Desktop soll sich das Modell öfter aus Sackgassen befreien. Das Kontextfenster bleibt bei einer Million Token, die Ausgabe bei bis zu 128.000 Token.
Ein zweiter Punkt betrifft den Rechenaufwand. Das Modell arbeitet in fünf Aufwandsstufen von "low" bis "max". Laut Anthropic erreicht Fable 5.1 schon auf den unteren Stufen Ergebnisse auf dem Niveau von Fable 5, allerdings zu deutlich geringeren Kosten. In Claude Code ist "high" voreingestellt, in der Claude-App und in Cowork "medium".
Der dritte Punkt sind die Sicherheitsfilter. Beim Vorgänger haben sie im Juni für Ärger gesorgt. Harmlose Code-Reviews und Sicherheitsanalysen blieben hängen, und bei Verdacht auf Destillation hat das Modell heimlich schlechter geantwortet. Anthropic hat sich damals entschuldigt. Jetzt soll der Cyber-Filter 60 Prozent seltener zu Unrecht eingreifen, bei einfachen Fragen aus Biologie und Medizin soll der Filter 85 Prozent seltener anschlagen. Sicherheitslücken in Software darf das Modell nun benennen, wenn es um deren Behebung geht.
Mythos 5.1 ist laut Anthropic dasselbe Modell ohne diese zusätzlichen Schutzmaßnahmen. Es bleibt US-Organisationen vorbehalten, die an zwei Prüfprogrammen für Cyberabwehr und Lebenswissenschaften teilnehmen. Über einen größeren Kreis verhandelt Anthropic nach eigenen Angaben mit der US-Regierung.
Am Grundpreis ändert sich nichts. Fable 5.1 kostet wie der Vorgänger 10 Dollar je Million Input-Token und 50 Dollar für den Output, das Doppelte von Claude Opus 5. Billiger wird allein das Lesen aus dem Prompt Cache, und zwar von 1 Dollar auf 0,25 Dollar je Million Token.
| Modell | Input | Output | Cache-Lesen |
|---|---|---|---|
| Claude Fable 5.1 | 10 Dollar | 50 Dollar | 0,25 Dollar |
| Claude Opus 5 | 5 Dollar | 25 Dollar | 0,50 Dollar |
| GPT-5.6 Sol | 4 Dollar | 20 Dollar | 0,40 Dollar |
| Grok 4.6 | 2 Dollar | 6 Dollar | 0,50 Dollar |
Preise je eine Million Token, Standardstufe. Anbieterangaben (Stand: 1. September 2026). Bei GPT-5.6 Sol gilt ein befristeter Aktionspreis, laut OpenAI mindestens bis zum 21. November 2026. Grok 4.6 verdoppelt alle Preise ab 200.000 Token je Anfrage.
Dass ausgerechnet der Cache-Preis fällt, hat einen Grund. Ein Agent, der stundenlang an einer Codebasis arbeitet, schickt denselben Kontext immer wieder durch das Modell, und genau diese Wiederholungen laufen über den Cache. Anthropic rechnet deshalb mit rund 25 Prozent niedrigeren Kosten bei typischen Aufgaben und bis zu 45 Prozent bei stark agentischen. Wer dagegen kurze Anfragen ohne Cache stellt, zahlt so viel wie bisher.
Verfügbar ist das Modell ab sofort über die API von Anthropic unter der Kennung claude-fable-5-1, bei Amazon Bedrock, Google Cloud und Microsoft Foundry sowie in Claude.ai, Claude Code und Claude Cowork. Regionale Einschränkungen nennt Anthropic nicht. In den Abos gelten die Regeln von Fable 5 weiter. Max-Kunden und Premium-Plätze in Team- und Enterprise-Plänen dürfen bis zur Hälfte ihres Wochenkontingents auf Fable-Modelle verwenden, Pro-Kunden zahlen nach Verbrauch per Guthaben, im kostenlosen Tarif fehlt das Modell. Claude Code braucht mindestens Version 2.1.250.
Anthropic hat zum Start eigene Messwerte veröffentlicht. Den größten Sprung zeigt das Modell dort, wo der Vorgänger schwach war.
| Benchmark | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | GPT-5.6 Sol |
|---|---|---|---|---|
| Terminal-Bench-Science 0.1 | 52,6 % | 24,7 % | 29,0 % | 22,4 % |
| Terminal-Bench 4.0 | 55,8 % | 42,0 % | 52,3 % | 37,3 % |
| AutomationBench | 31,4 % | 17,1 % | 26,9 % | 19,6 % |
| CursorBench 3.2.0 | 73,4 % | 70,5 % | 70,0 % | 67,2 % |
| Humanity's Last Exam (ohne Tools) | 60,9 % | 57,8 % | 56,6 % | - |
| Humanity's Last Exam (mit Tools) | 65,0 % | 63,8 % | 63,6 % | - |
| OSWorld 2.0 (strikt) | 41,7 % | 36,1 % | 39,6 % | - |
| GDPval-AA v2 | 1853 | 1723 | 1824 | 1711 |
Alle Werte laut Anthropic (Stand: 1. September 2026). GDPval-AA v2 ist ein Elo-Wert, kein Prozentwert. Fable 5.1 lief mit aktiven Sicherheitsfiltern. Wo sie eingriffen, zählte die Aufgabe bei OSWorld als nicht gelöst, bei Fable 5 auch bei AutomationBench. Zu den Einstellungen von GPT-5.6 Sol macht Anthropic keine Angaben.
Bei Terminal-Bench-Science, einem neuen Test für wissenschaftliche Arbeit im Terminal, verdoppelt Fable 5.1 den Wert des Vorgängers. Beim Coding-Test Terminal-Bench 4.0 liegt der Abstand zu Opus 5 bei dreieinhalb Punkten, und im CursorBench trennen alle vier Modelle gut sechs Punkte. Mythos 5.1, die Variante ohne Zusatzfilter, kommt bei Terminal-Bench 4.0 auf 60,9 Prozent. Die fünf Punkte Abstand zu Fable 5.1 sind der Preis der Filter, jedenfalls in diesem Test.
Inzwischen gibt es erste unabhängige Zahlen. Beim Benchmark-Dienst Artificial Analysis kommt Fable 5.1 im Intelligence Index auf 66 Punkte und übernimmt damit Platz eins vor Claude Opus 5 mit 63. GPT-5.6 Sol und Grok 4.6 folgen mit je 61 Punkten. Der Vorgänger Fable 5 steht in derselben Fassung des Index bei 62.
Der Fortschritt ist also messbar, aber klein. Und er hat seinen Preis. Für den kompletten Index hat Fable 5.1 laut Artificial Analysis rund 140 Millionen Output-Token erzeugt, was etwa 8.500 Dollar gekostet hat - gemessen auf der höchsten Aufwandsstufe. Fable 5 ist mit 83 Millionen Token und rund 5.500 Dollar ausgekommen.
Wer Fable 5 über die API nutzt, kann nicht einfach die Modellkennung tauschen. Anthropic nennt in der Dokumentation drei Brüche. Erzwungene Tool Calls über den Parameter tool_choice liefern einen Fehler. Thinking-Blöcke von Fable 5.1 kann kein älteres Modell mehr lesen. Und wer den Verlauf eines Gesprächs nachträglich ändert, macht alle späteren Thinking-Blöcke ungültig.
Der letzte Punkt heißt bei Anthropic "Preserved Thinking" und richtet sich gegen Destillation, also gegen das Abschöpfen der Fähigkeiten für fremde Modelle. Durchgesetzt wird die Regel zunächst nur bei Konten, die seit dem 31. August 2026 angelegt wurden. Bestehende Konten haben Zeit zum Umbau, mit künftigen Modellen soll die Prüfung aber für alle gelten.
Neu sind außerdem drei Beta-Funktionen, darunter der Wechsel der Aufwandsstufe mitten im Gespräch, ohne den Prompt Cache zu verlieren. Und jeder Text aus Fable 5.1 trägt auf allen Plattformen ein statistisches Wasserzeichen. Anthropic verweist auf die Kennzeichnungspflicht des EU AI Act für Modelle, die nach dem 2. August 2026 erschienen sind. Eine Schnittstelle zum Erkennen des Wasserzeichens gibt es vorerst nur in einer geschlossenen Vorschau für Behörden, Medien und Forschung.
Das Team des Newsletters Every hat das Modell vorab getestet. Der Befund fällt überwiegend positiv aus. Bei Agenten-Aufgaben hat Fable 5.1 demnach Ergebnisse auf dem Niveau von Opus 5 geliefert und dafür etwa halb so viele Token gebraucht. Gründer Dan Shipper nennt es "einen extrem guten Programmierer, der tatsächlich wie ein normaler Mensch spricht".
Allerdings gab es auch Ausreißer. In einem Test sollte das Modell acht bis zwölf Zitate liefern. Es hat 43 geliefert, fünf davon erfunden. Vorgaben zu Länge und Umfang hat es laut Every regelmäßig überschritten, und auf der Stufe "xhigh" hat es ungefragt Unteragenten gestartet und Unterbrechungen ignoriert.
Auf Hacker News loben Entwickler vor allem den Schreibstil. Das Modell klinge weniger nach Claude und fasse sich kürzer als Opus 5. Skeptisch sehen viele das Wasserzeichen. Einzelne Nutzer berichten auch weiter von Fehlalarmen der Bio-Filter bei harmlosen Fragen.
Die wichtigste Einschränkung betrifft die Zahlen. Alle Werte zum Start stammen von Anthropic, und unter welchen Einstellungen GPT-5.6 Sol lief, sagt das Unternehmen nicht. Auch die Verdopplung bei AutomationBench relativiert sich mit der Fußnote. Der Vorgänger hat dort Aufgaben verloren, weil seine Sicherheitsfilter eingegriffen haben. Ein Teil des Zuwachses ist also nicht das Modell, sondern der Filter.
Dazu kommt die Preisfrage. Fable 5 hat sich am Markt schwergetan. Nach Daten des Zahlungsdienstleisters Ramp sind im Juli nur 11,4 Prozent der Ausgaben für Anthropic-Modelle auf das Spitzenmodell entfallen, bei gerade sechs Prozent der Token. Die Financial Times hat das Ende August als Stagnation gedeutet, während die günstigeren Opus-Modelle zugelegt haben, berichtet heise. Ob ein billigerer Cache diese Rechnung ändert, ist offen. Der Grundpreis bleibt doppelt so hoch wie bei Opus 5, der Vorsprung im unabhängigen Index beträgt drei Punkte.
Für Firmen kommt ein praktischer Punkt hinzu. Fable 5.1 setzt wie der Vorgänger eine Datenaufbewahrung von 30 Tagen voraus. Wer auf Null-Aufbewahrung besteht, bleibt außen vor, bis Anthropic im Herbst die angekündigte Variante mit kundeneigener Infrastruktur ausrollt. Und wer das Modell erst jetzt anbindet, arbeitet von Anfang an unter den strengeren Regeln für Thinking-Blöcke.
Wie viel von den Versprechen im Alltag bleibt, zeigen jetzt unabhängige Tests - und die Rechnungen der Kunden am Monatsende.