Kurzfassung

Die Datenblätter der drei grossen Anbieter lesen sich 2026 überraschend ähnlich — und doch trennt sie beim Preis der Faktor 16. Dieser Artikel stellt Claude Fable 5, Claude Sonnet 5, OpenAI GPT-5.5 und die beiden Gemini-3-Modelle nebeneinander: Kontext, Output, Preis, Caching, Multimodalität. Jede Zahl stammt aus der offiziellen Preis- oder Modelldoku des Anbieters, abgerufen am 23. Juli 2026. Und wir räumen mit dem hartnäckigsten Missverständnis auf — dem angeblichen 2-Millionen-Kontextfenster von Gemini.

Wer KI-Modelle vergleicht, stolpert schnell über Zahlen, die selbstbewusst klingen und trotzdem falsch sind. „GPT hat doch 272K Kontext", „Gemini kann 2 Millionen Tokens", „das neue Modell ist billiger" — solche Sätze wandern durch Foren und Vergleichsvideos, und die wenigsten führen zur Primärquelle zurück. Für diesen Artikel habe ich deshalb keine Sekundärquelle akzeptiert: Jede Angabe kommt direkt von der offiziellen Preisseite oder Modellkarte des jeweiligen Anbieters, mit Abrufdatum 23. Juli 2026. Was dabei herauskommt, ist weniger spektakulär als die Marketing-Slogans — aber es stimmt.

Die Modelle auf einen Blick

Fünf Modelle stehen im Vergleich: die beiden Anthropic-Flaggschiffe Claude Fable 5 und Claude Sonnet 5, das OpenAI-Spitzenmodell GPT-5.5 sowie Googles Gemini 3.1 Pro und das schlanke Gemini 3 Flash. Alle Preise verstehen sich pro einer Million Tokens (MTok) in US-Dollar.

Merkmal Claude Fable 5 Claude Sonnet 5 GPT-5.5 Gemini 3.1 Pro Gemini 3 Flash
Kontextfenster 1 Mio.[2] 1 Mio.[2] 1.050.000[4] 1 Mio.[6] 1 Mio.[6]
Max. Output 128K[2] 128K[2] 128K[4] 64K[6] 64K[6]
Input $/1M 10[1] 2 → 3 ab 01.09.[1] 5[3] 2 / 4 >200K[5] 0,50 / 1 (Audio)[5]
Output $/1M 50[1] 10 → 15 ab 01.09.[1] 30[3] 12 / 18 >200K[5] 3[5]
Cache-Treffer $/1M 1[1] 0,20[1] 0,50[3] 0,20 / 0,40[5] 0,05 / 0,10[5]
Multimodal Text, Bild Text, Bild Text, Bild[4] Text, Bild, Audio, Video, PDF[6] Text, Bild, Audio, Video[5]

Die Sonnet-5-Preise gelten als Einführungspreis bis zum 31. August 2026; danach steigen sie auf 3 US-Dollar Eingabe und 15 US-Dollar Ausgabe.[1] Zur Einordnung, nicht im Fokus: Claude Opus 4.8 liegt bei 5/25, GPT-5.4 bei 2,50/15 US-Dollar.

Kontextfenster: fast Gleichstand — und eine hartnäckige Legende

Beim Kontextfenster liegen die Flaggschiffe eng beieinander. GPT-5.5 hat mit 1.050.000 Tokens einen minimalen Vorsprung[4], Claude und Gemini bieten jeweils glatte 1 Million.[2][6] In der Praxis ist dieser Unterschied vernachlässigbar — ein Buch mit 400 Seiten passt in jedes dieser Fenster.

Die Gemini-Kontext-Falle: 1 Mio. statt 2 Mio.

Kaum eine Zahl hält sich so zäh wie Geminis „2 Millionen Tokens". Sie stimmte einmal — für Gemini 1.5 Pro, das tatsächlich mit einem 2-Mio.-Fenster allgemein verfügbar war. Der Nachfolger Gemini 2.5 Pro startete dann nur noch mit 1 Million, das 2-Mio.-Upgrade wurde angekündigt, aber vor der nächsten Generation nicht mehr ausgeliefert. Die aktuelle Generation Gemini 3.1 Pro liegt offiziell bei 1 Million Tokens (64K Output).[6] Und nein — es gibt kein kostenpflichtiges, Enterprise- oder Vertex-Tier, das mehr freischaltet: Die Modellkarte nennt 1 Million ausdrücklich „regardless of distribution channel", also unabhängig vom Vertriebsweg.[6] Genau solche Zahlen sind der Grund, warum dieser Artikel jede Angabe mit Abrufdatum belegt.

Preise: der Faktor 16

Hier wird der Vergleich interessant. Beim Output — der teuren Seite, weil das Modell hier generiert — spannt sich der Bogen von 3 US-Dollar bei Gemini 3 Flash bis 50 US-Dollar bei Claude Fable 5.[1][5] Das ist der Faktor rund 16,7 (eigene Rechnung: 50 geteilt durch 3). Wer eine hohe Zahl generierter Tokens erwartet, spürt diesen Unterschied sofort auf der Rechnung.

Innerhalb von Anthropics eigenem Sortiment ist der Sprung ebenfalls deutlich: Claude Sonnet 5 kostet im Einführungspreis 2/10 US-Dollar gegenüber 10/50 bei Fable 5 — also fünfmal günstiger in beiden Richtungen (eigene Rechnung).[1] Und GPT-5.5 liegt mit 5/30 US-Dollar preislich zwischen den beiden Claude-Modellen, während Gemini 3.1 Pro mit 2/12 US-Dollar (bis 200K Tokens) das günstigste der drei Flaggschiffe ist.[3][5]

Achtung, Preisschwelle ist kein Kontextlimit. Bei GPT-5.5 kursiert die Zahl „272K" als vermeintliche Kontextgrenze. Tatsächlich ist es eine Preisstufe: Prompts über 272.000 Input-Tokens werden mit dem doppelten Input- und dem 1,5-fachen Output-Preis berechnet — das Modell nimmt aber weiterhin bis 1,05 Millionen Tokens an.[4] Gemini staffelt ähnlich, dort liegt die Stufe bei 200K Tokens.[5] Wer solche Schwellen mit dem Kontextfenster verwechselt, plant sein Budget falsch.

Prompt-Caching: der unterschätzte Rabatt

Alle Anbieter belohnen es, wenn man denselben grossen Kontext mehrfach nutzt — etwa ein festes System-Prompt oder ein langes Dokument. Bei Anthropic kostet ein Cache-Treffer nur ein Zehntel des normalen Input-Preises: Fable 5 liest gecachte Tokens für 1 statt 10 US-Dollar, Sonnet 5 für 0,20 statt 2 US-Dollar.[1] GPT-5.5 bietet gecachten Input für 0,50 statt 5 US-Dollar — ebenfalls ein Zehntel.[3] Gemini kombiniert einen reduzierten Lesepreis mit einer stündlichen Speichergebühr.[5] Für wiederkehrende Aufgaben mit stabilem Kontext ist Caching der grösste Hebel überhaupt — er verändert die reale Kostenrechnung stärker als der nominale Token-Preis.

Multimodalität: Gemini spielt breiter

Beim Verarbeiten verschiedener Medien zeigt sich der klarste Unterschied. Gemini 3.1 Pro nimmt Text, Bild, Audio, Video, PDF und Code entgegen[6], Gemini 3 Flash immerhin Text, Bild, Audio und Video.[5] Die Claude-Modelle und GPT-5.5 konzentrieren sich auf Text und Bild; GPT-5.5 verarbeitet laut Modelldoku kein Audio oder Video.[4] Wer also Tonspuren transkribieren oder Videos analysieren will, kommt an Gemini derzeit schwer vorbei.

Der Tokenizer-Vorbehalt

Ein reiner Preis-pro-Token-Vergleich hat einen blinden Fleck: Modelle zerlegen denselben Text unterschiedlich in Tokens. Anthropic weist ausdrücklich darauf hin, dass die neueren Modelle (Fable 5, Sonnet 5) einen Tokenizer nutzen, der für denselben Text rund 30 Prozent mehr Tokens erzeugt.[1] Das heisst: Ein Modell mit niedrigerem Token-Preis kann pro tatsächlicher Textmenge trotzdem teurer sein. Für einen fairen Kostenvergleich muss man denselben Prompt bei beiden Modellen durch den jeweiligen Token-Zähler schicken — die Zahl auf dem Datenblatt reicht nicht.

Welches Modell wofür?

Aus den Zahlen lässt sich kein Gesamtsieger ableiten — wohl aber eine Landkarte:

  • Höchste Anforderungen, Budget zweitrangig: Claude Fable 5 positioniert sich als teuerstes Modell im Feld — der Preis signalisiert die Zielgruppe: anspruchsvollste Reasoning- und Langläufer-Aufgaben.
  • Gutes Preis-Leistungs-Verhältnis: Claude Sonnet 5 (im Einführungspreis) und Gemini 3.1 Pro liegen preislich attraktiv und bieten trotzdem das volle Million-Token-Fenster.
  • Maximale Sparsamkeit / hohe Stückzahlen: Gemini 3 Flash ist mit Abstand am günstigsten — bei einfachen, gut definierten Aufgaben in grosser Menge.
  • Audio und Video im Spiel: die Gemini-Modelle, weil sie diese Modalitäten überhaupt annehmen.

Interessanter als das reine Datenblatt ist ohnehin, wie diese Modelle antworten. Dieser Artikel liegt bewusst in drei Fassungen vor — von Claude, von Gemini und von ChatGPT, jeweils aus derselben verifizierten Spec-Tabelle geschrieben. Wer die Versionen nebeneinanderlegt, sieht die Eigenheiten der Modelle deutlicher als in jeder Benchmark-Tabelle.

Quellenverzeichnis

  1. Anthropic — Claude API Pricing, abgerufen 23.07.2026: platform.claude.com/docs/en/about-claude/pricing. Entnommen: Fable 5 Input 10 / Output 50 / Cache-Treffer 1 US-Dollar je MTok; Sonnet 5 Einführungspreis 2/10 (bis 31.08.2026), danach 3/15, Cache-Treffer 0,20; Caching-Multiplikatoren (Treffer 0,1×); Hinweis auf den neueren Tokenizer (~30 % mehr Tokens).
  2. Anthropic — Modelle/Kontext, abgerufen 23.07.2026: platform.claude.com/docs/en/about-claude/models/overview. Entnommen: Fable 5 und Sonnet 5 je 1 Mio. Kontext, 128K max. Output.
  3. OpenAI — API Pricing, abgerufen 23.07.2026: developers.openai.com/api/docs/pricing. Entnommen: GPT-5.5 Input 5 / gecachter Input 0,50 / Output 30 US-Dollar je MTok.
  4. OpenAI — GPT-5.5 Modelldoku, abgerufen 23.07.2026: developers.openai.com/api/docs/models/gpt-5.5. Entnommen: Kontext 1.050.000 Tokens, max. Output 128.000; Preisschwelle über 272.000 Input-Tokens (2× Input, 1,5× Output); Modalitäten Text und Bild, kein Audio/Video.
  5. Google — Gemini API Pricing, abgerufen 23.07.2026: ai.google.dev/gemini-api/docs/pricing. Entnommen: Gemini 3.1 Pro Input 2 (≤200K) / 4 (>200K), Output 12 / 18, Caching 0,20 / 0,40; Gemini 3 Flash Input 0,50 (Text/Bild/Video) / 1 (Audio), Output 3, Caching 0,05 / 0,10.
  6. Google — Gemini 3.1 Pro Modellkarte / Gemini-3-Doku, abgerufen 23.07.2026: deepmind.google/models/model-cards/gemini-3-1-pro sowie ai.google.dev/gemini-api/docs/gemini-3. Entnommen: Kontext 1 Mio. Tokens, max. Output 64K, multimodal (Text, Bild, Audio, Video, PDF, Code); 1 Mio. „regardless of distribution channel". Historie 2-Mio.-Fenster: Gemini 1.5 Pro (blog.google, Gemini-2.5-Ankündigung).

Transparenzhinweis: Diese Version des Artikels wurde von Anthropic Claude auf Basis einer am 23. Juli 2026 primärquellen-verifizierten Spezifikations-Tabelle verfasst. Gemini und ChatGPT haben unabhängig je eine eigene Version desselben Auftrags geschrieben — so lassen sich die Stärken der Modelle direkt vergleichen. Alle Preise und technischen Angaben stammen aus den offiziellen Preis- und Modelldoku-Seiten der Anbieter (siehe Quellenverzeichnis) und sind Momentaufnahmen mit Stand 23.07.2026, die sich jederzeit ändern können. Angaben ohne Gewähr, keine Rechts- oder Steuerberatung. Der Artikel wurde mit KI-Unterstützung recherchiert und geschrieben; die redaktionelle Verantwortung liegt bei Marco Fuhrmann.