Modell-Verzeichnis

Jedes KI-Modell, das hier je gemessen wurde — mit allen Werten aus allen Testreihen, datiert und zur Quelle verlinkt.

48 Modelle 76 Messungen 13 Testreihen 11 Anbieter

Keine gemeinsame Rangliste. Die Testreihen verwenden unterschiedliche Verfahren — mal bewertet ein Sprachmodell die Antworten, mal gibt es eine berechenbare richtige Lösung. Werte aus verschiedenen Reihen lassen sich deshalb nicht ineinander umrechnen. Sie stehen hier nebeneinander, nicht übereinander.

Claude Fable 5

Anthropic 1× gemessen
  1. 23.07.2026 Claude Fable 5 vs. GPT-5.5 vs. Gemini 3.1 Pro — der ehrliche Datenblatt-Vergleich
    Modell-ID
    claude-fable-5
    Kontext (Input)
    1 Mio.[2]
    Max. Output
    128K[2]
    Input $/1M
    $10[1]
    Output $/1M
    $50[1]
    Cache-Read $/1M
    $1 (= 0,1×)[1]
    Cache-Write / Caching
    $12,50 (5min)[1]
    Preisschwellen
    Keine[1]
    Multimodalität
    Text, Bild (Vision)[1]
    Reasoning
    Immer aktiv[1]
    Kontextfenster, Input
    1 Mio. Tokens[2]
    Maximale Ausgabe
    128K Tokens[2]
    Reasoning / Thinking
    Immer aktiv, nicht abschaltbar[2]
    Input
    $10 / Mio.[1]
    Output
    $50 / Mio.[1]
    Cache-Treffer
    $1 / Mio.[1]
    Besonderheit
    Cache-Write, 5 Min.: $12,50 / Mio.[1]
    Veröffentlichte Eingabe-Modalitäten
    Text, Bild; Vision hochauflösend[2]
    Praktische Einordnung
    Passt zu text- und bildzentrierten Arbeitsabläufen.

Claude Opus 4.8

Anthropic nur über API 3× gemessen
  1. 26.07.2026 11 KI-Modelle, ein echter Server-Check: teuer verliert, günstig überrascht, Datenschutz kostet extra
    Herkunft
    🇺🇸 USA
    Preis I/O je 1 Mio. · Stand 07/2026[1]
    5,00 $ / 25,00 $
    Score (0–10)
    8,6
    Fakten35 %
    8
    Korrekt25 %
    8
    Detail20 %
    9
    Docker10 %
    10
    Secrets10 %
    10
    Σ gew.
    8,6
    Wörter
    ≈ 200
  2. 25.07.2026 42 KI-Modelle, Teil 8: Das vollständige Effort-Ranking — alle 32 Kandidaten in einer Tabelle
    Teil-2-Ranking (Juni-Feld)
    22,50
    Dieser Lauf (Juli-Feld)
    19,75
    Δ
    −2,75
  3. 24.07.2026 42 KI-Modelle, Teil 6: Die Abo-CLIs im Effort-Test — misst du das Modell oder den Harness?
    Zugangsweg
    API (Juni-Anker)
    Score
    19,75

Claude Sonnet 5

Anthropic nur über API 4× gemessen
  1. 16.08.2026 Der ultimative LLM-Vergleich 2026: 18 Modelle, 972 Messungen — und warum das Flaggschiff verliert
    Ausgabe je Antwort
    85 Token
    davon Denken
    0
    Treffer
    98 %
    Ø Zeit
    3,5 s
    Art
    API
    Stabil
    94 %
    $/Durchlauf
    0,1367
    Ø Sek
    3,5
    Ausfall
    0
  2. 07.08.2026 Nicht das Modell — die Frage
    Treffer
    98 %
    Stabilität
    94 %
    Kosten je Durchlauf
    $0,1367
    Admin-Aufgabe (offen)
    Platz 6, hinter vier günstigeren
    Faktenaufgabe (geschlossen)
    98 % — einziges Spitzenmodell mit Fehler
  3. 26.07.2026 11 KI-Modelle, ein echter Server-Check: teuer verliert, günstig überrascht, Datenschutz kostet extra
    Herkunft
    🇺🇸 USA
    Preis I/O je 1 Mio. · Stand 07/2026[1]
    2,00 $ / 10,00 $
    Score (0–10)
    8,4
    Fakten35 %
    8
    Korrekt25 %
    8
    Detail20 %
    9
    Docker10 %
    10
    Secrets10 %
    8
    Σ gew.
    8,4
    Wörter
    ≈ 200
  4. 23.07.2026 Claude Fable 5 vs. GPT-5.5 vs. Gemini 3.1 Pro — der ehrliche Datenblatt-Vergleich
    Modell-ID
    claude-sonnet-5
    Kontext (Input)
    1 Mio.[2]
    Max. Output
    128K[2]
    Input $/1M
    $2 (bis 31.08.) → $3[1]
    Output $/1M
    $10 (bis 31.08.) → $15[1]
    Cache-Read $/1M
    $0,20 (= 0,1×)[1]
    Cache-Write / Caching
    $2,50 (5min)[1]
    Preisschwellen
    Keine[1]
    Multimodalität
    Text, Bild[1]
    Reasoning
    Adaptiv[1]
    Kontextfenster, Input
    1 Mio. Tokens[2]
    Maximale Ausgabe
    128K Tokens[2]
    Reasoning / Thinking
    Adaptiv, standardmäßig aktiv[2]
    Input
    $2 / Mio. bis 31.08.2026, danach $3 / Mio.[1]
    Output
    $10 / Mio. bis 31.08.2026, danach $15 / Mio.[1]
    Cache-Treffer
    $0,20 / Mio.[1]
    Besonderheit
    Cache-Write, 5 Min.: $2,50 / Mio.[1]
    Veröffentlichte Eingabe-Modalitäten
    Text, Bild[2]
    Praktische Einordnung
    Die gleiche Grundrichtung, mit adaptivem Reasoning.

Gemini 3 Flash

Google 1× gemessen
  1. 23.07.2026 Claude Fable 5 vs. GPT-5.5 vs. Gemini 3.1 Pro — der ehrliche Datenblatt-Vergleich
    Kontextfenster, Input
    1 Mio. Tokens[6]
    Maximale Ausgabe
    64K Tokens[6]
    Reasoning / Thinking
    Thinking[6]
    Input
    $0,50 / Mio. für Text, Bild, Video; $1 / Mio. für Audio[5]
    Output
    $3 / Mio.[5]
    Cache-Treffer
    $0,05 / Mio.; Audio $0,10 / Mio.[5]
    Besonderheit
    Cache-Speicher: $1 / Std.[5]
    Veröffentlichte Eingabe-Modalitäten
    Text, Bild, Audio, Video[5]
    Praktische Einordnung
    Breite Multimodalität bei deutlich niedrigerem Listenpreis.

Gemini 3.1 Pro

Google nur über API 3× gemessen
  1. 16.08.2026 Der ultimative LLM-Vergleich 2026: 18 Modelle, 972 Messungen — und warum das Flaggschiff verliert
    Treffer
    100 %
    Stabilität
    100 %
    Ø Antwortzeit
    5,3 s
    Kosten je Durchlauf
    $0,3969
    Art
    API
    Stabil
    100 %
    $/Durchlauf
    0,3969
    Ø Sek
    5,3
    Ausfall
    1
  2. 07.08.2026 Nicht das Modell — die Frage
    Treffer
    100 %
    Stabilität
    94 %
    Kosten je Durchlauf
    $0,3969
  3. 23.07.2026 Claude Fable 5 vs. GPT-5.5 vs. Gemini 3.1 Pro — der ehrliche Datenblatt-Vergleich
    Kontextfenster, Input
    1 Mio. Tokens[6]
    Maximale Ausgabe
    64K Tokens[6]
    Reasoning / Thinking
    Thinking[6]
    Input
    $2 / Mio. bis 200K, darüber $4 / Mio.[5]
    Output
    $12 / Mio. bis 200K, darüber $18 / Mio.[5]
    Cache-Treffer
    $0,20 / Mio. bis 200K, darüber $0,40 / Mio.[5]
    Besonderheit
    Cache-Speicher: $4,50 / Mio. / Std.[5]
    Veröffentlichte Eingabe-Modalitäten
    Text, Bild, Audio, Video, PDF, Code[6]
    Praktische Einordnung
    Die breiteste veröffentlichte Eingabepalette dieser Auswahl.

Gemini 3.6 Flash

Google nur über API 2× gemessen
  1. 16.08.2026 Der ultimative LLM-Vergleich 2026: 18 Modelle, 972 Messungen — und warum das Flaggschiff verliert
    Treffer
    100 %
    Stabilität
    100 %
    Ø Antwortzeit
    2,2 s
    Kosten je Durchlauf
    $0,0847
    Art
    API
    Stabil
    100 %
    $/Durchlauf
    0,0847
    Ø Sek
    2,2
    Ausfall
    0
  2. 26.07.2026 11 KI-Modelle, ein echter Server-Check: teuer verliert, günstig überrascht, Datenschutz kostet extra
    Herkunft
    🇺🇸 USA
    Preis I/O je 1 Mio. · Stand 07/2026[1]
    1,50 $ / 7,50 $
    Score (0–10)
    4,6
    Fakten35 %
    2
    Korrekt25 %
    4
    Detail20 %
    6
    Docker10 %
    9
    Secrets10 %
    8
    Σ gew.
    4,6
    Wörter
    ≈ 140

GPT-5.5

OpenAI 1× gemessen
  1. 23.07.2026 Claude Fable 5 vs. GPT-5.5 vs. Gemini 3.1 Pro — der ehrliche Datenblatt-Vergleich
    Kontextfenster, Input
    1.050.000 Tokens[4]
    Maximale Ausgabe
    128.000 Tokens[4]
    Reasoning / Thinking
    Reasoning-Modell[4]
    Input
    $5 / Mio.[3]
    Output
    $30 / Mio.[3]
    Cache-Treffer
    $0,50 / Mio.[3]
    Besonderheit
    Über 272.000 Input-Tokens: doppelter Inputpreis, 1,5-facher Outputpreis[4]
    Veröffentlichte Eingabe-Modalitäten
    Text, Bild; kein Audio, kein Video[4]
    Praktische Einordnung
    Für Audio- oder Videoeingaben ist ein zusätzlicher Verarbeitungsschritt nötig.

Kimi K3

Moonshot nur über API 3× gemessen
  1. 16.08.2026 Der ultimative LLM-Vergleich 2026: 18 Modelle, 972 Messungen — und warum das Flaggschiff verliert
    Art
    API
    Treffer
    100 %
    Stabil
    100 %
    $/Durchlauf
    0,2429
    Ø Sek
    10,2
    Ausfall
    1
  2. 07.08.2026 Nicht das Modell — die Frage
    Treffer
    100 %
    Stabilität
    94 %
    Kosten je Durchlauf
    $0,2429
  3. 25.07.2026 42 KI-Modelle, Teil 9: Der Open-Weight-Showdown und die große Gesamtschau — alle drei Messläufe, alle Roh-Tabellen, alle Kosten
    Qualität Σ/25
    22,00
    $/Mio. Token (In)
    3,00
    $/Mio. Token (Out)
    15,00
    Kosten dieses Laufs
    4,46 ct

MiniMax M3

MiniMax 3× gemessen
  1. 02.08.2026 Sechs KIs, eine Frage — und die Mehrheit lag daneben
    Empfahl für die Spracherkennung
    ML Kit oder Sherpa-ONNX
    Wort-Zeitstempel bedacht?
    nur am Rande
  2. 26.07.2026 11 KI-Modelle, ein echter Server-Check: teuer verliert, günstig überrascht, Datenschutz kostet extra
    Herkunft
    🇨🇳 China
    Preis I/O je 1 Mio. · Stand 07/2026[1]
    0,30 $ / 1,20 $
    Score (0–10)
    9,7
    Fakten35 %
    9
    Korrekt25 %
    10
    Detail20 %
    10
    Docker10 %
    10
    Secrets10 %
    10
    Σ gew.
    9,7
    Wörter
    ≈ 240
  3. 25.07.2026 42 KI-Modelle, Teil 9: Der Open-Weight-Showdown und die große Gesamtschau — alle drei Messläufe, alle Roh-Tabellen, alle Kosten
    Qualität Σ/25
    21,50
    $/Mio. Token (In)
    0,30
    $/Mio. Token (Out)
    1,20
    Kosten dieses Laufs
    0,37 ct

Qwen3.6-35B-A3B

Alibaba offene Gewichte 3× gemessen
  1. 16.08.2026 Der ultimative LLM-Vergleich 2026: 18 Modelle, 972 Messungen — und warum das Flaggschiff verliert
    Ausgabe je Antwort
    1.172 Token
    davon Denken
    864
    Treffer
    98 %
    Ø Zeit
    15,8 s
    Art
    offen
    Stabil
    94 %
    $/Durchlauf
    0,0680
    Ø Sek
    15,8
    Ausfall
    0
  2. 07.08.2026 Nicht das Modell — die Frage
    Treffer
    98 %
    Stabilität
    94 %
    Kosten je Durchlauf
    $0,0680
    Ausgabe je Antwort
    1.172 Token
    davon Denkphase
    864
    Ø Dauer
    15,8 s
  3. 05.07.2026 42 KI-Modelle im Vergleich, Teil 4: Misst der Benchmark das Modell — oder den Anbieter?
    Läufe
    20
    davon leer
    16
    Anbieter im selben Test
    5 verschiedene
    Reasoning AN
    4 von 4 leer
    Reasoning AUS
    0 von 4 leer

Qwen3.7-Max

Alibaba 2× gemessen
  1. 02.08.2026 Sechs KIs, eine Frage — und die Mehrheit lag daneben
    Empfahl für die Spracherkennung
    whisper.cpp
    Wort-Zeitstempel bedacht?
    ja — ML Kit abgelehnt
  2. 26.07.2026 11 KI-Modelle, ein echter Server-Check: teuer verliert, günstig überrascht, Datenschutz kostet extra
    Herkunft
    🇨🇳 China
    Preis I/O je 1 Mio. · Stand 07/2026[1]
    1,48 $ / 4,43 $
    Score (0–10)
    9,6
    Fakten35 %
    10
    Korrekt25 %
    10
    Detail20 %
    9
    Docker10 %
    10
    Secrets10 %
    8
    Σ gew.
    9,6
    Wörter
    ≈ 185

Die Angaben stammen aus den verlinkten Artikeln und geben deren Messzeitpunkt wieder. Preise und Modellversionen ändern sich; für aktuelle Werte gilt die Primärquelle des jeweiligen Anbieters.