Zum Abschluss der Serie treten vier offene Spitzenmodelle in einem eigenen, sauberen Judge-Lauf gegen zwei Frontier-Anker an — mit echten Kosten je Modell. Ergebnis: Die offene Spitze ist erstaunlich nah dran, aber Qualität und Preis-Leistung haben verschiedene Sieger. Und weil sich viele nach den harten Zahlen gefragt haben, versammelt dieser Teil alle drei Ranglisten der Serie als vollständiges Nachschlagewerk — jede Tabelle als Vollbild zu öffnen, die ganze Seite als PDF mit Quellen und Copyright zu speichern.
Acht Teile lang ging es um dieselbe Frage aus immer neuen Blickwinkeln: Welches KI-Modell beantwortet vier reale Verkehrsdaten-Fragen am besten — und was heißt „am besten" überhaupt, wenn ein anderes Modell die Noten vergibt? Teil 1 stellte 42 Modelle über die rohe API nebeneinander, Teil 6 drehte die Achse auf die Abo-CLIs und ihre Effort-Stufen. Was in beiden Läufen fehlte: die großen offenen Modelle aus China, die inzwischen an der Weltspitze mitspielen. Genau die holen wir hier nach — und führen am Ende alles zusammen.
Drei Messungen, ein Bild
Bevor die neuen Zahlen kommen, die Landkarte. Diese Serie besteht aus drei getrennten Messläufen, und sie sind mit Absicht getrennt:
- Der Juni-Lauf (42 Modelle, rohe API): Jedes Modell direkt über seine API, identische Parameter, ein Ranking. Das ist die breite Übersicht — von Frontier bis lokal auf dem Mac. Vollständig in Teil 2, hier unten als Nachschlagewerk.
- Der Juli-Lauf (32 Kandidaten, Effort-Test): Dieselben vier Fragen, aber über die Abo-CLIs (Claude Code, Codex, Gemini CLI) und in mehreren Effort-Stufen. Hier zeigt sich, dass der Zugangsweg mitbenotet wird. Vollständig in Teil 8, hier unten ebenfalls.
- Der Open-Weight-Lauf (dieser Teil): Vier offene Spitzenmodelle über OpenRouter, gemessen am 23.07.2026, in einem eigenen Judge-Lauf mit zwei Ankern.
Warum drei getrennte Tabellen und nicht eine große? Weil ein LLM-as-Judge keine absoluten Noten vergibt, sondern relativ zum Vergleichsfeld bewertet, das er gerade sieht. Wer das ignoriert und Scores aus verschiedenen Läufen mischt, produziert eine Rangliste, die genauer aussieht, als sie ist. Die Methodik dazu steht ausführlich in Teil 3; die Brücke zwischen den Läufen bauen wir mit Ankern.
Der Open-Weight-Showdown
Vier offene Flaggschiffe, je eines aus den großen chinesischen Häusern, beantworten die identischen vier Iron-Butt-Fragen über OpenRouter: Kimi K3 (Moonshot), GLM 5.2 (Zhipu/Z.ai), Qwen3-Max (Alibaba) und MiniMax M3. Damit sich ihre Noten in die bestehenden Ranglisten übersetzen lassen, laufen zwei bekannte Modelle als Anker im selben Judge-Durchgang mit: Claude Fable 5 medium als Obergrenze (führt das Effort-Ranking in Teil 8 an) und DeepSeek-Chat als Open-Weight-Peer (dort auf Platz 13, vor GPT-5.4).
Der Judge — Claude Sonnet 4.6, anonymisiert, fünf Dimensionen zu je 5 Sternen — sieht alle sechs Antworten pro Frage in einem Durchgang. Das Ergebnis:
Messlauf gestartet: 23.07.2026 · ein Judge-Durchgang · Judge Claude Sonnet 4.6 · sechs Kandidaten anonymisiert
| # | Modell | Σ /25 | Fakt | Empf | Voll | Klar | Ehrl | Zugang |
|---|---|---|---|---|---|---|---|---|
| 1 | Claude Fable 5 · medium (Anker) | 23,50 | CLI-Anker | |||||
| 2 | Kimi K3 | 22,00 | OpenRouter | |||||
| 3 | MiniMax M3 | 21,50 | OpenRouter | |||||
| 4 | DeepSeek-Chat (Anker) | 21,00 | OpenRouter | |||||
| 5 | GLM 5.2 | 20,50 | OpenRouter | |||||
| 6 | Qwen3-Max | 18,25 | OpenRouter |
Die Anker sitzen fast perfekt. Fable 5 medium bekommt hier exakt 23,50 — denselben Wert wie im Effort-Feld aus Teil 8. DeepSeek-Chat driftet nur um einen Viertelschritt nach oben (20,50 → 21,00). Das bedeutet: Dieses kleine Feld benotet praktisch genauso streng wie das große. Die neuen Werte lassen sich also seriös in Teil 8 einordnen — und genau das macht die Aussage belastbar.
Kimi K3 ist der stärkste offene Herausforderer mit 22,00 Punkten, nur anderthalb hinter Fable 5 medium. Über die Anker-Brücke gerechnet läge es im Effort-Ranking zwischen Claude Sonnet 4.6 und Opus 4.8 — mitten im Frontier-Feld. MiniMax M3 folgt dicht dahinter und schlägt sogar den Peer DeepSeek-Chat. Drei der vier Herausforderer erreichen oder übertreffen damit ein Modell, das im großen Ranking schon vor GPT-5.4 lag.
Und wieder entscheidet dieselbe Spalte wie in allen Läufen zuvor: die Vollständigkeit. Die Faktentreue liegt bei fast allen bei 5,0 — kein Modell erfindet Verkehrsdaten. Getrennt wird das Feld über die Frage, ob eine Antwort wirklich alle relevanten Muster nennt oder nur die halbe Wahrheit. Kimi (4,25) und MiniMax (4,50) liefern vollständig, Qwen3-Max fällt mit 2,50 klar ab — seine Antworten waren mit 4 bis 6 Sekunden auffällig schnell und knapp. Tempo ohne Substanz kostet Punkte.
Was die Kosten verraten
Qualität ist die eine Achse, der Preis die andere — und sie zeigen in verschiedene Richtungen. Die folgenden Preise stammen direkt aus dem OpenRouter-Modellkatalog[1], abgerufen am 23.07.2026; die Lauf-Kosten sind die tatsächlich abgerechneten Token dieses Messlaufs, aus den Nutzungsdaten der API berechnet.
Token-Verbrauch gemessen · Preise laut OpenRouter-Katalog, abgerufen 23.07.2026 · Lauf = 4 Fragen je Modell
| Modell | Qualität Σ/25 | $ / 1M In | $ / 1M Out | Kosten dieses Laufs |
|---|---|---|---|---|
| Kimi K3 | 22,00 | 3,00 | 15,00 | 4,46 ct |
| MiniMax M3 | 21,50 | 0,30 | 1,20 | 0,37 ct |
| DeepSeek-Chat | 21,00 | 0,20 | 0,80 | 0,13 ct |
| GLM 5.2 | 20,50 | 0,83 | 2,60 | 1,22 ct |
| Qwen3-Max | 18,25 | 0,78 | 3,90 | 0,57 ct |
MiniMax M3 ist der Preis-Leistungs-Sieger. Mit 21,50 Punkten liegt es praktisch gleichauf mit Kimi K3 — der Abstand von einem halben Punkt liegt innerhalb der Rauschgrenze — kostet aber nur 0,30 zu 1,20 Dollar je Million Token statt 3,00 zu 15,00. Das ist rund zwölfmal günstiger bei nahezu gleicher Qualität. Kimi K3 führt die Qualität an, spielt preislich aber in der Frontier-Klasse: 15 Dollar je Million Output-Token liegen auf dem Niveau von Claude Opus oder GPT-5-Pro. Spitzenqualität ist offen — aber nicht automatisch billig.
Am unteren Ende steht Qwen3-Max als Verlierer in beiden Dimensionen: teurer als MiniMax und DeepSeek, dabei mit deutlichem Abstand die schwächste Qualität. Der ganze Messlauf über alle fünf Modelle kostete zusammen 6,7 Cent — ein Beleg dafür, dass solche Vergleiche keine Frage des Budgets sind, sondern der Sorgfalt.
Die drei großen Erkenntnisse der Serie
Neun Teile lassen sich auf drei Sätze eindampfen, die jeder in eigenen Zahlen wieder auftauchen:
Erstens: Der Judge misst das Feld, nicht nur das Modell. Dasselbe Modell mit demselben Antworttext bekommt in einem anderen Vergleichsfeld eine andere Note — im Juli-Feld verloren die Anker gegenüber Juni messbar, ohne dass sich an ihren Antworten ein Zeichen geändert hätte. Deshalb steht jeder Lauf in seiner eigenen Tabelle, und deshalb gibt es Anker als Brücke. Wer LLM-Rankings liest, sollte immer fragen: gegen wen wurde hier bewertet?
Zweitens: Der Zugangsweg schreibt mit. Dasselbe Modell landet über CLI-Abo, native API und OpenRouter auf unterschiedlichen Plätzen, weil die Umgebung eigene System-Prompts, Formatierungen und Antwortlängen mitbringt. Der Effort-Test in Teil 6 hat das isoliert; hier bestätigt es sich erneut. Ein Benchmark misst nie das Modell allein, sondern das Modell in seinem Harness.
Drittens: Vollständigkeit entscheidet, nicht Faktentreue. In allen drei Läufen liegt die Faktentreue der ernstzunehmenden Modelle bei fast 5,0 — halluzinierte Verkehrsdaten sind die Ausnahme. Getrennt wird das Feld darüber, ob eine Antwort alle relevanten Muster nennt oder nur die naheliegenden. Das ist die praktisch wichtigste Erkenntnis für jeden, der RAG baut: Das Risiko ist heute selten die Lüge, sondern die unvollständige Wahrheit.
Nachschlagewerk: alle drei Ranglisten
Hier stehen die vollständigen Roh-Daten aller drei Läufe — zum Nachschlagen, Vergleichen und Zitieren. Jede Tabelle lässt sich über die Schaltfläche ⛶ Vollbild vergrößern (praktisch auf dem Smartphone), und über den Knopf am Ende speicherst du die ganze Seite als PDF mit Quellenverzeichnis und Copyright.
1 — Open-Weight-Herausforderer (Juli 2026)
Messlauf gestartet: 23.07.2026 · eigener Judge-Durchgang · Anker: Fable 5 medium, DeepSeek-Chat
Die vollständige Tabelle steht oben im Abschnitt Open-Weight-Showdown — Qualität und Kosten. Sie ist Teil dieses Nachschlagewerks.
2 — Das Effort-Ranking: 32 Kandidaten (Juli 2026)
Messlauf gestartet: 22.07.2026 · ein Judge-Durchgang · Abo-CLIs, native API und OpenRouter · Quelle: Teil 8
| # | Modell | Σ /25 | Fakt | Empf | Voll | Klar | Ehrl | Zugang |
|---|---|---|---|---|---|---|---|---|
| 1 | Claude Fable 5 · max | 23,75 | CLI · Abo | |||||
| 2 | Claude Fable 5 · xhigh | 23,75 | CLI · Abo | |||||
| 3 | Claude Fable 5 · high | 23,50 | CLI · Abo | |||||
| 4 | Claude Fable 5 · medium | 23,50 | CLI · Abo | |||||
| 5 | Claude Sonnet 4.6 (Juni-Anker) | 22,50 | API-Anker | |||||
| 6 | Claude Sonnet 4.6 · max | 22,50 | CLI · Abo | |||||
| 7 | Claude Opus 4.8 · max | 21,50 | CLI · Abo | |||||
| 8 | Claude Sonnet 4.6 · xhigh | 21,25 | CLI · Abo | |||||
| 9 | Claude Sonnet 4.6 · high | 21,00 | CLI · Abo | |||||
| 10 | Claude Opus 4.8 · high | 20,75 | CLI · Abo | |||||
| 11 | Claude Sonnet 4.6 · medium | 20,75 | CLI · Abo | |||||
| 12 | Claude Opus 4.8 · xhigh | 20,50 | CLI · Abo | |||||
| 13 | DeepSeek-Chat | 20,50 | OpenRouter | |||||
| 14 | Claude Opus 4.8 · medium | 20,00 | CLI · Abo | |||||
| 15 | gpt-5.6-luna | 20,00 | OpenRouter | |||||
| 16 | Claude Opus 4.8 (Juni-Anker) | 19,75 | API-Anker | |||||
| 17 | GPT-5.4 | 19,75 | OpenRouter | |||||
| 18 | GPT-5.4-mini | 19,75 | API nativ | |||||
| 19 | Gemini CLI · flash | 19,75 | CLI · Abo | |||||
| 20 | gpt-5.6-terra | 19,75 | API nativ | |||||
| 21 | gpt-5.6-terra | 19,50 | OpenRouter | |||||
| 22 | GPT-5.4-mini | 19,25 | OpenRouter | |||||
| 23 | Gemini 3.6 Flash | 19,25 | OpenRouter | |||||
| 24 | Gemini CLI · default | 19,25 | CLI · Abo | |||||
| 25 | gpt-5.6-terra · xhigh (Codex) | 19,25 | CLI · Abo | |||||
| 26 | gpt-5.6-terra-pro | 19,00 | OpenRouter | |||||
| 27 | gpt-5.6-terra · medium (Codex) | 18,75 | CLI · Abo | |||||
| 28 | Gemini 3.1 Pro (Preview) | 18,25 | OpenRouter | |||||
| 29 | Nemotron 3 Super 120B | 18,25 | OpenRouter | |||||
| 30 | gpt-5.6-terra · high (Codex) | 18,25 | CLI · Abo | |||||
| 31 | GPT-5.4-nano | 17,50 | OpenRouter | |||||
| 32 | Gemini 2.5 Pro | 17,50 | OpenRouter |
3 — Der große Vergleich: 42 Modelle über die rohe API (Juni 2026)
Messlauf: Juni 2026 · rohe API, identische Parameter · Preis in Dollar je Million Token · Quelle: Teil 2
| # | Modell | Σ /25 | Fakt | Empf | Voll | Klar | Ehrl | Preis $/M |
|---|---|---|---|---|---|---|---|---|
| 1 | Claude Opus 4.7 | 23,5 | 5,00 | |||||
| 2 | Claude Sonnet 4.6 | 23,25 | 3,00 | |||||
| 3 | Claude Opus 4.8 | 22,5 | 5,00 | |||||
| 4 | Claude Sonnet 4.5 | 22,25 | 3,00 | |||||
| 5 | Claude Haiku 4.5 | 22,0 | 1,00 | |||||
| 6 | GPT-5.4 | 22,0 | 2,50 | |||||
| 7 | Nemotron Super 120B | 22,0 | 0,09 | |||||
| 8 | Qwen3.5-35B (lokal, Intel Arc) | 22,0 | lokal | |||||
| 9 | OpenAI o3-Pro | 21,75 | 20,00 | |||||
| 10 | DeepSeek V3.5 (671B MoE) | 21,75 | 0,27 | |||||
| 11 | Mistral Medium 3.1 | 21,5 | 0,40 | |||||
| 12 | GPT-5.5 | 21,25 | 5,00 | |||||
| 13 | Grok 4.20 Multi-Agent | 21,0 | 1,25 | |||||
| 14 | Grok 4.20 | 20,75 | 1,25 | |||||
| 15 | OpenAI o3 | 20,75 | 2,00 | |||||
| 16 | Gemma 4 26B MoE (a4b) | 20,75 | 0,06 | |||||
| 17 | Mistral Large 2512 | 20,75 | 2,00 | |||||
| 18 | Gemma 4 31B IT | 20,75 | 0,12 | |||||
| 19 | Grok 4.3 | 20,5 | 1,25 | |||||
| 20 | Qwen3-Max Thinking | 20,5 | 0,78 | |||||
| 21 | DeepSeek R1 | 20,25 | 0,70 | |||||
| 22 | Qwen3-Max | 20,25 | 0,78 | |||||
| 23 | Cohere Command A | 19,75 | 2,50 | |||||
| 24 | GPT-4o | 19,75 | 2,50 | |||||
| 25 | Hermes 4 (Llama 405B) | 19,25 | 0,80 | |||||
| 26 | gemma3:27b (lokal, NAS-CPU) | 19,0 | lokal | |||||
| 27 | Llama 4 Maverick | 18,75 | 0,15 | |||||
| 28 | Nemotron 3 Ultra 550B | 18,5 | 0,50 | |||||
| 29 | qwen2.5:32b (lokal, NAS-CPU) | 18,25 | lokal | |||||
| 30 | Llama 4 Scout | 18,0 | 0,10 | |||||
| 31 | GPT-OSS 120B (lokal) | 17,75 | lokal | |||||
| 32 | gemma3:4b (lokal, Mac) | 16,5 | lokal | |||||
| 33 | llama3.3:70b (lokal, NAS-CPU) | 16,5 | lokal | |||||
| 34 | GPT-4o-mini | 16,25 | 0,15 | |||||
| 35 | mistral:7b (lokal, Mac) | 15,5 | lokal | |||||
| 36 | llama3.2:3b (lokal, Mac) | 14,5 | lokal | |||||
| 37 | phi3.5:3.8b (lokal, Mac) | 13,5 | lokal | |||||
| 38 | qwen2.5:7b (lokal, Mac) | 13,5 | lokal | |||||
| 39 | Qwen3.5-35B Cloud | 12,5 | 0,14 | |||||
| 40 | qwen2.5:3b (lokal, Mac) | 12,0 | lokal | |||||
| 41 | Gemini 2.5 Pro | 5,25 | 1,25 | |||||
| 42 | GPT-5-Pro | 5,0 | 15,00 |
Ein Wort zur Einordnung über die Läufe hinweg: Man ist versucht, die 22,00 von Kimi K3 direkt neben die 22,50 von Opus 4.8 aus dem Juni-Ranking zu legen. Das wäre der Fehler, vor dem diese ganze Serie warnt — es sind verschiedene Judge-Läufe. Vergleichbar ist Kimi nur innerhalb seines eigenen Laufs (dort Platz 2 hinter Fable 5 medium) und, über die Anker, näherungsweise mit dem Juli-Effort-Feld. Die Roh-Tabellen stehen deshalb bewusst nebeneinander, nicht ineinander.
Quellenverzeichnis
- Modellpreise (Dollar je Million Token) und Token-Verbrauch: OpenRouter-Modellkatalog, openrouter.ai/models (abgerufen 23.07.2026; entnommen: Preise pro Prompt-/Completion-Token für kimi-k3, glm-5.2, qwen3-max, minimax-m3, deepseek-chat). Die Lauf-Kosten sind eigene Berechnungen aus den von der API zurückgemeldeten Token-Zahlen dieses Messlaufs.
- Alle Scores, Einzelnoten und Antworttexte des Open-Weight-Laufs stammen aus unserem eigenen Messlauf vom 23.07.2026 (vier Herausforderer plus zwei Anker, ein Judge-Durchgang, Judge Claude Sonnet 4.6, anonymisiert). Aufbau und Runner-Skripte: Teil 7; Methodik und Limitationen: Teil 3.
- Das Effort-Ranking (32 Kandidaten, Juli): Teil 8. Das große Ranking (42 Modelle, Juni): Teil 2. Die Anker-Werte des Juni-Laufs stammen aus Teil 2 (Claude Sonnet 4.6: 23,25; Claude Opus 4.8: 22,50).
- Zheng et al. (2023): „Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena", arXiv:2306.05685 (methodische Grundlage des feldrelativen LLM-as-Judge-Verfahrens).
Transparenzhinweis: Diese Messung entstand aus eigenem Antrieb und wurde vollständig selbst finanziert (die API-Kosten dieses Laufs lagen bei 6,7 Cent, die Abo-Kosten der genannten CLI-Dienste trägt der Autor privat). Es besteht keine Kooperation, Bezahlung oder Partnerschaft mit einem der genannten Anbieter. Bei vier Testfragen sind Score-Unterschiede unter 0,5 Punkten nicht belastbar — das vollständige Limitationskapitel steht in Teil 3. Modell-IDs, Preise und Verfügbarkeit können sich jederzeit ändern; Angaben ohne Gewähr. Der Artikel wurde mit KI-Unterstützung (Claude) recherchiert und geschrieben; die Preise wurden aus der Primärquelle (OpenRouter) verifiziert, die Zahlen stammen aus unseren eigenen instrumentierten Testläufen, die redaktionelle Verantwortung liegt bei Marco Fuhrmann.