Kurzfassung

Zum Abschluss der Serie treten vier offene Spitzenmodelle in einem eigenen, sauberen Judge-Lauf gegen zwei Frontier-Anker an — mit echten Kosten je Modell. Ergebnis: Die offene Spitze ist erstaunlich nah dran, aber Qualität und Preis-Leistung haben verschiedene Sieger. Und weil sich viele nach den harten Zahlen gefragt haben, versammelt dieser Teil alle drei Ranglisten der Serie als vollständiges Nachschlagewerk — jede Tabelle als Vollbild zu öffnen, die ganze Seite als PDF mit Quellen und Copyright zu speichern.

Acht Teile lang ging es um dieselbe Frage aus immer neuen Blickwinkeln: Welches KI-Modell beantwortet vier reale Verkehrsdaten-Fragen am besten — und was heißt „am besten" überhaupt, wenn ein anderes Modell die Noten vergibt? Teil 1 stellte 42 Modelle über die rohe API nebeneinander, Teil 6 drehte die Achse auf die Abo-CLIs und ihre Effort-Stufen. Was in beiden Läufen fehlte: die großen offenen Modelle aus China, die inzwischen an der Weltspitze mitspielen. Genau die holen wir hier nach — und führen am Ende alles zusammen.

Drei Messungen, ein Bild

Bevor die neuen Zahlen kommen, die Landkarte. Diese Serie besteht aus drei getrennten Messläufen, und sie sind mit Absicht getrennt:

  • Der Juni-Lauf (42 Modelle, rohe API): Jedes Modell direkt über seine API, identische Parameter, ein Ranking. Das ist die breite Übersicht — von Frontier bis lokal auf dem Mac. Vollständig in Teil 2, hier unten als Nachschlagewerk.
  • Der Juli-Lauf (32 Kandidaten, Effort-Test): Dieselben vier Fragen, aber über die Abo-CLIs (Claude Code, Codex, Gemini CLI) und in mehreren Effort-Stufen. Hier zeigt sich, dass der Zugangsweg mitbenotet wird. Vollständig in Teil 8, hier unten ebenfalls.
  • Der Open-Weight-Lauf (dieser Teil): Vier offene Spitzenmodelle über OpenRouter, gemessen am 23.07.2026, in einem eigenen Judge-Lauf mit zwei Ankern.

Warum drei getrennte Tabellen und nicht eine große? Weil ein LLM-as-Judge keine absoluten Noten vergibt, sondern relativ zum Vergleichsfeld bewertet, das er gerade sieht. Wer das ignoriert und Scores aus verschiedenen Läufen mischt, produziert eine Rangliste, die genauer aussieht, als sie ist. Die Methodik dazu steht ausführlich in Teil 3; die Brücke zwischen den Läufen bauen wir mit Ankern.

Der Open-Weight-Showdown

Vier offene Flaggschiffe, je eines aus den großen chinesischen Häusern, beantworten die identischen vier Iron-Butt-Fragen über OpenRouter: Kimi K3 (Moonshot), GLM 5.2 (Zhipu/Z.ai), Qwen3-Max (Alibaba) und MiniMax M3. Damit sich ihre Noten in die bestehenden Ranglisten übersetzen lassen, laufen zwei bekannte Modelle als Anker im selben Judge-Durchgang mit: Claude Fable 5 medium als Obergrenze (führt das Effort-Ranking in Teil 8 an) und DeepSeek-Chat als Open-Weight-Peer (dort auf Platz 13, vor GPT-5.4).

Der Judge — Claude Sonnet 4.6, anonymisiert, fünf Dimensionen zu je 5 Sternen — sieht alle sechs Antworten pro Frage in einem Durchgang. Das Ergebnis:

Messlauf gestartet: 23.07.2026 · ein Judge-Durchgang · Judge Claude Sonnet 4.6 · sechs Kandidaten anonymisiert

#ModellΣ /25FaktEmpfVollKlarEhrlZugang
1Claude Fable 5 · medium (Anker)23,50 5 3,75 5 5 4,75 CLI-Anker
2Kimi K322,00 5 3,75 4,25 4,75 4,25 OpenRouter
3MiniMax M321,50 4,75 3,75 4,5 4,75 3,75 OpenRouter
4DeepSeek-Chat (Anker)21,00 5 3,25 3,5 4,75 4,5 OpenRouter
5GLM 5.220,50 5 3,5 3,5 4,75 3,75 OpenRouter
6Qwen3-Max18,25 4,75 3 2,5 4,5 3,5 OpenRouter

Die Anker sitzen fast perfekt. Fable 5 medium bekommt hier exakt 23,50 — denselben Wert wie im Effort-Feld aus Teil 8. DeepSeek-Chat driftet nur um einen Viertelschritt nach oben (20,50 → 21,00). Das bedeutet: Dieses kleine Feld benotet praktisch genauso streng wie das große. Die neuen Werte lassen sich also seriös in Teil 8 einordnen — und genau das macht die Aussage belastbar.

Kimi K3 ist der stärkste offene Herausforderer mit 22,00 Punkten, nur anderthalb hinter Fable 5 medium. Über die Anker-Brücke gerechnet läge es im Effort-Ranking zwischen Claude Sonnet 4.6 und Opus 4.8 — mitten im Frontier-Feld. MiniMax M3 folgt dicht dahinter und schlägt sogar den Peer DeepSeek-Chat. Drei der vier Herausforderer erreichen oder übertreffen damit ein Modell, das im großen Ranking schon vor GPT-5.4 lag.

Und wieder entscheidet dieselbe Spalte wie in allen Läufen zuvor: die Vollständigkeit. Die Faktentreue liegt bei fast allen bei 5,0 — kein Modell erfindet Verkehrsdaten. Getrennt wird das Feld über die Frage, ob eine Antwort wirklich alle relevanten Muster nennt oder nur die halbe Wahrheit. Kimi (4,25) und MiniMax (4,50) liefern vollständig, Qwen3-Max fällt mit 2,50 klar ab — seine Antworten waren mit 4 bis 6 Sekunden auffällig schnell und knapp. Tempo ohne Substanz kostet Punkte.

Was die Kosten verraten

Qualität ist die eine Achse, der Preis die andere — und sie zeigen in verschiedene Richtungen. Die folgenden Preise stammen direkt aus dem OpenRouter-Modellkatalog[1], abgerufen am 23.07.2026; die Lauf-Kosten sind die tatsächlich abgerechneten Token dieses Messlaufs, aus den Nutzungsdaten der API berechnet.

Token-Verbrauch gemessen · Preise laut OpenRouter-Katalog, abgerufen 23.07.2026 · Lauf = 4 Fragen je Modell

ModellQualität Σ/25$ / 1M In$ / 1M OutKosten dieses Laufs
Kimi K322,003,0015,004,46 ct
MiniMax M321,500,301,200,37 ct
DeepSeek-Chat21,000,200,800,13 ct
GLM 5.220,500,832,601,22 ct
Qwen3-Max18,250,783,900,57 ct

MiniMax M3 ist der Preis-Leistungs-Sieger. Mit 21,50 Punkten liegt es praktisch gleichauf mit Kimi K3 — der Abstand von einem halben Punkt liegt innerhalb der Rauschgrenze — kostet aber nur 0,30 zu 1,20 Dollar je Million Token statt 3,00 zu 15,00. Das ist rund zwölfmal günstiger bei nahezu gleicher Qualität. Kimi K3 führt die Qualität an, spielt preislich aber in der Frontier-Klasse: 15 Dollar je Million Output-Token liegen auf dem Niveau von Claude Opus oder GPT-5-Pro. Spitzenqualität ist offen — aber nicht automatisch billig.

Am unteren Ende steht Qwen3-Max als Verlierer in beiden Dimensionen: teurer als MiniMax und DeepSeek, dabei mit deutlichem Abstand die schwächste Qualität. Der ganze Messlauf über alle fünf Modelle kostete zusammen 6,7 Cent — ein Beleg dafür, dass solche Vergleiche keine Frage des Budgets sind, sondern der Sorgfalt.

Die drei großen Erkenntnisse der Serie

Neun Teile lassen sich auf drei Sätze eindampfen, die jeder in eigenen Zahlen wieder auftauchen:

Erstens: Der Judge misst das Feld, nicht nur das Modell. Dasselbe Modell mit demselben Antworttext bekommt in einem anderen Vergleichsfeld eine andere Note — im Juli-Feld verloren die Anker gegenüber Juni messbar, ohne dass sich an ihren Antworten ein Zeichen geändert hätte. Deshalb steht jeder Lauf in seiner eigenen Tabelle, und deshalb gibt es Anker als Brücke. Wer LLM-Rankings liest, sollte immer fragen: gegen wen wurde hier bewertet?

Zweitens: Der Zugangsweg schreibt mit. Dasselbe Modell landet über CLI-Abo, native API und OpenRouter auf unterschiedlichen Plätzen, weil die Umgebung eigene System-Prompts, Formatierungen und Antwortlängen mitbringt. Der Effort-Test in Teil 6 hat das isoliert; hier bestätigt es sich erneut. Ein Benchmark misst nie das Modell allein, sondern das Modell in seinem Harness.

Drittens: Vollständigkeit entscheidet, nicht Faktentreue. In allen drei Läufen liegt die Faktentreue der ernstzunehmenden Modelle bei fast 5,0 — halluzinierte Verkehrsdaten sind die Ausnahme. Getrennt wird das Feld darüber, ob eine Antwort alle relevanten Muster nennt oder nur die naheliegenden. Das ist die praktisch wichtigste Erkenntnis für jeden, der RAG baut: Das Risiko ist heute selten die Lüge, sondern die unvollständige Wahrheit.

Nachschlagewerk: alle drei Ranglisten

Hier stehen die vollständigen Roh-Daten aller drei Läufe — zum Nachschlagen, Vergleichen und Zitieren. Jede Tabelle lässt sich über die Schaltfläche ⛶ Vollbild vergrößern (praktisch auf dem Smartphone), und über den Knopf am Ende speicherst du die ganze Seite als PDF mit Quellenverzeichnis und Copyright.

1 — Open-Weight-Herausforderer (Juli 2026)

Messlauf gestartet: 23.07.2026 · eigener Judge-Durchgang · Anker: Fable 5 medium, DeepSeek-Chat

Die vollständige Tabelle steht oben im Abschnitt Open-Weight-Showdown — Qualität und Kosten. Sie ist Teil dieses Nachschlagewerks.

2 — Das Effort-Ranking: 32 Kandidaten (Juli 2026)

Messlauf gestartet: 22.07.2026 · ein Judge-Durchgang · Abo-CLIs, native API und OpenRouter · Quelle: Teil 8

#ModellΣ /25FaktEmpfVollKlarEhrlZugang
1Claude Fable 5 · max23,75 5 4,25 4,75 5 4,75 CLI · Abo
2Claude Fable 5 · xhigh23,75 5 4,25 4,75 5 4,75 CLI · Abo
3Claude Fable 5 · high23,50 5 4,25 4,5 5 4,75 CLI · Abo
4Claude Fable 5 · medium23,50 4,75 4,25 4,75 5 4,75 CLI · Abo
5Claude Sonnet 4.6 (Juni-Anker)22,50 5 3,75 4 5 4,75 API-Anker
6Claude Sonnet 4.6 · max22,50 5 3,75 4 5 4,75 CLI · Abo
7Claude Opus 4.8 · max21,50 5 4 3,25 4,75 4,5 CLI · Abo
8Claude Sonnet 4.6 · xhigh21,25 5 3,75 3,5 4,75 4,25 CLI · Abo
9Claude Sonnet 4.6 · high21,00 5 3,5 3,25 5 4,25 CLI · Abo
10Claude Opus 4.8 · high20,75 5 3,75 3,25 4,75 4 CLI · Abo
11Claude Sonnet 4.6 · medium20,75 5 3,25 3,5 5 4 CLI · Abo
12Claude Opus 4.8 · xhigh20,50 5 3,75 2,75 5 4 CLI · Abo
13DeepSeek-Chat20,50 5 3,5 3,25 4,5 4,25 OpenRouter
14Claude Opus 4.8 · medium20,00 5 3,5 2,75 4,75 4 CLI · Abo
15gpt-5.6-luna20,00 5 3,25 3 4,75 4 OpenRouter
16Claude Opus 4.8 (Juni-Anker)19,75 5 3,5 2,5 4,75 4 API-Anker
17GPT-5.419,75 5 3,25 2,5 4,75 4,25 OpenRouter
18GPT-5.4-mini19,75 5 3,25 2,75 4,75 4 API nativ
19Gemini CLI · flash19,75 5 3,25 2,75 4,75 4 CLI · Abo
20gpt-5.6-terra19,75 5 3,25 2,5 4,75 4,25 API nativ
21gpt-5.6-terra19,50 5 3,25 2,5 4,75 4 OpenRouter
22GPT-5.4-mini19,25 5 3 2,5 4,75 4 OpenRouter
23Gemini 3.6 Flash19,25 5 3,25 2,5 4,75 3,75 OpenRouter
24Gemini CLI · default19,25 5 3,25 2,5 4,75 3,75 CLI · Abo
25gpt-5.6-terra · xhigh (Codex)19,25 5 3 2,5 4,75 4 CLI · Abo
26gpt-5.6-terra-pro19,00 5 3 2,25 4,75 4 OpenRouter
27gpt-5.6-terra · medium (Codex)18,75 5 3 2,25 4,75 3,75 CLI · Abo
28Gemini 3.1 Pro (Preview)18,25 5 3 2,25 4,5 3,5 OpenRouter
29Nemotron 3 Super 120B18,25 4,75 3 2 4,75 3,75 OpenRouter
30gpt-5.6-terra · high (Codex)18,25 5 3 2 4,5 3,75 CLI · Abo
31GPT-5.4-nano17,50 5 3 2 3,75 3,75 OpenRouter
32Gemini 2.5 Pro17,50 5 3 2 4 3,5 OpenRouter

3 — Der große Vergleich: 42 Modelle über die rohe API (Juni 2026)

Messlauf: Juni 2026 · rohe API, identische Parameter · Preis in Dollar je Million Token · Quelle: Teil 2

#ModellΣ /25FaktEmpfVollKlarEhrlPreis $/M
1Claude Opus 4.723,5 5 4,75 4,5 5 4,25 5,00
2Claude Sonnet 4.623,25 5 4,5 4,5 4,75 4,5 3,00
3Claude Opus 4.822,5 5 4,75 3,5 5 4,25 5,00
4Claude Sonnet 4.522,25 5 5 3,5 4,5 4,25 3,00
5Claude Haiku 4.522,0 5 4,75 3,25 4,75 4,25 1,00
6GPT-5.422,0 5 4,75 3,25 4,5 4,5 2,50
7Nemotron Super 120B22,0 5 4,75 3,25 4,75 4,25 0,09
8Qwen3.5-35B (lokal, Intel Arc)22,0 5 4,5 3,75 4,75 4 lokal
9OpenAI o3-Pro21,75 5 4,5 3 5 4,25 20,00
10DeepSeek V3.5 (671B MoE)21,75 4,75 4,75 3,75 4,5 4 0,27
11Mistral Medium 3.121,5 4,5 4,75 4 4,5 3,75 0,40
12GPT-5.521,25 5 4,25 3,25 4,25 4,5 5,00
13Grok 4.20 Multi-Agent21,0 4,75 4,5 3,25 4,5 4 1,25
14Grok 4.2020,75 4,75 4,25 3,25 4,5 4 1,25
15OpenAI o320,75 5 4,25 3 4,25 4,25 2,00
16Gemma 4 26B MoE (a4b)20,75 5 4,5 2,75 4,25 4,25 0,06
17Mistral Large 251220,75 4,75 4,5 2,75 4,5 4,25 2,00
18Gemma 4 31B IT20,75 5 4,5 2,75 4,25 4,25 0,12
19Grok 4.320,5 5 4,5 2,75 4 4,25 1,25
20Qwen3-Max Thinking20,5 4,75 4,5 2,5 4,75 4 0,78
21DeepSeek R120,25 4,75 4,25 2,75 4,25 4,25 0,70
22Qwen3-Max20,25 4,75 4,5 2,5 4,5 4 0,78
23Cohere Command A19,75 4,75 4,25 2,5 4,25 4 2,50
24GPT-4o19,75 4,75 4,5 2,5 4 4 2,50
25Hermes 4 (Llama 405B)19,25 4,75 4,25 2,5 3,75 4 0,80
26gemma3:27b (lokal, NAS-CPU)19,0 4,5 3,5 3 4 4 lokal
27Llama 4 Maverick18,75 4,75 4 2,25 3,75 4 0,15
28Nemotron 3 Ultra 550B18,5 4,5 3,5 3,25 3,5 3,75 0,50
29qwen2.5:32b (lokal, NAS-CPU)18,25 4,5 4 2 4 3,75 lokal
30Llama 4 Scout18,0 4,25 4 2,25 3,75 3,75 0,10
31GPT-OSS 120B (lokal)17,75 4 3,75 2,5 4 3,5 lokal
32gemma3:4b (lokal, Mac)16,5 3,5 3,75 2,5 3,5 3,25 lokal
33llama3.3:70b (lokal, NAS-CPU)16,5 4 3,25 2,5 3,25 3,5 lokal
34GPT-4o-mini16,25 3,75 3,5 2,25 3,5 3,25 0,15
35mistral:7b (lokal, Mac)15,5 3,75 2,75 2,25 3,25 3,5 lokal
36llama3.2:3b (lokal, Mac)14,5 3,75 2,75 2 3 3 lokal
37phi3.5:3.8b (lokal, Mac)13,5 2,75 3 3 2,25 2,5 lokal
38qwen2.5:7b (lokal, Mac)13,5 2,75 3,25 2 3,25 2,25 lokal
39Qwen3.5-35B Cloud12,5 3 2,5 1,75 2,5 2,75 0,14
40qwen2.5:3b (lokal, Mac)12,0 2,5 3 2,25 2,5 1,75 lokal
41Gemini 2.5 Pro5,25 1 1 1 1 1,25 1,25
42GPT-5-Pro5,0 1 1 1 1 1 15,00

Ein Wort zur Einordnung über die Läufe hinweg: Man ist versucht, die 22,00 von Kimi K3 direkt neben die 22,50 von Opus 4.8 aus dem Juni-Ranking zu legen. Das wäre der Fehler, vor dem diese ganze Serie warnt — es sind verschiedene Judge-Läufe. Vergleichbar ist Kimi nur innerhalb seines eigenen Laufs (dort Platz 2 hinter Fable 5 medium) und, über die Anker, näherungsweise mit dem Juli-Effort-Feld. Die Roh-Tabellen stehen deshalb bewusst nebeneinander, nicht ineinander.

Quellenverzeichnis

  1. Modellpreise (Dollar je Million Token) und Token-Verbrauch: OpenRouter-Modellkatalog, openrouter.ai/models (abgerufen 23.07.2026; entnommen: Preise pro Prompt-/Completion-Token für kimi-k3, glm-5.2, qwen3-max, minimax-m3, deepseek-chat). Die Lauf-Kosten sind eigene Berechnungen aus den von der API zurückgemeldeten Token-Zahlen dieses Messlaufs.
  2. Alle Scores, Einzelnoten und Antworttexte des Open-Weight-Laufs stammen aus unserem eigenen Messlauf vom 23.07.2026 (vier Herausforderer plus zwei Anker, ein Judge-Durchgang, Judge Claude Sonnet 4.6, anonymisiert). Aufbau und Runner-Skripte: Teil 7; Methodik und Limitationen: Teil 3.
  3. Das Effort-Ranking (32 Kandidaten, Juli): Teil 8. Das große Ranking (42 Modelle, Juni): Teil 2. Die Anker-Werte des Juni-Laufs stammen aus Teil 2 (Claude Sonnet 4.6: 23,25; Claude Opus 4.8: 22,50).
  4. Zheng et al. (2023): „Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena", arXiv:2306.05685 (methodische Grundlage des feldrelativen LLM-as-Judge-Verfahrens).

Transparenzhinweis: Diese Messung entstand aus eigenem Antrieb und wurde vollständig selbst finanziert (die API-Kosten dieses Laufs lagen bei 6,7 Cent, die Abo-Kosten der genannten CLI-Dienste trägt der Autor privat). Es besteht keine Kooperation, Bezahlung oder Partnerschaft mit einem der genannten Anbieter. Bei vier Testfragen sind Score-Unterschiede unter 0,5 Punkten nicht belastbar — das vollständige Limitationskapitel steht in Teil 3. Modell-IDs, Preise und Verfügbarkeit können sich jederzeit ändern; Angaben ohne Gewähr. Der Artikel wurde mit KI-Unterstützung (Claude) recherchiert und geschrieben; die Preise wurden aus der Primärquelle (OpenRouter) verifiziert, die Zahlen stammen aus unseren eigenen instrumentierten Testläufen, die redaktionelle Verantwortung liegt bei Marco Fuhrmann.