Kurzfassung

Teil 6 hat den Effort-Test erzählt — die Erkenntnisse, die Anomalien, die Faustregeln. Dieser Teil legt die vollständige Datengrundlage offen: alle 32 Kandidaten des Juli-Laufs in einer gerankten Tabelle, mit Einzelnoten in fünf Dimensionen und dem Zugangsweg je Zeile. Es ist die Ranking-Seite zum Effort-Test — das, was Teil 2 für den großen Juni-Vergleich war.

Der große Vergleich im Juni stellte 42 Modelle über die rohe API nebeneinander (die Erkenntnisse in Teil 1, das Ranking in Teil 2). Der Juli-Lauf drehte die Messachse: dieselben vier Verkehrsdaten-Fragen, aber gestellt über die Abo-CLIs — Claude Code, Codex und Gemini CLI — jedes Top-Modell in mehreren Effort-Stufen, dazu Nativ- und OpenRouter-Gegenproben. Die Analyse steht in Teil 6. Hier folgt die komplette Tabelle dahinter.

Warum eine eigene Tabelle — und keine Zeile im alten Ranking

Die naheliegende Idee wäre, die neuen Modelle einfach unten an das 42er-Ranking anzuhängen. Genau das wäre falsch. Ein LLM-as-Judge vergibt keine absoluten Noten, sondern bewertet relativ zum Vergleichsfeld, das er gerade sieht. Um diese Verschiebung messbar zu machen, haben wir zwei Modelle aus dem Juni mit ihren unveränderten Antworttexten als Anker in den Juli-Lauf gelegt:

Anker-ModellTeil-2-Ranking (Juni-Feld)Dieser Lauf (Juli-Feld)Δ
Claude Sonnet 4.623,2522,50−0,75
Claude Opus 4.822,5019,75−2,75

Beide Anker verlieren, obwohl sich an ihren Antworten kein Zeichen geändert hat — im größeren, von ausführlichen Claude-Code-Antworten geprägten Juli-Feld wirkt eine solide Antwort schneller „unvollständig". Absolute Punktzahlen aus zwei Läufen nebeneinanderzustellen ist deshalb irreführend. Vergleichbar sind nur Werte aus demselben Judge-Lauf — und darum steht der Juli-Test hier in seiner eigenen, in sich konsistenten Rangliste. Die zwei Anker sind trotzdem mit aufgeführt: Sie sind die Brücke, an der man ablesen kann, wie streng dieses Feld benotet.

Das vollständige Ranking: 32 Kandidaten

Alle 32 Kandidaten des Juli-Laufs, sortiert nach Gesamtnote (Σ von 25), bewertet in fünf Dimensionen auf einer 5-Sterne-Skala — Faktentreue, Empfehlungsqualität, Vollständigkeit, Klarheit, Ehrlichkeit. Die Sterne sind exakt gefüllt, die Zahl steht daneben. Die letzte Spalte nennt den Zugangsweg statt eines Preises: Die Abo-CLIs haben keinen Token-Preis, und der Zugangsweg ist in diesem Lauf ohnehin die entscheidende Variable.

#ModellΣ /25FaktEmpfVollKlarEhrlZugang
1Claude Fable 5 · max23,75 5 4,25 4,75 5 4,75 CLI · Abo
2Claude Fable 5 · xhigh23,75 5 4,25 4,75 5 4,75 CLI · Abo
3Claude Fable 5 · high23,50 5 4,25 4,5 5 4,75 CLI · Abo
4Claude Fable 5 · medium23,50 4,75 4,25 4,75 5 4,75 CLI · Abo
5Claude Sonnet 4.6 (Juni-Anker)22,50 5 3,75 4 5 4,75 API-Anker
6Claude Sonnet 4.6 · max22,50 5 3,75 4 5 4,75 CLI · Abo
7Claude Opus 4.8 · max21,50 5 4 3,25 4,75 4,5 CLI · Abo
8Claude Sonnet 4.6 · xhigh21,25 5 3,75 3,5 4,75 4,25 CLI · Abo
9Claude Sonnet 4.6 · high21,00 5 3,5 3,25 5 4,25 CLI · Abo
10Claude Opus 4.8 · high20,75 5 3,75 3,25 4,75 4 CLI · Abo
11Claude Sonnet 4.6 · medium20,75 5 3,25 3,5 5 4 CLI · Abo
12Claude Opus 4.8 · xhigh20,50 5 3,75 2,75 5 4 CLI · Abo
13DeepSeek-Chat20,50 5 3,5 3,25 4,5 4,25 OpenRouter
14Claude Opus 4.8 · medium20,00 5 3,5 2,75 4,75 4 CLI · Abo
15gpt-5.6-luna20,00 5 3,25 3 4,75 4 OpenRouter
16Claude Opus 4.8 (Juni-Anker)19,75 5 3,5 2,5 4,75 4 API-Anker
17GPT-5.419,75 5 3,25 2,5 4,75 4,25 OpenRouter
18GPT-5.4-mini19,75 5 3,25 2,75 4,75 4 API nativ
19Gemini CLI · flash19,75 5 3,25 2,75 4,75 4 CLI · Abo
20gpt-5.6-terra19,75 5 3,25 2,5 4,75 4,25 API nativ
21gpt-5.6-terra19,50 5 3,25 2,5 4,75 4 OpenRouter
22GPT-5.4-mini19,25 5 3 2,5 4,75 4 OpenRouter
23Gemini 3.6 Flash19,25 5 3,25 2,5 4,75 3,75 OpenRouter
24Gemini CLI · default19,25 5 3,25 2,5 4,75 3,75 CLI · Abo
25gpt-5.6-terra · xhigh (Codex)19,25 5 3 2,5 4,75 4 CLI · Abo
26gpt-5.6-terra-pro19,00 5 3 2,25 4,75 4 OpenRouter
27gpt-5.6-terra · medium (Codex)18,75 5 3 2,25 4,75 3,75 CLI · Abo
28Gemini 3.1 Pro (Preview)18,25 5 3 2,25 4,5 3,5 OpenRouter
29Nemotron 3 Super 120B18,25 4,75 3 2 4,75 3,75 OpenRouter
30gpt-5.6-terra · high (Codex)18,25 5 3 2 4,5 3,75 CLI · Abo
31GPT-5.4-nano17,50 5 3 2 3,75 3,75 OpenRouter
32Gemini 2.5 Pro17,50 5 3 2 4 3,5 OpenRouter

Wie man diese Tabelle liest

Claude Fable 5 belegt die ersten vier Plätze — die komplette eigene Effort-Leiter. Selbst die niedrigste getestete Stufe (medium) landet vor jedem anderen Kandidaten. Und genau hier zeigt sich das zentrale Muster des Laufs: Innerhalb dieser Leiter liegen medium bis max nur 0,25 Punkte auseinander — tief unter der Signifikanzschwelle von 0,5 Punkten bei vier Fragen (siehe Teil 3). Beim Spitzenmodell kauft mehr Effort also nur Latenz, keine Qualität.

Weiter unten dreht sich das Bild: Die Leitern von Sonnet und Opus klettern sichtbar mit der Stufe (Sonnet von 20,75 auf 22,50, Opus von 20,00 auf 21,50). Effort wirkt dort, wo das Modell noch Luft nach oben hat — die Faustregel aus Teil 6, hier Zeile für Zeile belegt.

Auffällig ist, dass die Faktentreue fast durchgängig bei 5,0 liegt — kein Modell erfindet Verkehrsdaten. Getrennt wird das Feld, wie schon im Juni, über die Vollständigkeit: Sie schwankt von 2,0 bis 4,75 und entscheidet damit die Platzierung. Und die Zugangsspalte macht sichtbar, was Teil 6 analysiert: Dasselbe Modell landet über CLI-Abo, native API und OpenRouter auf unterschiedlichen Rängen — der Harness benotet mit.

Quellenverzeichnis

  1. Alle Scores, Einzelnoten und Antworttexte stammen aus unserem eigenen Messlauf vom 22.07.2026: 32 Kandidaten, ein einziger Judge-Lauf, Judge Claude Sonnet 4.6, anonymisiert. Aufbau und Runner-Skripte: Teil 7; Methodik und Limitationen: Teil 3.
  2. Die Anker-Werte des Juni-Laufs stammen aus dem vollständigen Ranking in Teil 2 (Claude Sonnet 4.6: 23,25; Claude Opus 4.8: 22,50).
  3. Zheng et al. (2023): „Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena", arXiv:2306.05685 (methodische Grundlage des feldrelativen LLM-as-Judge-Verfahrens).

Transparenzhinweis: Diese Messung entstand aus eigenem Antrieb und wurde vollständig selbst finanziert (API-Kosten im einstelligen Euro-Bereich, die Abo-Kosten der genannten CLI-Dienste trägt der Autor privat). Es besteht keine Kooperation, Bezahlung oder Partnerschaft mit einem der genannten Anbieter. Bei vier Testfragen sind Score-Unterschiede unter 0,5 Punkten nicht belastbar — das vollständige Limitationskapitel steht in Teil 3. Der Artikel wurde mit KI-Unterstützung (Claude) recherchiert und geschrieben; die Zahlen stammen aus unseren eigenen instrumentierten Testläufen, die redaktionelle Verantwortung liegt bei Marco Fuhrmann.