Du kannst zwei Antworten von KI vergleichen — und hilfst durch deine
Einschätzung im Blindvergleich, eine Rangliste für journalistische KI zu
erstellen.
Rangliste
37 gevotete Duelle.
Sortiert nach der unteren Grenze des 95-%-Wilson-Intervalls — nicht nach der
rohen Siegquote, sonst stünde ein Modell mit einem einzigen Sieg oben.
Unentschieden und „beide schlecht" zählen nicht in die Quote, stehen aber
in einer eigenen Spalte.
Zu wenig Daten
Unter 10 entscheidenden Votes ist das Intervall breiter als
fast jeder Unterschied. Diese Modelle sind im Feld, aber noch nicht
vergleichbar — manche haben noch gar keinen Vote.
#
Modell
Siegquote
95-%-Intervall (Skala 0–100 %)
Siege / n
Remis
—
Qwen3.8:27b (Reasoning: medium)
openrouter
100 %
51–100 %
4 / 4
0
—
Gemini 3.5 Flash
google
83 %
44–97 %
5 / 6
2
—
DeepSeek V4 Flash
openrouter
80 %
38–96 %
4 / 5
1
—
GPT-5.2
openai
67 %
21–94 %
2 / 3
2
—
Mistral Medium 3.5
mistral
67 %
21–94 %
2 / 3
1
—
Claude Opus 5
anthropic
50 %
15–85 %
2 / 4
0
—
Claude Sonnet 5
anthropic
50 %
15–85 %
2 / 4
1
—
Qwen3.8 Max
openrouter
50 %
15–85 %
2 / 4
0
—
Qwen3.6 35B A3B
openrouter
40 %
12–77 %
2 / 5
1
—
GPT-5 mini
openai
33 %
10–70 %
2 / 6
0
—
Claude Haiku 4.5
anthropic
33 %
6–79 %
1 / 3
1
—
Mistral Small 4
mistral
25 %
5–70 %
1 / 4
0
—
Kimi K3
openrouter
25 %
5–70 %
1 / 4
2
—
Qwen3.5 122B A10B
openrouter
20 %
4–62 %
1 / 5
0
—
Mistral Large 3
mistral
0 %
0–66 %
0 / 2
1
Rohdaten als CSV
Eine Zeile je Duell, mit Modellen, Ausgang, Kosten und Latenz.