Du kannst zwei Antworten von KI vergleichen — und hilfst durch deine
Einschätzung im Blindvergleich, eine Rangliste für journalistische KI zu
erstellen.
Rangliste
6 gevotete Duelle.
Sortiert nach der unteren Grenze des 95-%-Wilson-Intervalls — nicht nach der
rohen Siegquote, sonst stünde ein Modell mit einem einzigen Sieg oben.
Unentschieden und „beide schlecht" zählen nicht in die Quote, stehen aber
in einer eigenen Spalte.
Zu wenig Daten
Unter 10 entscheidenden Votes ist das Intervall breiter als
fast jeder Unterschied. Diese Modelle sind im Feld, aber noch nicht
vergleichbar — manche haben noch gar keinen Vote.
#
Modell
Siegquote
95-%-Intervall (Skala 0–100 %)
Siege / n
Remis
—
Mistral Medium 3.5
mistral
100 %
34–100 %
2 / 2
0
—
GPT-5.2
openai
100 %
21–100 %
1 / 1
0
—
GPT-5 mini
openai
50 %
9–91 %
1 / 2
0
—
Mistral Small 4
mistral
50 %
9–91 %
1 / 2
0
—
Qwen3.6 35B A3B
openrouter
50 %
9–91 %
1 / 2
0
—
Kimi K3
openrouter
0 %
0–79 %
0 / 1
0
—
Qwen3.5 122B A10B
openrouter
0 %
0–79 %
0 / 1
0
—
Qwen3.8 Max
openrouter
0 %
0–79 %
0 / 1
0
—
Gemini 3.6 Flash
google
—
noch kein Vote
0 / 0
0
—
Mistral Large 3
mistral
—
noch kein Vote
0 / 0
0
—
DeepSeek V4 Flash
openrouter
—
noch kein Vote
0 / 0
0
Rohdaten als CSV
Eine Zeile je Duell, mit Modellen, Ausgang, Kosten und Latenz.