JournArena

Welches Sprachmodell taugt wofür?

Du kannst zwei Antworten von KI vergleichen — und hilfst durch deine Einschätzung im Blindvergleich, eine Rangliste für journalistische KI zu erstellen.

Rangliste

37 gevotete Duelle. Sortiert nach der unteren Grenze des 95-%-Wilson-Intervalls — nicht nach der rohen Siegquote, sonst stünde ein Modell mit einem einzigen Sieg oben. Unentschieden und „beide schlecht" zählen nicht in die Quote, stehen aber in einer eigenen Spalte.

Zu wenig Daten

Unter 10 entscheidenden Votes ist das Intervall breiter als fast jeder Unterschied. Diese Modelle sind im Feld, aber noch nicht vergleichbar — manche haben noch gar keinen Vote.

# Modell Siegquote 95-%-Intervall (Skala 0–100 %) Siege / n Remis
— Qwen3.8:27b (Reasoning: medium) openrouter 100 % 51–100 % 4 / 4 0
— Gemini 3.5 Flash google 83 % 44–97 % 5 / 6 2
— DeepSeek V4 Flash openrouter 80 % 38–96 % 4 / 5 1
— GPT-5.2 openai 67 % 21–94 % 2 / 3 2
— Mistral Medium 3.5 mistral 67 % 21–94 % 2 / 3 1
— Claude Opus 5 anthropic 50 % 15–85 % 2 / 4 0
— Claude Sonnet 5 anthropic 50 % 15–85 % 2 / 4 1
— Qwen3.8 Max openrouter 50 % 15–85 % 2 / 4 0
— Qwen3.6 35B A3B openrouter 40 % 12–77 % 2 / 5 1
— GPT-5 mini openai 33 % 10–70 % 2 / 6 0
— Claude Haiku 4.5 anthropic 33 % 6–79 % 1 / 3 1
— Mistral Small 4 mistral 25 % 5–70 % 1 / 4 0
— Kimi K3 openrouter 25 % 5–70 % 1 / 4 2
— Qwen3.5 122B A10B openrouter 20 % 4–62 % 1 / 5 0
— Mistral Large 3 mistral 0 % 0–66 % 0 / 2 1

Rohdaten als CSV Eine Zeile je Duell, mit Modellen, Ausgang, Kosten und Latenz.