JournArena

Welches Sprachmodell taugt wofür?

Du kannst zwei Antworten von KI vergleichen — und hilfst durch deine Einschätzung im Blindvergleich, eine Rangliste für journalistische KI zu erstellen.

Rangliste

6 gevotete Duelle. Sortiert nach der unteren Grenze des 95-%-Wilson-Intervalls — nicht nach der rohen Siegquote, sonst stünde ein Modell mit einem einzigen Sieg oben. Unentschieden und „beide schlecht" zählen nicht in die Quote, stehen aber in einer eigenen Spalte.

Zu wenig Daten

Unter 10 entscheidenden Votes ist das Intervall breiter als fast jeder Unterschied. Diese Modelle sind im Feld, aber noch nicht vergleichbar — manche haben noch gar keinen Vote.

# Modell Siegquote 95-%-Intervall (Skala 0–100 %) Siege / n Remis
Mistral Medium 3.5 mistral 100 % 34–100 % 2 / 2 0
GPT-5.2 openai 100 % 21–100 % 1 / 1 0
GPT-5 mini openai 50 % 9–91 % 1 / 2 0
Mistral Small 4 mistral 50 % 9–91 % 1 / 2 0
Qwen3.6 35B A3B openrouter 50 % 9–91 % 1 / 2 0
Kimi K3 openrouter 0 % 0–79 % 0 / 1 0
Qwen3.5 122B A10B openrouter 0 % 0–79 % 0 / 1 0
Qwen3.8 Max openrouter 0 % 0–79 % 0 / 1 0
Gemini 3.6 Flash google noch kein Vote 0 / 0 0
Mistral Large 3 mistral noch kein Vote 0 / 0 0
DeepSeek V4 Flash openrouter noch kein Vote 0 / 0 0

Rohdaten als CSV Eine Zeile je Duell, mit Modellen, Ausgang, Kosten und Latenz.