Warum es diese Wertung gibt und nicht irgendeine andere.
Es zählt immer nur die höchste erreichte Stufe, nichts wird addiert:
Pro Spieltag darf genau ein Spiel als Bank markiert werden — die Punkte dieses Spiels zählen doppelt. Eine Null bleibt allerdings eine Null. Das ist die einzige Ebene, die nicht schon im Ergebnistipp steckt: Sie misst, ob jemand weiß, wann er sich sicher sein darf.
Läuft in einer eigenen Wertung, damit ein einzelner Glückstreffer nicht 38 Spieltage überstrahlt. Auflösung am Saisonende: Meister 10 Punkte, jeder exakt getroffene Tabellenplatz 3, jeder richtige Absteiger 5, Torschützenkönig 8.
ChatGPT, Gemini und Claude bekommen denselben Prompt, wortgleich, mit demselben Briefing. Ein Versuch, kein zweiter Anlauf — was rauskommt, kommt raus. Die Tipps stehen vor Anpfiff fest. Das Punktesystem kennen die Modelle dabei bewusst nicht: Wer die Wertung kennt, tippt nicht mehr das wahrscheinlichste Ergebnis, sondern das punktemaximierende, und das ist ein anderes Spiel.
Die Frage ist nicht „welche KI gewinnt", sondern wie gut künstliche Intelligenz bei Prognosen wirklich ist. Nach einem Spieltag ist die Tabelle reines Rauschen. Um einen 53-Prozent- von einem 48-Prozent-Tipper sauber zu trennen, braucht es grob 700 bis 1.500 Spiele. Über eine ganze Saison und alle Wettbewerbe kommt man genau dorthin — dann wissen wir es.