Zum Inhalt springen

Wie die Zahlen entstehen

Welche Daten die Rubrik Zahlen nutzt und welche nicht, wie eine Wahrscheinlichkeit entsteht und bewertet wird, was zurückgehalten wird und warum, und wie sich jeder Beitrag nachrechnen lässt.

Zuletzt aktualisiert

Jeder Beitrag in Zahlen beantwortet eine Frage mit Daten. Diese Seite sagt, woher die Daten kommen, was sie tragen können und was nicht, wie eine genannte Wahrscheinlichkeit entsteht und später bewertet wird, und wie jeder die Rechnung wiederholen kann. Sie ist der feste Vertrag hinter der Rubrik; ein Beitrag, der davon abweicht, sagt es in seiner eigenen Datennotiz.

Was die Daten sind

FifthSet besitzt zwei eigene Datensätze: eine Punkt-für-Punkt-Aufzeichnung der vier Grand-Slam-Turniere, ab den Australian Open 2027 vom eigenen Live-System erfasst, und die Tipps seiner Tippspiel-Gemeinschaft. Beide gehören FifthSet, und daraus abgeleitete Tabellen werden mit jedem Beitrag unter CC BY 4.0 veröffentlicht.

Für die Geschichte stützt sich die Rubrik auf offene Quellen. Ergebnisse auf Matchebene bis zurück ins Jahr 1967 stammen von TennisMyLife, dessen Website die Datenbank unter der MIT-Lizenz veröffentlicht; FifthSet behält diesen Hinweis bei und nennt die Quelle auf jeder abgeleiteten Grafik. Matchstatistiken und aus Quoten abgeleitete Tabellen kommen von Valuebetennis unter CC BY 4.0, ebenso genannt. Punktdaten der Grand Slams von 2011 bis 2024 und das Match Charting Project gibt es nur unter nichtkommerziellen Lizenzen (CC BY-NC-SA); FifthSet nutzt sie, solange es nichts verdient, kennzeichnet jeden darauf gestützten Beitrag in seinen Metadaten und wird diese Beiträge an dem Tag neu berechnen oder zurückziehen, an dem die erste Einnahme fließt. Wimbledons eigene Tracking-Daten zählen erst, wenn die Nutzungsbedingungen gelesen sind und die Verwendung erlauben.

Was die Daten nicht sind

Die Aufzeichnung umfasst nur die Grand Slams und beginnt 2027; „seit 2011 bei den Grand Slams“ lässt sich schreiben, „seit 2011 auf der Tour“ nicht. Tracking- und Schlagdaten des Herrentennis außerhalb Wimbledons werden von ihren Herausgebern zitiert, nicht berechnet. Zeilen aus Live-Feeds, ob von ESPN, der WTA oder einem bezahlten Anbieter, sind Eingaben und werden nie weiterveröffentlicht; veröffentlicht werden daraus abgeleitete Aggregate, und eine withheld.md neben dem Notebook jedes Beitrags nennt, was zurückgehalten wurde und warum. Die Rubrik hat keine eigene Bilderkennung und beansprucht keine Tracking-Zahlen, die sie nicht erhalten hat.

Wie eine Wahrscheinlichkeit entsteht und bewertet wird

Wo ein Beitrag eine Wahrscheinlichkeit nennt, ist sie eine kalibrierte Zahl, die ein benanntes Modell aus benannten Eingaben erzeugt und die mit ihren Eingaben zitiert wird („das Modell gibt einem Spieler 0,62 aus diesen Eingaben“); sie ist die einzige Art vorausschauender Aussage, die die Rubrik macht. Wer gewinnt, steht hier nirgends. Jede solche Wahrscheinlichkeit steht in den Metadaten des Beitrags mit dem, was sie behauptet, der genannten Zahl und dem Datum, an dem die Welt antwortet. Liegt die Antwort vor, wird das Ergebnis eingetragen und die Prognose mit dem Brier-Score bewertet, dem quadrierten Abstand zwischen genannter Wahrscheinlichkeit und Eintreten, bei dem 0 perfekt ist und 0,25 das Ergebnis einer Münze. Jede bewertete Prognose, ihr laufender Mittelwert und die Kalibrierungskurve stehen im Prognoseregister, einer Seite, die sich nicht ändern lässt, ohne dass die Aufzeichnung es zeigt.

Unsicherheit gehört zu jedem Ergebnis: Intervalle oder Spannen, wo die Stichprobe es erlaubt, die Stichprobengröße in den Tabellen des Beitrags, und eine kleine Stichprobe wird ausgesprochen. Beschreibende und ursächliche Lesarten werden durch die Formulierung getrennt, und durch eine Überschrift, wo ein Beitrag beides tut. Eine korrigierte Zahl behält den alten Wert im Update-Protokoll des Beitrags sichtbar.

Was zurückgehalten wird

Rohzeilen aus jedem Live-Feed oder von jedem bezahlten Anbieter; alles, dessen Lizenz die Weitergabe untersagt; und jede Tabelle, deren Veröffentlichung ein einzelnes Mitglied der Tippgemeinschaft erkennbar machen würde. Die withheld.md neben dem Notebook jedes Beitrags benennt die zurückgehaltenen Dateien nach Kategorie.

Wie sich ein Beitrag nachrechnen lässt

Jeder Beitrag nennt seine methodology-Datei, ein Notebook oder Skript unter analysis/<datum>-<slug>/ im Repository der Publikation. Der Ordner enthält die gesamte Berechnung, deterministisch und mit festem Seed, die veröffentlichten abgeleiteten Daten mit ihrer Lizenz, und eine withheld.md mit dem, was nicht veröffentlicht werden konnte; die Grafikspezifikationen, die der Beitrag rendert, liegen unter content/charts/. Die Notebooks laufen im Build gegen die eingecheckten Daten und prüfen jede im Artikel zitierte Zahl: Eine Zahl, die das Notebook nicht reproduzieren kann, lässt den Build scheitern, sodass auf der Seite steht, was der Code erzeugt hat.