DearWho
DearWho

Über uns und Methodik

Woher die Daten stammen und wie das Verdikt berechnet wird.

Wie das Verdikt berechnet wird

Jeder Name wird gegen bis zu 55 Länder bewertet, anhand der erfassten männlich/weiblich-Verteilung im jeweiligen Land, gewichtet nach dessen Häufigkeit dort. Länder mit mehr Daten beeinflussen das Gesamtverdikt stärker als Länder mit nur wenigen Datensätzen.

Für die USA werden die Werte mit Geburtenstatistiken der Social Security Administration kombiniert, die deutlich umfangreicher sind als der Basisdatensatz für US-Namen.

Ein Name gilt als länderabhängig, wenn er in mindestens einem gut belegten Land stark männlich und in einem anderen stark weiblich ausfällt — genau dieser Fall führt bei reinem Raten am häufigsten zu Fehlern.

Chinesische Vornamen, die nicht im Hauptdatensatz vorkommen, werden zeichenweise anhand einer Häufigkeitstabelle typischer Vornamens-Zeichen bewertet.

Datenquellen

Die Namen-Geschlechts-Daten stammen aus dem Vornamen-Wörterbuch von Jörg Michael („gender.c“, nam_dict.txt, Version 1.2, 2008-11-30), veröffentlicht in der Zeitschrift c't und lizenziert unter der GNU Free Documentation License, Version 1.2 oder später, ohne unveränderliche Abschnitte und ohne Umschlagtexte — unsere abgeleiteten Daten stehen unter derselben Lizenz, vollständiger Text unter /lizenz —, aus den öffentlichen Vornamensstatistiken der US Social Security Administration (gemeinfrei) sowie aus dem wainshine/Chinese-Names-Corpus auf GitHub (Apache License 2.0).

Lizenz

Der abgeleitete Namensdatensatz wird unter der GNU Free Documentation License (GFDL) bereitgestellt. Die vollständige Attribution finden Sie im Detail.

Kontakt

nielserselius@yahoo.de