- Startseite/
- Über den Phänotyp-Katalog
Über den Phänotyp-Katalog
Eine strukturierte ethnografische und phänotypische Referenz, die 484 ethnische Gruppen in 22 anatomischen Kategorien erfasst, mit 195 Dimensionen, 848 belegten Vokabularklassen und 113 Literaturangaben.
Worum es geht
Der Phänotyp-Katalog ist eine öffentliche, durch Quellenangaben belegte Referenz, die strukturierte ethnografische Metadaten (Herkunftsgebiet, Sprachfamilie, ISO-Codes, Religion) zu 484 ethnischen Gruppen mit einem umfassenden medizinischen / anthropologischen Vokabular verknüpft, das 22 anatomische Kategorien abdeckt. Jede Kategorie umfasst 4 bis 16 Variationsdimensionen, die auf Skalen aus begutachteter Fachliteratur beruhen: Fitzpatrick I bis VI für die Haut, Halls für die Brustform, Regnault für die Ptosis, Heath-Carter für den Somatotyp, Andre Walker 1A bis 4C für die Haartextur, Hamilton-Norwood und Ludwig für Haarausfall, 2D:4D nach Manning für das Fingerlängenverhältnis, Cavanagh-Rodgers für den Fußgewölbeindex, Mendieta für die Gesäßform und weitere.
Jede Zeile strukturierter Beobachtungsdaten pro Bild auf der Live-Website lässt sich auf ein gemeinfreies Wikipedia-Foto einer bekannten Person aus der jeweiligen Gruppe zurückführen, das ein Vision-Language-Modell (Anthropic Claude Sonnet 4.6 über AWS Bedrock) in die strukturierten Felder überführt hat. Die aggregierten Verteilungen pro Gruppe erscheinen auf jeder Seite /ethnic/[slug], mit ausdrücklichen Hinweisen auf Quellenverzerrung und Stichprobengröße.
Warum dieser Katalog existiert
Bestehende Fairness-Benchmarks wie FairFace und BUPT-Balancedface fassen Ethnizität in vier bis sieben Rassenkategorien zusammen, zu grob für ein feinkörnigeres Bias-Audit von Computer-Vision-Systemen und KI-Generierungswerkzeugen. Einen feinkörnigeren Datensatz direkt aufzubauen ist teuer: Crowd-Labeling hat eigene Verzerrungen, den meisten infrage kommenden Bildquellen fehlt eine klare Lizenzlage pro Bild, und die Fachliteratur zu ethnisch unterschiedlicher Phänotypvariation ist auf Fachzeitschriften der Dermatologie, plastischen Chirurgie, Urologie, Anthropologie und Trichologie verstreut.
Dieser Katalog löst das Lizenzproblem, indem er ausschließlich gemeinfreie Wikipedia-Fotos verwendet, löst das Kostenproblem der Annotation durch Vision-LLM-Annotation anhand fester strukturierter Prompts und löst das Problem der zersplitterten Literatur, indem er die relevanten Skalen aus begutachteter Fachliteratur in einem einzigen offenen Vokabular zusammenführt, das auf GitHub und HuggingFace veröffentlicht ist. Das Ergebnis ist ein strukturierter Phänotyp-Datensatz pro Bild mit ungewöhnlich feiner ethnografischer Auflösung (484 Gruppen, im Mittel ~24 Bilder pro vertretener Gruppe), gestützt auf 113+ Quellen aus begutachteter Fachliteratur.
Was Sie damit tun können
- KI-Bildgenerierung auf Basis realer Verteilungen. Die Website nutzt diese Phänotyp-Verteilungen pro Gruppe, um Prompts für Bildgeneratoren zu fundieren, und erzeugt so Vielfalt innerhalb der Gruppe statt durch Mode Collapse verengter Stereotype. Nutzer wählen eine Gruppe, das System zieht Stichproben aus der tatsächlich beobachteten Verteilung, die Generierung spiegelt die reale Varianz wider.
- Bias-Audit von Computer-Vision-Systemen. Ground-Truth-Phänotyp-Labels pro Gruppe ermöglichen es, die Genauigkeit pro Gruppe jedes Computer-Vision-Systems zu messen, das Sie prüfen möchten.
- Anthropologisches Nachschlagewerk. Der Katalog mit 484 Gruppen und normalisierten Feldern für Herkunftsgebiet, Sprache, ISO-Codes und Religion unterstützt gruppenübergreifende Abfragen und den Einsatz in der Lehre.
- Fine-Tuning von KI-Modellen. Nach Fitzpatrick ausbalancierte Trainingsteilmengen, multiethnisches Prompt-Grounding, demografische Embeddings.
Offene Artefakte
- Datensatz (CC BY 4.0): huggingface.co/datasets/EthnicErotic/phenotype-catalog
- Methodenartikel (DOI): 10.5281/zenodo.20075617
- Pipeline-Code (Apache 2.0): github.com/Agaveis/phenotype-catalog-pipeline
- 22 Vokabulardateien: öffentliche kanonische Taxonomie
Einschränkungen
Die wichtigste Einschränkung des Datensatzes ist der Wikipedia-Auswahlrahmen: „bekannte Personen, für die Wikipedia einen Listenartikel ‚Liste von X‘ führt, mit einem Foto im eigenen Personenartikel.“ Diese Stichprobe ist in Richtung Männer, öffentliches Leben, englischsprachige Abdeckung und fotografisches Zeitalter verzerrt. Der Aggregator weist in jeder Zusammenfassung pro Gruppe im Text auf diesen Vorbehalt hin.
Außerdem: Der Datensatz ist ausschließlich für aggregierte Forschung bestimmt; Zeilen pro Bild eignen sich nicht für Anwendungen zur individuellen Klassifizierung, Identifizierung oder Überwachung. Die Phänotypvariation innerhalb ethnischer Gruppen überschneidet sich erheblich mit der Variation zwischen Gruppen; Gruppendurchschnitte sollten nicht als individuelle Vorhersagen gelesen werden. Die ausdrückliche Festlegung des Anwendungsbereichs finden Sie auf der Ethik-Seite.
Weiterlesen
- Methodik: wie der Katalog aufgebaut wurde
- Ethik: vorgesehene Verwendungszwecke und ausdrücklich ausgeschlossene Verwendungen
- FAQ: naheliegende Fragen, fundierte Antworten
- Glossar: 848 definierte Begriffe aus allen 22 Kategorien
- Atlas: nach anatomischer Kategorie durchsuchen
- Welt: nach Region und ethnischer Gruppe durchsuchen