FAQ: Phänotyp-Katalog

Vorhersehbare Fragen, fundierte Antworten. Mehr Details unter Über das Projekt · Methodik · Ethik.

Ist das wissenschaftlich valide?

Jede Dimension der Taxonomie stützt sich auf eine wissenschaftlich begutachtete Skala: Fitzpatrick I bis VI (Fitzpatrick 1988, Archives of Dermatology), Klassifikation der Brustform nach Halls (Halls 1998), Einteilung der Ptosis nach Regnault (Regnault 1976, Clinics in Plastic Surgery), Somatotyp nach Heath-Carter (Carter & Heath 1990), Haartextur nach Andre Walker, Haarausfallskalen nach Hamilton-Norwood und Ludwig, Gesäßform nach Mendieta (2007), 2D:4D-Fingerlängenverhältnis nach Manning (1998, Human Reproduction) und weitere. Jede Werteklasse hat eine Definition und eine Quellenangabe.

Der Datensatz selbst ist deskriptiv, nicht prädiktiv. Die Beobachtungen pro Bild dokumentieren die auf den Quellfotos sichtbaren Phänotyp-Merkmale; die Aggregationen pro Gruppe fassen die beobachteten Verteilungen mit ausdrücklichen Vorbehalten zusammen. Wir stellen keine kausalen Behauptungen über Zusammenhänge zwischen Phänotyp und Genetik auf, keine prädiktiven Behauptungen über die ethnische Identifizierung anhand von Fotos und keine Behauptung, dass die Verteilungen pro Gruppe für die Bevölkerung repräsentativ sind.

Kann man damit die ethnische Zugehörigkeit anhand eines Fotos vorhersagen?

Nein, und diese Nutzung ist ausdrücklich ausgeschlossen. Der Datensatz ist pro Bild strukturiert, doch Ausrichtung, Aggregationen und Nutzungsbeschränkungen liegen alle auf aggregierter Ebene. Die phänotypische Varianz innerhalb ethnischer Gruppen überschneidet sich stark mit der Varianz zwischen den Gruppen: Viele Phänotyp-Kombinationen kommen gleichzeitig in fünf oder mehr ethnischen Gruppen vor. Ein Klassifikator, der auf Gruppendurchschnitten aufbaut, hätte erhebliche Genauigkeitsprobleme.

Wichtiger noch: Diese Art von Anwendung verursacht gut dokumentierte Schäden. Die Datensatzkarte verbietet ausdrücklich Anwendungen zur individuellen Klassifizierung, Identifizierung oder Überwachung. Wir haben diese Grenze bewusst gezogen und halten sie über die Lizenzierung des Datensatzes und die Dokumentation zur vorgesehenen Nutzung aufrecht.

Wie genau sind die Labels?

Die Annotation durch das Vision-LLM liefert pro Bild einen selbst angegebenen Konfidenzwert (0.0 bis 1.0). Die mittlere Konfidenz über das gesamte Korpus von 5.668 Bildern beträgt 0,67. Qualitätsverteilung: 42% hoch, 39% mittel, 16% niedrig, 3% sehr niedrig.

Eine externe Kalibrierung der Genauigkeit pro Dimension wurde für diesen Prompt nicht in großem Maßstab gemessen; wir empfehlen, nach image_quality IN ('high', 'medium') zu filtern (wodurch etwa 19% der Zeilen ausgeschlossen werden) und für Anwendungsfälle mit hohen Präzisionsanforderungen zusätzlich confidence > 0.55 als Schwellenwert in Betracht zu ziehen. Jede Zeile enthält ihre eigene Konfidenz, sodass nachgelagerte Nutzer eigene Filter anwenden können.

Warum diese Dimensionen und keine anderen?

Die Dimensionen wurden ausgewählt nach (a) ihrem Vorkommen in etablierten, wissenschaftlich begutachteten Skalen, wobei wir Skalen bevorzugt haben, die durch spezifische medizinische, anthropometrische oder ästhetisch-anatomische Fachliteratur gestützt sind, und (b) ihrer Beobachtbarkeit auf Fotos: Für jede Dimension ist vermerkt, ob sie anhand eines typischen Fotos beurteilt werden kann und welcher Mindestbildausschnitt dafür nötig ist. Einige Dimensionen (z. B. density_inference aus BI-RADS, wofür eine Mammografie nötig ist) sind der akademischen Vollständigkeit halber im Schema enthalten, sind aber mit not_assessable gekennzeichnet und werden nie aus Fotos befüllt.

Wie wird mit Personen gemischter Herkunft umgegangen?

Der Datensatz ist pro Bild strukturiert, nicht pro Person als Repräsentant einer ethnischen Gruppe. Jede Bildzeile dokumentiert die Phänotyp-Merkmale, die auf genau diesem Foto sichtbar sind; die Aggregationsebene zeigt Verteilungen pro Gruppe, die sich zwischen den Gruppen erheblich überschneiden. Die Phänotyp-Kombination einer Person gemischter Herkunft kann gleichzeitig in mehreren Gruppenverteilungen auftauchen, und das ist korrekt: Es spiegelt die Realität phänotypischer Verteilungen wider, statt sie auf stereotype Modalwerte zu verdichten.

Für die KI-Generierung erlaubt die dimensionsweise Struktur des Vokabulars es Nutzern, einzelne Dimensionen unabhängig voneinander zu überschreiben. Das System kann „Cherokee-Frau, aber ausdrücklich mit hellbraunen Augen“ als Überschreibung einer einzelnen Dimension beim Sampling aus der Verteilung der Gruppe erzeugen.

Worin unterscheidet sich das von der Rassenkunde?

Die Rassenkunde beruht darauf, den Phänotyp auf eine kleine Zahl typologischer Kategorien zu reduzieren, mit behaupteten hierarchischen Beziehungen und angenommenem genetischem Determinismus. Die heutige kraniofaziale Anthropologie tut das Gegenteil: hochdimensionale deskriptive Messung, ausdrückliche Anerkennung umweltbedingter Varianz, individuelle Variation wird erfasst statt eingeebnet, keine hierarchischen Behauptungen. Dieser Datensatz steht in der zweiten Tradition.

Ein konkretes Beispiel: Die Dimension Schädelindex in head-shape.json verwendet die Kategorien dolichozephal / mesozephal / brachyzephal, Begriffe mit einer dokumentierten Geschichte des Missbrauchs in der Rassentypologie des 19. Jahrhunderts. Der Block framing_caveats der Vokabulardatei distanziert sich ausdrücklich von dieser Geschichte, unter Berufung auf Boas 1912 (der eine umweltbedingte Variabilität des Schädelindex nachwies, die dessen Verwendung als stabiles Merkmal zur Klassifizierung von Populationen untergräbt), und beschränkt die Dimension auf klinische / forensische / individuell beschreibende Verwendung.

Woher stammen die Daten?

Die Beobachtungen pro Bild stammen ausschließlich aus gemeinfreien Wikipedia-Fotos bekannter Persönlichkeiten. Die Fotos werden über die Wikipedia-Artikel „List of {Ethnicity} people“ (sofern vorhanden; 291 von 484 Gruppen haben einen solchen Artikel) und die darin verlinkten biografischen Wikipedia-Seiten der einzelnen Personen bezogen. Die Bilder werden von upload.wikimedia.org abgerufen und mit den Vision-Fähigkeiten von Anthropic Claude Sonnet 4.6 auf AWS Bedrock analysiert.

Jede Zeile des Datensatzes enthält die Quell-URL des analysierten Bildes, sodass sich die Lizenz jedes einzelnen Bildes überprüfen und die Analyse Zeile für Zeile prüfen lässt.

Was ist die Hauptquelle für Verzerrungen?

Der Wikipedia-Stichprobenrahmen: „bekannte Personen, für die Wikipedia einen Artikel vom Typ ‚List of X people‘ hat, mit einem Foto in ihrem eigenen Artikel.“ Diese Stichprobe ist männlich dominiert, auf das öffentliche Leben ausgerichtet (Politiker, Wissenschaftler, Sportler, Entertainer, historische Persönlichkeiten), durch die englischsprachige Abdeckung verzerrt und zugunsten des fotografischen Zeitalters verschoben. Der Aggregator zeigt diesen Vorbehalt bei jeder Gruppenzusammenfassung an, die zu 100% aus Wikipedia stammt (was derzeit auf alle Zusammenfassungen zutrifft). Künftige Versionen, die von Nutzern eingereichte Bilder oder eine zweite gemeinfreie Quelle einbeziehen, werden diese Schieflage abschwächen.

Wie kann ich Korrekturen oder Ergänzungen beitragen?

Das Vokabularsystem und die Pipeline sind unter Apache 2.0 als Open Source auf github.com/Agaveis/phenotype-catalog-pipeline verfügbar; Pull Requests mit Verfeinerungen des Vokabulars, zusätzlichen Quellenangaben oder Verbesserungen der Pipeline sind dort willkommen. Korrekturen an bestimmten Gruppeneinträgen auf der Live-Website können an admin@agaveis.com gesendet werden.

Warum steht das auf einer Website namens Ethnic Erotic?

Der Katalog entstand als kuratorisches Nebenprojekt einer Plattform für Creator von Erwachseneninhalten, die präzise, ethnisch fundierte Prompts für die KI-Generierung wollte statt der auf Stereotype verkürzten Standardergebnisse, die die meisten Bildgeneratoren liefern. Die strukturierte Taxonomie erwies sich als deutlich breiter angelegt und strenger als der unmittelbare Bedarf der Plattform, daher werden die öffentlichen Artefakte (Datensatz, Vokabular, Methodenpapier) unter freizügigen Lizenzen zur Weiterverwendung durch alle veröffentlicht, auch durch akademische Forschende, die den Datensatz lieber unter einer anderen Marke spiegeln möchten. Die Lizenzierung unter Apache 2.0 + CC BY 4.0 macht diese Weiterverwendung ausdrücklich.

Weiterlesen: Über das Projekt · Methodik · Ethik · Glossar