À propos du catalogue de phénotypes

Une référence ethnographique et phénotypique structurée couvrant 484 groupes ethniques dans 22 catégories anatomiques, avec 195 dimensions, 848 classes de vocabulaire sourcées et 113 références.

De quoi il s'agit

Le catalogue de phénotypes est une référence publique, étayée par des citations, qui associe des métadonnées ethnographiques structurées (territoire d'origine, famille de langues, codes ISO, religion) pour 484 groupes ethniques à un vocabulaire médical / anthropologique complet couvrant 22 catégories anatomiques. Chaque catégorie comporte de 4 à 16 dimensions de variation tirées d'échelles évaluées par les pairs : Fitzpatrick I à VI pour la peau, Halls pour la forme des seins, Regnault pour la ptôse, Heath-Carter pour le somatotype, Andre Walker 1A à 4C pour la texture des cheveux, Hamilton-Norwood et Ludwig pour la chute des cheveux, le 2D:4D de Manning pour le rapport digital, Cavanagh-Rodgers pour l'indice de voûte plantaire, Mendieta pour la forme des fesses, et d'autres.

Chaque ligne de données d'observation structurées par image du site en ligne peut être rattachée à une photographie Wikipedia du domaine public d'une personnalité du groupe correspondant, analysée par un modèle vision-langage (Anthropic Claude Sonnet 4.6 via AWS Bedrock) pour remplir les champs structurés. Les distributions agrégées par groupe apparaissent sur chaque page /ethnic/[slug], avec des mises en garde explicites sur le biais des sources et la taille de l'échantillon.

Pourquoi ce catalogue existe

Les benchmarks d'équité existants, comme FairFace et BUPT-Balancedface, regroupent l'ethnicité en quatre à sept catégories raciales, un découpage trop grossier pour un audit plus fin des biais des systèmes de vision et des outils de génération par IA. Construire directement un jeu de données plus fin coûte cher : l'annotation par crowdsourcing a ses propres biais, la plupart des sources d'images envisageables n'offrent pas de licence claire image par image, et la littérature académique sur la variation phénotypique propre à chaque ethnie est dispersée entre des revues de dermatologie, de chirurgie plastique, d'urologie, d'anthropologie et de trichologie.

Ce catalogue résout le problème des licences en s'appuyant exclusivement sur des photographies Wikipedia du domaine public, résout le coût de l'annotation grâce à une annotation par LLM de vision à partir de prompts structurés fixes, et résout le problème de la fragmentation de la littérature en regroupant les échelles pertinentes évaluées par les pairs dans un vocabulaire ouvert unique publié sur GitHub et HuggingFace. Le résultat est un jeu de données phénotypiques structurées par image, d'une granularité ethnographique inhabituelle (484 groupes, en moyenne ~24 images par groupe représenté), fondé sur 113+ citations évaluées par les pairs.

Ce que vous pouvez en faire

  • Génération d'images par IA, ancrée dans des distributions réelles. Le site utilise ces distributions phénotypiques par groupe pour ancrer les prompts envoyés aux générateurs d'images, ce qui produit une diversité au sein de chaque groupe au lieu de stéréotypes issus d'un effondrement de mode. L'utilisateur choisit un groupe, le système échantillonne dans la distribution réellement observée, la génération reflète la variance réelle.
  • Audit des biais des systèmes de vision. Les étiquettes phénotypiques de vérité terrain par groupe permettent de mesurer la précision par groupe de tout système de vision que vous souhaitez auditer.
  • Référence anthropologique. Le catalogue de 484 groupes, avec des champs normalisés pour le territoire d'origine, la langue, les codes ISO et la religion, permet des requêtes entre groupes et un usage pédagogique.
  • Fine-tuning de modèles d'IA. Sous-ensembles d'entraînement équilibrés selon Fitzpatrick, ancrage multiethnique des prompts, embeddings démographiques.

Artefacts ouverts

Mises en garde

La principale limite du jeu de données est le cadre d'échantillonnage de Wikipedia : « les personnalités pour lesquelles Wikipedia possède un article de type liste de personnalités X, avec une photographie dans leur article individuel ». Cet échantillon est biaisé en faveur des hommes, de la vie publique, de la couverture en langue anglaise et de l'ère de la photographie. L'agrégateur affiche cette mise en garde en toutes lettres sur chaque synthèse par groupe.

En outre : le jeu de données est réservé à la recherche agrégée ; les lignes par image ne conviennent pas à des applications de classification individuelle, d'identification ou de surveillance. La variation phénotypique au sein des groupes ethniques recoupe largement la variation entre groupes ; les moyennes par groupe ne doivent pas être lues comme des prédictions individuelles. Voir la page sur l'éthique pour la définition explicite du périmètre d'usage.

En savoir plus

  • Méthodologie : comment le catalogue a été construit
  • Éthique : usages prévus et usages explicitement exclus
  • FAQ : les questions attendues, des réponses de fond
  • Glossaire : 848 termes définis dans les 22 catégories
  • Atlas : parcourir par catégorie anatomique
  • Monde : parcourir par région et groupe ethnique