- Accueil/
- Éthique
Éthique
Le catalogue de phénotypes dit explicitement ce qu'il est et ce qu'il n'est pas. Cette page documente les usages prévus, les usages hors périmètre, les réserves sur les biais des sources et la limite, face aux détournements historiques, dans laquelle s'inscrit le jeu de données.
Usages prévus
- Audit des biais des systèmes de vision. Des étiquettes de phénotype structurées de référence (vérité terrain), établies par groupe, permettent de mesurer la précision par groupe des systèmes de vision audités (classificateurs d'attributs faciaux, détecteurs de teinte de peau, estimateurs d'âge).
- Sous-ensembles d'entraînement équilibrés selon Fitzpatrick. Le champ skin_tone permet de constituer des sous-ensembles d'entraînement et d'évaluation équilibrés sur la distribution Fitzpatrick I à VI, avec une granularité plus fine que les étiquettes raciales en quatre catégories typiques des benchmarks existants.
- Génération d'images par IA, ancrée dans des distributions réelles. Les distributions de phénotypes par groupe ancrent les prompts des générateurs d'images, ce qui produit une diversité au sein de chaque groupe au lieu de résultats stéréotypés issus d'un effondrement de mode.
- Référence anthropologique et enseignement. Le catalogue de 484 groupes, avec des champs normalisés territoire d'origine / langue / codes ISO / religion, permet des requêtes transversales entre groupes, des travaux universitaires et un usage pédagogique.
- Ancrage multiethnique des prompts en TAL. Des embeddings démographiques structurés pour ancrer les sorties des modèles de langage sur l'ensemble des groupes ethniques.
Usages hors périmètre
Le jeu de données n'est approprié pour aucune des applications suivantes :
- Classification individuelle. Prédire le groupe ethnique d'une personne à partir de sa photographie. Le jeu de données décrit les groupes ethniques de manière agrégée ; les lignes individuelles ne sont pas des données d'entraînement pour des classificateurs.
- Identification ou surveillance. Associer des personnes à des groupes au moyen de caractéristiques phénotypiques. Les lignes par image conservent les URL sources à des fins d'audit ; elles ne sont pas conçues pour l'appariement biométrique, et toute application qui établit l'empreinte d'individus à partir de caractéristiques phénotypiques par image est explicitement hors périmètre.
- Discrimination fondée sur le profil. Filtrer des personnes sur la base de leur phénotype dans le recrutement, l'octroi de crédits, l'immigration ou tout autre processus de décision lourd de conséquences.
- Affirmations hiérarchiques sur les populations. Les différences de distribution entre groupes dans ce jeu de données reflètent la base de sondage de Wikipedia, et non des hiérarchies génétiques ou de traits à l'échelle des populations. Les affirmations selon lesquelles un groupe serait « plus » ou « moins » sur une quelconque dimension phénotypique ne sont pas étayées par ces données.
- Inférence génétique causale. Les distributions de phénotypes sont observationnelles, et non expérimentales. Le jeu de données ne peut étayer aucune affirmation sur les locus génétiques à l'origine de telle ou telle variation phénotypique.
Nous avons choisi ces limites délibérément. La fiche du jeu de données sur HuggingFace, l'article méthodologique et cette page d'éthique comportent tous la même déclaration explicite des usages hors périmètre.
Réserves sur les biais des sources
La principale limite du jeu de données est le cadre de sources Wikipedia. Chaque ligne par image du corpus provient d'une photographie Wikipedia du domaine public montrant une personne recensée dans la tradition des articles Wikipedia « List of {Ethnicity} people ». Cet échantillon est :
- Déséquilibré en faveur des hommes. La notoriété publique sur Wikipedia penche vers les hommes dans la plupart des catégories (responsables politiques, scientifiques, sportifs, personnages historiques) ; le déséquilibre global approximatif est de ~70 à 75% d'hommes.
- Biaisé en faveur de la vie publique. Les scientifiques, responsables politiques, artistes du spectacle, sportifs et personnages historiques sont surreprésentés par rapport à la population générale.
- Biaisé par la couverture en langue anglaise. Les groupes plus présents sur la Wikipedia anglophone ont davantage d'observations d'images ; cela est vaguement corrélé à la taille de la diaspora anglophone, et non à celle de la population d'origine.
- Biaisé par l'ère photographique. Les personnages antérieurs à la photographie n'ont pas d'image d'infobox ; les groupes dont la présence sur Wikipedia est surtout historique ont donc une couverture plus faible en observations d'images.
Les agrégations par groupe sur le site en ligne affichent explicitement ces réserves chaque fois que la répartition des sources est à 100% Wikipedia (ce qui est actuellement le cas de toutes les agrégations). Les futures versions intégrant des images soumises par les utilisateurs ou une seconde source du domaine public atténueront ce déséquilibre.
Limite face aux détournements historiques
Plusieurs dimensions anatomiques du catalogue emploient un vocabulaire qui a été détourné par la pseudoscience de la typologie raciale du XIXe et du début du XXe siècle. La plus notable est l'indice céphalique dans le vocabulaire head-shape : les catégories dolichocéphale / mésocéphale / brachycéphale ont été largement détournées pour étayer des affirmations hiérarchiques sur les populations.
L'étude de Boas de 1912 (Changes in bodily form of descendants of immigrants, American Anthropologist 14(3): 530-562) a démontré que l'indice céphalique réagit à l'environnement en une seule génération, ce qui fragilise tout usage de la morphologie crânienne comme marqueur fixe de population. L'anthropologie craniofaciale contemporaine n'utilise ces dimensions que comme descripteurs développementaux, cliniques et individuels. Le bloc de réserves de cadrage du fichier de vocabulaire désavoue explicitement ce détournement historique et limite la dimension aux usages cliniques (dépistage de la craniosténose, orthèses pédiatriques), médico-légaux (identification individuelle) et de description individuelle.
Les utilisateurs en aval de ce jeu de données doivent se garder de projeter les catégories de l'indice céphalique, ou toute autre dimension du catalogue, sur des affirmations raciales ou de typologie des populations. Les distributions par groupe sont documentées par souci d'exhaustivité, et non comme des définitions ou des distinctions.
Schémas d'anatomie génitale
Trois fichiers de vocabulaire couvrent l'anatomie génitale externe (vulva, penis, pubic-region). Ils sont publiés dans un cadre académique (appuyés sur des citations, interopérables avec des ontologies, défendables devant des relecteurs) mais portent un indicateur observations_source_policy: "internal_only" au niveau du fichier. Aucune observation relative à ces dimensions n'est renseignée à partir de photographies du domaine public, et aucune n'est intégrée au jeu de données public.
La justification : Wikipedia et les sources similaires du domaine public ne contiennent aucune photographie pertinente ; les sources de contenus pour adultes posent des problèmes de consentement et de provenance qui les rendent inappropriées pour la constitution d'un jeu de données académique ; les populations de photographies cliniques exigent un consentement équivalent à celui d'un IRB, qu'un jeu de données ouvert ne peut garantir. Le schéma est publié afin que la taxonomie académique soit transparente ; les observations restent internes jusqu'à ce que des sources au consentement vérifié soient disponibles.
Licence et réutilisation
Le code est publié sous Apache License 2.0 ; le jeu de données est publié sous CC BY 4.0. Les URL d'images du jeu de données renvoient à des contenus Wikipedia / Wikimedia Commons soumis à leurs propres licences par image (généralement CC-BY-SA, domaine public ou diverses variantes Creative Commons) ; consultez l'URL de référence de chaque ligne avant de redistribuer les fichiers d'image eux-mêmes.
Le choix de licences permissives est délibéré. Les chercheurs universitaires, les équipes de recherche sur l'équité et les développeurs d'IA qui souhaitent créer un miroir du jeu de données avec une autre attribution ou le renommer pour un usage propre à leur domaine y sont explicitement invités. Les artefacts sont conçus pour survivre à tout hébergeur ou contexte de marque particulier.
En savoir plus : À propos · Méthodologie · FAQ · Glossaire