- Accueil/
- FAQ : catalogue de phénotypes
FAQ : catalogue de phénotypes
Des questions prévisibles, des réponses de fond. Pour plus de détails, voir À propos · Méthodologie · Éthique.
Est-ce scientifiquement valide ?
Chaque dimension de la taxonomie repose sur une échelle évaluée par des pairs : Fitzpatrick I à VI (Fitzpatrick 1988, Archives of Dermatology), classification de la forme des seins de Halls (Halls 1998), gradation de la ptose de Regnault (Regnault 1976, Clinics in Plastic Surgery), somatotype de Heath-Carter (Carter & Heath 1990), texture capillaire d'Andre Walker, échelles de perte de cheveux de Hamilton-Norwood et de Ludwig, forme des fesses de Mendieta (2007), rapport digital 2D:4D de Manning (1998, Human Reproduction), entre autres. Chaque classe de valeurs a une définition et une source citée.
Le jeu de données lui-même est descriptif, pas prédictif. Les observations par image documentent les caractéristiques phénotypiques visibles sur les photographies sources ; les agrégations par groupe résument les distributions observées, avec des réserves explicites. Nous ne formulons aucune affirmation causale sur les relations entre phénotype et génétique, aucune affirmation prédictive sur l'identification ethnique à partir de photographies, et nous n'affirmons pas que les distributions par groupe sont représentatives des populations.
Peut-on s'en servir pour prédire l'origine ethnique d'après une photographie ?
Non, et c'est un usage explicitement exclu du périmètre. Le jeu de données est structuré par image, mais le cadrage, les agrégations et les restrictions d'usage se situent tous au niveau agrégé. La variance phénotypique au sein des groupes ethniques recoupe largement la variance entre les groupes : de nombreuses combinaisons de phénotypes sont présentes simultanément dans cinq groupes ethniques ou plus. Un classificateur fondé sur les moyennes par groupe aurait des problèmes de précision importants.
Plus important encore, ce type d'application cause des préjudices bien documentés. La fiche descriptive du jeu de données interdit explicitement les applications de classification individuelle, d'identification ou de surveillance. Nous avons choisi cette limite délibérément et la maintenons au moyen de la licence du jeu de données et de sa documentation sur les usages prévus.
Quelle est la précision des étiquettes ?
L'annotation par un LLM de vision produit un score de confiance autoévalué pour chaque image (de 0.0 à 1.0). La confiance moyenne sur l'ensemble du corpus de 5 668 images est de 0,67. Répartition par qualité : 42% élevée, 39% moyenne, 16% faible, 3% très faible.
La précision par dimension n'a pas fait l'objet d'une calibration externe à grande échelle pour ce prompt ; nous recommandons de filtrer sur image_quality IN ('high', 'medium') (ce qui exclut environ 19% des lignes) et d'envisager confidence > 0.55 comme seuil supplémentaire pour les cas d'usage exigeant une haute précision. Chaque ligne porte son propre indice de confiance, afin que les utilisateurs en aval puissent appliquer leurs propres filtres.
Pourquoi ces dimensions et pas d'autres ?
Les dimensions ont été sélectionnées en fonction (a) de leur présence dans des échelles établies et évaluées par des pairs ; nous avons privilégié les échelles appuyées par une littérature spécifique en médecine, en anthropométrie ou en anatomie esthétique, et (b) de leur observabilité sur photo : pour chaque dimension, il est indiqué si elle peut être évaluée à partir d'une photographie ordinaire et avec quel cadrage minimal. Certaines dimensions (par ex. density_inference, issue de BI-RADS, qui nécessite une mammographie) figurent dans le schéma par souci d'exhaustivité académique, mais sont marquées not_assessable et ne sont jamais renseignées à partir de photographies.
En quoi est-ce différent du racisme scientifique ?
Le racisme scientifique repose sur la réduction du phénotype à un petit nombre de catégories typologiques, avec des relations hiérarchiques revendiquées et un déterminisme génétique présumé. L'anthropologie craniofaciale contemporaine fait l'inverse : mesure descriptive à haute dimension, reconnaissance explicite de la variance environnementale, variation individuelle saisie plutôt qu'écrasée, aucune prétention hiérarchique. Ce jeu de données s'inscrit dans la seconde tradition.
Un exemple précis : la dimension de l'indice céphalique dans head-shape.json utilise les catégories dolichocéphale / mésocéphale / brachycéphale, des termes dont l'usage abusif dans la typologie raciale du XIXe siècle est documenté. Le bloc framing_caveats du fichier de vocabulaire prend explicitement ses distances avec cet historique en citant Boas 1912 (qui a démontré une variabilité environnementale de l'indice céphalique, ce qui compromet son utilisation comme marqueur stable de classification des populations), et limite la dimension à un usage clinique / médico-légal / de description individuelle.
D'où viennent les données ?
Les observations par image proviennent exclusivement de photographies Wikipedia relevant du domaine public montrant des personnalités. Les photographies sont obtenues via les articles Wikipedia « List of {Ethnicity} people » (lorsqu'ils existent ; 291 des 484 groupes disposent d'un tel article) et les pages biographiques Wikipedia individuelles qui y sont liées. Les images sont téléchargées depuis upload.wikimedia.org et analysées avec les capacités de vision d'Anthropic Claude Sonnet 4.6 sur AWS Bedrock.
Chaque ligne du jeu de données conserve l'URL source de l'image analysée, de sorte que la licence de chaque image peut être vérifiée et l'analyse auditée ligne par ligne.
Quelle est la principale source de biais ?
Le cadre d'échantillonnage Wikipedia : « personnalités figurant dans un article Wikipedia de type “List of X people” et ayant une photographie dans leur article individuel ». Cet échantillon est déséquilibré en faveur des hommes, orienté vers la vie publique (responsables politiques, scientifiques, sportifs, artistes, personnages historiques), biaisé par la couverture en langue anglaise et biaisé en faveur de l'ère photographique. L'agrégateur affiche cette réserve sur chaque synthèse par groupe issue à 100% de Wikipedia (ce qui est actuellement le cas de toutes les synthèses). Les prochaines versions qui intégreront des images soumises par les utilisateurs ou une deuxième source du domaine public atténueront ce biais.
Comment puis-je proposer des corrections ou des ajouts ?
Le système de vocabulaire et le pipeline sont open source sous licence Apache 2.0 sur github.com/Agaveis/phenotype-catalog-pipeline ; les pull requests proposant des affinements du vocabulaire, des citations supplémentaires ou des améliorations du pipeline y sont les bienvenues. Pour corriger des fiches de groupe spécifiques sur le site en ligne, écrivez à admin@agaveis.com.
Pourquoi ce catalogue se trouve-t-il sur un site appelé Ethnic Erotic ?
Le catalogue est né comme projet annexe de curation d'une plateforme de créateurs de contenu pour adultes, qui voulait des prompts de génération par IA précis et fondés sur l'origine ethnique, plutôt que les rendus par défaut réduits à des stéréotypes que produisent la plupart des générateurs d'images. La taxonomie structurée s'est révélée d'une portée bien plus large et plus rigoureuse que les besoins immédiats de la plateforme ; les artefacts publics (jeu de données, vocabulaire, article méthodologique) sont donc publiés sous licences permissives pour être réutilisés par tous, y compris par des chercheurs universitaires qui préféreraient héberger une copie miroir du jeu de données sous une autre marque. Les licences Apache 2.0 + CC BY 4.0 rendent cette réutilisation explicite.
En savoir plus : À propos · Méthodologie · Éthique · Glossaire
Comment sont traitées les personnes d'ascendance mixte ?
Le jeu de données est structuré par image, et non par individu considéré comme représentant d'un groupe ethnique. Chaque ligne d'image documente les caractéristiques phénotypiques visibles sur cette photographie précise ; la couche d'agrégation fait apparaître des distributions par groupe qui se recoupent largement d'un groupe à l'autre. La combinaison phénotypique d'une personne d'ascendance mixte peut apparaître simultanément dans plusieurs distributions par groupe, et c'est correct : cela reflète la réalité des distributions phénotypiques au lieu de les réduire à des modes stéréotypés.
Pour la génération par IA, la structure par dimension du vocabulaire permet aux utilisateurs de remplacer certaines dimensions indépendamment les unes des autres. Le système peut générer « femme cherokee, mais précisément avec des yeux marron clair » en ne remplaçant qu'une seule dimension dans l'échantillonnage de la distribution du groupe.