- Inicio/
- Acerca del catálogo de fenotipos
Acerca del catálogo de fenotipos
Una referencia etnográfica y fenotípica estructurada que abarca 484 grupos étnicos en 22 categorías anatómicas, con 195 dimensiones, 848 clases de vocabulario con fuentes citadas y 113 referencias.
Qué es
El catálogo de fenotipos es una referencia pública y respaldada por citas que combina metadatos etnográficos estructurados (territorio de origen, familia lingüística, códigos ISO, religión) de 484 grupos étnicos con un vocabulario médico / antropológico exhaustivo que abarca 22 categorías anatómicas. Cada categoría tiene de 4 a 16 dimensiones de variación tomadas de escalas revisadas por pares: Fitzpatrick I a VI para la piel, Halls para la forma de los senos, Regnault para la ptosis, Heath-Carter para el somatotipo, Andre Walker 1A a 4C para la textura del cabello, Hamilton-Norwood y Ludwig para la caída del cabello, el 2D:4D de Manning para la proporción digital, Cavanagh-Rodgers para el índice del arco plantar, Mendieta para la forma de los glúteos, entre otras.
Cada fila de datos de observación estructurados por imagen del sitio en vivo puede rastrearse hasta una fotografía de dominio público de Wikipedia de una persona notable del grupo correspondiente, analizada por un modelo de visión y lenguaje (Anthropic Claude Sonnet 4.6 mediante AWS Bedrock) para convertirla en los campos estructurados. Las distribuciones agregadas por grupo aparecen en cada página /ethnic/[slug], con advertencias explícitas sobre el sesgo de las fuentes y el tamaño de la muestra.
Por qué existe
Los benchmarks de equidad existentes, como FairFace y BUPT-Balancedface, agrupan la etnicidad en entre cuatro y siete categorías raciales, demasiado gruesas para auditar sesgos con mayor detalle en sistemas de visión y herramientas de generación con IA. Construir directamente un conjunto de datos más detallado es costoso: el etiquetado colaborativo tiene sus propios sesgos, la mayoría de las posibles fuentes de imágenes carecen de claridad de licencia por imagen y la literatura académica sobre la variación fenotípica propia de cada etnia está fragmentada entre revistas de dermatología, cirugía plástica, urología, antropología y tricología.
Este catálogo resuelve el problema de las licencias al basarse exclusivamente en fotografías de dominio público de Wikipedia, resuelve el costo del etiquetado mediante anotación con un LLM de visión a partir de prompts estructurados fijos, y resuelve el problema de la fragmentación de la literatura al consolidar las escalas pertinentes revisadas por pares en un único vocabulario abierto publicado en GitHub y HuggingFace. El resultado es un conjunto de datos fenotípicos estructurados por imagen con una granularidad etnográfica poco habitual (484 grupos, una media de ~24 imágenes por grupo representado), respaldado por 113+ citas revisadas por pares.
Qué puede hacer con él
- Generación de imágenes con IA, basada en distribuciones reales. El sitio usa estas distribuciones fenotípicas por grupo para fundamentar los prompts de los generadores de imágenes, lo que produce diversidad dentro de cada grupo en lugar de estereotipos por colapso de modo. El usuario selecciona un grupo, el sistema muestrea la distribución realmente observada y la generación refleja la varianza real.
- Auditoría de sesgos de sistemas de visión. Las etiquetas fenotípicas de referencia por grupo permiten medir la precisión por grupo de cualquier sistema de visión que quiera auditar.
- Referencia antropológica. El catálogo de 484 grupos, con campos normalizados de territorio de origen, lengua, códigos ISO y religión, permite consultas entre grupos y uso educativo.
- Ajuste fino de modelos de IA. Subconjuntos de entrenamiento equilibrados según Fitzpatrick, fundamentación multiétnica de prompts, embeddings demográficos.
Artefactos abiertos
- Conjunto de datos (CC BY 4.0): huggingface.co/datasets/EthnicErotic/phenotype-catalog
- Artículo de metodología (DOI): 10.5281/zenodo.20075617
- Código del pipeline (Apache 2.0): github.com/Agaveis/phenotype-catalog-pipeline
- 22 archivos de vocabulario: taxonomía canónica pública
Advertencias
La principal limitación del conjunto de datos es el marco muestral de Wikipedia: «personas notables para las que Wikipedia tiene un artículo del tipo lista de personas X, con una fotografía en su artículo individual». Esta muestra está sesgada hacia los hombres, hacia la vida pública, hacia la cobertura en inglés y hacia la era fotográfica. El agregador muestra esta advertencia por escrito en cada resumen por grupo.
Además: el conjunto de datos es de uso exclusivo para investigación agregada; las filas por imagen no son adecuadas para aplicaciones de clasificación individual, identificación o vigilancia. La variación fenotípica dentro de los grupos étnicos se solapa considerablemente con la variación entre grupos; los promedios por grupo no deben interpretarse como predicciones individuales. Consulte la página de ética para ver la declaración explícita del alcance.
Más información
- Metodología: cómo se construyó el catálogo
- Ética: usos previstos y usos explícitamente fuera de alcance
- Preguntas frecuentes: preguntas previsibles, respuestas sustanciales
- Glosario: 848 términos definidos en las 22 categorías
- Atlas: explorar por categoría anatómica
- Mundo: explorar por región y grupo étnico