- Inicio/
- Preguntas frecuentes: catálogo de fenotipos
Preguntas frecuentes: catálogo de fenotipos
Preguntas previsibles, respuestas a fondo. Más detalles en Acerca del proyecto · Metodología · Ética.
¿Es esto científicamente válido?
Cada dimensión de la taxonomía se basa en una escala revisada por pares: Fitzpatrick I a VI (Fitzpatrick 1988, Archives of Dermatology), clasificación de la forma mamaria de Halls (Halls 1998), graduación de la ptosis de Regnault (Regnault 1976, Clinics in Plastic Surgery), somatotipo de Heath-Carter (Carter & Heath 1990), textura capilar de Andre Walker, escalas de pérdida de cabello de Hamilton-Norwood y de Ludwig, forma de los glúteos de Mendieta (2007), índice digital 2D:4D de Manning (1998, Human Reproduction), entre otras. Cada categoría de valores tiene una definición y una cita de la fuente.
El conjunto de datos en sí es descriptivo, no predictivo. Las observaciones por imagen documentan los rasgos fenotípicos visibles en las fotografías de origen; las agregaciones por grupo resumen las distribuciones observadas con salvedades explícitas. No hacemos afirmaciones causales sobre la relación entre fenotipo y genética, ni afirmaciones predictivas sobre la identificación étnica a partir de fotografías, ni afirmamos que las distribuciones por grupo sean representativas de la población.
¿Sirve para predecir la etnia a partir de una fotografía?
No, y es un uso expresamente excluido. El conjunto de datos está estructurado por imagen, pero el enfoque, las agregaciones y las restricciones de uso son todos de nivel agregado. La varianza fenotípica dentro de los grupos étnicos se solapa en gran medida con la varianza entre grupos: muchas combinaciones de fenotipos están presentes a la vez en cinco o más grupos étnicos. Un clasificador construido sobre promedios por grupo tendría problemas de precisión importantes.
Y lo que es más importante, este tipo de aplicación causa daños bien documentados. La ficha del conjunto de datos prohíbe explícitamente las aplicaciones de clasificación individual, identificación o vigilancia. Elegimos este límite deliberadamente y lo mantenemos mediante la licencia del conjunto de datos y su documentación de usos previstos.
¿Qué precisión tienen las etiquetas?
La anotación mediante un LLM de visión produce una puntuación de confianza autoinformada por imagen (de 0.0 a 1.0). La confianza media en el corpus de 5668 imágenes es de 0,67. Distribución por calidad: 42% alta, 39% media, 16% baja, 3% muy baja.
La calibración externa de la precisión por dimensión no se ha medido a gran escala con este prompt; recomendamos filtrar por image_quality IN ('high', 'medium') (lo que excluye aproximadamente el 19% de las filas) y considerar confidence > 0.55 como umbral adicional para casos de uso que requieran alta precisión. Cada fila lleva su propia confianza para que los usuarios posteriores puedan aplicar sus propios filtros.
¿Por qué estas dimensiones y no otras?
Las dimensiones se seleccionaron en función de (a) su presencia en escalas consolidadas y revisadas por pares; dimos prioridad a las escalas respaldadas por literatura médica, antropométrica o de anatomía estética específica, y (b) su observabilidad en fotografía: cada dimensión indica si puede evaluarse a partir de una fotografía típica y con qué encuadre mínimo. Algunas dimensiones (p. ej., density_inference, de BI-RADS, que requiere una mamografía) se incluyen en el esquema por exhaustividad académica, pero están marcadas como not_assessable y nunca se rellenan a partir de fotografías.
¿Cómo se tratan las personas de ascendencia mixta?
El conjunto de datos está estructurado por imagen, no por individuo como representante étnico. Cada fila de imagen documenta los rasgos fenotípicos visibles en esa fotografía concreta; la capa de agregación muestra distribuciones por grupo con un solapamiento considerable entre grupos. La combinación fenotípica de una persona de ascendencia mixta puede aparecer simultáneamente en varias distribuciones por grupo, y eso es correcto: refleja la realidad de las distribuciones fenotípicas en lugar de reducirlas a modas estereotipadas.
Para la generación con IA, la estructura por dimensiones del vocabulario permite a los usuarios sobrescribir dimensiones concretas de forma independiente. El sistema puede generar “mujer cheroqui, pero específicamente con ojos castaño claro” como sustitución de una sola dimensión en el muestreo de la distribución del grupo.
¿En qué se diferencia esto del racismo científico?
El racismo científico se basa en reducir el fenotipo a un pequeño número de categorías tipológicas con supuestas relaciones jerárquicas y un determinismo genético presupuesto. La antropología craneofacial contemporánea hace lo contrario: medición descriptiva de alta dimensionalidad, reconocimiento explícito de la varianza ambiental, variación individual registrada en lugar de reducida, ninguna afirmación jerárquica. Este conjunto de datos se inscribe en la segunda tradición.
Un ejemplo concreto: la dimensión del índice cefálico en head-shape.json usa las categorías dolicocéfalo / mesocéfalo / braquicéfalo, términos con una historia documentada de uso indebido en la tipología racial del siglo XIX. El bloque framing_caveats del archivo de vocabulario se desmarca explícitamente de esa historia, citando a Boas 1912 (que demostró una variabilidad ambiental del índice cefálico que socava su uso como marcador estable de clasificación de poblaciones), y restringe la dimensión a usos clínicos / forenses / de descripción individual.
¿De dónde proceden los datos?
Las observaciones por imagen proceden exclusivamente de fotografías de Wikipedia de dominio público que muestran a personas notables. Las fotografías se obtienen a través de los artículos de Wikipedia “List of {Ethnicity} people” (cuando existen; 291 de los 484 grupos tienen un artículo así) y de las páginas biográficas de Wikipedia de cada persona enlazadas desde ellos. Las imágenes se descargan de upload.wikimedia.org y se analizan con las capacidades de visión de Anthropic Claude Sonnet 4.6 en AWS Bedrock.
Cada fila del conjunto de datos conserva la URL de origen de la imagen analizada, de modo que se puede verificar la licencia de cada imagen y auditar el análisis fila por fila.
¿Cuál es la principal fuente de sesgo?
El marco de muestreo de Wikipedia: “personas notables para las que Wikipedia tiene un artículo del tipo ‘List of X people’, con una fotografía en su artículo individual”. Esta muestra está sesgada hacia los hombres, orientada a la vida pública (políticos, científicos, deportistas, artistas, figuras históricas), sesgada por la cobertura en lengua inglesa y sesgada hacia la era fotográfica. El agregador muestra esta salvedad en cada resumen por grupo que procede al 100% de Wikipedia (lo que actualmente es el caso de todos los resúmenes). Las futuras versiones que incorporen imágenes enviadas por los usuarios o una segunda fuente de dominio público atenuarán este sesgo.
¿Cómo puedo aportar correcciones o añadidos?
El sistema de vocabulario y el pipeline son de código abierto bajo Apache 2.0 en github.com/Agaveis/phenotype-catalog-pipeline; allí son bienvenidas las pull requests con refinamientos del vocabulario, citas adicionales o mejoras del pipeline. Las correcciones de entradas concretas de grupos en el sitio publicado pueden enviarse a admin@agaveis.com.
¿Por qué está esto en un sitio llamado Ethnic Erotic?
El catálogo nació como un proyecto paralelo de curaduría de una plataforma de creadores de contenido para adultos que quería prompts de generación con IA precisos y con base étnica, en lugar de los resultados por defecto reducidos a estereotipos que producen la mayoría de los generadores de imágenes. La taxonomía estructurada resultó tener un alcance considerablemente más amplio y ser más rigurosa de lo que la plataforma necesitaba de inmediato, por lo que los artefactos públicos (conjunto de datos, vocabulario, artículo de metodología) se publican bajo licencias permisivas para que cualquiera pueda reutilizarlos, incluidos investigadores académicos que prefieran replicar el conjunto de datos bajo otra marca. Las licencias Apache 2.0 + CC BY 4.0 hacen explícita esa reutilización.
Más información: Acerca del proyecto · Metodología · Ética · Glosario