La calidad de la generación de manos por parte de las redes neuronales está mejorando gradualmente, pero el problema de la precisión anatómica aún persiste. Los modelos a menudo no saben “contar” correctamente los dedos. En su lugar, reconocen un patrón similar a “cierta cantidad de elementos parecidos uno al lado del otro”*).
Cuando una red neuronal intenta completar una zona que, según sus patrones, debería ser una mano, puede generar cuatro, seis o incluso más dedos. Este comportamiento se explica por la naturaleza estadística del entrenamiento: el modelo ha visto muchas imágenes de manos, pero rara vez con una anatomía completamente detallada.
La red neuronal no comprende cómo debe lucir una mano; simplemente adivina la estructura basándose en fragmentos incompletos u ocultos y en miles de variaciones del conjunto de datos de entrenamiento. Por eso, al generar, se ve obligada a “rellenar” los detalles anatómicos, lo que conduce a errores.
*) ¿Cómo “adivinan” la estructura las redes neuronales?
Los modelos generativos modernos (DALL·E, Stable Diffusion, MidJourney) funcionan con transformadores:
- La imagen se divide en tokens (pequeños fragmentos).
- El modelo predice el siguiente token según la estadística.
- Si una parte de la imagen recuerda a una mano, elige la combinación de tokens que apareció con mayor frecuencia durante el entrenamiento.