ESCUELA INTERNACIONAL DE DOCTORADO Logos-Falcultades

 
Tesis doctorales de la Escuela Internacional de Doctorado de la URJC desde el curso 2024/25
Interpretable Artificial Intelligence for Melanoma Identification: From Acquisition-Aware Image Processing to Multimodal Learning Using Heterogeneous Dermatological Data
AutorGÓMEZ MARTÍNEZ, VANESA
DirectorCHUSHIG MUZO, CRISTIAN DAVID
CodirectorSOGUERO RUÍZ, CRISTINA
Fecha de depósito24-07-2026
Periodo de exposición pública25 de julio a 28 de agosto de 2026
Fecha de defensaSin especificar
ProgramaTecnologías de la información y las Comunicaciones (TICs)
Mención internacionalNo
ResumenLa aplicación de metodologías basadas en inteligencia artificial (AI, del inglés Artificial Intelligence) en el ámbito sanitario se ha consolidado como una línea estratégica para el desarrollo de sistemas avanzados de apoyo a la decisión clínica. En dermatología, estas herramientas ofrecen la posibilidad de asistir a los especialistas en tareas de cribado, diagnóstico y seguimiento mediante análisis cuantitativos y reproducibles a partir de distintas fuentes de información clínica. Entre los distintos tipos de cáncer cutáneo, el melanoma constituye una de las neoplasias más agresivas debido a su elevada capacidad metastásica y a la fuerte dependencia del pronóstico respecto al momento de detección. La identificación temprana de lesiones sospechosas resulta, por tanto, esencial para mejorar la supervivencia de los pacientes y reducir la carga asistencial asociada a diagnósticos tardíos.

El diagnóstico dermatológico no se basa en una única fuente de información, sino en la integración de múltiples fuentes de información complementarias. En la práctica clínica, los especialistas combinan la inspección visual de la lesión, mediante dermatoscopia o fotografía macroscópica, con información clínica del paciente, localización anatómica y criterios estructurados relacionados con la morfología, el color y la textura. Esta naturaleza multimodal hace que el desarrollo de sistemas de AI para melanoma sea especialmente complejo. Las imágenes dermatoscópicas pueden contener artefactos de adquisición, como pelo, reglas, burbujas de gel o esquinas oscuras, que pueden ocultar estructuras diagnósticas relevantes y generar correlaciones espurias en los modelos. Por su parte, las imágenes macroscópicas, frecuentes en teledermatología y cribado remoto, suelen adquirirse en condiciones no controladas y pueden verse afectadas por sombras, subexposición e iluminación no uniforme. Además, los datos tabulares asociados al paciente y a la lesión combinan variables clínicas de baja dimensionalidad, descriptores visuales de alta dimensionalidad, tipos de datos mixtos, ausencia de estructura espacial y desequilibrio entre clases.

En este contexto, esta tesis doctoral propone un conjunto de métodos de aprendizaje automático (ML, del inglés Machine Learning) y aprendizaje profundo (DL, del inglés Deep Learning) orientados a mejorar la identificación de melanoma a partir de datos dermatológicos heterogéneos. El trabajo se articula en torno al desarrollo de sistemas robustos, interpretables y clínicamente orientados, capaces de abordar de forma específica los problemas asociados a cada modalidad de datos y, posteriormente, integrar dichas fuentes de información en un marco multimodal. La tesis presta especial atención a la preservación del contenido diagnóstico, la reducción de sesgos derivados de artefactos o condiciones de adquisición, la generación de representaciones tabulares interpretables y la cuantificación de la contribución relativa de cada modalidad mediante técnicas de explicabilidad.

OBJETIVOS
El objetivo general de esta tesis es desarrollar metodologías interpretables de AI para la identificación de melanoma a partir de datos dermatológicos heterogéneos. Para ello, se definen cuatro objetivos específicos.

El Objetivo 1 (O1) aborda el preprocesamiento de imágenes dermatoscópicas sensible a artefactos. En primer lugar, se formula la identificación de artefactos como un problema de clasificación multi-etiqueta, ya que una misma imagen puede contener varios artefactos simultáneamente y su detección constituye un paso previo necesario para decidir qué estrategias de preprocesamiento aplicar. En segundo lugar, se desarrolla una estrategia de eliminación digital de pelo de alta resolución que combina segmentación e inpainting, con el fin de limpiar la región de la lesión sin alterar sus propiedades diagnósticas.
El Objetivo 2 (O2) se centra en la mejora de iluminación no supervisada en imágenes macroscópicas de lesiones cutáneas. La propuesta busca corregir iluminación no uniforme y mejorar la visibilidad de la imagen sin requerir imágenes pareadas degradadas y correctamente iluminadas, preservando al mismo tiempo la apariencia de la lesión.
El Objetivo 3 (O3) aborda el aprendizaje de representaciones robustas para datos tabulares dermatológicos heterogéneos. Se consideran dos escenarios: descriptores de lesión de alta dimensionalidad y metadatos clínicos de baja dimensionalidad. En el primer caso, se busca reducir la redundancia y mitigar el desequilibrio de clases mediante selección de características y aumento de datos tabulares. En el segundo, se propone transformar los metadatos clínicos en representaciones compatibles con modelos convolucionales, manteniendo la trazabilidad entre píxeles y variables originales.
El Objetivo 4 (O4) consiste en el diseño de un marco de fusión multimodal interpretable para la identificación de melanoma. Este objetivo integra imágenes dermatoscópicas, metadatos clínicos y descriptores de la lesión en modelos predictivos comunes, explorando estrategias de fusión temprana y tardía e incorporando técnicas de explicabilidad post-hoc para estimar la contribución relativa de cada modalidad y de cada variable.

METODOLOGÍA
La metodología combina procesamiento de imagen, DL, selección de características, aumento de datos, transformación tabular-a-imagen, clasificación supervisada e interpretabilidad. Todos los métodos se diseñan considerando las particularidades del dominio dermatológico y se evalúan sobre bases de datos públicas de lesiones cutáneas.

En relación con el O1, la detección de artefactos se aborda mediante una arquitectura basada en transformers, C-Tran, adaptada para modelar dependencias entre etiquetas y capturar relaciones entre distintos tipos de artefactos. Además, se introduce una función de pérdida específica, Class-Adaptive Focal with Confidence (CAFC), orientada a mejorar el aprendizaje en escenarios con clases desbalanceadas y etiquetas poco frecuentes. Como segunda contribución, se desarrolla un método de eliminación digital de pelo basado en segmentación con Attention U-Net e inpainting mediante Aggregated Contextual Transformations Generative Adversarial Network (AOT-GAN), con el objetivo de reconstruir las regiones ocluidas preservando la coherencia visual del tejido subyacente.

Para el O2, se propone MacroE-Net, un método de mejora de iluminación sin referencia para imágenes macroscópicas dermatológicas. El método se basa en una arquitectura ligera tipo DCE-Net, adaptada al dominio dermatológico mediante ajuste selectivo de capas y optimización automática de la función de pérdida. La evaluación se realiza en Waterloo, PAD-UFES-20 y Derm7pt, empleando trece métricas sin referencia relacionadas con contraste, naturalidad, preservación de luminancia y calidad perceptual. Además, se valida su utilidad práctica en una tarea posterior de segmentación de lesiones.

El O3 se aborda mediante dos líneas complementarias. Para los descriptores de alta dimensionalidad, se emplea selección de características basada en ensambles homogéneos utilizando Relief como selector base. Esta etapa se combina con aumento de datos tabulares mediante Conditional Tabular Generative Adversarial Network (CTGAN) para mitigar el desequilibrio de clases. Las representaciones resultantes se evalúan con clasificadores clásicos de ML, como árboles de decisión, vecinos más cercanos, regresión logística regularizada mediante LASSO y máquinas de vectores soporte. La interpretabilidad se analiza mediante SHapley Additive exPlanations (SHAP), pruebas estadísticas basadas en remuestreo y visualizaciones UMAP.

Para los metadatos clínicos de baja dimensionalidad, se propone Low Mixed-Image Generator for Tabular Data (LM-IGTD), una transformación tabular-a-imagen que convierte variables clínicas mixtas en imágenes bidimensionales en escala de grises. El método combina aumento mediante ruido, cálculo de afinidades entre variables, organización espacial basada en rankings y generación de imágenes con correspondencia uno a uno entre píxeles y variables originales. Gracias a esta correspondencia, las predicciones de los modelos convolucionales pueden interpretarse mediante Gradient-weighted Class Activation Mapping (Grad-CAM).

Finalmente, el O4 integra las modalidades consideradas en un marco multimodal para la identificación de melanoma. Se utilizan imágenes dermatoscópicas, representaciones profundas, o embeddings, de imágenes dermatoscópicas obtenidas mediante ResNet-50, metadatos clínicos y descriptores manuales de la lesión. La fusión temprana concatena las modalidades en un único vector, mientras que la fusión tardía combina las predicciones de modelos independientes. La evaluación se realiza en International Skin Imaging Collaboration (ISIC)-2020 y PH2, complementándose con análisis de interpretabilidad mediante SHAP.

RESULTADOS
Los resultados obtenidos muestran la utilidad de abordar la identificación de melanoma desde una perspectiva integral, considerando la calidad de los datos, la representación de las variables y la integración multimodal como elementos esenciales del sistema predictivo.

En el O1, la detección multi-etiqueta de artefactos permitió identificar distintos tipos de artefactos presentes simultáneamente en una misma imagen. La arquitectura basada en C-Tran y la función de pérdida CAFC mejoraron el rendimiento global respecto a la configuración basal con entropía cruzada binaria, alcanzando una precisión media promedio de 0.961, una puntuación F1 global de 0.872 y una puntuación F1 por clase de 0.890. La mejora fue especialmente relevante en sensibilidad, con un aumento de 0.57 a 0.88 en la detección de burbujas de gel. La eliminación digital de pelo mediante segmentación e inpainting también obtuvo resultados superiores a los métodos clásicos. En la evaluación de inpainting, AOT-GAN alcanzó una relación pico señal-ruido de 37.81, un índice de similitud estructural de 0.99 y un índice de calidad universal de 1.00. Además, las imágenes restauradas con AOT-GAN alcanzaron los mejores valores del área bajo la curva ROC (AUCROC, del inglés Area Under the Receiver Operating Characteristic Curve) en Derm7pt (0.75), ISIC-2020 (0.87) y PH2 (0.91).

Respecto al O2, MacroE-Net obtuvo resultados sólidos en Waterloo, PAD-UFES-20 y Derm7pt, alcanzando el mejor rendimiento o resultados competitivos en la mayoría de las trece métricas sin referencia consideradas. De forma cualitativa, el método realizó correcciones moderadas y espacialmente coherentes, mejorando principalmente la piel circundante y evitando modificaciones agresivas dentro de la lesión. La validación mediante segmentación mostró que MacroE-Net fue el único método de mejora de iluminación que incrementó de forma consistente el rendimiento sobre las imágenes originales, con mejoras medias aproximadas de 2.9% en el coeficiente de similitud Dice y 5.1% en sensibilidad. Estos resultados indican que la mejora de iluminación es beneficiosa cuando preserva el contenido diagnóstico de la lesión.

En el O3, la combinación de selección de características basada en ensambles y aumento mediante CTGAN redujo la complejidad del espacio de entrada y mitigó el desequilibrio de clases. En PH2, los mejores resultados alcanzaron un AUCROC de 0.860 con características manuales y de 0.872 con embeddings de imagen, mientras que en Derm7pt se obtuvieron valores máximos de 0.704 y 0.760, respectivamente. Además, el aumento progresivo de muestras sintéticas mejoró la separación entre clases en el espacio latente. Las características seleccionadas se relacionaron con propiedades clínicamente significativas, como geometría, color, textura y representaciones profundas de la apariencia visual. En el caso de los metadatos clínicos de baja dimensionalidad, LM-IGTD permitió transformar datos originalmente no espaciales en imágenes aptas para redes convolucionales. Aunque estos modelos no superaron de forma consistente a los mejores clasificadores tabulares clásicos en términos de AUCROC, sí alcanzaron un rendimiento competitivo y permitieron interpretar las predicciones mediante Grad-CAM, revelando señales clínicamente plausibles y posibles dependencias de variables contextuales.

Finalmente, el O4 confirmó el valor de la integración multimodal cuando se consideran imágenes dermoscópicas. En ISIC-2020 y PH2, los modelos multimodales igualaron o superaron al mejor modelo unimodal en cada conjunto de datos, correspondiente al modelo basado en imagen en ISIC-2020 (AUCROC = 0.858) y al modelo basado en características manuales en PH2 (AUCROC = 0.950). Los mejores resultados se obtuvieron con fusión temprana y doble selección de características, alcanzando valores de AUCROC de 0.873 en ISIC-2020 y 0.963 en PH2. El análisis basado en SHAP mostró que las modalidades no contribuyen de manera uniforme: algunas aportan muchas variables con efectos moderados, mientras que otras incorporan pocas variables individualmente muy informativas. Esta observación refuerza la utilidad de combinar imagen, metadatos y características manuales dentro de un marco multimodal interpretable.

CONCLUSIONES
Esta tesis presenta un marco metodológico para la identificación interpretable de melanoma a partir de datos dermatológicos heterogéneos. Las contribuciones desarrolladas abordan retos clave para la aplicación clínica de sistemas de AI en dermatología: la presencia de artefactos en imágenes dermatoscópicas, la iluminación no uniforme en fotografías macroscópicas, la dificultad de representar datos tabulares mixtos y la necesidad de integrar múltiples modalidades de forma transparente.

El preprocesamiento de imágenes resulta una etapa clínicamente relevante, no una mera operación técnica: la detección multi-etiqueta de artefactos, la eliminación digital de pelo y la mejora de iluminación generan entradas más fiables y reducen el riesgo de predicciones basadas en información espuria. Para los datos tabulares no existe una representación única: los descriptores de alta dimensionalidad se benefician de selección de características y aumento de datos, mientras que los metadatos de baja dimensionalidad pueden transformarse en imágenes preservando su interpretabilidad. Por último, la fusión multimodal confirma que combinar imágenes, metadatos y descriptores produce modelos más robustos que los enfoques unimodales, en línea con cómo los dermatólogos integran información visual y contextual.

A pesar de los resultados prometedores, la tesis presenta algunas limitaciones. Los experimentos se basan en conjuntos de datos públicos, algunos de tamaño reducido o adquiridos en condiciones controladas, lo que puede limitar la generalización a entornos clínicos reales. Además, los análisis muestran que los modelos pueden apoyarse parcialmente en variables contextuales no relacionadas con la morfología de la lesión, lo que refuerza la necesidad de auditar sesgos antes de su despliegue clínico. La cuantificación de la incertidumbre asociada a predicciones y explicaciones sigue siendo, asimismo, una línea necesaria.

Como líneas futuras, se plantea la validación prospectiva en escenarios clínicos reales, la estimación de incertidumbre, la mitigación de sesgos y la exploración de arquitecturas multimodales más avanzadas. Especialmente relevante es la integración conjunta de imágenes dermoscópicas y macroscópicas, hasta ahora estudiadas en objetivos separados, cuya combinación permitiría explotar el detalle estructural de la dermoscopia junto con la visión contextual de las imágenes clínicas. Resulta también prometedor trasladar todas las modalidades a un espacio común de representación en imagen y emplear modelos generativos, incluidos los de difusión, para mejorar el preprocesamiento, el aumento de datos y el modelado longitudinal de lesiones.

En conjunto, esta tesis aporta una base metodológica sólida, robusta e interpretable para futuros sistemas de AI de apoyo a la identificación temprana de melanoma.

 

 

Enlaces
Universidad Rey Juan Carlos
Escuela Internacional de Doctorado
Toda la actualidad de la EID
Agenda EID
Escuela Internacional de Doctorado
Universidad Rey Juan Carlos
Edificio de Rectorado
C/ Tulipán s/n
28933. Móstoles. Madrid
916655060
Buzón de Ayuda al Doctorando
Conecta con nosotros