Tesis doctorales de la Escuela Internacional de Doctorado de la URJC desde el curso 2024/25
Generación de dato sintético en imagen de microscopía médica y su aplicación en la parametrización de sistemas de aprendizaje automático
Autor
HERNÁNDEZ FERRÁNDIZ, DANIEL
Director
CABIDO VALLADOLID, RAÚL
Codirector
PANTRIGO FERNÁNDEZ, JUAN JOSÉ
Fecha de depósito
08-07-2026
Periodo de exposición pública
8 a 22 de julio de 2026
Fecha de defensa
Sin especificar
Modalidad
Presencial
Programa
Tecnologías de la información y las Comunicaciones (TICs)
Mención internacional
No
Resumen
En esta tesis doctoral se propone una metodología basada en la generación de datos sintéticos para el desarrollo de sistemas automáticos de análisis de muestras espermáticas mediante técnicas de visión por computador y aprendizaje automático. Estos sistemas, conocidos como CASA (Computer-Aided Sperm Analysis), permiten automatizar la obtención de valores que determinan calidad seminal, como la concentración, la motilidad o la morfología de los espermatozoides presentes en la muestra. Estos valores se pueden obtener mediante tareas clásicas en el ámbito de la visión por computador como la detección de objetos, el seguimiento por detección o la clasificación de imágenes. Sin embargo, el desarrollo de estos sistemas que utilizan tecnologías basadas en aprendizaje profundo se encuentra limitado por la necesidad de disponer de grandes conjuntos de datos anotados, cuya obtención resulta costosa, laboriosa y dependiente de la intervención de expertos. En este contexto, se plantea la utilización de imágenes sintéticas para su entrenamiento. En consecuencia, la hipótesis de trabajo que se plantea en esta tesis doctoral consiste en que "la generación de datos sintéticos realistas de muestras espermáticas permite entrenar y parametrizar modelos de aprendizaje automático capaces de realizar tareas de análisis espermático, tales como la detección, el seguimiento o la clasificación de espermatozoides, reduciendo significativamente la dependencia de datos reales anotados manualmente".
Los modelos de aprendizaje profundo y en particular los detectores de objetos basados en redes neuronales convolucionales, han demostrado un rendimiento notable en tareas de visión por computador. Sin embargo, estos métodos requieren de grandes cantidades de dato etiquetado, lo que en el ámbito del análisis microscópico supone un cuello de botella significativo, ya que cada imagen microscópica puede contener cientos de células que deben ser anotados individualmente. Por otro lado, en la literatura se han propuesto diferentes enfoques para la generación de datos sintéticos en este contexto, incluyendo modelos generativos adversarios (GANs) y modelos de difusión. El problema de estos métodos es que también requieren de un entrenamiento a partir de conjuntos de datos reales grandes y no ofrecen control total sobre las características de las imágenes generadas. En este escenario, resulta necesario disponer de metodologías que permitan generar datos sintéticos realistas, controlables y adaptables a distintos dominios, de forma que sean aprovechables para entrenar sistemas capaces de extraer métricas relevantes de los datos.
El problema fundamental que se plantea en este contexto es determinar si es posible utilizar modelos de generación de datos sintéticos para construir conjuntos de datos artificiales que permitan entrenar sistemas de visión por computador aplicados al análisis de muestras espermáticas. Además, en el caso de ser posible, se pretende analizar hasta qué punto estos datos sintéticos pueden complementar o sustituir a los datos reales en el proceso de entrenamiento de sistemas capaces de obtener resultados de calidad de esperma. Por este motivo, el objetivo fundamental de este trabajo de tesis ha sido "determinar si el uso de datos sintéticos puede facilitar el desarrollo de sistemas automáticos de análisis de muestras espermáticas basados en técnicas de visión por computador y aprendizaje automático".
Para dar respuesta al problema planteado, se ha desarrollado un modelo paramétrico para la generación de dato sintético espermático que contempla de forma explícita los principales aspectos de las imágenes microscópicas a tratar, incluyendo la morfometría y morfología de las células, la presencia de detritos, las condiciones del fondo y la variabilidad visual entre dominios. Este modelo se ha implementado en una herramienta de código abierto denominada AndroGen, que permite generar conjuntos de datos sintéticos con anotaciones automáticas a través de una interfaz gráfica, con configuraciones predefinidas para diferentes especies. Sobre este modelo, se ha tratado la optimización automática de estos parámetros mediante estrategias metaheurísticas, guiando el ajuste con métricas de similitud visual entre imágenes sintéticas y imágenes reales de referencia. Finalmente, este modelo se ha validado como método de entrenamiento de modelos empleados en sistemas CASA para la extracción de métricas relevantes, en particular detección y seguimiento de espermatozoides. Para realizar esta validación, los modelos se han entrenado con tan solo datos sintéticos y su evaluación se realiza sobre diferentes conjuntos de datos reales.
Este enfoque se ha evaluado en tres conjunto de datos de referencia (BOSS, SVIA y VISEM), comprobando primero que la optimización automática de parámetros mediante metaheurísticas mejora de forma consistente las métricas de similitud visual frente a configuraciones manuales ajustadas por un experto. Usando configuraciones optimizadas de los parámetros del modelo, se generan conjuntos de datos sintéticos equivalentes a cada uno de los dominios de referencia y se entrenan modelos únicamente con dato sintético. Estos modelos son evaluados sobre imágenes reales, mostrado un rendimiento competitivo en tareas clave de sistemas CASA: en detección se ha alcanzado un mAP = 86,0 %, equivalente al obtenido con aproximadamente 8800 anotaciones manuales, y en seguimiento se han obtenido valores de MOTA competitivos. Además, se ha conseguido optimizar el sistema completo de evaluación de vídeos con tiempos de procesamiento inferiores a 4 segundos por secuencia en un hardware de propósito general. En conjunto, estos resultados respaldan que el dato sintético puede ser una alternativa al dato real para el entrenamiento de sistemas automáticos de análisis espermático.