Automatización de la Extracción de Datos en Revisiones Sistemáticas de la Literatura en Ingeniería del Software: promesas, dificultades y el papel de la supervisión humana

Ponente: Ignacio Marco Pérez (Grupo PSYCOTRIP, Universidad de La Rioja).

Lugar: Seminario Mirian Andrés (Edificio CCT).

Hora: martes 29 de septiembre de 2026, 11:00.

Resumen: Las Revisiones Sistemáticas de la Literatura (SLR, por sus siglas en inglés) constituyen una metodología fundamental para analizar el estado del arte en prácticamente todas las disciplinas científicas, en particular en Ingeniería del Software y sus diversos subdominios. A pesar de su indiscutible relevancia para el ámbito de la investigación, las SLR son procesos que requieren muchos recursos y que han dependido casi por completo del trabajo manual de los investigadores.

En los últimos años, algunos investigadores han comenzado a utilizar herramientas de Procesamiento del Lenguaje Natural (NLP, por sus siglas en inglés) para automatizar o facilitar algunas fases del proceso de las SLR, lo que plantea una pregunta importante: ¿hasta qué punto son eficaces estas herramientas para realizar tareas de esta complejidad?

En este trabajo, presentamos los resultados de un experimento diseñado específicamente para analizar esta cuestión, centrándonos en la fase de extracción de datos (una de las etapas cognitivamente más exigentes, que requiere más tiempo y es más propensa a errores del proceso de las SLR) dentro del contexto de la Ingeniería del Software.

Nota: se trata de un trabajo, realizado en colaboración con Ángel Luis Rubio y Beatriz Pérez, que fue presentado en la 52nd Euromicro Conference on Software Engineering and Advanced Applications (SEAA 2026), celebrado del 2 al 4 de septiembre de 2026 en Cracovia, Polonia, dentro del track SMSE, Systematic Literature Reviews and Mapping Studies in Software Engineering.