Automatización de la Extracción de Datos en Revisiones Sistemáticas de la Literatura en Ingeniería del Software: promesas, dificultades y el papel de la supervisión humana

Ponente: Ignacio Marco Pérez (Grupo PSYCOTRIP, Universidad de La Rioja).

Lugar: Seminario Mirian Andrés (Edificio CCT).

Hora: martes 29 de septiembre de 2026, 11:00.

Resumen: Las Revisiones Sistemáticas de la Literatura (SLR, por sus siglas en inglés) constituyen una metodología fundamental para analizar el estado del arte en prácticamente todas las disciplinas científicas, en particular en Ingeniería del Software y sus diversos subdominios. A pesar de su indiscutible relevancia para el ámbito de la investigación, las SLR son procesos que requieren muchos recursos y que han dependido casi por completo del trabajo manual de los investigadores.

En los últimos años, algunos investigadores han comenzado a utilizar herramientas de Procesamiento del Lenguaje Natural (NLP, por sus siglas en inglés) para automatizar o facilitar algunas fases del proceso de las SLR, lo que plantea una pregunta importante: ¿hasta qué punto son eficaces estas herramientas para realizar tareas de esta complejidad?

En este trabajo, presentamos los resultados de un experimento diseñado específicamente para analizar esta cuestión, centrándonos en la fase de extracción de datos (una de las etapas cognitivamente más exigentes, que requiere más tiempo y es más propensa a errores del proceso de las SLR) dentro del contexto de la Ingeniería del Software.

Nota: se trata de un trabajo, realizado en colaboración con Ángel Luis Rubio y Beatriz Pérez, que fue presentado en la 52nd Euromicro Conference on Software Engineering and Advanced Applications (SEAA 2026), celebrado del 2 al 4 de septiembre de 2026 en Cracovia, Polonia, dentro del track SMSE, Systematic Literature Reviews and Mapping Studies in Software Engineering.

Evaluating and Improving DM in UDP Development Research Projects

Ponente: Ignacio Marco Pérez (Grupo PSYCOTRIP, Universidad de La Rioja).

Lugar: Seminario Mirian Andrés (Edificio CCT).

Hora: viernes 20 de febrero de 2026, 11:30.

Resumen: Urban Data Platforms (UDPs) are key enablers of data-driven governance in smart cities, yet their validation and evaluation (particularly regarding data management practices) remain underexplored in research projects that involve their development or use. This study assesses data management maturity in two European smart city initiatives, CITyFiED and SmartEnCity, both aimed at supporting energy efficiency and climate neutrality through UDP development. Using the Alarcos’ Model for Data Improvement (MAMD v4.0), a process-based maturity framework aligned with international data management standards, we conducted a triangulated analysis combining project documentation review, expert interviews, and technical artifact inspection.

The results reveal a decreasing level of commitment at higher maturity stages, with operational data management outperforming data quality and governance processes. While incremental improvements between projects indicate experiential learning, persistent weaknesses were identified in metadata management, data quality strategies, and governance mechanisms. The study has demonstrated the applicability of organizational data maturity models to research-oriented, time-bounded environments and provides insights for strengthening data management practices in future smart city R&D projects.

Nota: La charla es una prueba de tiempo de la ponencia que presentará Ignacio en la 20th International Conference on Computer Aided Systems Theory (Eurocast 2026) que se celebrará en Las Palmas de Gran Canaria del 23 al 27 de febrero. 

Entonces, ¿cuándo uso DISTINCT en mis consultas SQL?

Ponente: Ignacio Marco Pérez (Grupo PSYCOTRIP, Universidad de La Rioja).

Lugar: Seminario Mirian Andrés (Edificio CCT).

Hora: lunes 2 de junio de 2025, 13:00.

Resumen: La palabra clave DISTINCT en SQL se emplea para eliminar filas duplicadas y obtener o considerar una lista única de valores. Sin embargo, su uso encierra en ocasiones mayor dificultad de lo que podría parecer a priori.

En esta charla se presentarán algunos de los retos asociados a su uso, así como un intento exploratorio de sistematización para el descubrimiento de tuplas duplicadas en los resultados de consultas SQL. El enfoque propuesto en este segundo caso consiste en el análisis de los nodos fuente del grafo asociado al esquema relacional derivado de las reuniones o JOINs de las tablas implicadas en la consulta, atendiendo a las relaciones consideradas entre ellas en la propia consulta.