scieee AI-readable full text Open interactive document viewer

Uso de la IA en la actualización del estado de edificaciones aisladas incluidas en el Nomenclátor Geográfico de Andalucía

Martínez Gómez, Natalia

Abstract

El Nomenclátor Geográfico de Andalucía (NGA) es una base de datos toponímica que recoge más de 245.000 entidades geográficas del territorio andaluz. En los últimos años, un estudio ha evidenciado que muchas edificaciones rurales aisladas han experimentado un deterioro progresivo en su uso, siendo abandonadas, demolidas o sustituidas por otras con denominaciones distintas, sin que estos cambios se reflejen de forma ágil y precisa en el campo relativo al estatus del inmueble en el registro. En un contexto de creciente integración entre inteligencia artificial (IA) y Sistemas de Información Geográfica (SIG), este estudio propone una metodología innovadora para optimizar los procesos de actualización del NGA mediante automatización inteligente. La investigación se ha desarrollado en dos fases: una prueba piloto sobre una muestra de 285 edificaciones rurales registradas en el NGA, y una validación sobre una muestra independiente de 959 entidades. Como datos de entrada se han empleado ortofotografías aéreas del Plan Nacional de Ortofotografía Aérea (PNOA) y la información alfanumérica del propio NGA. La metodología se ha implementado en entornos SIG mediante automatización de tareas en Python asistida por IA. Se han aplicado tres enfoques diferenciados, dos basados en IA, y otro convencional: i) análisis de imágenes mediante modelos de lenguaje de gran tamaño (LLMs); ii) detección de huellas de edificación mediante modelos de aprendizaje profundo preentrenados; y iii) geoprocesamiento SIG sobre información catastral. Los resultados, evaluados según la tasa de acierto y la desviación estándar por categorías, muestran un rendimiento significativamente superior de los métodos basados en IA frente a las técnicas tradicionales. El análisis multicriterio y la validación sobre una muestra independiente confirman la eficacia de la combinación de enfoques, con tasas de acierto por categoría superiores al 93,2%, una desviación estándar del 2,7% y una tasa global de acierto del 97,8%. Estos resultados refuerzan el potencial de la IA para desarrollar soluciones más escalables y transferibles a otros contextos del NGA.

Full text

i i Equation Chapter 1 Section 1 Trabajo Fin de Grado en Ingeniería Civil Uso de la IA en la actualización del estado de edificaciones aisladas incluidas en el Nomenclátor Geográfico de Andalucía Autora: Natalia Martínez Gómez Tutores: Cristina Torrecillas Lozano Francisco Jesús Ramos Sánchez Dpto. Ingeniería Gráfica Escuela Técnica Superior de Ingeniería Universidad de Sevilla Sevilla, 2025 iii Trabajo Fin de Grado en Ingeniería Civil Uso de la IA en la actualización del estado de edificaciones aisladas incluidas en el Nomenclátor Geográfico de Andalucía Autora: Natalia Martínez Gómez Tutores: Cristina Torrecillas Lozano Profesora Titular de Universidad Francisco Jesús Ramos Sánchez Profesor Sustituto Interino Dpto. de Ingeniería Gráfica Escuela Técnica Superior de Ingeniería Universidad de Sevilla Sevilla, 2025 v Trabajo Fin de Grado: Uso de la IA en la actualización del estado de edificaciones aisladas incluidas en el Nomenclátor Geográfico de Andalucía Autora: Natalia Martínez Gómez Tutores: Cristina Torrecillas Lozano Francisco Jesús Ramos Sánchez El tribunal nombrado para juzgar el Proyecto arriba indicado, compuesto por los siguientes miembros: Presidente: Vocales: Secretario: Acuerdan otorgarle la calificación de: Sevilla, 2025 El Secretario del Tribunal vii A mi madre y a mi padre ix Agradecimientos Este Trabajo de Fin de Grado representa el cierre de una etapa que, después de explorar otros rumbos, llega en el momento justo. Quiero agradecer a Cristina y a Paco la oportunidad de trabajar en un proyecto innovador, interesante y con el que he aprendido y disfrutado. A mis padres, su apoyo en momentos de incertidumbre y cambio. Habéis sabido acompañarme en caminos que no estaban planeados, hasta llegar a donde siempre pensamos. A mis amigas y amigos, el haber compartido conmigo este proceso. En especial a María, con la que empecé este grado, y que me ha acompañado hasta el final; a Manuela, que ha sido mi alegría durante los años en Sevilla; a Eli, el ser una inspiración constante, tanto académica como personal; a Julio, la confianza que siempre ha tenido en mí. Si no hubieras estado cerca, no sé si habría llegado hasta aquí. Y a Betan, contigo me sobran las palabras. Todo lo que he conseguido tiene mucho que ver con que estés a mi lado. Natalia Huelva, 2025 4 Resultados de la prueba piloto (Fase 1) 24 4.1 Consideraciones generales 24 4.2 Resultados del Método 1: Análisis LLM 27 4.3 Resultados del Método 2: Modelo DL 30 4.4 Resultados del Método 3: Análisis catastral 34 4.5 Combinación de resultados y comparativa: Análisis multicriterio 38 4.6 Discusión 40 5 Marco metodológico de la validación (Fase 2) 43 5.1 Criterios de validación y mejora de la metodología 43 5.2 Datos de entrada y ajustes en el preprocesamiento 44 5.2.1 Selección de muestra independiente 44 5.2.2 Preprocesado de datos 45 5.2.3 Etiquetado de la muestra 46 5.3 Metodología aplicada en la validación 47 5.3.1 Método 1 revisado: Análisis LLM 47 5.3.2 Método 2 revisado: Modelo DL 48 6 Resultados de la validación (Fase 2) 49 6.1 Consideraciones generales 49 6.2 Resultados del Método 1 revisado: LLM 49 6.3 Resultados del Método 2 revisado: DL 50 6.4 Combinación de resultados y comparativa: Análisis multicriterio revisado 52 6.5 Discusión 53 7 Conclusiones 55 Referencias 58 xvii Índice de Tablas Tabla 1. Códigos geográficos seleccionados (CODGEO), número de entidades y extensión de áreas de influencia (BBox) 14 Tabla 2. Criterios de análisis de imágenes mediante Gemini 1.5 Flash 20 Tabla 3. Decisión del estado de las edificaciones rurales aisladas en el Método 1 20 Tabla 4. Parámetros del modelo Building Footprint Extraction - USA 21 Tabla 5. Decisión del estado de las edificaciones rurales aisladas en los Métodos 2 y 3: análisis comparativo de geometrías según criterio existencia de edificación 22 Tabla 6. Decisión del estado de las edificaciones rurales aisladas en los Métodos 2 y 3: análisis comparativo de geometrías según criterio diferencia de superficie entre edificaciones anteriores y actuales 22 Tabla 7. Decisión del estado de las edificaciones rurales aisladas por inspección visual 24 Tabla 8. Resultados Método 1 28 Tabla 9. Resultado general Método 1 30 Tabla 10. Resultados Método 2: existencia de edificación 32 Tabla 11. Resultados Método 2: diferencia de superficies 33 Tabla 12. Resultado general Método 2 33 Tabla 13. Resultados Método 3: existencia de edificación 36 Tabla 14. Resultados Método 3: diferencia de superficies 37 Tabla 15. Resultado general Método 3 38 Tabla 16. Resultados análisis multicriterio 39 Tabla 17. Resultado general análisis multicriterio y comparación con Métodos 1,2 y 3 40 Tabla 18. Códigos geográficos seleccionados (CODGEO), número de entidades y extensión de áreas de influencia (BBox) de la muestra independiente 46 Tabla 19. Decisión del estado de las edificaciones rurales aisladas por inspección visual sobre muestra independiente 46 Tabla 20. Criterios de análisis de imágenes mediante Gemini 1.5 Flash (Método 1 revisado) 47 Tabla 21. Decisión del estado de las edificaciones rurales aisladas bajo el criterio existencia de edificación (Método 2 revisado) 48 Tabla 22. Resultados Método 1 revisado 50 Tabla 23. Resultados Método 2 revisado 51 Tabla 24. Análisis de complementariedad: Aciertos totales Método 1 revisado y Método 2 revisado 53 xix Índice de Figuras Figura 1. Buscador de Nombres Geográficos del portal IDEAndalucía (URL: https://www.ideandalucia.es/- nomenclator/buscador.jsp?lang=esp, accedido el 24 de junio de 2025) [18] 4 Figura 2. Modelo de datos del NGA v.1 11 Figura 3. Captura de pantalla del Modelo NGA en formato Microsoft Access mostrando la tabla NGA_NOMENT 11 Figura 4. Preprocesamiento de datos de entrada y metodología (Fase 1) 17 Figura 5. Localización del área de estudio (Fase 1): a) Comunidad Autónoma de Andalucía; b) Municipios seleccionados para muestra piloto; y c), d) y e) Edificaciones rurales aisladas por municipio 18 Figura 6. Entidad clasificada como activo mediante inspección visual: edificación en buen estado y señales de actividad 25 Figura 7. Entidad clasificada como desaparecido o ruina mediante inspección visual: no se observa edificación 25 Figura 8. Entidad clasificada como incidencia mediante inspección visual: tejados parcialmente derruidos en conjunto edificado 26 Figura 9. Entidad clasificada como incidencia mediante inspección visual: edificación en ruinas junto a edificación en uso 26 Figura 10. Modelo de archivo de salida CSV para los tres criterios de análisis de imágenes mediante LLM 27 Figura 11. Ejemplo de falso positivo: entidad en uso clasificada erróneamente como desaparecido o ruina por el Método 1 28 Figura 12. Ejemplo de coincidencia con inspección visual: estado clasificado correctamente como incidencia por el Método 1 (tejados parcialmente derruidos en conjunto edificado) 29 Figura 13. Ejemplo de falso positivo: estado incidencia por inspección visual (entidad en ruinas junto a entidad íntegra) clasificado como desaparecido o ruina por el Método 1 29 Figura 14. Ejemplo de detección de estado activo (ambos criterios): huellas de edificación generadas en ambas imágenes 30 Figura 15. Ejemplo de omisión de edificación en el proceso de vectorizado 31 Figura 16. Ejemplo de generación de huella sobre una ruina 31 Figura 17. Ejemplo de información vectorial registrada en el Catastro: detección de estado activo (ambos criterios) 34 Figura 18. Ejemplo de inexistencia de registro en el Catastro de una entidad del NGA 35 Figura 19. Ejemplo de entidad registrada en el Catastro actualmente desaparecida 35 Figura 20. Ejemplo de detección de estado desaparecido o ruina por diferencia de superficies: error por mayor número de geometrías (o entidades registradas) en Catastro histórico que en actual 37 Figura 21. Preprocesamiento de datos de entrada y metodología (Fase 2) 43 Figura 22. Localización del área de estudio (Fase 2): a) Comunidad Autónoma de Andalucía; b) Municipios seleccionados para muestra independiente 45 Figura 23. Modelo de archivo de salida CSV (Método 1 revisado) 50 Figura 24. Ejemplos de acierto de estados activo en el Método 2 revisado: el modelo genera geometría 51 Figura 25. Ejemplos de falso positivo en la categoría desaparecido o ruina en el Método 2 revisado: el modelo no genera geometría 52 1 1 INTRODUCCIÓN En este capítulo se presenta el estudio realizado, contextualizando su desarrollo y fundamentando el interés científico que lo respalda. A continuación, se expone el Nomenclátor Geográfico de Andalucía (NGA) como objeto central de análisis, ofreciendo una descripción detallada de sus características. Finalmente, se revisa el estado del arte sobre la aplicación de técnicas de inteligencia artificial (IA) en el ámbito de los Sistemas de Información Geográfica (SIG), marco en el que se inscribe esta propuesta. 1.1 Contextualización y justificación del estudio La Comunidad Autónoma de Andalucía es la entidad territorial más meridional de España y la segunda en extensión, con una superficie de 87.597 km² repartidos en ocho provincias. La gestión toponímica en esta administración ha estado tradicionalmente vinculada a la cartografía y, consecuentemente, al Instituto de Estadística y Cartografía de Andalucía (IECA) [1]. Desde 1985, la toponimia ha evolucionado desde su integración en mapas analógicos en papel hasta convertirse en un conjunto de datos prioritario conforme al Anexo I de la Directiva europea INSPIRE [2]. Los avances tecnológicos en la adquisición y tratamiento de datos toponímicos, junto con su integración en la cartografía digital y en la Infraestructura de Datos Espaciales de Andalucía (IDEAndalucía) [3], han contribuido significativamente a establecer acciones claras de inventario, normalización y difusión de nombres geográficos, competencias fundamentales que el Decreto autonómico 141/2006, que regula la actividad cartográfica en Andalucía, atribuye al IECA [4]. Cabe destacar que, en 2007, la IX Conferencia de las Naciones Unidas sobre la Normalización de los Nombres Geográficos reconoció el valor de la toponimia como patrimonio cultural inmaterial. Por ello, y siguiendo esta línea, desde el IECA se busca fomentar el conocimiento, el uso y la revitalización de la toponimia andaluza como patrimonio de gran interés para el conocimiento científico y emotivo del territorio [5]. En este marco, se han desarrollado diversas iniciativas que han dado lugar a que el Nomenclátor Geográfico de Andalucía (NGA) sea la base de datos toponímica más completa de la región. El NGA nació con la finalidad de almacenar y gestionar los nombres geográficos o topónimos andaluces y, a este respecto, se ha convertido en la base de datos de referencia en el territorio [1]. En los últimos años, una comparación con el Nomenclátor Geográfico Básico de España [6] ha puesto de manifiesto que muchas edificaciones aisladas en entornos rurales han sufrido un deterioro progresivo en su uso desde su adquisición inicial. Estas construcciones, normalmente asociadas a topónimos, eran conocidas por la Introducción 2 población local y se empleaban como puntos de referencia en épocas previas al uso extendido del GPS. Su actualización, que implica reflejar su cambio de tipología (de edificaciones activas a ruinas o desaparición total), suele llevarse a cabo de forma visual, coincidiendo con el proceso de actualización de las hojas cartográficas 1:10.000 por parte del IECA [7]. Este procedimiento es lento y, depende tanto de la interpretación humana como de la resolución de las imágenes disponibles. De este modo, se detecta la necesidad de desarrollar metodologías que permitan optimizar los recursos disponibles y agilizar el mantenimiento y actualización del NGA, lo que, junto a las labores de normalización y difusión que realiza el IECA [8], contribuye a garantizar la conservación y puesta en valor de la toponimia como patrimonio inmaterial. Por otro lado, resulta imprescindible señalar que en los últimos años la inteligencia artificial (IA) ha supuesto una revolución tecnológica en todos los sectores. El campo de los Sistemas de Información Geográfica (SIG) no se ha quedado atrás, y son numerosos los trabajos que exploran la integración de los SIG con la IA en temas como clasificación de imágenes, detección de objetos, mapeo de cobertura terrestre, predicción del crecimiento urbano o respuesta ante catástrofes, destacando su gran potencial para el manejo y análisis de grandes volúmenes de datos espaciales [9], [10]. La disciplina resultante de esta integración se conoce como Inteligencia Artificial Geoespacial o GeoAI, y consiste en la adaptación de técnicas de IA tradicionales como Machine Learning (ML) y Deep Learning (DL) a las particularidades de los datos geoespaciales [9]. Asimismo, a las técnicas de IA tradicionales se ha sumado la conocida como Inteligencia Artificial Generativa (IAG), centrada en el procesamiento del lenguaje natural a partir de modelos de lenguaje de gran tamaño (Large Language Models o LLMs), que es capaz de generar contenido nuevo y realista semejante al creado por los humanos [11]. La IAG también está siendo integrada en el trabajo con SIG, donde técnicas de Procesamiento de Lenguaje Natural (PLN) están siendo testadas en la interpretación de las intenciones de los usuarios (prompts) y su traducción en operaciones SIG específicas, dando lugar a una democratización de tareas especializadas [11], [12]. En este contexto, cabe preguntarse si los avances en inteligencia artificial pueden ofrecer herramientas capaces de afrontar los desafíos que plantea la actualización del Nomenclátor Geográfico de Andalucía, abriendo así posibilidades para una gestión más eficiente y automatizada de la toponimia. 1.2 El Nomenclátor Geográfico de Andalucía El Nomenclátor Geográfico de Andalucía (NGA) es una infraestructura geográfica esencial dentro del Sistema Cartográfico de Andalucía, gestionada por el Instituto de Estadística y Cartografía de Andalucía (IECA). Se trata de un conjunto de bases de datos normalizadas que recopilan, organizan y gestionan los nombres geográficos o topónimos del territorio. Su estructura y funcionamiento están alineados con los estándares, recomendaciones y normativas vigentes a nivel nacional y europeo, en especial con lo establecido por la Directiva INSPIRE [1], [2]. Los topónimos se usan para elaboración de mapas, censos de población, estudios geográficos, léxico-semánticos, dialectológicos o históricos, y sirven como identificadores geográficos en la búsqueda de información por geolocalización [8]. Asimismo, la consideración de la toponimia como patrimonio inmaterial abre nuevos horizontes e interesantes perspectivas para la cooperación multidisciplinar y para una mejor comprensión y 3 Uso de la IA en la actualización del estado de edificaciones aisladas incluidas en el Nomenclátor Geográfico de Andalucía valoración del territorio [13]. La cronología del proyecto se remonta a 1985, con la elaboración del primer inventario toponímico de Andalucía [14]. Ante la ausencia de una base cartográfica oficial regional de cobertura completa, se recurrió a fuentes cartográficas y documentales de otras administraciones estatales, logrando recopilar más de 120.000 topónimos. Este trabajo dio lugar a la “Base de Datos de Toponimia Andaluza 1:50.000” (BTA50), que mejoró la georreferenciación de los registros. Posteriormente, la experiencia adquirida se integró en el proceso de vectorización de la “Cartografía Topográfica de Andalucía 1:10.000” (MTA10) [7], con un corpus toponímico que alcanzó aproximadamente 150.000 entidades registradas. El MTA10, como cartografía oficial detallada de todo el territorio andaluz, se constituyó como la fuente básica del NGA. Además, dado que el NGA está concebido como un registro dinámico, se ha ido enriqueciendo con otras fuentes de datos cartográficas, documentales y orales, lo que ha permitido tanto la incorporación de datos omitidos en la fuente principal como el desarrollo de bases de datos temáticas o especializadas. Entre las fuentes complementarias destacan la Base de Datos Catastral Rústica y el Nomenclátor Geográfico Básico de España (NGBE) [15]. A este respecto, diversos estudios han destacado específicamente la relevancia del Catastro como fuente de información geoespacial al favorecer tanto la coordinación entre registros como el análisis territorial [16], [17]. De este modo, el proceso de incorporación o inventario de toponimia del NGA se basa en la reutilización de bases de datos cartográficas o georreferenciadas procedentes de distintas entidades autonómicas, locales o estatales. Una vez recopilados, los nombres se normalizan, se coordinan con otros productos geoespaciales y se publican. Esta reutilización enriquece el NGA, aunque también da lugar a complicaciones relacionadas con diferencias en la precisión de las localizaciones, denominaciones no normalizadas, diversidad de la clasificación temática o del nivel de detalle de las entidades. Del mismo modo, la falta de persistencia de identificadores únicos en las bases reutilizadas puede dificultar la vinculación y actualización de los datos. Por ello, la labor de normalización resulta imprescindible para resolver problemas de ambigüedad y definir relaciones estables entre los identificadores únicos del NGA y los de otras bases de datos, lo cual es esencial para su integración en Sistemas de Información Geográfica (SIG) e Infraestructuras de Datos Espaciales (IDE) [1], [8], [15]. En 2013, el NGA fue adaptado al modelo INSPIRE [2], y se habilitó un servicio web para la búsqueda de nombres geográficos (véase Figura 1), junto con un servicio de visualización cartográfica y dos servicios WFS (Web Feature Service), garantizando tanto la difusión general de los datos toponímicos como la interoperabilidad del servicio. De esta forma, el proyecto del NGA normaliza y simplifica los procesos de inventario, normalización y difusión de la toponimia andaluza al concentrarlos en una única base de datos, gestionada por un único responsable y accesible desde distintas aplicaciones del Sistema Cartográfico de Andalucía [1]. Actualmente, el NGA ha evolucionado hasta convertirse en una base de datos con más de 245.000 entidades recopiladas, de las cuales aproximadamente 230.000 están publicadas. Cuenta con georreferenciación en el sistema geodésico ETRS89 y proyección UTM, con una precisión de 10 metros. Su clasificación temática se Introducción 4 articula en más de 400 códigos geográficos, distribuidos en más de 40 tipos de entidades agrupadas en ocho grandes clases temáticas: Actividad industrial, Área administrativa, Entidad de población, Hidrografía, Infraestructuras, Medio físico terrestre y marino, Patrimonio y Servicios. Además, incorpora otros atributos de interés geográfico como la fuente del topónimo, el estado de normalización (oficial, normalizado, no normalizado o no disponible), identificadores únicos vinculados a otras bases de datos, fecha de inserción, localización principal o incidencias de nomenclatura que permiten consultar estudios previos relacionados con la entidad [8]. Figura 1. Buscador de Nombres Geográficos del portal IDEAndalucía (URL: https://www.ideandalucia.es/- nomenclator/buscador.jsp?lang=esp, accedido el 24 de junio de 2025) [18] Como se ha destacado, el NGA es una geodatabase de datos dinámica que se ha ido enriqueciendo a partir de nuevas fuentes, las cuales han contribuido a resolver incidencias sobre denominación o localización. Sin embargo, el NGA presenta limitaciones en cuanto a la agilidad de los procesos de actualización. La incorporación de nuevas entidades o la revisión del estado de las ya existentes depende de recursos humanos y técnicos limitados, así como de la calidad de las fuentes externas. Esta situación dificulta la adecuada representación de los cambios recientes en el territorio y pone de manifiesto la necesidad de mejorar los mecanismos de mantenimiento y revisión continua del NGA. En consecuencia, la necesidad de actualización constante abre la puerta a enfoques metodológicos innovadores que complementen las estrategias actuales y optimicen su eficiencia. 5 Uso de la IA en la actualización del estado de edificaciones aisladas incluidas en el Nomenclátor Geográfico de Andalucía 1.3 Inteligencia artificial aplicada a los SIG 1.3.1 Aproximación a la inteligencia artificial en el contexto geográfico La inteligencia artificial (IA), en especial el Machine Learning (ML) o Aprendizaje Automático y el Deep Learning (DL) o Aprendizaje Profundo, son tecnologías emergentes que han demostrado un gran potencial para mejorar los SIG. De forma general, la inteligencia artificial implica el desarrollo de sistemas capaces de simular procesos cognitivos humanos, como el razonamiento, el aprendizaje, la percepción o la toma de decisiones [19]. Dentro de este campo, el ML constituye un subcampo enfocado en el diseño de algoritmos capaces de aprender patrones a partir de datos sin necesidad de ser explícitamente programados para cada tarea [9], [10]. A su vez, el DP representa una subárea del ML que emplea arquitecturas de redes neuronales profundas para modelar relaciones complejas y resolver problemas en grandes volúmenes de datos, especialmente en contextos donde la información es no estructurada o de alta dimensionalidad, como imágenes, texto o series temporales [9], [19]. La creciente integración entre la IA y los SIG ha dado lugar a una nueva disciplina conocida como Inteligencia Artificial Geoespacial o GeoAI, que se define como la aplicación de técnicas propias de IA, ML y DL al análisis de datos geoespaciales, incorporando además herramientas computacionales avanzadas como Big Data, computación en la nube, grafos de conocimiento o técnicas de análisis semántico aplicadas a datos espaciales, con el objetivo de extraer conocimiento útil, identificar patrones espaciales y temporales, y apoyar la toma de decisiones en contextos territoriales [20]. GeoAI permite abordar problemas complejos como la clasificación del uso del suelo, la detección de cambios en el territorio, la predicción de fenómenos ambientales, la planificación urbana o la gestión de recursos naturales. A este respecto, el aprendizaje profundo ha cobrado especial relevancia, ya que ha puesto el foco en tareas de análisis automatizado de imágenes geoespaciales, facilitando la identificación de elementos del territorio y contribuyendo a mejorar la precisión y agilidad en procesos como la detección de objetos o el monitoreo de transformaciones en el paisaje [21], [22]. Entre las fuentes de datos que alimentan los modelos de GeoAI se encuentran las imágenes satelitales, los datos LIDAR, las redes sociales geolocalizadas y los sensores IoT (en inglés, Internet of Things) [9], [10], [19]. Además, la GeoAI se apoya en infraestructuras computacionales de alto rendimiento y en bibliotecas especializadas para el procesamiento de grandes volúmenes de datos espaciales, lo que ha permitido escalar su aplicación a nivel global [19]. No obstante, la integración entre la IA y los SIG todavía tiene por delante importantes desafíos como la escasa incorporación de propiedades espaciales explícitas en los modelos, la dificultad para manejar datos multiescalares o la necesidad de desarrollar modelos más interpretables y transparentes [20], [23]. Adicionalmente, cabe destacar como en los últimos años la inteligencia artificial generativa (IAG) ha emergido como una subdisciplina de la IA con un notable potencial para transformar la forma en que se genera, comunica y visualiza el conocimiento geoespacial. Esta tecnología se basa en modelos de lenguaje de gran tamaño (Large Language Models o LLMs) entrenados con grandes volúmenes de texto y código, que son capaces de Datos de entrada 12 El programa gestor del NGA, el MNGA, permite exportaciones a tabla simple, o copiado del modelo PostgreSQL en formato de Microsoft Access. Para este estudio, se ha utilizado una exportación completa en formato Access (véase Figura 3) que incluye todas las tablas del modelo y mantiene las relaciones de integridad referencial. Esta exportación ha sido facilitada por el IECA en respuesta a una petición sobre las entidades aisladas del NGA. Esta base de datos ha servido como punto de partida para la selección y análisis de las edificaciones rurales aisladas registradas en el NGA que componen la muestra. 2.2 Plan Nacional de Ortofografía Aérea El Plan Nacional de Ortofotografía Aérea (PNOA) [34] es una iniciativa cooperativa de las administraciones públicas, tanto a nivel estatal como autonómico, enmarcada dentro del Plan Nacional de Observación del Territorio. Su objetivo principal es la obtención periódica de ortofotografías aéreas digitales que cubran la totalidad del territorio español. El PNOA constituye una de las principales fuentes de información geoespacial en España, especialmente en el ámbito de la cartografía oficial, al que dota de imágenes aéreas homogéneas, actualizadas y de alta resolución esenciales para el estudio de las dinámicas territoriales y las transformaciones espaciales. El proyecto se puso en marcha en 2004, con un ciclo de actualización trienal que ha garantizado una cobertura continua del territorio. Desde 2009, se estructura en dos grandes líneas de trabajo: PNOA Imagen, centrado en la obtención de ortofotografías aéreas mediante vuelos fotogramétricos; y PNOA LIDAR, orientado a la captura de datos altimétricos mediante sensores láser aerotransportados. En el marco de este estudio, el interés se centra en PNOA Imagen, que proporciona ortofotografías digitales generadas a partir de vuelos ejecutados bajo especificaciones técnicas normalizadas. Estas imágenes constituyen una fuente clave para el análisis geoespacial, ya que permiten observar con precisión la configuración del territorio en distintos momentos temporales, facilitando la detección de cambios en elementos como edificaciones, usos del suelo o infraestructuras. Desde sus inicios, el proyecto ha experimentado mejoras técnicas significativas. Las primeras ortofotos ofrecían una resolución de 0,45 metros por píxel, que fue sustituida por una resolución estándar de 0,25 metros a partir de 2017, alcanzando los 0,15 metros en campañas más recientes. Por otra parte, durante los primeros años los vuelos se realizaban de forma parcial y progresiva, ofreciendo una cobertura limitada del territorio español y restringiendo su uso en estudios comparativos a gran escala. No obstante, desde 2013 el PNOA garantiza una cobertura completa y sistemática de todo el territorio nacional en cada ciclo, consolidándose como una fuente de referencia en análisis territorial. La información del PNOA es accesible mediante dos servicios web de visualización: Ortofotos PNOA Máxima Actualidad, que proporciona los mosaicos más recientes; y Ortofotos Históricas y PNOA Anual, que permite consultar los vuelos realizados desde 2004. Ambos servicios están disponibles mediante protocolos estándar (WMS y WMTS), lo que asegura su integración en plataformas SIG como QGIS o ArcGIS. Esta interoperabilidad convierte al PNOA en una herramienta esencial para estudios de evolución territorial. 13 Uso de la IA en la actualización del estado de edificaciones aisladas incluidas en el Nomenclátor Geográfico de Andalucía 2.3 Catastro El Catastro [35] es un registro administrativo gestionado por la Dirección General del Catastro, un organismo dependiente del Ministerio de Hacienda. Su función principal es la descripción de los bienes inmuebles rústicos, urbanos y de características especiales en todo el territorio nacional, con excepción de Navarra y el País Vasco. Aunque su finalidad está orientada principalmente a la gestión fiscal, al servir de base para tributos como el Impuesto sobre Bienes Inmuebles (IBI), su utilidad se extiende a numerosos ámbitos administrativos y técnicos. El Catastro mantiene relaciones de colaboración con otras administraciones públicas, como los ayuntamientos, las comunidades autónomas o el Registro de la Propiedad. Esto permite coordinar actuaciones, compartir información y facilitar la integración de datos, lo que lo convierte en una infraestructura clave para la gestión del territorio. Por ello, desde una perspectiva geográfica, constituye una fuente de información territorial de gran valor. A través de su Sede Electrónica se ofrece acceso a datos alfanuméricos y cartográficos de los inmuebles, incluyendo su localización, geometría, uso, superficie, antigüedad o construcciones asociadas. Esta información permite identificar, localizar y analizar edificaciones y parcelas tanto en suelo urbano como rústico, y resulta especialmente útil para estudios de transformación territorial, planificación urbana o análisis geoespacial. La información disponible incluye tanto datos actuales como históricos, lo que permite comparar la evolución del parcelario a lo largo del tiempo. Los datos pueden consultarse mediante visor cartográfico, descargarse por municipio o integrarse en entornos SIG a través de servicios web compatibles con estándares INSPIRE [2]. La cartografía catastral está disponible en formato vectorial (shapefile), y se complementa con ficheros alfanuméricos en formato CAT. Estos datos son de consulta libre. El Catastro ofrece herramientas para la descarga masiva, la validación gráfica y la consulta automatizada, lo que garantiza su accesibilidad, interoperabilidad y reutilización en múltiples contextos. 2.4 Preprocesado de datos de entrada y clasificación de resultados 2.4.1 Selección de entidades para la prueba piloto (Fase 1) y la validación de la metodología (Fase 2) La selección de las entidades del NGA responde a las necesidades de una implementación metodológica distribuida en dos etapas, una prueba piloto y una validación de la metodología. De esta forma, se definen dos muestras diferenciadas: i) Una muestra inicial, compuesta por un número limitado y manejable de entidades, sobre la que se aplican los ensayos requeridos durante la fase piloto; y ii) Una muestra de validación independiente, más amplia y diversa, sobre la que se evalúa el rendimiento y la capacidad de generalización de las metodologías con mejores resultados. Datos de entrada 14 En conjunto, el total de las entidades seleccionadas responde a criterios de representatividad territorial y diversidad tipológica, los cuales están orientados a evaluar la versatilidad y escalabilidad de los enfoques aplicados. Asimismo, se ha procurado que la distribución de las entidades garantice la cobertura provincial de Andalucía y represente una amplia variedad de entornos rurales. 2.4.2 Acotado de áreas de influencia para recortes PNOA El análisis del estado de las edificaciones rurales aisladas requiere de un soporte visual que permita una revisión efectiva del mismo. Con este fin, se han tomado como datos de entrada del estudio las imágenes de ortofotos aéreas del Plan Nacional de Ortofotografía Aérea (PNOA). El enfoque de los métodos planteados es comparativo, es decir, la evaluación del estado de una edificación aislada se basa en la detección de cambios producidos en la misma lo largo del tiempo. Para dar respuesta a este planteamiento, se seleccionan ortofotos aéreas de dos momentos diferenciados en el tiempo. En concreto, se hace uso de las imágenes de los vuelos realizados en 2022, el más reciente sobre la Comunidad Autónoma de Andalucía, y las de los vuelos realizados en 2007, o 2008, según el municipio, dado que el barrido fotogramétrico no cubrió todo el territorio andaluz de forma simultánea hasta 2013. No se tienen en consideración imágenes anteriores a 2007 debido a deficiencias en su calidad. La obtención de las imágenes se realizó a través del servicio web de mapas del PNOA. En concreto, las imágenes correspondientes al vuelo más reciente, el del año 2022, han sido obtenidas a través del servicio WMS más actualizado: Ortofotos máxima actualidad del PNOA [36]. Por su parte, las imágenes de vuelos anteriores fueron obtenidas a través del servicio web de mapas históricos del PNOA: Ortofotos históricas y PNOA anual [37]. Las imágenes han sido procesadas para limitar las zonas de interés y acotar un área de influencia alrededor de las edificaciones aisladas de la muestra. Así, a partir de las coordenadas de las entidades, extraídas de la base de datos del NGA, se han definido cajas delimitadoras (Bounding Boxes o BBox) cuyo tamaño se ha determinado según el valor del campo CODGEO (véase Tabla 1) en base una revisión de las características de las edificaciones de la muestra. Las BBox definidas son usadas como máscara un script en Python para recortar las ortofotos del PNOA. Tabla 1. Códigos geográficos seleccionados (CODGEO), número de entidades y extensión de áreas de influencia (BBox) CODGEO Descripción CODGEO N. º entidades muestra fase 1 Extensión BBox desde semilado (m) 20301 Casa, casilla 78 100 20302 Cortijo 151 60 20303 Hacienda 1 300 20305 Casería 2 80 20306 Caserío 7 80 20309 Huerta 9 100 20310 Huerto 4 40 20312 Casilla 1 100 20318 Granja 5 150 20320 Caseta 1 20 20327 Cortijada 13 100 20336 Edificación Desaparecida o en Ruinas 3 300 20399 Otra Edificación Rural 10 80 15 Uso de la IA en la actualización del estado de edificaciones aisladas incluidas en el Nomenclátor Geográfico de Andalucía 1.1.1 Tipología del análisis Para la evaluación de resultados es necesario contar con una clasificación predeterminada que recoja los valores de referencia esperados sobre el estado de la edificación rural aislada. Con este fin, se realiza una inspección visual de las ortofotos recortadas del PNOA, a partir de la cual el estado de cada entidad es clasificado según las siguientes categorías: - activo, cuando no se aprecian cambios o deterioros significativos en las edificaciones; - desaparecido o ruina, cuando el deterioro es evidente o la edificación ha desaparecido por completo; e - incidencia, cuando la determinación del estado actual de la entidad resulta dudosa debido a factores como la localización imprecisa respecto a las coordenadas registradas en el NGA, la presencia de vegetación o sombras, o la existencia de deterioros poco claros o ambiguos. 16 3 MARCO METODOLÓGICO DE LA PRUEBA PILOTO (FASE 1) Este capítulo presenta el marco metodológico adoptado en la Fase 1 del estudio. Se describe el proceso seguido para la aplicación de tres enfoques complementarios que, desarrollados en el contexto de una prueba piloto, permiten evaluar distintas soluciones metodológicas orientadas a mejorar los procesos de actualización del Nomenclátor Geográfico de Andalucía. 3.1 Consideraciones iniciales En la Fase 1 se ha definido un enfoque metodológico estructurado (véase Figura 4), basado en la aplicación de tres métodos complementarios sobre una prueba piloto. Para ello, se requiere acotar una muestra de edificaciones aisladas adecuada al alcance de la fase evaluativa, así como preparar un conjunto de datos de entrada. A este respecto se cuenta con tres fuentes principales, descritas en el Capítulo 2 y que, en resumen, son: - En primer lugar, la base de datos del Nomenclátor Geográfico de Andalucía (NGA) en formato Access, facilitada por el Instituto de Estadística y Cartografía de Andalucía (IECA), y desde la cual la información registrada en el NGA es accesible mediante consultas SQL. - En segundo lugar, los recursos disponibles en el portal del Plan Nacional de Ortofotografía Aérea (PNOA) [34], en concreto, las ortofotos aéreas actuales e históricas, obtenidas mediante vuelos fotogramétricos como parte del proyecto PNOA Imagen. - Por último, los datos catastrales vectoriales y alfanuméricos accesibles a través de la Sede Electrónica del Catastro [35]. El desarrollo del trabajo se ha llevado a cabo principalmente en entornos SIG, como QGIS [38] y ArcGIS Pro [39], combinando herramientas de geoprocesamiento tradicionales y automatización de procesos complejos mediante scripting en Python, es decir, a través de pequeños programas automatizados. La generación y optimización de scripts han sido asistidas por modelos de inteligencia artificial basados en el procesamiento de lenguaje natural (PLN). Se ha pretendido que esta forma de trabajo represente una de las fortalezas del estudio, agilizando tareas y mostrando la utilidad de un uso transversal de la IA en el desarrollo del proyecto. En lugar de programación tradicional, se ha optado por una lógica de interacción con modelos de lenguaje mediante la generación de prompts precisos, formulados como instrucciones en lenguaje natural para orientar la respuesta del modelo, y se han empleado herramientas como PyQGIS [31], el entorno de desarrollo VS Code [40], y la plataforma en línea Google Colab [41]. 17 Uso de la IA en la actualización del estado de edificaciones aisladas incluidas en el Nomenclátor Geográfico de Andalucía Figura 4. Preprocesamiento de datos de entrada y metodología (Fase 1) Por otro lado, es importante señalar la inexistencia de datos clasificados/etiquetados sobre las entidades registradas en el NGA, que son muy numerosas. Dado que el etiquetado de una gran cantidad de datos es necesario para el desarrollo y entrenamiento de un modelo de aprendizaje automático que detecte el estado de las edificaciones rurales aisladas, se decide descartar este enfoque, que requiere un elevado gasto de tiempo, en favor de la aplicación de modelos preentrenados consolidados en el ámbito de los SIG o de modelos de lenguaje de gran tamaño, cuyo uso está empezando a integrarse en tareas SIG y que no precisan de datos etiquetados. Adicionalmente, se ha tenido en cuenta que ciertas aplicaciones de IA requieren recursos de hardware específicos. Las limitaciones encontradas se han solventado mediante el uso de entornos en la nube, como Google Colab, y a través de una gestión eficiente del scripting, ajustando parámetros de ejecución y consumo de recursos a las capacidades del hardware disponible, como se detalla en los apartados siguientes. Marco metodológico de la prueba piloto (Fase 1) 18 3.2 Datos de entrada La muestra seleccionada para la prueba piloto está constituida por las edificaciones rurales aisladas registradas en el NGA de tres municipios pertenecientes a distintas provincias andaluzas: Alosno (Huelva), Baeza (Jaén) y Tabernas (Almería), véase Figura 5. Figura 5. Localización del área de estudio (Fase 1): a) Comunidad Autónoma de Andalucía; b) Municipios seleccionados para muestra piloto; y c), d) y e) Edificaciones rurales aisladas por municipio La elección de estos municipios responde al objetivo de representar la diversidad de las áreas rurales del contexto andaluz, abarcando una variedad significativa de tipologías constructivas en una muestra con un número de ítems manejable para los testeos. Así, Alosno ejemplifica un núcleo agrícola tradicional; Baeza, un centro olivarero característico de la zona septentrional de Andalucía; y Tabernas, una región desértica adaptada a condiciones climáticas áridas. La información relativa a las edificaciones de la muestra fue extraída mediante una consulta SQL sobre la base de datos del NGA, aplicando filtros por código municipal y por tipología de edificación, restringida a las categorías “Edificación rural aislada” y “Edificación rural desaparecida o en ruinas”. El resultado se exportó a un archivo CSV que incluía, entre otros campos, identificador único (ID_ENTIDAD), nombre, tipo de entidad (según 43 tipologías), código geográfico (CODGEO, de un total de 439 códigos) y coordenadas X e Y en el sistema EPSG 25830. El campo CODGEO, que indica la tipología de la entidad rural, ha resultado fundamental para filtrar la muestra 19 Uso de la IA en la actualización del estado de edificaciones aisladas incluidas en el Nomenclátor Geográfico de Andalucía y adecuarla a los objetivos del estudio. Dado que no todos los códigos hacen referencia a edificaciones, como en el caso de categorías como corral o cercado, se limitó la selección a aquellas entidades cuya tipología corresponde inequívocamente a edificaciones rurales aisladas. La muestra final para la prueba piloto incluyó un total de 285 entidades: 69 en Alosno, 99 en Baeza y 117 en Tabernas. 3.3 Metodología aplicada en la prueba piloto La metodología desarrollada incluye tres métodos de análisis para determinar de forma automática el estado actual de una edificación rural aislada a partir de las imágenes recogidas por el último vuelo fotogramétrico sobre Andalucía, publicado por el PNOA en el año 2022. Estos métodos son: i) Análisis de imágenes mediante Modelos de Lenguaje de Gran Tamaño (LLMs); ii) Análisis comparativo de geometrías a partir de huellas de edificaciones extraídas mediante modelos de aprendizaje profundo preentrenados; y iii) Análisis comparativo de geometrías derivadas de información catastral. De este modo, dos de los métodos emplean técnicas de IA, mientras que el tercero se fundamenta en el análisis vectorial tradicional con herramientas SIG no inteligentes. Los resultados obtenidos por los tres métodos son posteriormente evaluados mediante un análisis multicriterio, con el objetivo de valorar su eficacia conjunta. Esta evaluación permite analizar la consistencia de las detecciones realizadas por cada enfoque, identificar sus fortalezas y limitaciones, y explorar combinaciones que mejoren la fiabilidad global de los resultados. 3.3.1 Método 1: Análisis de imágenes con LLMs La primera vía de análisis se fundamenta en la evaluación automatizada del estado de edificaciones rurales aisladas mediante inteligencia artificial generativa (IAG), basada en Modelos de Lenguaje de Gran Tamaño (LLMs) con los que la interacción se realiza usando el lenguaje natural. Estos modelos son capaces de interpretar instrucciones complejas y ejecutar tareas como la comparación de imágenes de forma autónoma y contextualizada [11], [12]. En este caso, se emplea Gemini 1.5. Flash [29] para procesar por pares las imágenes correspondientes al estado de las edificaciones en 2007/2008 y en 2022, efectuando un análisis comparativo donde se evalúan tres criterios: la presencia de edificación, la existencia de tejado y el estado del tejado. El procesamiento y la comparación de las imágenes se han ejecutado en el entorno de Google Colab [41], mediante el uso de tres scripts en Python, asistidos por inteligencia artificial, que abordan individualmente cada uno de los tres criterios definidos. Estos scripts cargan los pares de imágenes en directorios en la nube y realizan el análisis automático llamando a la Gemini API de AI Studio [42]. Para cada criterio, se utiliza un prompt en español que guía la evaluación y limita las posibles respuestas (véase Tabla 2). Marco metodológico de la prueba piloto (Fase 1) 20 Tabla 2. Criterios de análisis de imágenes mediante Gemini 1.5 Flash Criterio Preguntas Posibles respuestas 1 Presencia de edificación ¿Identificas alguna edificación en la imagen? Sí / No / No lo tengo claro 2 Existencia de tejado Si hay alguna edificación en la imagen, ¿identificas tejado? Sí / No / No lo tengo claro 3 Estado del tejado Considerando la imagen, ¿cuál es el estado del tejado de las edificaciones? Hay tejado en buen estado / Hay tejado en mal estado No hay tejado / No hay edificación / No lo tengo claro La salida consiste en un archivo CSV con las respuestas generadas para cada entidad analizada. Los resultados, de tipo alfanumérico, se integran para traducir la interpretación del modelo, basada en los tres criterios planteados, en una clasificación del estado de la entidad, lo que permite asignar un valor específico de CODGEO (véase Tabla 3). Tabla 3. Decisión del estado de las edificaciones rurales aisladas en el Método 1 Análisis del estado del tejado Análisis existencia de tejado Análisis presencia de edificación Decisión estado entidad CODGEO No hay edificación No hay edificación No en ambas Desaparecido o Ruina Cambia a 20336 Hay deterioro Desaparecido o Ruina Cambia a 20336 El tejado se mantiene Activo No cambia No lo tengo claro, hay tejado en buen estado Sí en ambos Activo No cambia No lo tengo claro, no hay edificación No en ambos No en ambos Desaparecido o Ruina Cambiar a 20336 Otros casos Incidencia 3.3.2 Método 2: Detección de huellas de edificaciones mediante modelos de Deep Learning (DL) La segunda vía de análisis está enfocada en la generación de las huellas de las edificaciones presentes en las ortofotos del PNOA, para efectuar un análisis comparativo basado en la existencia de geometrías. La detección de objetos es una técnica habitual en el área de los SIG, que en los últimos años se ha visto enriquecida a partir de la integración con modelos de aprendizaje profundo [21], [24]. Esta creciente integración ha dado lugar a la creación de numerosas herramientas especializadas. Esri, especialista en el desarrollo de software SIG, ofrece diversas y variadas herramientas inteligentes para la automatización de tareas desde la plataforma ArcGIS Living Atlas of the World [43]. Así, esta empresa dispone de varios modelos preentrenados para la detección de huellas de edificaciones, todos adaptados a zonas geográficas específicas: Estados Unidos, China, África, Australia y Nueva Zelanda. La ventaja de estos modelos radica en que desde el software ArcGIS Pro es posible efectuar tanto la adecuación y 21 Uso de la IA en la actualización del estado de edificaciones aisladas incluidas en el Nomenclátor Geográfico de Andalucía el preprocesamiento de los datos de entrada como la aplicación de los modelos desde herramientas de geoprocesamiento integradas en el programa. Además, es reseñable que los modelos permiten ser ajustados mediante técnicas de fine-tuning, lo que abre la posibilidad de llevar a cabo un refinamiento que adapte el modelo a las peculiaridades de un territorio determinado. Dado que no hay disponibles modelos de detección de huellas entrenados en el área de estudio, para la aplicación y evaluación de esta segunda vía de análisis se ha optado por la implementación del modelo Building Footprint Extraction – USA [44], cuyo uso es el más generalizado, y que está centrado en un territorio donde se ha considerado que las tipologías de edificaciones aisladas pueden presentar una mayor similitud a las del contexto andaluz. La ejecución del modelo se realizó desde la herramienta de geoprocesamiento Detect Objects Using Deep Learning de ArcGIS Pro, en la cual es posible ajustar los parámetros del modelo en base a la disponibilidad de hardware y los requerimientos de tiempo de procesado (véase Tabla 4). Los datos de entrada han sido las ortofotos recortadas del PNOA en formato tif. Previamente, las imágenes han sido preprocesadas para limitar su tamaño a tres bandas, uno de los requisitos del modelo, y combinadas como mosaico ráster en una geodatabase. El modelo se aplicó seis veces, una por cada año, 2007/8 y 2022, en cada uno de los tres municipios de la muestra. Tabla 4. Parámetros del modelo Building Footprint Extraction - USA Parámetros Descripción Valor por defecto Rango Valor aplicado Impacto Padding Margen extra entre mosaicos 128 32-256 64 A mayor valor: menor error en bordes, más memoria Batch_size Imágenes procesadas simultáneamente 4 1-16 4 A mayor valor: más rapidez, más RAM, necesidad GPU Threshold Umbral de confianza 0,9 0,5-0,95 0,7 A mayor valor: más precisión, menos detecciones Return_bboxes Cajas (True) o máscaras (False) F T/F F T: más rapidez, menos detalle Test_time augmentation Mejora de precisión ajustando la imagen F T/F F T: más precisión, mayor tiempo procesado Merge_policy Estrategia de fusión para zonas solapadas mean min/mean/max mean Sin efecto en rendimiento (suvidad vs. contraste) Tile_size Tamaño de mosaico 512 256-1024 512 A mayor valor: menor tiempo procesado, más RAM Resultados de la prueba piloto (Fase 1) 28 número de falsos positivos podría comprometer la fiabilidad del método. Por su parte, Baeza supone una excepción a la tendencia, ya que los aciertos de la categoría (22) se mantienen muy por encima de los falsos positivos (4). Tabla 8. Resultados Método 1 Alosno Baeza Tabernas A D/R I T A D/R I T A D/R I T Plantilla 45 18 6 69 56 31 12 99 85 20 12 117 Método 1 34 25 10 51 35 13 58 54 5 Aciertos 32 11 1 44 48 22 2 72 58 19 2 79 F. positivos 1 10 9 20 2 4 11 17 0 25 3 28 Incidencias 1 4 5 1 9 10 0 10 10 Aciertos 32 11 1 44 48 22 2 72 58 19 2 79 Aciertos (%) 71,1 61,1 16,7 63,8 85,7 71,0 16,7 72,7 68,2 95,0 16,7 67,5 Nota: A es activo; D/R es desaparecido o ruina; I es incidencia; T son valores totales. La concentración de falsos positivos en la detección de estados desaparecido o ruina en dos municipios podría sugerir que el modelo comete errores asociados a características particulares de la tipología de edificación en esas zonas, que podrían alejarse de los patrones asumidos por el modelo. Por ejemplo, la Figura 11 muestra una entidad clasificada erróneamente, caracterizada por una cubierta plana sin tejas. Figura 11. Ejemplo de falso positivo: entidad en uso clasificada erróneamente como desaparecido o ruina por el Método 1 Por otra parte, el Método 1 es el único capaz de detectar estados incidencia, aquellos en los que el modelo de lenguaje responde No lo tengo claro (véanse Figuras 12 y 13). Los resultados muestran que generalmente las 29 Uso de la IA en la actualización del estado de edificaciones aisladas incluidas en el Nomenclátor Geográfico de Andalucía dudas del modelo no coinciden con los casos ambiguos detectados durante el etiquetado de la muestra, lo que se traduce en porcentajes de acierto muy bajos en esta categoría, que no alcanzan el 20%. Figura 12. Ejemplo de coincidencia con inspección visual: estado clasificado correctamente como incidencia por el Método 1 (tejados parcialmente derruidos en conjunto edificado) Figura 13. Ejemplo de falso positivo: estado incidencia por inspección visual (entidad en ruinas junto a entidad íntegra) clasificado como desaparecido o ruina por el Método 1 Si se analizan de forma conjunta la totalidad de las detecciones (véase Tabla 9), se observa un porcentaje de acierto general próximo al 70%. Sin embargo, la desviación estándar, calculada sobre los porcentajes de acierto de las tres categorías, es muy elevada, lo que indica que la fiabilidad del método es limitada. No obstante, al excluir la categoría incidencia del cálculo, la desviación estándar se reduce considerablemente, lo que indica que el modelo se aproxima uniformemente a las categorías activo y desaparecido o ruina. Por tanto, el Método 1 no solo alcanza porcentajes de acierto próximos al 75% en la detección de esos estados, sino que esas detecciones Resultados de la prueba piloto (Fase 1) 30 se producen de forma uniforme y consistente. La visión global de los resultados, donde el porcentaje general de aciertos de las categorías activo y desaparecido o ruina es similar, sugiere que la tendencia a detectar estados desaparecido o ruina que el modelo ha mostrado en Alosno y Tabernas podría reducirse o desaparecer en una muestra con mayor diversidad tipológica. Tabla 9. Resultado general Método 1 Activo Desaparecido o Ruina Incidencia Valores totales Plantilla 186 69 30 285 Método 1 138 52 5 195 Aciertos (%) 74,2 75,4 16,7 68,4 Desviación estándar (%) 27,4 Desviación estándar sin incidencias (%) 0,58 4.3 Resultados del Método 2: Modelo DL El Método 2 consiste en la detección de las huellas de edificaciones de las ortofotos recortadas del PNOA correspondientes a los años 2007/8 y 2022, realizando posteriormente un análisis comparativo de éstas mediante herramientas de geoprocesamiento automatizadas en base a dos criterios: la existencia de edificación, y la disminución de superficie entre edificaciones anteriores y edificaciones actuales. Figura 14. Ejemplo de detección de estado activo (ambos criterios): huellas de edificación generadas en ambas imágenes La generación de las huellas de las edificaciones se efectúa aplicando el modelo de DL Building Footprint Detection – USA [44] a las ortofotos desde el entorno de ArcGIS Pro [39]. En general, el modelo genera geometría cuando identifica una edificación. Aunque la precisión de las detecciones es alta, ésta se ve afectada por los parámetros descritos en el Capítulo 3. A este respecto, el modelo puede producir diferentes escenarios. El más evidente para el estudio es la no generación de geometría en el estado actual, que siempre es interpretada 31 Uso de la IA en la actualización del estado de edificaciones aisladas incluidas en el Nomenclátor Geográfico de Andalucía como un estado desaparecido o ruina. Por su parte, la generación de geometría se asocia a la detección de estados activo (véase Figura 14), estando la clasificación final sujeta al criterio de análisis aplicado. Asimismo, el modelo de DL puede incurrir en dos tipos de errores, que se reflejan en los resultados como falsos positivos: i) omisión de edificaciones en el proceso de vectorizado (véase Figura 15), y ii) generación de huellas donde no existen edificaciones (véase Figura 16). Figura 15. Ejemplo de omisión de edificación en el proceso de vectorizado Figura 16. Ejemplo de generación de huella sobre una ruina Los resultados del Método 2 son de tipo binario. Las entidades son categorizadas en dos estados: activo o desaparecido o ruina. Por tanto, el alcance del método es limitado, no siendo posible la identificación automática Resultados de la prueba piloto (Fase 1) 32 de los estados etiquetados manualmente como incidencia. Esto quiere decir que el método no tiene capacidad cualitativa para discernir deterioros en edificaciones existentes, sino que determina un estado en base a criterios cuantitativos. Por ello, en los resultados, además del porcentaje de acierto general basado en el total de las entidades de la muestra, se calcula un porcentaje de acierto de casos detectables, que mide el éxito del modelo considerando únicamente los casos que puede resolver positivamente. A continuación, se presentan los resultados en tablas separadas por criterio de análisis, desglosados por municipio: Alosno, Baeza y Tabernas; y por categoría: activo (A), desaparecido o ruina (D/R) e incidencia (I). Los resultados del Método 2 basados en el criterio existencia de edificación (véase Tabla 10) muestran porcentajes de acierto elevados, superiores al 71,8% en todos los casos. La categoría activo es detectada con éxito en un rango que comprende entre el 86,7% y el 91,1%. La categoría desaparecido o ruina presenta una mayor dispersión, con un rango de éxito que oscila entre el 72,2% y 90,3%. Es destacable que en el municipio de Tabernas esta última categoría muestra una proporción similar de falsos positivos (19) y de aciertos (18). Esta tendencia indica que el modelo de generación de huellas de edificaciones ha cometido numerosos errores por omisión de edificación, dando lugar a un sesgo en el método que favorece la detección de la categoría desaparecido o ruina en el municipio. A pesar del alto porcentaje de acierto (90,0%), los errores del modelo DL introducen arbitrariedad y reducen la fiabilidad del método. Tabla 10. Resultados Método 2: existencia de edificación Alosno Baeza Tabernas A D/R I T TD A D/R I T TD A D/R I T TD Plantilla 45 18 6 69 63 56 31 12 99 87 85 20 12 117 105 Método 2 (edificación) 48 21 64 35 73 44 Aciertos 39 13 52 51 28 79 66 18 84 F. positivos 5 6 11 3 5 8 2 19 21 No detectable 4 2 6 10 2 12 5 7 12 Aciertos 39 13 52 52 51 28 79 79 66 18 84 84 Aciertos (%) 86,7 72,2 75,4 82,5 91,1 90,3 79,8 90,8 77,6 90,0 71,8 80,0 Nota: A es activo; D/R es desaparecido o ruina; I es incidencia; T son valores totales; TD son valores totales detectables. Los resultados obtenidos bajo el criterio diferencia de superficies (véase Tabla 11) presentan igualmente porcentajes de acierto elevados, superiores al 66,7%, aunque se observa una mayor dispersión en los resultados que en el criterio anterior. La categoría activo se detecta correctamente entre el 70,6% y el 87,5%, y la categoría desaparecido o ruina entre el 72,2% y el 90,3%. En esta última categoría, los aciertos por diferencia de superficie coinciden con los obtenidos por existencia de edificación, sin embargo, la detección de falsos positivos es superior en todos los casos, especialmente en Tabernas, donde el segundo criterio devuelve 25 falsos 33 Uso de la IA en la actualización del estado de edificaciones aisladas incluidas en el Nomenclátor Geográfico de Andalucía positivos frente a 18 aciertos, lo que corrobora la existencia de errores en la generación de huellas de edificios que afectan a las detecciones en los dos criterios de análisis. Por su parte, en la categoría activo, el número de falsos positivos es reducido y estable en las dos vías, lo que indica que generalmente cuando el modelo DL identifica edificaciones lo hace de forma correcta. Ambos enfoques muestran altos porcentajes de acierto, mostrando valores de dispersión entre categorías tolerables, aunque el criterio existencia de edificación muestra mayor rendimiento, lo que sugiere que considerar diferencias geométricas no aporta un valor añadido con impacto en los resultados. Tabla 11. Resultados Método 2: diferencia de superficies Nota: A es activo; D/R es desaparecido o ruina; I es incidencia; T son valores totales; TD son valores totales detectables. Los resultados generales del Método 2 (véase Tabla 12) son positivos, con aciertos superiores al 80% y valores de desviación estándar reducidos en los dos criterios de análisis aplicados. Sin embargo, el criterio existencia de edificación presenta mejores porcentajes de acierto en todas las categorías, menor número de falsos positivos y una desviación estándar significativamente más baja, destacando en uniformidad y fiabilidad frente al criterio por diferencia de superficies. Tabla 12. Resultado general Método 2 Método 2: edificaciones Método 2: superficies Activo Desaparecido o Ruina Totales detectables Activo Desaparecido o ruina Totales detectables Plantilla 186 69 255 186 69 255 Método 2 156 59 215 146 59 205 Aciertos (%) 83,9 85,5 84,3 78,5 85,5 80,4 Desviación estándar (%) 0,82 3,51 Alosno Baeza Tabernas A D/R I T TD A D/R I T TD A D/R I T TD Plantilla 45 18 6 69 63 56 31 12 99 87 85 20 12 117 105 Método 2 (superficie) 46 23 59 40 66 51 Aciertos 37 13 50 49 28 77 60 18 78 F. positivos 5 8 13 3 7 10 2 25 27 No detectable 4 2 6 7 5 12 4 8 12 Aciertos 37 13 50 50 49 28 77 77 60 18 78 78 Aciertos (%) 82,2 72,2 72,5 79,4 87,5 90,3 77,8 88,5 70,6 90,0 66,7 74,3 Resultados de la prueba piloto (Fase 1) 34 4.4 Resultados del Método 3: Análisis catastral El Método 3 se ha basado en un análisis comparativo de información catastral en formato vectorial, mediante un geoprocesamiento automatizado de las geometrías catastrales históricas y actuales, aplicando dos criterios cuantitativos: i) la existencia de edificación; y ii) la disminución de superficie de las edificaciones entre estados. Figura 17. Ejemplo de información vectorial registrada en el Catastro: detección de estado activo (ambos criterios) A diferencia del Método 2, en el que la generación de huellas de edificaciones se lleva a cabo específicamente sobre las ortofotos del PNOA, las huellas del Método 3 son datos preexistentes registrados en la base de datos del Catastro (véase Figura 17). Por lo tanto, la eficacia del método depende tanto del grado de correspondencia entre registros, como del nivel de actualización de la información catastral. A este respecto, se pueden producir errores por dos causas: i) inexistencia de huella de una entidad registrada en el NGA (véase Figura 18), lo que supone la clasificación como desaparecido o ruina de una entidad en uso. ii) existencia de huellas de entidades que han desaparecido o están en ruinas (véase Figura 19), lo que genera falsos positivos en la categoría activo. Ante estos errores, el cruce de información alfanumérica entre el NGA y el Catastro podría servir para sistematizar las correspondencias entre ambos registros y fortalecer esta vía de análisis. Las detecciones son de carácter binario. El método determina estados activo o estados desaparecido o ruina, no teniendo alcance para detectar estados incidencia. Los resultados se presentan desglosados por municipio y categoría, de forma análoga a los métodos anteriores. Asimismo, se muestran tanto los porcentajes de acierto sobre el total de entidades de la muestra como sobre los casos detectables, entre los cuales se excluyen los etiquetados como incidencia. 35 Uso de la IA en la actualización del estado de edificaciones aisladas incluidas en el Nomenclátor Geográfico de Andalucía Figura 18. Ejemplo de inexistencia de registro en el Catastro de una entidad del NGA Figura 19. Ejemplo de entidad registrada en el Catastro actualmente desaparecida Los resultados de Método 3 en base al criterio existencia de edificación (véase Tabla 13) presentan una alta dispersión. Si bien los porcentajes totales de acierto son superiores al 69,7%, alcanzando el 90,5% en los casos detectables, se observa una variabilidad significativa en los resultados entre municipios, lo que sugiere una correspondencia irregular entre el registro catastral y el NGA, que se traduce en una falta de homogeneidad de las detecciones. Resultados de la prueba piloto (Fase 1) 36 Tabla 13. Resultados Método 3: existencia de edificación Alosno Baeza Tabernas A D/R I T TD A D/R I T TD A D/R I T TD Plantilla 45 18 6 69 63 56 31 12 99 87 85 20 12 117 105 Método 3 (edificación) 47 22 57 42 109 8 Aciertos 41 16 57 44 25 69 83 6 89 F. positivos 2 4 6 6 12 18 14 2 16 No detectable 4 2 6 7 5 12 12 0 12 Aciertos 41 16 57 57 44 25 69 69 83 6 89 89 Aciertos (%) 91,1 88,9 82,6 90,5 78,6 80,6 69,7 79,3 97,6 30,0 76,1 84,8 Nota: A es activo; D/R es desaparecido o ruina; I es incidencia; T son valores totales; TD son valores totales detectables. Los porcentajes de acierto en Alosno son superiores al 88,9% en ambas categorías, la desviación es mínima y el número de falsos positivos muy bajo. En Baeza, disminuyen levemente los porcentajes de acierto hasta un 78,6% y se mantiene la uniformidad entre categorías. Sin embargo, se produce un aumento de falsos positivos en la categoría desaparecido o ruina, que suponen un tercio de las detecciones, lo que apunta a que existen diferencias entre los registros. Por otro lado, Tabernas presenta una disrupción significativa en las detecciones por categoría. La determinación de estados activo alcanza un 97,6% de aciertos, mientras que los desaparecido o ruina caen hasta el 30,0%. En este caso, es reseñable que el etiquetado de la muestra concibe que una mayoría de las entidades de Tabernas (85) sigue en uso, frente a una minoría de entidades desaparecidas o en desuso (20). En términos absolutos el número de falsos positivos es reducido en ambas categorías, sin embargo, el bajo número de aciertos en estados desaparecido o ruina respecto a los valores en plantilla indica que el modelo favorece la detección de activos. Este sesgo puede estar provocado por una falta de actualización del Catastro, que sigue registrando entidades que han desaparecido o están en ruinas. Los resultados del Método 3 obtenidos bajo el criterio diferencia de superficies (véase Tabla 14) son dispersos e inconsistentes tanto por municipio como por categoría. El porcentaje total de aciertos varía entre un 21,9% en Tabernas y un 68,3% en Alosno. La categoría activo presenta valores muy bajos, sin superar el 14,1% en Tabernas, mientras que la categoría desaparecido o ruina alcanza el 100% en Alosno. El número de falsos positivos en los estados desaparecido o ruina es muy elevado, lo que indica que bajo este criterio el modelo está viciado hacia la detección de esta categoría. Esto puede estar relacionado con que el registro de geometrías históricas y actuales difieran en información almacenada, conteniendo la información histórica huellas de diferentes edificaciones asociadas a un área determinada a lo largo del tiempo (véase Figura 20). Esto implicaría que una comparación por disminución de superficies entre los dos estados no esté detectando cambios reales en la superficie ocupada por una misma entidad. 37 Uso de la IA en la actualización del estado de edificaciones aisladas incluidas en el Nomenclátor Geográfico de Andalucía Tabla 14. Resultados Método 3: diferencia de superficies Alosno Baeza Tabernas A D/R I T TD A D/R I T TD A D/R I T TD Plantilla 45 18 6 69 63 56 31 12 99 87 85 20 12 117 105 Método 3 (superficie) 27 42 69 18 81 99 24 93 117 Aciertos 25 18 43 11 26 37 12 11 23 F. positivos 0 20 20 5 45 50 9 73 82 No detectable 2 4 6 2 10 12 3 9 12 Aciertos 25 18 43 43 11 26 37 37 12 11 23 23 Aciertos (%) 55,6 100,0 62,3 68,3 19,6 83,9 37,4 42,5 14,1 55,0 19,7 21,9 Nota: A es activo; D/R es desaparecido o ruina; I es incidencia; T son valores totales; TD son valores totales detectables. Figura 20. Ejemplo de detección de estado desaparecido o ruina por diferencia de superficies: error por mayor número de geometrías (o entidades registradas) en Catastro histórico que en actual Los resultados generales del Método 3 confirman la baja fiabilidad del criterio diferencia de superficies (véase Tabla 15), con un porcentaje total de aciertos que apenas supera el 40% y una desviación estándar muy alta (26,95%). En contraste, el criterio existencia de edificación alcanza un 84,3% de aciertos, con una desviación estándar de 11,10%, un valor más aceptable, aunque con una ligera inclinación hacia la detección de estados activo que, como se ha señalado, podría estar provocada por faltas de correspondencia entre los registros del Catastro y el estado actual de las entidades. Marco metodológico de la validación (Fase 2) 44 La evaluación de los métodos aplicados en la Fase 1 permitió identificar las vías que no alcanzaron los resultados esperados y ajustar la implementación de aquellos enfoques que mostraron un rendimiento favorable. De este modo, se concluyó que la fiabilidad del Método 3 estaba comprometida debido a la irregularidad de sus detecciones, por lo que fue descartado en fases posteriores. Asimismo, los bajos porcentajes de acierto del Método 1 en la detección automatizada de la categoría incidencia llevaron a prescindir de la clasificación automatizada de estados ambiguos. Por el contrario, los altos niveles de acierto del Método 2, especialmente bajo el criterio de existencia de huella de edificación en el estado más reciente, motivaron el abandono del enfoque comparativo inicialmente planteado, al considerarse innecesario. Así, la segunda fase del estudio ha consistido en la adaptación y aplicación de los Métodos 1 y 2 sobre una muestra de validación independiente, con el objetivo de comprobar la robustez y consistencia de la metodología en un contexto territorial más diverso (véase Figura 21). Esta nueva aplicación ha permitido eliminar redundancias, afinar parámetros y evaluar la capacidad de generalización de los métodos seleccionados al conjunto del territorio andaluz. El testeo se llevó a cabo en un mayor número de municipios, seleccionados conforme a los criterios de representatividad y diversidad geográfica que rigen este estudio. En resumen, la Fase 2 se rige por los siguientes criterios metodológicos: 1. Eliminación de enfoques tradicionales, priorizando exclusivamente las metodologías basadas en inteligencia artificial (Métodos 1 y 2). 2. Reducción de categorías detectables a una clasificación binaria: activo o desaparecido o ruina. 3. Sustitución de la categoría incidencia por una inclinación sistemática a clasificar como activo en casos de ambigüedad. 4. Abandono del enfoque comparativo en el Método 2, limitando su aplicación al análisis de la existencia de edificación en el estado actual. 5. Ampliación de la representatividad territorial y tipológica, mediante la selección de una muestra independiente más amplia y diversa. 5.2 Datos de entrada y ajustes en el preprocesamiento 5.2.1 Selección de muestra independiente La muestra de validación se ha definido con el objetivo de ampliar la diversidad territorial y tipológica del estudio, incorporando municipios de distintas provincias y contextos rurales. Se han seleccionado cinco municipios (véase Figura 22): Cazalla de la Sierra (Sevilla), situada en un entorno de sierra con arquitectura dispersa vinculada a la actividad ganadera y forestal; Grazalema (Cádiz), un área de alta montaña y marcado carácter patrimonial, centrada en la ganadería extensiva y el turismo rural; Montefrío (Granada), un territorio de media montaña caracterizado por laderas cultivadas; Montilla (Córdoba), una zona de campiña fértil vinculada a la producción vitivinícola y agrícola; y Torrox (Málaga), un enclave costero que combina desarrollo turístico con áreas rurales agroganaderas. Se ha procurado que el conjunto, además de representar una variedad suficiente 45 Uso de la IA en la actualización del estado de edificaciones aisladas incluidas en el Nomenclátor Geográfico de Andalucía de entornos rurales, sirva para completar la cobertura provincial del estudio. Figura 22. Localización del área de estudio (Fase 2): a) Comunidad Autónoma de Andalucía; b) Municipios seleccionados para muestra independiente 5.2.2 Preprocesado de datos El preprocesado de los datos se ha realizado conforme a lo descrito en el epígrafe 2.4. La información de las entidades se ha extraído mediante una consulta SQL sobre la base de datos del NGA, aplicando filtros por código municipal y por tipología de edificación (edificación rural aislada y edificación rural desaparecida o en ruinas). Este filtrado devuelve un archivo CSV con identificadores únicos (ID_ENTIDAD), tipo de entidad, códigos geográficos (CODGEO) y coordenadas X e Y en el sistema EPSG 25830. En esta fase, la muestra independiente incorpora una mayor variedad de códigos geográficos (CODGEO), aunque el código 20302 vuelve a ser el más representado (véase Tabla 18). En este caso, se ha decidido mantener todos los códigos presentes en la muestra, sin atender a peculiaridades tipológicas o a escasa representación. Esta decisión responde al objetivo de evaluar la capacidad de generalización de los métodos, enfrentándolos a una diversidad tipológica más amplia. En total, la muestra incluye 959 entidades. Además, cabe resaltar que en esta fase no se hace distinción por municipio durante la aplicación de los métodos, tratando de forma global al conjunto de entidades para analizar el comportamiento de los enfoques desde una perspectiva generalizada. Por otro parte, como se especifica en el capítulo de datos de entrada, la aplicación de los métodos hace uso de las ortofotos del PNOA. En esta fase, el estado actual sigue correspondiendo al vuelo fotogramétrico más reciente, el del año 2022. Sin embargo, el estado más antiguo se ha fijado en el año 2013, por ser el primero que cubre de forma completa el territorio andaluz. Esta elección garantiza la homogeneidad y fluidez del preprocesamiento en los cinco municipios seleccionados. Marco metodológico de la validación (Fase 2) 46 Asimismo, se han delimitado áreas de influencia mediante cajas BBox generadas a partir de las coordenadas de cada entidad, ajustando su tamaño según el tipo de edificación, conforme al valor del campo CODGEO, según se muestra en la Tabla 18. La extensión de las áreas de influencia ha sido revisada y ajustada mediante inspección de las características de las entidades de la muestra independiente. Estas cajas se han utilizado como máscaras en un script en Python para recortar las ortofotos del PNOA. Tabla 18. Códigos geográficos seleccionados (CODGEO), número de entidades y extensión de áreas de influencia (BBox) de la muestra independiente CODGEO Descripción CODGEO N.º entidades muestra Extensión Bbox desde semilado (m) 20301 Casa, casilla 150 100 20302 Cortijo 600 60 20303 Hacienda 11 60 20304 Molino 25 60 20306 Caserío 13 80 20307 Rancho 2 100 20309 Huerta 5 60 20312 Casilla 29 100 20313 Dehesa 1 100 20314 Villa 1 100 20315 Zahúrda 1 80 20318 Granja 1 60 20319 Corral 5 100 20320 Caseta 7 100 20323 Lagar 53 100 20325 Majada 1 60 20327 Cortijada 8 100 20330 Cueva 1 100 20332 Choza 9 60 20336 Edificación Desaparecida o en Ruinas 10 100 20399 Otra Edificación Rural 26 80 5.2.3 Etiquetado de la muestra Se ha efectuado un etiquetado de la muestra independiente mediante inspección visual, que sirve como referencia para la evaluación de los resultados. La clasificación se ha realizado en dos categorías: activo o desaparecido o ruina, siguiendo los mismos criterios que en la Fase 1 (véase Tabla 19). Tabla 19. Decisión del estado de las edificaciones rurales aisladas por inspección visual sobre muestra independiente Edificación en 2013 Edificación en 2022 Decisión estado entidad No No Desaparecido o ruina No Sí Activo Sí No Desaparecido o ruina Sí Sí Activo La falta de consideración de las ambigüedades o incidencias como una categoría independiente es sustituida por un nuevo criterio, por el cual, los estados de deterioro dudosos se seguirán considerando activos, de tal forma que se mantendrá su código geográfico hasta una nueva revisión del estado de las entidades. 47 Uso de la IA en la actualización del estado de edificaciones aisladas incluidas en el Nomenclátor Geográfico de Andalucía 5.3 Metodología aplicada en la validación 5.3.1 Método 1 revisado: Análisis LLM La aplicación del Método 1 revisado es similar a la descrita en el epígrafe 3.3.1. No obstante, se ha planteado una implementación que introduce dos mejoras principales. Por un lado, se elimina la detección de la categoría incidencia. El modelo de lenguaje determinará únicamente estados activo o desaparecido o ruina. Por el otro, se reduce el número de scripts de tres a uno. El planteamiento revisado se centra en un solo prompt más extenso e informativo, que aúna las preguntas originales e incluye descripciones precisas sobre qué se considera un estado activo y uno desaparecido o ruina. La salida, en formato CSV, incluye tanto respuestas parciales a las preguntas originales, lo que permite interpretar el razonamiento seguido por el modelo, como la determinación del estado final de cada entidad. El nuevo prompt plantea al modelo una comparación entre imágenes de edificaciones de dos años diferentes mediante una revisión iterativa basada en cuatro preguntas, con el objetivo de determinar su estado a lo largo del tiempo (véase Tabla 20). Las respuestas están restringidas y se especifican las consideraciones a tener en cuenta para decantarse por una respuesta u otra. El prompt incluye definiciones de conceptos clave desarrollados mediante una interacción con Gemini 1.5. Flash [29]. De este modo, se define: edificación, como una estructura con volumen discernible y tejado; deterioro significativo, como cambios evidentes que incluyen agujeros en los tejados, desaparición de tejados o colapso estructural; deterioro menor o no concluyente, como modificaciones en la vegetación o distribución de las sombras en ausencia de indicios claros de deterioro significativo; y edificación significativa, como edificación próxima al centro del área de influencia o que constituya el edificio o conjunto de edificios principal de la entidad. Asimismo, se indica al modelo que, en caso de duda razonable, determine un estado activo. Esta decisión busca compensar la eliminación de la categoría incidencia, priorizando la conservación del CODGEO actual en situaciones ambiguas, que será revisado en posteriores procesos de actualización. Tabla 20. Criterios de análisis de imágenes mediante Gemini 1.5 Flash (Método 1 revisado) Enfoque Pregunta Respuestas Consideraciones 1 Individual 2013 y 2022 ¿Identificas alguna edificación en la imagen? Sí Estructura con volumen y tejado. No Muros bajos. Cimientos. Ruinas. Irregularidades difusas o inespecíficas. 2 Individual 2013 y 2022 ¿Las edificaciones tienen tejado? Sí Tejado completo. Tejado con deterioro menor pero funcional. No Tejado ausente o colapsado. 3 Comparativo 2022 frente a 2013 ¿Identificas cambios en los tejados que indiquen deterioro significativo de la edificación? Sí Agujeros. Secciones completas ausentes. Sin tejado. Colapso total. Vegetación donde había tejado. No Sin cambios. Deterioro menor o no concluyente. 4 Actual 2022 ¿Hay al menos una edificación significativa en buen estado? Sí, estado activo Edificación con tejado y buen estado general. No, estado desaparecido o ruina No hay edificación. Solo cimientos. Ruina evidente. Edificación sin tejado. Marco metodológico de la validación (Fase 2) 48 5.3.2 Método 2 revisado: Modelo DL La aplicación del Método 2 revisado sigue el planteamiento efectuado en el epígrafe 3.3.2. En este caso, se elimina el enfoque comparativo, generando únicamente las huellas de las edificaciones en el estado actual, 2022. Las geometrías son analizadas para determinar el estado de las entidades bajo el criterio existencia de edificación (véase Tabla 21). Tabla 21. Decisión del estado de las edificaciones rurales aisladas bajo el criterio existencia de edificación (Método 2 revisado) Edificación en 2022 Decisión estado entidad CODGEO No Desaparecido o Ruina Cambia a 20336 Sí Activo No cambia Además, dado que el número de entidades de la muestra independiente es más elevado, se decide sustituir el uso de la herramienta Detect Object Using Deep Learning de ArcGIS Pro por una ejecución controlada del modelo mediante scripting, lo que reduce la probabilidad de errores y bloqueos durante la ejecución del proceso. El desarrollo de un script en Python que integre el modelo Building Footprint Extraction – USA [44] se ha realizado con asistencia de inteligencia artificial. El código final está diseñado para ejecutarse en un cuaderno, o notebook, de Python dentro del entorno de ArcGIS Pro. Este script permite cargar individualmente los ráster de las ortofotos como datos de entrada, configurar los parámetros definidos en el epígrafe 3.3.2, dividir el procesamiento en lotes para una ejecución escalonada del modelo, e interrumpir su ejecución tras el análisis de cada lote, si es necesario. Las salidas son individuales, de modo que el modelo genera tanto archivos shapefile como imágenes correspondientes a cada lote procesado. La generación de salidas individualizadas minimiza el riesgo de pérdida de datos ante posibles errores durante la ejecución. Estos archivos, de tamaño muy reducido, son fácilmente manejables mediante herramientas de geoprocesamiento y pueden combinarse posteriormente en una única capa vectorial para el análisis del estado de las entidades. Se han explorado distintas alternativas para implementar el modelo mediante scripting. En primer lugar, se planteó una ejecución controlada en el entorno de Google Colab [41], considerada inicialmente como la opción más escalable, ya que permitiría combinar los Métodos 1 y 2 en un análisis simultáneo. Sin embargo, el modelo requiere una configuración muy específica de librerías de inteligencia artificial, con versiones concretas y dependencias cruzadas, lo que dificultó su correcta ejecución en Colab, debido a que este entorno cuenta con muchas librerías preinstaladas cuyas versiones resultan incompatibles con las requeridas por el modelo de Deep Learning. El mismo problema se presentó en la plataforma en línea Kaggle [45]. Estas limitaciones impidieron aprovechar GPUs externas, restringiendo la posibilidad de ejecutar el modelo en entornos de computación más potentes. Otro enfoque, a nivel local, ha sido la implementación del scripting mediante Anaconda [46], una plataforma que facilita la gestión de entornos y la ejecución de código en Python. Se utilizó su terminal en combinación con Jupyter Notebook [47], en el cual los problemas de compatibilidad persistieron, dificultando el desarrollo estable del script. Finalmente, se optó por la implementación dentro del propio ArcGIS Pro, previa instalación del paquete específico de Deep Learning de Esri [48], lo que resolvió los problemas de compatibilidad. 49 6 RESULTADOS DE LA VALIDACIÓN (FASE 2) Este capítulo presenta los resultados de la Fase 2 del estudio, centrada en la validación y optimización de la propuesta metodológica mediante su aplicación sobre una muestra más amplia y diversa. Se exponen los resultados individuales de cada método, se realiza un análisis multicriterio y se evalúa la consistencia y fiabilidad de la metodología revisada. 6.1 Consideraciones generales La evaluación de la eficacia de los métodos revisados se ha llevado a cabo mediante la comparación entre los resultados obtenidos y el etiquetado de la muestra independiente, realizado manualmente mediante una inspección visual, siguiendo un procedimiento análogo al descrito en el Capítulo 4. En esta fase, la muestra se ha clasificado únicamente en dos categorías, atiendo a los criterios establecidos en el epígrafe 4.1: i) activo, si en 2022 se observa edificación en buen estado; y ii) desaparecido o ruina, si en 2022 la edificación presenta un deterioro evidente o ha desaparecido. En consonancia con estos criterios, durante el etiquetado se ha optado por clasificar como activo aquellas entidades cuyo estado resultaba ambiguo. Asimismo, la evaluación general del rendimiento de la metodología revisada sigue el modelo descrito la Fase 1. De este modo, la fiabilidad de cada método se mide en función de la tasa de aciertos y la desviación estándar por categorías. A continuación, se presentan los resultados distribuidos por categoría, activo y desaparecido o ruina, para el conjunto de entidades que componen la muestra independiente. 6.2 Resultados del Método 1 revisado: LLM El Método 1 revisado optimiza el proceso de implementación respecto a la Fase 1. Aunque su aplicación es similar a la descrita en el epígrafe 4.2, en este caso se ejecuta un único script que genera un archivo CSV con las respuestas parciales y la clasificación final del estado de las entidades de la muestra independiente en su conjunto (véase Figura 23). Resultados de la validación (Fase 2) 50 Figura 23. Modelo de archivo de salida CSV (Método 1 revisado) El Método 1 revisado presenta resultados muy favorables (véase Tabla 22), con un porcentaje general de acierto del 94,5%. Además, el número total de falsos positivos es poco significativo en relación con el tamaño de la muestra. No obstante, el rendimiento por categorías revela un sesgo hacia la detección de estados activo, cuyo porcentaje de aciertos asciende al 96,9% frente al 81,1% en el caso de estados desaparecido o ruina. La desviación estándar, aunque se mantiene en un valor aceptable (7,92%), confirma la tendencia del método a favorecer la detección de activos. Esta inclinación es coherente con planteamiento adoptado, en el que se estableció que, en casos de duda, se priorice la determinación de un estado activo. Tabla 22. Resultados Método 1 revisado Activo Desaparecido o ruina Desviación estándar (%) Valores totales Plantilla 811 148 959 Método 1 revisado 814 145 959 Aciertos 786 120 906 Falsos positivos 28 25 53 Aciertos (%) 96,9 81,1 7,92 94,5 En conjunto, los resultados mejoran significativamente respecto a los obtenidos por el Método 1 en la fase anterior, lo que confirma que las modificaciones implementadas han contribuido a aumentar su fiabilidad y capacidad de generalización. En este sentido, el ligero aumento de la desviación entre categorías no compromete la calidad de los resultados. Dado que esta desviación responde a un criterio explícito introducido en el prompt, se estima que podría reducirse mediante ajustes sutiles en las directrices proporcionadas al modelo que, según la proporción de falsos positivos, muestra mayores dificultades para determinar si una entidad está desaparecida o en ruinas, que en uso. 6.3 Resultados del Método 2 revisado: DL La aplicación del Método 2 revisado introduce un cambio sustancial respecto a la Fase 1. En esta etapa, el modelo se ejecuta mediante un script en Python lanzado desde un cuaderno del entorno de ArcGIS Pro. Al haberse descartado el enfoque comparativo, el análisis se limita a las imágenes correspondientes al año 2022. Las salidas, tal como se detalla en el epígrafe 5.3.2, consisten en archivos shapefile individuales por cada caso analizado que, posteriormente, se procesan para evaluar el estado de las entidades según los criterios establecidos. El Método 2 revisado muestra un rendimiento general elevado, de un 88,8% (véase Tabla 23). Sin embargo, las detecciones por categorías presentan una diferencia de 25 puntos porcentuales, con una desviación estándar de 12,58%, lo que se aleja de los estándares de uniformidad establecidos en este estudio. La categoría activo alcanza 51 Uso de la IA en la actualización del estado de edificaciones aisladas incluidas en el Nomenclátor Geográfico de Andalucía un porcentaje de aciertos del 92,7% (véase Figura 24), mientras que la detección de estados desaparecido o ruina desciende al 67,6%. Esta última presenta un número elevado de falsos positivos, lo que sugiere que el modelo de detección de huellas no responde de forma suficientemente precisa a la diversidad tipológica de edificaciones presentes en la muestra, omitiendo la vectorización de un número significativo de entidades activas (véase Figura 25). Esto da lugar a un considerable número de casos clasificados erróneamente como desaparecido o ruina y reduce la fiabilidad del método. Tabla 23. Resultados Método 2 revisado Activo Desaparecido o ruina Desviación estándar (%) Valores totales Plantilla 811 148 959 Método 2 revisado 800 159 959 Aciertos 752 100 852 Falsos positivos 48 59 107 Aciertos (%) 92,7 67,6 12,58 88,8 Cabe destacar que el porcentaje de acierto general del Método 2 revisado mejora con respecto a su aplicación en la fase anterior. Aunque el valor de desviación estándar es relativamente elevado, el incremento en la detección de casos activo es notable, frente a una caída moderada de la tasa de aciertos en la categoría desaparecido o ruina. Estos resultados apuntan a la necesidad de un proceso de refinamiento del modelo que refuerce su capacidad de generalización ante la diversidad tipológica del contexto andaluz, lo que daría lugar a una mayor precisión en la detección de huellas, minimizando errores y aumentando la uniformidad del método. Figura 24. Ejemplos de acierto de estados activo en el Método 2 revisado: el modelo genera geometría Resultados de la validación (Fase 2) 52 Figura 25. Ejemplos de falso positivo en la categoría desaparecido o ruina en el Método 2 revisado: el modelo no genera geometría 6.4 Combinación de resultados y comparativa: Análisis multicriterio revisado En esta segunda fase, el número de métodos aplicados se reduce de tres a dos, lo que limita la aplicabilidad del criterio de mayoría simple utilizado en el análisis multicriterio anterior. Para resolver esta limitación, se plantea un enfoque analítico ponderado por categorías, en el que se consideran los porcentajes de acierto de cada método en cada categoría. De este modo, en situaciones de discrepancia, se asignaría el estado detectado por el método con mayor rendimiento específico para esa categoría. Sin embargo, el análisis individualizado de los dos métodos muestra de forma clara que el Método 1 revisado presenta un rendimiento superior, tanto a nivel global como por categoría. Además, su número de falsos positivos es significativamente menor y la desviación estándar entre categorías, más baja. Como consecuencia, el análisis multicriterio ponderado, tanto por categoría como de forma global, devuelve resultados idénticos a los del Método 1, restringiendo el alcance analítico del enfoque multicriterio. A partir de estos resultados, podría concluirse que el Método 1 es suficiente por sí solo, sin necesidad de complementariedad con otros enfoques. No obstante, restringir el análisis a una única vía puede limitar la robustez de la metodología, especialmente en un contexto donde la validación cruzada entre métodos se ha considerado garantía de fiabilidad en las detecciones. Por ello, se plantea contrastar el nivel de coincidencia entre ambos métodos, evaluando si los aciertos aumentan al considerar el resultado correcto en los casos en los que los dos métodos difieren. En otras palabras, se analiza si los errores del Método 1 podrían ser corregidos por las detecciones del Método 2, y viceversa (véase Tabla 24). 53 Uso de la IA en la actualización del estado de edificaciones aisladas incluidas en el Nomenclátor Geográfico de Andalucía Tabla 24. Análisis de complementariedad: Aciertos totales Método 1 revisado y Método 2 revisado Activo Desaparecido o ruina Desviación estándar (%) Valores totales Plantilla 811 148 959 Aciertos 800 138 938 Aciertos (%) 98,6 93,2 2,7 97,8 El análisis de complementariedad muestra que, aunque el Método 1 revisado presenta mayores porcentajes de acierto, sus resultados no son plenamente coincidentes con los del Método 2 revisado. Esto implica que la combinación de los aciertos de ambos métodos permite alcanzar tasas de acierto superiores y una desviación estándar entre categorías más baja. Estos resultados refuerzan la idea de que ambos métodos son funcionales y complementarios, por lo que un próximo paso sería explorar vías para sistematizar esta complementariedad, con el objetivo de obtener un resultado único que integre las fortalezas de ambos enfoques, mejorando así la precisión, la robustez y la fiabilidad de la metodología. 6.5 Discusión La segunda fase del estudio ha consistido en la implementación de mejoras en dos de los métodos evaluados favorablemente en la fase anterior, con el objetivo de validar sus resultados y optimizar su aplicación sobre una muestra independiente, caracterizada por una mayor diversidad tipológica. El Método 1, basado en el análisis de imágenes mediante modelos de lenguaje de gran tamaño (LLMs), se ha reformulado para clasificar las entidades en dos categorías: activo y desaparecido o ruinas. La implementación se ha simplificado mediante la ejecución de un único script que devuelve una salida alfanumérica con los estados detectados, acompañada de una lógica interna que fundamenta la decisión a partir de conceptos clave, preguntas y respuestas proporcionadas al modelo mediante un prompt más extenso y específico. Los resultados obtenidos son muy positivos. El Método 1 revisado ha mostrado un alto rendimiento, con tasas de acierto elevadas tanto por categorías como en términos generales. No obstante, un valor de desviación estándar del 7,92% revela una tendencia del modelo a favorecer la detección de estados activo. Este sesgo puede estar inducido por un criterio de análisis introducido en esta fase, según el cual se prioriza la categorización como activo de aquellas entidades cuyo estado pueda resultar ambiguo. Además, el mayor nivel de dificultad que muestra el modelo a la hora de determinar estados desaparecido o ruina puede deberse a una falta de precisión en las especificaciones dadas. A este respecto, se considera que pequeños ajustes en el prompt podrían reducir esta inclinación y mejorar la detección de la categoría. El Método 2, centrado en el análisis de huellas de edificación generadas mediante un modelo de Deep Learning, se ha replanteado eliminando el enfoque comparativo que lo caracterizaba en la primera fase y manteniendo un único criterio de análisis: la existencia de edificación. Asimismo, se ha rediseñado su implementación, sustituyendo las herramientas de Deep Learning integradas en ArcGIS Pro por una ejecución mediante scripting, lo que ha permitido aumentar el control sobre parámetros, lotes, tiempos de ejecución y salidas, minimizando errores y facilitando el procesamiento de una muestra más amplia. El rendimiento general del Método 2 revisado 60 [37] Instituto Geográfico Nacional, «Ortofotos históricas y PNOA anual (WMS)». Accedido: 24 de junio de 2025. [En línea]. Disponible en: https://www.ign.es/wms/pnoa-historico [38] QGIS Development Team, «QGIS Geographic Information System (Software)», 2025, Open Source Geospatial Foundation: Versión 3.42. [En línea]. Disponible en: https://qgis.org/ [39] Esri, «ArcGIS Pro (Software)», 2024, Esri: Versión 3.4.3. [En línea]. Disponible en: https://www.esri.com/ [40] Microsoft Corporation, «Visual Studio Code (Software)», 2025, Microsoft Corporation: Versión 1.101.0. [En línea]. Disponible en: https://code.visualstudio.com/ [41] Google, «Google Colaboratory». Accedido: 24 de junio de 2025. [En línea]. Disponible en: https://colab.research.google.com/ [42] Google, «Gemini 1.5 Flash via Gemini API», Google AI Studio. Accedido: 24 de junio de 2025. [En línea]. Disponible en: https://ai.google.dev/gemini-api/docs/api-key?hl=es-419 [43] Esri, «ArcGIS Living Atlas of the World». Accedido: 24 de junio de 2025. [En línea]. Disponible en: https://livingatlas.arcgis.com/ [44] Esri, «Building Footprint Extraction - USA ». [En línea]. Disponible en: https://www.arcgis.com/home/item.html?id=a6857359a1cd44839781a4f113cd5934 [45] Kaggle, «Kaggle». Accedido: 24 de junio de 2025. [En línea]. Disponible en: https://www.kaggle.com/ [46] Anaconda Inc., «Anaconda Individual Edition (sotfware)», 2024, Anaconda: Versión 10.1. [En línea]. Disponible en: https://www.anaconda.com/ [47] Project Jupyter, «Jupyter Notebook (sotfware)», 2025, Project Jupyter: Versión 7.4.1. [En línea]. Disponible en: https://jupyter.org/ [48] Esri, «Install deep learning frameworks for ArcGIS Pro». Accedido: 24 de junio de 2025. [En línea]. Disponible en: https://pro.arcgis.com/en/pro-app/latest/help/analysis/deep-learning/install-deep-learning-frameworks.htm