scieee AI-readable full text Open interactive document viewer

¿Puede la tecnología forzar un cambio de paradigma? Aplicación de algoritmos de aprendizaje automático (IA) en la historiografía del siglo XXI.

Werner, Wiktor

Abstract

Preprint of the article under review for an academic journal. This version has not undergone peer review. DOI ensures citability and open-access visibility CC BY-NC-ND 4.0. English:This article examines the potential paradigm shift in contemporary historiography driven by artificial intelligence (AI) and machine learning (ML) algorithms. It outlines three levels of AI application in historical research: (1) reconstruction and analysis of sources; (2) establishment of facts using text mining and semantic networks; and (3) modeling of historical processes through simulation and deep learning algorithms. The paper combines methodological reflection with empirical examples from digital humanities projects, proposing a reconsideration of the epistemological foundations of historical inquiry in the twenty-first century. Español:Este artículo analiza la posibilidad de un cambio de paradigma en la historiografía contemporánea bajo la influencia de la inteligencia artificial (IA) y los algoritmos de aprendizaje automático (ML). Se presentan tres niveles de aplicación de la IA en la investigación histórica: (1) la reconstrucción y el análisis de fuentes; (2) el establecimiento de hechos mediante técnicas de minería de textos y redes semánticas; y (3) la modelización de procesos históricos a través de algoritmos de simulación y aprendizaje profundo. El estudio combina una reflexión metodológica con ejemplos empíricos recientes del uso de la IA en las humanidades digitales, proponiendo una reevaluación de las bases epistemológicas de la disciplina histórica en el siglo XXI.

Full text

Wiktor Werner (AMU, Poznan, Poland) ORCID: 0000-0002-3004-6021 ¿Puede la tecnología forzar un cambio de paradigma? Aplicación de algoritmos de aprendizaje automático (IA) en la historiografía del siglo XXI. 10.5281/zenodo.17593682 Title (EN) Can technology force the paradigmatic change? The Use of Machine Learning Palabras clave aprendizaje automático, historiografía, análisis de redes sociales, PLN, historia digital, IA, sesgo Resumen (ES) Este artículo explora cómo la implementación de algoritmos de inteligencia artificial (IA) y aprendizaje automático (ML) ha comenzado a transformar la metodología histórica en el siglo XXI. Al rastrear la evolución de la IA desde las primeras bases teóricas establecidas por Alan Turing y Marvin Minsky hasta arquitecturas neuronales contemporáneas como los transformadores y los modelos de lenguaje grande (LLM), el autor argumenta que la historiografía está experimentando un cambio paradigmático. El artículo distingue tres niveles metodológicos de la integración de la IA en la investigación histórica: (1) la reconstrucción de fuentes a través de técnicas computacionales como OCR, visión por computadora e imágenes tomográficas; (2) la extracción y verificación de hechos utilizando PLN, árboles de decisión y análisis de redes sociales (SNA); y (3) el modelado interpretativo y la generación de hipótesis a través del aprendizaje profundo y el razonamiento probabilístico. La discusión sitúa estos cambios dentro de un debate epistemológico más amplio sobre el estatus de la historia entre la literatura y la ciencia, refiriéndose a la visión de Hayden White de la historiografía como un discurso atrapado entre la narrativa y la verificación empírica. Al comparar este giro digital con las reorientaciones metodológicas de la Escuela de los Annales, el artículo concluye que la historiografía asistida por IA marca una transición de la hermenéutica narrativa al empirismo basado en datos, pero también surge el peligro de abusos creados por los algoritmos generativos de los LLM que pueden reproducir sesgos culturales y prejuicios como sistemas semánticos autorreguladores. Keywords machine learning, historiography, social network analysis, NLP, digital history, AI, bias Summary (EN) This article explores how the implementation of artificial intelligence (AI) and machine learning (ML) algorithms has begun to transform historical methodology in the twentyfirst century. By tracing the evolution of AI from the early theoretical foundations laid by Alan Turing and Marvin Minsky to contemporary neural architectures such as transformers and large language models (LLMs), the author argues that historiography is undergoing a paradigmatic shift. The article distinguishes three methodological levels of AI’s integration into historical research: (1) the reconstruction of sources through computational techniques such as OCR, computer vision, and tomographic imaging; (2) the extraction and verification of facts using NLP, decision trees, and social network analysis (SNA); and (3) interpretative modeling and hypothesis generation through deep learning and probabilistic reasoning. The discussion situates these changes within a broader epistemological debate about the status of history between literature and science, referring to Hayden White’s view of historiography as a discourse caught between narrative and empirical verification. By comparing this digital turn to the methodological reorientations of the Annales School, the paper concludes that AI-assisted historiography marks a transition from narrative hermeneutics to data-driven empiricism but emerges also a danger of abuses created by LLM’s generative algorithms which can reproduce cultural biases and prejudices as self-regulatory semantic systems. Desarrollo de la Inteligencia Artificial y el Aprendizaje Automático Los inicios de la investigación en aprendizaje automático están vinculados a la reflexión de Alan Turing sobre la naturaleza del procesamiento de información por máquinas. En la década de 1930, describió el funcionamiento de una máquina de cálculo universal: un modelo de procesamiento de datos basado en un conjunto finito de estados y reglas (Turing 1936). En el artículo "Computing Machinery and Intelligence" (1950), propuso una prueba para evaluar empíricamente la capacidad de las máquinas para imitar el comportamiento intelectual humano. Según él, "pensar" puede entenderse como un proceso computacional en el que los algoritmos procesan datos de manera sistemática y repetitiva. Esta idea fue desarrollada posteriormente por Marvin Minsky, quien en 1951, junto con Dean Edmonds, construyó un modelo analógico de una red neuronal llamado SNARC (Calculador Estocástico de Refuerzo Analógico Neuronal) en Harvard. El dispositivo, compuesto por aproximadamente 3000 tubos de vacío que simulaban el funcionamiento de unos 40 neuronas, aprendió a navegar por un laberinto virtual. En 1959, Minsky y John McCarthy establecieron el Proyecto de Inteligencia Artificial del MIT (transformado en el AI Lab en 1970), que se convirtió en el centro de investigación sobre la simulación de procesos cognitivos. En "Steps Toward Artificial Intelligence" (1961), Minsky indicó que cada acto de razonamiento puede describirse como una secuencia finita de operaciones sobre símbolos, y en trabajos posteriores, desarrolló el concepto de inteligencia como una red de procesos cooperativos (Minsky 1967, 1986). La investigación sobre perceptrones (Minsky & Papert 1969) condujo al desarrollo de aprendizaje automático basado en mecanismos de corrección de errores. Un paso clave fue la introducción del algoritmo de retropropagación, descrito por Werbos (1974) y popularizado por Rumelhart, Hinton y Williams (1986). Este mecanismo permite a las redes neuronales ajustar los pesos (parámetros numéricos que procesan la información) enviando una señal de error desde la capa de salida a neuronas anteriores, lo que permite al sistema mejorar iterativamente su capacidad para predecir estados futuros. Así, el aprendizaje automático se convirtió en un proceso de autocorrección continua, mejorando mediante la reducción de errores. En las décadas siguientes, este método encontró aplicaciones en modelos de procesamiento del lenguaje natural (NLP). Las RNN (Redes Neuronales Recurrentes) diferenciaron el orden de los elementos de la secuencia (aquí: tokens de palabras), mientras que los modelos LSTM (Memoria a Largo Plazo) introdujeron las llamadas "puertas de memoria", que permitieron mantener el contexto en secuencias de datos más largas (Elman 1990; Hochreiter & Schmidhuber 1997). En ambos casos, el resultado predicho se comparó con el real, y la diferencia se propagó hacia atrás para la corrección de pesos. Los transformadores (Vaswani et al., 2017) continúan con esta lógica. A diferencia de las RNN, analizan simultáneamente las relaciones entre todos los elementos de la secuencia (auto-atención), y sus capas aprenden a través de múltiples ajustes de parámetros en respuesta a una señal de error. De esta manera, se crean los modelos de lenguaje contemporáneos (GPT-3, GPT-4, y los subsiguientes), con cientos de miles de millones de parámetros que aprenden la estructura del lenguaje a través de un proceso de corrección continua y minimización de errores, el mecanismo en el núcleo de la inteligencia de máquina moderna. Inteligencia Artificial e Investigación Histórica La mera existencia de una determinada tecnología no implica su uso simétrico en todas las áreas de la actividad humana. Sin embargo, hay tecnologías que ejercen un impacto tan fuerte en las operaciones, mejorando su eficiencia, que ignorarlas es imposible o solo factible por un tiempo muy limitado. Tal tecnología incluye la escritura, la impresión, la digitalización y ahora, la inteligencia artificial. Incluso el campo relativamente conservador, casi inercial, de la historiografía (Werner, Falkowski, 2024) no descarta los beneficios cognitivos que surgen de la aplicación de la tecnología de IA (aunque algunos investigadores individuales puedan ignorar efectivamente su existencia durante mucho tiempo). En la práctica, esto significa que la investigación que involucra algoritmos y herramientas de IA, incluso si no es realizada por todos los historiadores, será llevada a cabo por algunos, con efectos beneficiosos visibles. Las aplicaciones de los métodos y herramientas de inteligencia artificial en la investigación histórica son actualmente notables en tres niveles: aplicaciones técnicas (nivel básico – 1), establecimiento de nuevos hechos (nivel factográfico – 2) y establecimiento de relaciones entre hechos (nivel de interpretación – 3). En el nivel básico, las herramientas digitales han comenzado a usarse en el proceso de preparación de materiales fuente para su participación en la investigación histórica. Estos son trabajos bien conocidos relacionados con la lectura de manuscritos fuertemente dañados o manuscritos que no eran legibles en absoluto debido a los daños. Un éxito espectacular fue el uso pionero de la tomografía computarizada y el análisis de fluorescencia para la lectura virtual de rollos y libros carbonizados y parcialmente carbonizados sin abrirlos, lo que habría destruido los objetos (Albertin et al., 2015), demostrando los beneficios de la implementación generalizada de métodos digitales en la investigación histórica. Otro avance fue la introducción de herramientas de IA (no solo tecnología digital), que superaron a otros métodos previamente utilizados en efectividad, incluidos los métodos digitales más antiguos. Se obtuvieron resultados interesantes del proyecto Ancient Lives (Universidad de Oxford, Zooniverse), donde se comparó la efectividad de las redes neuronales CNN con la tecnología OCR más "tradicional" (tecnología que convierte fotografías o documentos escaneados en texto digital editable, usualmente desarrollada por fabricantes específicos de escáneres) para reconocer letras griegas en papiros de baja calidad. En el proyecto Ancient Lives, las redes CNN superaron significativamente al OCR tradicional en el reconocimiento de letras en papiros dañados (Swindall et al., 2021). Un ejemplo importante del éxito de la IA en la investigación histórica es el proyecto Ítaca, desarrollado por Google DeepMind y la Universidad de Oxford (Assael et al., 2022), que creó un modelo de inteligencia artificial entrenado en un corpus de 78,608 inscripciones griegas. Este modelo puede reconstruir fragmentos de texto faltantes con una precisión de hasta el 62%, fechar inscripciones con un error promedio de unos 30 años y determinar el origen geográfico con un 71% de precisión. El modelo Ítaca se basa en una arquitectura de red neuronal profunda tipo Transformer, similar a las utilizadas por los modelos de lenguaje contemporáneos (por ejemplo, GPT). El aprendizaje involucró el análisis del contexto lingüístico y topográfico: los fragmentos faltantes se predicen basándose en la probabilidad de secuencias de símbolos en el entorno. Técnicamente, Ítaca utiliza el mecanismo de autoatención y la retropropagación para minimizar el error de predicción de texto. Otro ejemplo es el trabajo de investigadores israelíes que utilizan redes neuronales recurrentes (RNN) para restaurar automáticamente fragmentos faltantes de tabletas cuneiformes de Babilonia (período aqueménida). El modelo fue entrenado en un corpus de textos en acadio transliterados, permitiendo la predicción de caracteres y palabras faltantes con alta precisión: del 65 al 95% (Fetaya, Lifshitz, Aaron, Gordin, 2020). El corpus de textos fue preparado utilizando funciones y módulos del lenguaje de programación Python (una especie de lingua franca para los sistemas de inteligencia artificial). Los beneficios de aplicar tecnología digital, particularmente algoritmos de autoaprendizaje (IA y aprendizaje automático), son tan evidentes que detenerse en el nivel "técnico" ya no parece posible. La nueva tecnología se está introduciendo así en etapas posteriores del proceso de investigación, participando no solo en la preparación de la fuente a un estado donde pueda ser leída por un historiador, sino también participando en la verificación de hipótesis sobre hechos basados en regularidades y conexiones no obvias en los datos que un historiador (un ser humano) no podría discernir con una "mente desarmada". Estamos así en el nivel factográfico – 2, donde las herramientas de PLN (Procesamiento de Lenguaje Natural) comienzan a jugar un papel significativo: algoritmos de NER (Reconocimiento de Entidades Nombradas) para reconocer nombres de lugares, personas y eventos, y herramientas estilométricas para determinar la autoría de textos y análisis de sentimientos (tono emocional de los textos). Una investigación estilométrica muy interesante del texto de la Crónica Polaca por Anónimo ("Gallus") fue llevada a cabo por Maciej Eder (Eder, 2015), quien, utilizando métodos de PLN, confirma la hipótesis de Tomasz Jasiński sobre la identidad italiana de Anónimo. Aquí se puede atribuir una importancia significativa a algoritmos de aprendizaje automático relativamente simples (CART – árbol de clasificación y regresión, árbol de decisión, bosque aleatorio), que pertenecen al grupo de algoritmos de aprendizaje supervisado donde el modelo aprende de datos de entrenamiento etiquetados. Por ejemplo, en la clasificación de textos históricos, un algoritmo puede recibir un conjunto de textos etiquetados con categorías como "documento", "carta", "artículo de prensa", y luego aprender a reconocer estas categorías en nuevos conjuntos de datos. Zbigniew Wilczyński y Wiktor Werner, en su investigación sobre las actividades del Servicio de Seguridad de la República Popular de Polonia (Departamento VI en Szczecin), aplicaron un único "árbol de clasificación y regresión" (CART) para reconocer tipos modelo de colaboradores de la SB y las relaciones entre parámetros específicos de su descripción (edad, profesión, educación, género, etc.) y su tendencia a presentar reportes personales (Werner, Wilczyński, 2024). Para estudiar todas las relaciones entre fenómenos (personas, instituciones, países, ciudades, etc.), son útiles los algoritmos de análisis de redes (Análisis de Redes Sociales), que utilizan la teoría de grafos como su base. La metodología de SNA y la teoría de grafos ya han encontrado aplicación en muchos estudios históricos que cubren una amplia gama de diferentes fuentes. La investigación de Anderson Pereira Antunes (Antunes, 2021) muestra cómo analizar estructuras sociales y dependencias personales en la historia de la ciencia. En su trabajo "Análisis de Redes Sociales en la Historia de las Ciencias," Antunes utilizó el programa Gephi y la biblioteca networkX (Python) para analizar relaciones entre participantes de expediciones científicas del siglo XIX (Anuntes 2021). Los nodos de la red representaban individuos, y los bordes representaban contactos científicos, correspondencia y coautorías. Los resultados fueron visualizados y analizados utilizando indicadores de centralidad (centralidad de intermediación, centralidad de autovalor), densidad y modularidad de la red, y detección de comunidades. Katherina Kaska estudió las relaciones entre escribas y manuscritos en los monasterios cistercienses de Heiligenkreuz, Zwettl y Baumgartenberg en el siglo XII. El objetivo era comprender la estructura de cooperación de los escribas y el desarrollo del "ecosistema" de producción de libros (Kaska, 2023). Ruedi Epple estudió las redes socio-políticas en el cantón de Basilea-Campiña (Suiza) a finales del siglo XIX, mostrando cómo las élites locales, el clero y los activistas formaron redes de influencia en el contexto de iniciativas políticas y votaciones (Epple, 2022). Louis Bissières examinó de manera interesante las redes de contactos comerciales y vínculos de crédito en la América del Norte del siglo XVIII utilizando métodos de redes multicapa que permiten la representación de dependencias temporales (Bissières, 2023). En el contexto de obtener resultados reales, la tendencia notable de llevar las herramientas de IA a un nivel aún más alto de investigación y de involucrar esta tecnología en la interpretación de hechos (por ejemplo, para encontrar relaciones causales entre ellos) y modelado histórico no puede ser sorprendente. En el tercer nivel (interpretativo), nos encontramos con modelos capaces de ayudar en la generación de hipótesis sobre causalidad, probar escenarios contrafactuales y simular procesos históricos. Aquí aparecen: modelos basados en agentes (ABM) – simulando comportamientos y decisiones sociales (por ejemplo, migraciones, conflictos), redes bayesianas – para estimar la probabilidad de eventos con datos incompletos, y Modelos de Lenguaje Grande (LLM) – para integrar datos narrativos y fácticos (por ejemplo, GPT utilizado para clasificar relaciones temporales en archivos). Un ejemplo de tal investigación puede ser el trabajo pionero y en este momento único de Atin Basuchoudhary, James T. Bang, John David, y Tinni Sen en "Identificando las Causas Complejas de la Guerra Civil" (Basuchoudhary et al., 2021). Los autores utilizan modelos de árboles de decisión para identificar factores estructurales de las guerras civiles; el modelo aplicado "aprende" dependencias causales de conjuntos de datos históricos y económicos extensos. En el enfoque presentado, los métodos de aprendizaje automático se tratan no solo como instrumentos de análisis cuantitativo sino como un análogo a los procesos cognitivos apropiados para la investigación histórica. Los autores mencionados desarrollaron el procedimiento de Selección de Covariables Informada Empíricamente (EICS), que combina selección de variables, análisis causal y visualización de dependencias en un modelo bayesiano. Su esquema de investigación incluye imputación de datos usando el método Miss Forest (un método basado en Random Forest, que es un conjunto de árboles de decisión que aprenden conjuntamente a predecir valores faltantes para cada variable basado en otras columnas en el conjunto de datos), un procedimiento para eliminar características insignificantes, Eliminación Recursiva de Características (RFE), análisis de impacto de variables (PDP), y modelado causal basado en estadísticas bayesianas (BART). MissForest corresponde al proceso histórico de reconstruir fuentes incompletas. El modelo no llena estos vacíos arbitrariamente, sino que reconstruye valores faltantes manteniendo relaciones no lineales entre variables (Basuchoudhary et al., 2021, p. 41). Es así un equivalente algorítmico de reconstruir "posibles estados del pasado" – una forma de hermenéutica probabilística, donde la ausencia se convierte en parte del proceso cognitivo en lugar de un factor de bloqueo. La Eliminación Recursiva de Características (RFE) constituye un proceso heurístico similar a la selección de significados en la interpretación histórica (Basuchoudhary et al., 2021, p. 53). En un sentido humanístico, es un procedimiento para distinguir información significativa de datos aleatorios – una versión digital de la interpretación tradicional de fuentes que selecciona datos y limita el riesgo de sobre-interpretación. Los Gráficos de Dependencia Parcial (PDP) visualizan cómo un cambio en una variable afecta el resultado del modelo mientras mantiene otros factores constantes (Basuchoudhary et al., 2021, p. 72). Finalmente, los Árboles de Regresión Aditiva Bayesiana (BART), un modelo flexible de pronóstico utilizado en la investigación causal, se aplican cuando se cumplen condiciones que permiten modelar la causalidad basada en distribuciones de probabilidad con incertidumbre variable (siempre que se cumplan previamente supuestos que realmente permitan distinguir causa de efecto). BART consiste en muchos árboles de decisión pequeños, combinados aditivamente (lo que significa que sus predicciones se suman). Cada árbol es muy superficial – responsable de un fragmento "local" del espacio de datos. El algoritmo dibuja un conjunto de tales árboles, los entrena en diferentes partes del conjunto de datos, y combina sus resultados en una distribución de probabilidad del resultado final (Basuchoudhary et al., 2021, p. 83). Epistemológicamente, esto corresponde a la conciencia del historiador de que el conocimiento del pasado siempre permanece probabilístico y sensible al azar. El modelo no elimina la incertidumbre, sino que la convierte en un elemento de descripción. El conjunto de métodos MissForest – RFE – PDP – BART puede así ser tratado como una propuesta para la hermenéutica computacional, donde los algoritmos no reemplazan la interpretación sino que imitan su estructura: reconstruyen enlaces de transmisión faltantes, seleccionan un exceso de significados, estudian relaciones contrafactuales y capturan conocimiento en términos de probabilidad. De esta manera, los métodos de aprendizaje automático se convierten no solo en una técnica de análisis de datos, sino en un modelo para pensar sobre el pasado, donde la cognición histórica y computacional se encuentran en el ámbito de la reflexión sobre la imagen incierta del mundo obtenida de un conjunto de datos incompleto. El siguiente paso en el uso de la IA en la historiografía, sin embargo, puede involucrar no usar estas herramientas como se describió anteriormente, sino su evidente abuso. Tampoco se pueden pasar por alto los problemas relacionados con el compromiso de algoritmos generativos asociados con modelos de lenguaje grande (LLM) no para ayudar en el análisis de datos (como se discutió anteriormente), sino para generar diversas formas de narrativas históricas (¡que no acompañan un proceso de investigación adecuado!) y pseudo-fuentes iconográficas. Se debe recordar que los algoritmos generativos no diferencian entre el pasado y el presente o entre verdad y falsedad. Aprenden de grandes conjuntos de datos para generar nuevos datos consistentes con los patrones encontrados en los conjuntos de entrenamiento. Donde nosotros podemos ver verdad o falsedad, las máquinas ven conformidad o falta de ella. En general, la densificación de la infosfera generada por la IA plantea muchas amenazas a la historiografía profesional y a la cultura histórica más amplia. Como enfatiza Marnie Hughes-Warrington en su libro "Historiadores Artificiales" (Hughes-Warrington et al., 2025), la lógica de la inteligencia artificial (como sabemos, basada en similitudes geométricas entre vectores de datos) difiere fundamentalmente de la lógica de la historia como una narrativa cultural creada por humanos. Secundariamente y algo antinaturalmente para el mundo interno de los algoritmos, se ven obligados a la adecuación con pesos apropiados (cargas numéricas colocadas en las puertas de flujo de información), se imponen salvaguardas adicionales en el modelo LLM para prevenir la diseminación de contenido flagrantemente falso (por ejemplo, negar crímenes de genocidio) y perjudicial (por ejemplo, difundir odio y racismo) a través de la introducción de etapas de entrenamiento adicionales (llamada sintonización de alineación), en la cual el modelo se ajusta a la verdad y estándares éticos a través de conjuntos de datos especiales y penalizaciones por generar respuestas no deseadas. Sin embargo, estas salvaguardas pueden ser eludidas por la llamada inyección de comandos – es decir, editando persistentemente comandos de una manera que sugiere al modelo evitar las reglas de seguridad (Perez & Ribeiro, 2022). El peligro de abusar de esta tecnología no solo es muy real – es un hecho ya confirmado. Sin embargo, estamos hablando aquí de crear narrativas sin investigación, por lo tanto, un procedimiento de falsificación de la historia en lugar de entenderla. Conclusiones. ¿Qué Cambios en la Historiografía Podemos Esperar? Los estudios mencionados aquí han demostrado que la aplicación de algoritmos de ML y AI permite una nueva forma de análisis de fuentes archivísticas, descubriendo estructuras y relaciones que un investigador no podría percibir sin asistencia computacional. Los modelos de lenguaje (LLM), los algoritmos de ML y los métodos de PNL permiten el análisis de grandes corpus de textos, archivos y datos sociales con una precisión sin precedentes. Sin embargo, con este cambio surge un nuevo problema metodológico: la cuestión del sesgo de entrada y salida, que es la transferencia de sesgos contenidos en los datos de entrada a las conclusiones generadas por los modelos (Barocas et al., 2023). En el contexto de la investigación histórica, este fenómeno es especialmente significativo porque las fuentes sobre las que los modelos aprenden reflejan asimetrías históricas existentes (como es el caso con la preservación de estados archivísticos), sesgos políticos y culturales. Los datos históricos son a menudo selectivos y a veces accidentales: provienen de instituciones específicas, idiomas, entornos sociales, a menudo representan la voz del poder en lugar de grupos marginados y, en última instancia, se caracterizan por la aleatoriedad de la realidad histórica. Como resultado, un modelo entrenado con tal material—independientemente de su complejidad—puede reproducir y reforzar los mismos patrones interpretativos que un investigador podría querer superar. ¿Significa