scieee AI-readable full text Open interactive document viewer

Drafting Definitions for Emerging Concepts and Terms Undergoing Semantic Shift Within the ARTES Knowledge Base: A Protocol for Integrating LLMS Into Terminological Analysis by Experimental Approach

Mojca Pecman

Abstract

This paper presents a protocol for evaluating and integrating generative AI (GenAI) tools in the framework of the terminological analysis of emerging, semantically unstable terms, absent from established term bases. Implemented within the ARTES knowledge base, the protocol supports Master’s students in translation at Université Paris Cité, in their task consisting of conducting a terminological analysis required for their dissertation. The study focuses particularly on terms displaying semantic instability and variation, thereby giving rise to semantic neologisms, and on evaluating the effectiveness of GenAI in retrieving existing definitions and drafting new terminological definitions for such terms. A survey of students’ GenAI use and an experimental study on the concept of data pollution illustrate the approach. Findings show corpus-linguistic tools help structure conceptual knowledge and critically assess GenAI outputs, confirming the need for human oversight. The study proposes a model for prompt construction and evaluation, a systematic process for building a collection of effective prompts, and a methodology that combines LLMs and corpus linguistics’ techniques for terminology management.

Full text

Terminologia Terminologia 2025, vol. 32, pag. 1-43 Contenuto link Turinio nuoroda ISN 2669-2198 (online elettroninis) Copyright © 2025 Mojca Pecman. Pubblicato dall'Istituto della lingua lituana. Questo è un articolo in accesso aperto distribuito sotto i termini della Creative Commons Attribution License, che consente l'uso, la distribuzione e la riproduzione illimitati in qualsiasi mezzo, a condizione che l'autore originale e la fonte siano accreditati. // Isleido Lietuvių kalbos institutas. Šis straipsnis yra atviros prieigos, platinamas pagal Creative Commons‚ priskyrimo licencijos sąlygos, leidžiančias neribotai naudoti, platinti ir atkurti turinį bet kokioje laikmenoje, nurodant autorių ir šaltinį. Ricevuto da: Gauta: 2025-09-10. Accettato: Priimta: 2025-09-22 . 1 DRAFTING DEFINITIONS FOR EMERGING CONCEPTS AND TERMS UNDERGERING SEMANTIC SHIFT WITHIN THE ARTES KNOWLEDGE BASE: A PROTOCOL FOR INTEGRATING LLMS IN TERMINOLOGYCAL ANALYSIS BY EXPERIMENTAL Un protocollo per l'integrazione dei LMS in un'analisi terminologica per mezzo di esperimenti Approccio Naujų sąvokų ir semantiniu poslinkiu pasižyminčių terminų apibrėžčių rengimas ARTES base di conoscenze kontekste: didžiųjų kalbos modelių integravimo į terminologinę analizę eksperimentinis protokolas MOJCA PECMAN Università di Parigi Cité E-mail: [email protected] ORCID ID: https://orcid.org/0000-0002-6753-1936 Campi di ricerca: database di conoscenza ARTES, terminologia basata su corpus, neologismi semantici, redazione di definizioni terminologiche, IA generativa, ingegneria rapida per la terminologia. https: doi.org/10.35321/term32-02 ------------------------------------------------------------------------------------------------------------------ Riassunto Questo documento presenta un protocollo per la valutazione e l'integrazione degli strumenti di IA generativa (GenAI) nel quadro dell'analisi terminologica di termini emergenti, semanticamente instabili, assenti dalle basi di termini stabilite. Implementato all'interno della base di conoscenze ARTES, il protocollo supporta gli studenti del Master in traduzione dell'Université Paris Cité, nel loro compito di condurre un'analisi terminologica richiesta per la loro dissertation. The study focuses particularly on terms displaying semantic instability and variation, thereby giving rise to semantic neologisms, and on evaluating the effectiveness of GenAI in retrieving existing definitions traduzione e di redigere nuove definizioni terminologiche per tali termini. Un'indagine sull'uso di GenAI da parte degli studenti e uno studio sperimentale sul concetto di inquinamento dei dati illustrano l'approccio. I risultati mostrano che gli strumenti corpus-linguistici aiutano a strutturare la conoscenza concettuale e a valutare criticamente i risultati di GenAI, confermando la necessità di una supervisione umana. Lo studio propone un modello per la costruzione e la valutazione rapide, un processo sistematico per la costruzione di una collezione di prompt efficaci e una metodologia che combina LLM e tecniche di linguistica del corpus per terminology management. 2 KEYWORDS: database di conoscenza ARTES, terminologia basata su corpus, neologismi semantici, redazione di definizioni terminologiche, IA generativa, ingegneria rapida per la terminologia. ANOTACIJA Šiame straipsnyje pristatomas generatyvinio DI (GDI) įrankių vertinimo terminologinės analizės kontekste ir jų integravimo į terminologinės analizės sistemą, taikomą pripažems, semantiškai nestabiliems, įintas terminų bazes neįtrauktiems terminams, protokolas. Jis, įgyvendinamas ARTES žinių bazėje, palengvina darbą Paryžiaus universiteto vertimo magistrantūros studentams, atliekantiems terminologinę analizę, reikalingą baigiamiesiems darbams. Tyrime principalmente attenzione skiriama terminams, kurie pasižymi semantiniu nestabilumu ir variantiškumu, todėl tai lemia semantinius neologizmus, bei GDI veiksmingumo atrenkant esamas šių terminų apibrėžtis ir rengiant naujas šių terminų apibrėžtis įvertinimui. Metodą iliustruoja atlikta studentų apklausa dėl GDI naudojimo ir eksperimentinis sąvokos inquinamento dei dati (klaidingų duomenų įrašymas) tyrimas. Rezultatai rodo, kad tekstynų lingvistikos įrankiai padeda struktūrizuoti konceptualias žinias, kritiškai įvertinti GDI išvestis ir patvirtina žmogaus atliekamos priežiūros poreikį. Tyrime siūlomas užklausų kūrimo ir vertinimo modelis, sistemingas procesas veiksmingų užklausų rinkiniui kurti bei didžiųjų kalbos modelių ir tekstynų lingvistikos technikas suderinanti terminologijos valdymo metodologija. ESMINIAI ŽODŽIAI: ARTES conoscenze bazė, tekstynais grindžiama terminologija, semantiniai neologizmai, terminologinių apibrėžčių rengimas, generatyvinis DI, užklausų kūrimas terminologijai. INTRODUZIONE In questo studio, presentiamo il protocollo per l'analisi terminologica assistita da GenAI, implementato nell'ambito del progetto ARTES. Il protocollo è specificamente progettato per 1 affrontare concetti emergenti che non sono ancora documentati nei database terminologici esistenti ma sono sempre più utilizzati nella letteratura specializzata. I concetti emergenti devono prima di tutto essere definiti. Il progetto ARTES si concentra sulla creazione delle risorse linguistiche e delle conoscenze necessarie per affrontare tali concetti, che spesso danno luogo a variazioni terminologiche […] sia formali che semantiche […] e sono generalmente assenti dalle basi di termini stabilite (cfr L[…]Homme 2024b). In questo contesto, i termini sono analizzati utilizzando una metodologia basata su corpus e registrati nella base di conoscenze ARTES, che funziona sia come base di termini che come strumento pedagogico per l'insegnamento della terminologia ai 2 futuri traduttori dell'Université Paris Cité. Inoltre, ARTES è utilizzato attivamente dagli studenti del Master come parte della loro tesi di Master in terminologia. Ogni anno gli studenti compilano corpus comparabili per condurre un'analisi terminologica approfondita e redigere documenti terminologici a sostegno della traduzione specializzata. Questo studio mira a valutare il contributo dei grandi modelli linguistici (LLM) alla gestione terminologica in questo specifico contesto educativo e a evidenziare l'importanza di condurre un'analisi basata sul corpus prima di interagire con gli strumenti di intelligenza artificiale generativa (GenAI). Lo studio illustra anche il contributo della terminologia all'ingegneria della conoscenza e la sua connessione, in questo contesto, con l'intelligenza artificiale (Condamines 2022). Utilizzando un corpus pilota composto da testi che rappresentano vari contesti di comunicazione specializzata e semi-specializzata in inglese, analizziamo il concetto di inquinamento dei dati mediante Knowledge-Rich Contexts (KRC) (Meyer 2001). 1 Disponibile all'indirizzo: https://altae.u-pariscite.fr/artes-aide-a-la-redaction-de-textes-scientifiques. 2 Available at: https://artes.app.univ-paris-diderot.fr/artes-symfony/web/app.php. 3 Il significato del termine "inquinamento dei dati" ha iniziato a cambiare nel 2018, rendendolo un candidato prezioso per studiare i processi di cambiamento semantico e le sfide coinvolte nella definizione di neologismi semantici. Mentre il termine è sempre più usato in inglese (al fianco della sua controparte più consolidata, l'inquinamento digitale, che è ben documentato nelle basi di termini), deve ancora essere registrato nei principali database terminologici con il suo nuovo significato emergente. Questo studio delinea le fasi di un protocollo sperimentale progettato per esplorare e valutare il contributo degli strumenti GenAI al lavoro terminologico, con particolare attenzione alla redazione di definizioni. L'obiettivo è quello di intraprendere un adattamento informato del curriculum terminologico nel programma di master per l'anno accademico 2025-2026. L'integrazione degli strumenti GenAI nella gestione dei termini è anche motivata dall'evoluzione dei bisogni degli studenti identificati attraverso un sondaggio i cui risultati sono presentati in questo studio. È anche guidato dai requisiti del Master europeo in 3 traduzione (EMT), affiancato dal Master ILTS in 2009. L'ultima versione del quadro di competenze EMT (2022), che copre il periodo 2023-2028, pone particolare enfasi sull'integrazione delle tecnologie e sulla necessità che i futuri traduttori aggiornino continuamente le loro competenze in materia di strumenti e tecnologie di traduzione. Alla luce dei recenti progressi nell'IA e nella traduzione automatica neurale (NMT), questo aspetto è diventato centrale per le attuali esigenze di formazione. La prima sezione dello studio è dedicata alla presentazione del contesto di base con particolare enfasi sull'interconnessione tra terminologia, linguistica del corpus e IA. Presenta inoltre il quadro ARTES per l'analisi terminologica e la fase chiave di questo processo: la redazione di definizioni terminologiche. Introduciamo anche l'approccio sperimentale per l'integrazione dei LLM nell'analisi dei termini basata sul corpus. La seconda sezione presenta la metodologia per l'elaborazione di un protocollo per l'integrazione GenAI e l'indagine condotta tra gli studenti del Master. L'ultima sezione fornisce l'analisi del protocollo progettato per la raccolta e la redazione di definizioni terminologiche integrando GenAI attraverso un approccio critico. Illustriamo anche la fase finale dell'analisi che porta alla stesura di un record di termini per il termine "inquinamento dei dati" nella base di conoscenze ARTES e il modello progettato all'interno di questo protocollo per raccogliere i prompts terminologici più efficienti. TERMINOLOGIA, INTELLIGENZA ARTIFICIALE E LE ARTE Base di conoscenze In questa sezione esaminiamo le ultime evoluzioni nella terminologia come scienza e pratica guidate dal progresso dell'IA. Successivamente presentiamo la piattaforma ARTES per la redazione di documenti di termine in linea con gli standard ISO e i principi FAIR e le possibilità che offre per interagire con l'IA. Presenta inoltre il ruolo centrale della definizione nell'analisi terminologica, in particolare nel caso di concetti e termini emergenti. 3 Master Industrie de la langue et traduction spécialisée (ILTS), UFR EILA, UPCité. 4 Secondo Leonardi (2025: 148), il lavoro di riferimento di Eugen Wüster, il fondatore della scienza della terminologia, fa parte di una lunga tradizione di interventi nei linguaggi naturali volti a migliorare la loro efficienza rappresentativa e comunicativa. Inoltre, Leonardi (2025) spiega che "questa tradizione continua nei modelli formalizzati contemporanei sviluppati nel Natural Language Processing (NLP) che sono alla base delle applicazioni di Intelligenza Artificiale". La terminologia e l'IA sono quindi intrinsecamente legate. In effetti, la convergenza tra Terminologia e IA risale al 1993, quando Didier Bourigault e Anne Condamines hanno istituito un gruppo di ricerca "Terminologia e intelligenza artificiale (TIA)". All'epoca, l'IA legata alla terminologia era radicata nell'ingegneria della conoscenza e nell'esplorazione delle interazioni tra corpora e terminologia mediante l'implementazione di un approccio simbolico utilizzando modelli per la ricerca di termini candidati e la modellazione della conoscenza. conceptual relationships (Meyer et al. 1992; Bourigault et al. 2001; Condamines, Rebeyrolle 2001; Condamines 2005). Consequently, Terminology and AI share the same goal: Inoltre, l'intersezione tra terminologia e IA attraverso il loro obiettivo condiviso […] modellazione della conoscenza […] è radicata nell'emergere della linguistica dei corpus alla fine degli anni '80, che ha fornito accesso ai corpus digitali e agli strumenti per la loro esplorazione. corpus linguistics became a leading approach in terminology studies (Pecman, Kübler 2022). It has also contributed to the development of the textual approach to terminology Nel corso del tempo, (Bourigault, Slodzian 1999), che è spesso visto come una reazione alla tradizionale metodologia prescrittiva della scuola Wüsterian (Humbley 2022). Questa connessione tra terminologia, linguistica del corpus e IA è visibile anche nell'uso di termini come terminologia computazionale e terminologia basata sul corpus. Secondo Condamines (2022), questo allineamento storico tra la terminologia e l'IA che perseguono obiettivi comuni e utilizzano strumenti comuni come corpora o grandi raccolte di dati linguistici si è progressivamente eroso, riflettendo i paradigmi mutevoli e lo sviluppo accelerato nel campo dell'IA che ha culminato negli anni 2020 con l'introduzione dei grandi modelli linguistici (LLM). Tuttavia, i dati linguistici, che servono come serbatoio per la modellazione della conoscenza, sono un altro elemento condiviso tra Terminologia, Corpus Linguistica e LLM. In circa trent'anni, la joint venture tra linguisti computazionali, NLP e specialisti IT ha culminato nello sviluppo del prototipo di ricerca, ChatGPT. Lanciato a novembre 2022, ChatGPT si è rapidamente evoluto in un'applicazione ampiamente utilizzata, illustrando la rapida assunzione pubblica delle innovazioni di intelligenza artificiale. Gli anni successivi sono stati caratterizzati dalla proliferazione di diversi tipi di LLM e strumenti GenAI: ChatGPT, DeepSeek, Perplexity, Gemini, Claude, ecc. 5 Il cambiamento di paradigma guidato dall'intelligenza artificiale Il cambiamento di paradigma portato dall'IA è in corso, ampliando la portata e le possibilità sia per la ricerca che per l'insegnamento, d'ora in poi orientato verso la valutazione e l'integrazione dell'IA. In relazione alla terminologia, alla traduzione specializzata e alla linguistica dei corpus, l'attenzione si concentra sulla valutazione critica dell'efficacia e delle insidie dell'assistenza dell'IA nell'analisi linguistica, nella traduzione e nella gestione dei termini. Mentre la maggior parte dei lavori sottolinea la necessità di un approccio critico, in particolare nel contesto dei linguaggi specializzati: ad esempio, Raus, Mattioda 2024; San Martín 2024; Davies 2025; Kübler, Pecman 2025; si possono trovare anche gli articoli molto entusiasti delle possibilità offerte dagli strumenti di IA, come lo studio di Schryver (2023) sugli effetti di ChatGPT nella lessicografia generale del linguaggio. Allo stesso tempo, la ricerca volta a migliorare le prestazioni dei modelli LLM è specificamente interessata alla terminologia specifica del dominio, in particolare alle risorse parallele, che servono come dati di formazione di alta qualità: ad esempio, Ballier et al. 2021; Bénard et al. 2023; Zhu et al. 2023. Inoltre, in questo contesto di rapida propagazione dell'IA, il numero crescente di pubblicazioni e conferenze invita gli scienziati a unirsi alla riflessione sul ruolo dell'IA nella scienza e nell'insegnamento, nelle pratiche professionali e sociali, sulle questioni etiche e del GDPR (Regolamento generale sulla protezione dei dati), nonché sulle questioni relative ai dati di formazione limitati per le lingue di minore diffusione: ad esempio: Rastier 2021; Casal, Kessler 2023; Finardi 2023; Lommel 2024. Le istituzioni contribuiscono al dibattito organizzando eventi importanti. La conferenza Interpreting Europe 2025 ha invitato professionisti, esperti del settore, accademici e studenti alla 4 discussione sul futuro dell'interpretazione, come professione, in relazione ai progressi nell'IA. Al Vertice d'azione sull'intelligenza artificiale 2025 (Sommet pour l'action sur l'intelligence artificielle) tenutosi a Parigi, oltre 60 paesi hanno firmato per la prima volta una dichiarazione volta a promuovere un'intelligenza artificiale affidabile, sostenibile e inclusiva. Allo stesso tempo, i media 5 e la stampa amplificano il dibattito portando l'argomento nella sfera pubblica, spingendo i ricercatori a raggiungere un pubblico più ampio e considerando una gamma più ampia di generi e fonti: ad esempio: Falgas, Robert 2023; Finardi 2023; Davies 2025. È quindi degno di nota che i progressi nell'IA hanno un grande impatto sui contesti scientifici, accademici ed educativi. Nel contesto degli studi di traduzione e lingua, la crescente influenza dell'IA sta rimodellando in modo significativo il comportamento degli studenti, in particolare nel modo in cui cercano e costruiscono le definizioni. Come notato da Ptasznik e Lew (2025), ChatGPT ha scatenato un dibattito tra i lessicografi. Nel loro recente studio sull'impatto dell'IA tra gli studenti polacchi di inglese, hanno scoperto che ChatGPT è ampiamente utilizzato e considerato come uno strumento prezioso per la scrittura e la traduzione. Gli autori riferiscono che gli studenti si rivolgono anche ad esso per ispirazione, curiosità e intrattenimento. Essi sottolineano inoltre che il ruolo futuro dell'IA nel campo rimane incerto. Man mano che il paesaggio tecnologico si evolve, lo fanno anche le pratiche accademiche, creando la necessità di rivedere i quadri educativi e metodologici per riflettere questi cambiamenti. 4 Disponibile all'indirizzo: https: knowledge-centre-translation-interpretation.ec.europa.eu/en/events/interpretingeurope-conference-2025. 5 Disponibile su: https: www.elysee.fr/sommet-pour-l-action-sur-l-ia. 6 Di conseguenza, gran parte della ricerca attuale in termini, sviluppo di risorse linguistiche e creazione di dizionari si concentra ora sull'esame del cambiamento di paradigma introdotto dagli strumenti di IA, insieme alla loro valutazione critica e alla loro potenziale integrazione nell'insegnamento e nella ricerca. Tra le iniziative recenti di rilievo ci sono un numero speciale della rivista Terminology, Terminology and AI, previsto per il 2027 e un workshop del 2025 a Parigi che esplorerà il ruolo dei dizionari nell'era dell'IA. Come sottolinea Altamei (2024: 429), 6 l'integrazione di CL [Corpus Linguistics] con ChatGPT ha un grande potenziale per la comprensione del linguaggio nell'era digitale. In altre parole, invece di essere cauti nell'applicazione di ChatGPT, i linguisti dovrebbero esaminare l'importanza di unire CL e ChatGPT. Anche i programmi accademici linguistici dovrebbero considerare l'importanza di applicare la tecnologia nel piano di studio dei loro diplomi. Inoltre, non sono solo i linguisti a dover prendere in considerazione questo punto, ma anche gli studiosi di altri campi che dovrebbero considerare questi aspetti e pensare all'utilizzo efficace della tecnologia nello studio dei campi della conoscenza umana. In questo contesto di urgente necessità di riflessione critica sul ruolo dell'IA e lo sviluppo di pratiche appropriate, questo studio mira a esplorare le possibilità di integrazione degli strumenti GenAI nel processo di analisi terminologica nel contesto del quadro di base di conoscenze ARTES. La necessità di tale valutazione è tanto più cruciale in quanto, con l'inevitabile integrazione dell'IA nel lavoro terminologico, la distinzione tra contenuti creati dall'uomo e contenuti creati dall'IA diventerà sempre più sfocata, come ha sottolineato San Martín (2024). La base di conoscenze ARTES e l'intelligenza artificiale La base di conoscenze ARTES è stata utilizzata dal 2010 per l'insegnamento della terminologia agli studenti del Master in Traduzione al dipartimento EILA (cfr Pecman, Kübler 2011; Kübler, 7 Pecman 2012; Gledhill, Kübler 2015; Pecman 2021). Fornisce risorse preziose per sostenere l'insegnamento e la ricerca in materia di terminologia e traduzione specializzata. Sviluppato dal team di ricerca ALTAE, ARTES è costituito da due piattaforme, una per la raccolta di risorse terminologiche e fraseologiche da parte degli studenti di traduzione e l'altra per 8 l'interrogazione del database liberamente online. ARTES è una base di termini; Tuttavia, il suo miglioramento, knowledge-oriented approach to terminology and specialised discourses also qualifies it as a knowledge base (Pecman 2018). Il principio di base del quadro ARTES è che la gestione efficiente dei termini si basa sull'acquisizione di conoscenze specialistiche. Ciò può essere ottenuto conducendo analisi dei termini onomasiologiche e semasiologiche basate su corpus, alle quali, nel quadro ARTES, si aggiunge l'analisi delle reti di conoscenza o concettuali. Va sottolineato che 6 Le dictionnaire face à l’essor de la traduction automatique et des intelligences artificielles génératives, ISIT, Paris, Il 12 giugno 2025. Disponibile su: https: www.isit-paris.fr/le-dictionnaire-face-a-lessor-de-la-traductionautomatique. 7 Disponibile su: https: u-paris.fr/eila. 8 Disponibile all'indirizzo: https://altae.u-pariscite.fr. 7 che sia la terminologia basata sul corpus (Pecman, Kübler 2022) che gli studi di traduzione basati sul corpus (CBTS) (Kübler et al. 2024) sono caratterizzati da una forte base di dati autentici tratti dai corpus, utilizzati per affrontare le sfide terminologiche e di traduzione. Inoltre, in terminologia, i corpora sono particolarmente utili per identificare e analizzare i termini e i neologismi semantici di nuova invenzione. Inoltre, la base di dati ARTES è progettata in conformità con le norme ISO (ISO 1087:2019, 704:2022, 12620-1:2022, 5078:2025) e i principi dei dati FAIR (riconoscibilità, accessibilità, interoperabilità e riutilizzazione) avviati da Wilkinson et al. (2016) e adattati per la terminologia da Vezzani et al. (2023). ARTES fornisce risorse preziose per la formazione in NMT (cfr. I progetti SPECTRANS (Ballier et al. 2021; Zhu et al. 2023) e MaTOS (Bénard et al. 2023). I dati allineati o paralleli sono disponibili per cinque tipi di elementi: termini, collocazioni, definizioni (terminologiche ed enciclopediche), note di traduzione e argomento o dominio. Nell'attuale anno accademico 2025-2026, il quadro ARTES viene esteso per esplorare l'integrazione dei LLM nell'analisi terminologica. Il protocollo è destinato a prendere in considerazione le varie fasi dell'analisi dei termini, cioè per l'identificazione dei termini e delle varianti terminologiche, la ricerca di collocazioni, termini equivalenti, contesti di definizione, KRC e per la redazione di definizioni e note. Per garantire un approccio critico e sperimentale alla valutazione dei risultati di GenAI, l'enfasi rimarrà sull'acquisizione di conoscenze sui termini attraverso un approccio basato sul corpus e sullo sviluppo delle competenze necessarie per produrre definizioni di alta qualità. Nell'analisi terminologica, le definizioni svolgono un ruolo centrale nel processo di acquisizione delle conoscenze. Di conseguenza, è importante esplorare l'efficacia degli strumenti GenAI per l'identificazione delle definizioni esistenti pertinenti e la redazione di definizioni terminologiche. Redazione di definizioni terminologiche con LLM e approccio basato sul corpus Con l'emergere della terminologia come disciplina indipendente a seguito della proposta di Wüster (1968) per la redazione di dizionari specializzati, la definizione ha assunto un ruolo centrale come elemento chiave nell'analisi dei termini. Nell'introduzione al suo dizionario inglese-francese di macchine utensili, Wüster (1968: 2.15) identifica la definizione come il primo e principale elemento essenziale per raggiungere la precisione terminologica. La definizione è anche la spina dorsale dell'approccio onomasiologico (dal concetto all'unità linguistica) nell'analisi terminologica. La definizione di concetti specializzati costituisce un primo passo per l'acquisizione di conoscenze specializzate e di competenze terminologiche. Nei programmi di master offerti dal dipartimento EILA, i futuri traduttori, interpreti e ricercatori specializzati in lingue per scopi specifici (LSP) sviluppano questa abilità attraverso corsi di terminologia. La raccolta e la redazione di definizioni terminologiche per la banca dati ARTES è uno dei requisiti per la progettazione dei documenti. Essa consiste nella redazione di una definizione originale al fine di armonizzare i dati memorizzati nella base terminologica e di fornire definizioni per concetti precedentemente non definiti o per i quali i terminologi utilizzano ampiamente solo contesti definitivi. Gli studenti redigono le definizioni selezionando le informazioni pertinenti fornite nei contesti di definizione e nel KRC, nonché analizzando i termini semanticamente available. The model for drafting definitions follows ISO standards 1087:2019 and 704:2022, 8 correlati e le reti semantiche. Essi raccolgono anche le definizioni esistenti quando sono disponibili in basi di termini di reputazione (UNTERM, IATE, Termium, ecc., cf. figura 7). La redazione di definizioni per concetti o neologismi di nuova nascita, in particolare in relazione ai termini che presentano instabilità semantica, è molto impegnativa. Nel progetto ARTES, si presta particolare attenzione alle situazioni in cui l'uso di un termine comincia a cambiare e a mostrare un cambiamento di significato, portando così alla formazione di un nuovo concetto. Si prevede che la valutazione del contributo dei LLM alla loro analisi sarà un compito complesso, come discusso da San Martín (2024), che osserva: "Se la redazione di definizioni tradizionali è ad alta intensità di lavoro, la considerazione dei vincoli contestuali e funzionali rende il compito ancora più dispendioso in tempo. Questa è un'importante barriera alla creazione di definizioni terminologiche flessibili. Gli strumenti di intelligenza artificiale generativa (GenAI), in particolare quelli alimentati da grandi modelli linguistici (LLM) come ChatGPT, possono rimuovere queste barriere riducendo il tempo e lo sforzo necessari per crearli. Tuttavia, l'impatto di GenAI può estendersi ben oltre questo, in quanto può trasformare profondamente i metodi e gli scopi alla base della creazione e del consumo di definizioni terminologiche. Per il nostro studio, abbiamo selezionato il termine "inquinamento dei dati" che abbiamo analizzato attraverso un approccio basato sul corpus prima dei test presentati in questo documento sull'analisi terminologica assistita dall'IA. Il termine "inquinamento dei dati" è un termine candidato prezioso ai fini del presente studio in quanto presenta un cambiamento semantico ed è assente dalle risorse terminologiche attualmente disponibili. Inoltre, lo studio di caso di questo termine consente una valutazione completa del quadro ARTES per la gestione dei termini, dei vantaggi dell'analisi terminologica basata su corpus e dell'efficacia dei LLM nel sostenere questo processo. Come è ben noto, i termini che subiscono un cambiamento semantico alterano sottilmente il paradigma della conoscenza sottostante, rendendo particolarmente difficile distinguere il significato appena emergente da quello originale. Tuttavia, tali termini riflettono tendenze concettuali più ampie e hanno un notevole significato terminologico (cfr. Pecman 2012; 2014). Tipicamente indicati come neologismi semantici (in contrasto con i neologismi formali) e talvolta come neosemi (Renouf 2020), questo tipo di termine deriva da una serie di fenomeni linguistici, come la polisemia e i microsensi, che li rendono particolarmente difficili da studiare (L[…]Homme 2024a; 2024b). Come sottolineano Lombard et al. (2023): […]i nuovi sensi delle parole sono chiamati […]neologismi semantici[…] e […]sono il risultato dell'estensione semantica mediante polisemia[…]. Inoltre, L[…]Homme (2024a: 216) spiega che la […]polisemia è un fenomeno prevalente con cui i terminologi si trovano spesso di fronte[…], rendendo la gestione dei termini polisemici nelle risorse terminologiche […]essenziale per evitare ambiguità nella comunicazione[…]. La sezione seguente presenta la metodologia generale utilizzata per l'elaborazione del protocollo sperimentale sull'integrazione degli strumenti GenAI nella redazione di documenti terminologici, con particolare attenzione alle definizioni terminologiche come elementi fondamentali forniti nei documenti terminologici. 9 Metodologia per l'integrazione degli strumenti Genai nelle arti Quadro basato su CORPUS Si prevede che l'integrazione dei LLM nel processo di ricerca e redazione di registri di termini e definizioni in particolare consentirà di risparmiare tempo e migliorare la qualità delle definizioni (cfr. San Martín 2024). Tuttavia, nel nostro approccio, l'analisi basata sul corpus viene condotta prima dell'introduzione dei LLM per essere in grado di integrarli e valutarli efficacemente. (2025) Davies spiega, nella sua valutazione critica di […] quanto bene le previsioni dei Large Language Models (o LLM, come ChatGPT e Gemini) corrispondessero ai dati effettivi del corpus[…], che […]un corpus è molto più immersivo ed è un'esperienza molto più connessa di quella che spesso sono solo le visualizzazioni barebones nei LLM.[…] […]...> […]Full-featured probabilmente per corpora provide an immersive learning environment with extensive links between words.‛ Moreover, Davies suggest: ‚both LLMs and corpora have their advantages and the best is utilizzare LLM in combinazione con i dati del corpus, poiché in molti casi queste due […]fonti di dati[…] si completano abbastanza bene.[…] Pertanto, per consentire un'interazione efficace con i LLM e sostenere una valutazione critica dei loro risultati, è essenziale una comprensione approfondita dei dati linguistici in fase di analisi. Consequently, in our experimental approach, the interaction with LLMs relies on corpus-based terminology, combined with prompt engineering for terminology. According Per Boonstra (2025: 7), l'ingegneria dei prompt è il processo di progettazione di prompt di alta qualità che guidano gli LLM per produrre output accurati. Questo processo comporta la ricerca del miglior prompt, l'ottimizzazione della lunghezza del prompt e la valutazione dello stile e della struttura di scrittura del prompt in relazione al compito. Nel contesto dell'elaborazione del linguaggio naturale e degli LLM, un prompt è un input fornito al modello per generare una risposta o una previsione.Per l'ingegneria del prompt, abbiamo utilizzato i modelli proposti da Boonstra (2025) originariamente sviluppati per Gemini-pro e da Schulhoff et al (2025), che abbiamo adattato per soddisfare un approccio critico agli LLM e per servire il nostro obiettivo di compilare una raccolta di prompt efficaci per la gestione dei termini. Abbiamo quindi escluso i parametri che sono progettati per influenzare il comportamento del modello, come la "temperatura" che controlla il grado di casualità nella selezione dei token, perché non sono supportati dagli strumenti GenAI testati qui. 9 Essi possono tuttavia essere regolati con una formulazione rapida: ad esempio, "Sii creativo e inaspettato". Incoraggia il comportamento ad alta temperatura mentre "Sii conciso e accurato". Incoraggia il comportamento a bassa temperatura. Nella gestione dei termini, per la ricerca di dati autentici pertinenti, si può attendere che il comportamento a bassa temperatura produca risultati migliori. Per i nostri scopi sperimentali, abbiamo aggiunto una serie di campi al modello di Boonastra, vale a dire: tecnica di sollecitazione, data, commento e 10 rilevanza. Abbiamo anche adottato la possibilità di definire il limite in modo diverso, con un certo numero di caratteri, token o oggetti. 9 Sono supportati da Application Programming Interface (API), che consente la personalizzazione delle applicazioni utilizzando LLM. 10 I diversi tipi di prompt secondo Boonastra (2025) includono: zero-shot (un prompt senza esempi forniti), one-shot (con un esempio fornito), few-shot (con diversi esempi forniti), sistema 16 Figura 6. Gli strumenti GenAI più frequenti utilizzati dagli studenti di Master 1 e Master 2 per la stesura di record di termine In questo studio, ci concentriamo quindi sul test di ChatGPT di OpenAI, così come DeepSeek sviluppato dall'azienda cinese omonima e Perplexity sviluppato da Perplexity AI che utilizza diversi LLM, vale a dire GPT sviluppato da OpenAI e Claude da Anthropic. Nelle sezioni successive, presentiamo un protocollo sequenziale sistematico per la loro integrazione nel flusso di lavoro di gestione dei termini di ARTES. Utilizzare la terminologia basata sul corpus per testare l'efficienza degli strumenti GenAI Come sottolineato nella sezione precedente, nel protocollo sperimentale che proponiamo, l'analisi terminologica mediante l'approccio basato sul corpus viene condotta prima di interagire con gli LLM per garantire la capacità di valutare criticamente l'output GenAI. Abbiamo quindi condotto l'analisi attraverso tutte le fasi del framework ARTES, cioè le fasi da 1 a 7, elencate nella sezione precedente, vale a dire utilizzando SketchEngine (Kilgarriff et al. 2014) per la progettazione e l'esplorazione di corpus specializzati, insieme a corpora integrati in SketchEngine e altri due strumenti con corpora integrati, Google Books Ngram Viewer (Michel et al. 2011) e 12 13 Netspeak 14 (Riehmann et al. 2012). La figura 7 illustra i risultati della fase 1, che consiste nel verificare se il termine è registrato nelle basi di termini esistenti. Il termine "inquinamento dei dati" è raramente registrato in basi di termini ben note, in quanto è stata trovata solo una voce in IATE, creata nel 2021, per il significato originale del termine. TERMINE RICERCA: inquinamento dei dati Data di RELEVANZA del commento del TERM BASE RECORD ricerca: 25 05 20 25 Termium Plus nessuno NA NA Vitrine linguistica nessuna NA NA 12 Disponibile all'indirizzo: https: www.sketchengine.eu. 13 Disponibile su: httpsbooks.google.com/ngrams. 14 Disponibile su: https://netspeak.org. 17 Registro IATE 1 Campi e Data di creazione del record: 2.3.2021, Significato: il primo significato del termine. informazioni fonti (dal 2018 e 2019), equivalenti in 20 lingue (tra cui francese: pollution des données) WIPO none NA forniti: definizione, contesti, mezzo NA UNTERM none NA NA dictionary IGI Global NA Figura 7. Risultati della ricerca del termine "inquinamento dei dati" nelle basi di termini esistenti Poiché il contenuto del record è dedicato al significato originale del termine, questo risultato è considerato di media rilevanza per la progettazione del record mirato. La figura 8 mostra il contenuto del record in IATE. Figura 8. Registrazione del termine "inquinamento dei dati" in IATE con informazioni sul significato originale del termine Tuttavia, i dati forniti possono essere utilizzati per creare un record di termini per l'inquinamento dei dati con il suo significato originale (che potrebbe essere glossato come "l'atto di inquinare i dati") al fine di contrastarlo con il record dedicato all'inquinamento dei dati utilizzato con il nuovo significato (che potrebbe essere glossato come "l'inquinamento causato dai dati"). La complessità della definizione dell'inquinamento dei dati con il suo nuovo significato (talvolta riformulato dall'inquinamento dei dati) è particolarmente complessa perché non solo si sovrappone al significato del termine inquinamento digitale, ma anche a causa dell'esistenza simultanea del suo significato originale (talvolta riformulato dall'inquinamento dei dati, dati inquinati). La raccolta di informazioni da risorse esistenti e la loro replicazione in registri di termini redatti in ARTES conferisce coerenza all'analisi, tenendo conto dell'ampia portata delle informazioni su un termine (figura 9). 18 INIZZZIONE di campioni di dati di addestramento elaborati malevolmente in un set di addestramento, causando al sistema di IA di imparare un modello errato e successivamente classificare erroneamente i campioni di test SOURCE IATE, Council-EN, basato su Yinzhi Cao et al. 2018: 1 SOONYME data poisoning COMMENT il primo significato del termine SOURCE Mori et al. 2024: 155 COMMENT il nuovo significato del termine, trovato in letteratura più recente SOURCE COELBACH et al. Hass 2022: 910MMENT il nuovo significato del termine, trovato in letteratura recente RELEVANCE RELEVANCE RELEVANCE RELEVANCE RELEVANCE RELEVANCE RELATE RELEVANCE RELATE RELEVANCE RELATE RELEVANCE RELATE RELATE RELEVANCE RELATE RELATE RELATE RELEVANCE RELATE based approach. Figure 10 shows the definitions retrieved from corpora by using discourse markers for definitional contexts (such as ‚is a‛, ‚is the‛, ‚refer to‛, etc.): 1 Il DEF. KRC L'inquinamento dei dati è l'insieme dei danni generati dalle attività economiche naturale, sulla raccolta, la conservazione e l'uso sociali, che ha un impatto gestione insostenibile, gli ambienti. distribuzione e generazione di risorse di dati. RELATE RELATE RELATE RELEVANCE RELATE RELATE RELATE RELATE RELATE RELATE RELATE RELATE RELATE RELATE RELATE RELATE RELATE RELATE RELATE RELATE RELATE RELATE Informazioni selezionate da IATE per la banca dati ARTES L'assenza del termine nelle basi di termini esistenti illustra l'utilità del corpus RELEVANCE high 2 Il DEF. KRC L'inquinamento dei dati è l'impatto negativo interconnesso che la generazione, lo legate alla gestione dei dati e dall'elaborazione dei dati digitali sul nostro ambiente trasversale sugli individui e sul loro ambiente di vita e sull'ambiente personale. È la 3 stoccaggio, il DEF. KRC 4 DEF. KRC I contenuti di Internet (documenti, e-mail, chat, immagini, video, ecc.) che vengono all'accumulo di tutti gli Internet sono spesso diffusi e replicati su diversi peer o server, generazione di quello che chiamiamo inquinamento dei dati. settore delle tecnologie pubblicati su In seguito il termine "inquinamento dei dati" è preso per riferirsi "contaminazioni" o "distorsioni" che possono derivare dal lavoro con i dati nella dell'informazione. 19 SOURCE Zimmerli 1986: 291 COMMENT il primo significato del termine, trovato in documenti meno recenti SOURCE Ben-Shahar 2018: 133 RELEVANCE high SOURCE Ben-Shahar 2018: 104 RELEVANCE medium COMMENT il nuovo significato del termine, trovato nella letteratura recente Figura 10. Contesti di definizione recuperati dal corpus Sebbene siano stati trovati diversi contesti di La seconda definizione rilevante per la redazione del record di termine mirato deriva da un white paper (Hasselbalch 2022), pubblicato successivamente a una monografia (Hasselbalch 2021), in cui la questione dell'inquinamento dei dati è affrontata nel quadro di un'iniziativa indipendente. 15 Il contesto definitivo 3 e 4 sono considerati di media rilevanza in quanto indicano il significato originale del termine. Nella fase successiva, l'acquisizione di conoscenze sul concetto di inquinamento dei dati attraverso il corpus è consistita nell'analisi delle concordanze del termine e, più specificamente, nell'identificazione dei KRC. L'analisi del corpus ci ha permesso di recuperare più contesti dai quali abbiamo selezionato quelli più rilevanti per la comprensione del termine e della sua relazione semantica con altri termini caratteristici di questo discorso. Questi contesti sono utili anche per fornire esempi sull'uso del termine. La figura 11 mostra un campione di KRC raccolti (con le parti selezionate in grassetto per l'interazione con i LLM, presentate nell'ultima sezione): 1 KRC Riconoscere che l'inquinamento dei dati è anche un problema pubblico che degrada un intero ecosistema e non semplicemente le singole sfere dei donatori di dati, offre una nuova e ricca prospettiva sulle soluzioni esistenti e ne introduce di nuove. definizione, solo i primi due si riferiscono al significato recente verificato dallo spostamento semantico. Questi contesti di definizione forniti nella comunicazione tra esperti sono di grande importanza per la progettazione di record di termini mirati. Il primo è particolarmente rilevante in quanto deriva da un documento pubblicato nei documenti di una conferenza 2 KRC L'informazione digitale è il carburante della nuova economia. Ma come il carburante a carbonio della vecchia economia, inquina anche. Le "emissioni di dati" dannose entrano nell'ecosistema digitale, distruggendo le istituzioni sociali e gli interessi pubblici. Questo articolo sviluppa un nuovo quadro - l'inquinamento dei dati - per ripensare ai danni che l'economia dei dati crea e al modo in cui devono essere regolamentati. internazionale. 15 L'iniziativa "Data Pollution & Power". Disponibile all'indirizzo: https: www.datapollution.eu. 20 COMMENT the new meaning of the term, found in recent literature RELEVANCE high 3 KRC Due usi tradizionali del termine inquinamento dei dati possono quindi essere combinati. In primo luogo, l'inquinamento dei dati può essere inteso come l'impatto negativo sugli ambienti personali e sociali, ad esempio sui diritti individuali, come la protezione dei dati o il diritto alla vita privata, e sulle istituzioni democratiche e sugli equilibri di potere. In secondo luogo, trasformando l'impronta professionale, sociale e di ogni tipo sul nostro ambiente naturale, informazioni pertinenti (295 caratteri) SOURCE Hasselbalch 2022: 22 COMMENT the new meaning and the original meaning of the term, put in contrast RELEVANCE alto 4 KRC e l'impatto ambientale negativo materiale dei big data su questi ambienti. Come nel impatto ambientale, ma piuttosto come gli effetti negativi interconnessi sui delicati equilibri dei nostri ecosistemi e ambienti naturali, sociali e personali. Come descritto, il termine "inquinamento dei dati" è attualmente utilizzato per sottolineare il fatto molto reale che l'obiettivo di un nuovo "movimento verde" per i big data è la "sostenibilità dei Libro bianco, l'inquinamento dei dati è affrontato in modo simile non solo come un tipo di dati", che attraversa gli SDGs con considerazioni di sostenibilità collegate ai vari cambiamenti ambientali causati dal volume e dalla diversità dei big data, dai suoi effetti sul paesaggio naturale alle nostre decisioni e alla democrazia. SOURCE Hasselbalch 2022: 22–25 COMMENTARIO ad esempio, il carbonio. L'esempio mostra l'intreccio del nuovo significato e del significato RELEVANCE alto Figura 11. Recupero di contesti ricchi di conoscenze (KRC) in un corpus specializzato I KRC da 1 a 4 illustrano il termine utilizzato con un nuovo significato. Nella fase successiva, sulla 16 base dei contesti di definizione raccolti e dei KRC (Figure 10-11), possiamo fare una proposta per una definizione terminologica, presentata nella Figura 12: Progetto caratterizzato da un tipo specifico di inquinamento legato alle tecnologie originale della vita quotidiana degli individui e del loro ambiente in un modo che sembra non dell'informazione e all'era digitale l'inquinamento dei dati può essere causato dalla crescente generazione di dati che sta essere in accordo con i big data. il termine con le loro capacità o esigenze per recuperare le SOURCE termine record nome dell'autore, basato su Mori et al. 2024, Hasselbalch et al. 2022 e Ben16 Abbiamo anche raccolto i KRC pertinenti che illustrano il primo significato del termine per la redazione del record del termine concorrente al fine di collegare i due record e fornire una nota sul legame semantico tra i due termini. 21 Shahar 2018 RELEVANCE alto GOAL Trovare KRC e riferimenti pertinenti MODEL ChatGPT-4-turbo LIMIT 3 definizioni Figura 12. In questa fase della nostra analisi sperimentale, abbiamo osservato un pregiudizio cognitivo: la restrizione all'interazione con i LLM prima di finalizzare l'analisi Laurea in giurisprudenza. Introduzione degli strumenti GenAI al processo di analisi dei termini Trovare contesti ricchi di conoscenza (KRC) e fonti pertinenti Abbiamo prima testato la capacità dei LLM di trovare contesti definitivi. L'obiettivo era quello di scrivere un prompt che restituisse i contesti definitivi più rilevanti in virgolette seguiti da un riferimento. Dopo diversi tentativi, la tecnica di suggerimento illustrata nella figura 13 ha prodotto risultati utili. Tuttavia, non ha restituito contesti specifici di definizione, il che nel caso in esame non è sorprendente. L'analisi basata sul corpus ha mostrato che i contesti di definizione per l'inquinamento dei dati sono rari. Il prompt ha restituito KRC utili e riferimenti pertinenti per la progettazione del corpus. Utilizzando una combinazione di prompting di sistema e prompting step-back, otteniamo il not only the results relevant for the new meaning of the term, but also in the desired format. By restricting the search to specific type of literature (scientific) and limiting numero di definizioni da cercare (tre), abbiamo limitato LLM per produrre l'output più rilevante (vedi Prompt 2 nella figura 13). Inoltre, abbiamo prima posto una domanda per consentire al LLM di attivare la conoscenza generale (prompt 1 nella figura 13), prima di chiedergli di trovare gli esempi più pertinenti. La figura 13 presenta il test condotto su ChatGPT: basata sul corpus è diventata un ostacolo in quanto ha richiesto un sostanziale autocontrollo. Nella fase successiva, abbiamo quindi introdotto LLM per la ricerca di KRC e fonti pertinenti, la stesura di definizioni informate da KRC, la revisione delle definizioni di termini (umani) e per la stesura di definizioni attraverso un'interazione "loop" con DATE 13/05/2025 TECHNIQUE generazione di dati che sta trasformando la Step-back prompting, system prompting individui PROMPT Qual è la differenza tra 1 "inquinamento dei dati" definito in questi termini "tipo specifico di pollution related to information technologies and digital era characterised by the increasing vita professionale, sociale e quotidiana degli 22 e il loro ambiente in un modo che non sembra essere conforme alle recupero delle informazioni pertinenti e l'inquinamento digitale? dati" nella letteratura scientifica e fornire le fonti per ciascuna OUTPUT I termini "inquinamento dei dati" e "inquinamento digitale" definizione trovata. Restituire le definizioni nell'elenco con l'esatto sono correlati ma distinti in termini di obiettivo e loro capacità formulazione trovata nei testi seguita dal riferimento L'URL. Vuole un confronto di tabelle per la chiarezza? PROMPT 1 ambito di applicazione: Inquinamento dei dati Focus: gli effetti dannosi di dati eccessivi o mal gestiti - la loro raccolta, immagazzinamento, elaborazione e utilizzo. Principali preoccupazioni: Sovraccarico di dati irrilevanti, parziali o dannosi Costi ambientali e sociali delle infrastrutture di big data Impatto sull'attenzione umana, sulla privacy e sul processo decisionale Interruzione degli ecosistemi sociali e informativi Analogia: paragonabile all'inquinamento chimico […] contaminazione dell'ambiente informativo con sottoprodotti nocivi. Inquinamento digitale Focus: L'impatto ambientale e delle risorse più ampio delle tecnologie digitali. Principali preoccupazioni: Consumo energetico e impronta di carbonio di dispositivi, server e reti Rifiuti elettronici provenienti da hardware e dispositivi Impatto del ciclo di vita della produzione e dello smaltimento di strumenti digitali Analogia: paragonabile all'inquinamento industriale […] danni fisici ed ecologici causati dalle infrastrutture digitali. Riassunto della differenza L'inquinamento dei dati riguarda il contenuto e le conseguenze dei dati stessi e i loro effetti socio-ambientali. L'inquinamento digitale riguarda il costo ambientale dei sistemi digitali che immagazzinano, bibliografico della fonte e dei suoi e dati di processo. o le esigenze di Trovare le tre definizioni più pertinenti del termine "inquinamento dei trasmettono, OUTPUT ‚L'informazione digitale è il carburante della nuova economia. Ma come il entrano nell'ecosistema digitale, distruggendo le istituzioni sociali e gli interessi pubblici. carburante a carbonio della vecchia economia, 2 inquina anche. Le "emissioni di dati" dannose Ben-Shahar O. 2018: Data Pollution 679, University of Chicago Public Law & Legal Theory Paper Series. Available at: L'inquinamento dei dati è l'impatto negativo interconnesso che la generazione, l'archiviazione, la gestione e l'elaborazione dei dati digitali hanno sul nostro ambiente naturale, sociale e personale. È la gestione, la distribuzione e la generazione insostenibili delle risorse di dati. […]Hasselbalch G. et al. 2022: Data Pollution & Power […] White Paper for a Global Sustainable Energy https: www.researchgate.net/publication2174889_Data_Pollution_PowerWhite_Paper_for_a_Global_SustaDevelopment Agenda on AI. Available at: inable_Development_Agenda_Data_on_AI_Gry_by_Hasselbalch _with_contributions_from_the_Pollution_Power_PDP_Group_at_Bonn_AI_Sustainable_Power _Lab 23 Il concetto di inquinamento dei dati include l'inquinamento dell'informazione o l'infolluzione (Özdemir 2016), come coniato da Oram 1984. Tuttavia, l'inquinamento dell'informazione è in certa misura diverso; "La contaminazione delle fonti di informazione con informazioni irrilevanti, ridondanti, non richieste e di basso valore" o come citano Cai e Zhang (1996): ""è un mucchio di messaggi diffusi ma indesiderati e che un giorno questi messaggi potrebbero influenzare citazione, fuorviante" Disponibile su: RELEhigh https: www.academia.edu/76896486 citazione, fonte fornita e ben costruita un altro termine), fonte fornita ma mal costruita, non profondamente la vita sociale portando MENT 2nd un contesto definitivo, una citazione, fonte fornita e risultati negativi ben costruiti". 3rd non un contesto definitivo, un KRC, una Data_Pollution_and_Taxation VANCE COM-1st non un contesto di definizione, un KRC, una un registro scientifico (registro accademico) Figura 13. Ingegneria rapida per la gestione dei termini: trovare KRC e riferimenti pertinenti con ChatGPT Sebbene sia stato restituito solo uno dei quattro contesti definitivi trovati dall'approccio basato sul corpus, insieme a due KRC, l'output è rilevante per l'analisi del concetto di inquinamento dei dati. In primo luogo, l'output mostra che l'approccio basato sul corpus non può essere aggirato per selezionare i migliori contesti di definizione e KRC, nonché per valutare efficacemente l'output del LLM. In secondo luogo, ChatGPT ha restituito una fonte che non è stata identificata durante la fase di progettazione del corpus. Sebbene appartenga a un registro accademico piuttosto che scientifico, può rivelarsi utile nell'analisi 17 successiva su termini semanticamente correlati e essere utilizzato per aumentare il corpus: il marcatore discorsivo ‚include‛ deduce che l'inquinamento dell'informazione è un meronimo dell'inquinamento dei dati, e i marcatori ‚or‛ e le citazioni semplici che infolluzione è un sinonimo di inquinamento dell'informazione. Tuttavia, questa terza proposta fatta da ChatGPT come contesto di definizione è fuorviante perché contiene due definizioni di un altro concetto (inquinamento dell'informazione) e nessuna definizione del concetto ricercato. Inoltre, in un prompt precedente, abbiamo utilizzato la stessa istruzione senza specificare che l'output previsto sono le citazioni, il che ha portato a citazioni riformulate e dati fuorvianti (cfr. figura 24 nell'appendice). Elaborazione di definizioni basate sul KRC Il test successivo consisteva nel chiedere ai LLM di redigere una definizione supportata da una selezione di KRC. Abbiamo selezionato tre KRC: il contesto definitivo 1 (nella figura 10) e gli estratti dei KRC 1 e 4 (in grassetto nella figura 11). La figura 14 mostra questa prova con ChatGPT, DeepSeek e Perplexity. 17 Nel quadro di ARTES, le tesi di master sono consultate quando mancano fonti specializzate. In generale, non sono utilizzati per la costruzione di corpora specializzati. Essi sono considerati appartenenti al registro accademico piuttosto che scientifico. 24 115b bG115a Definizione DATE 13/05/2025 basata sul NIQUE 4. KRC per la LIMIT 300 caratteri PROMPT Elaborare la definizione terminologica del termine "inquinamento dei dati" in non più di 300 caratteri sulla base di questi contesti ricchi di conoscenze: L'inquinamento dei dati è l'insieme dei danni generati dalle attività economiche legate alla raccolta, alla conservazione e all'uso dei dati, che ha un impatto trasversale sugli individui e sul loro ambiente di vita. L'inquinamento dei dati è anche un problema pubblico che degrada l'intero ecosistema e non solo le singole sfere dei donatori di dati. L'inquinamento dei dati è considerato non solo un tipo di impatto ambientale, ma piuttosto gli effetti negativi interconnessi sui delicati equilibri dei nostri ecosistemi e ambienti naturali, sociali e personali. Il termine "inquinamento dei dati" è attualmente utilizzato per sottolineare l'impatto ambientale negativo molto reale e materiale dei big data. MODEL ChatGPT-4-- turbo DeepSeek-V3 Perplexità OUTPUT L'inquinamento dei dati si riferisce dannoso dei dati i danni causati da attività legate ai attività economiche, degradazione naturale, sonaturi, sociali e personali temi avversi. Si tratta di un ampio, collettivo, con impatti individuali che si all'intero inquinamento all'inquinamento dei dati si sistemici causati da attività dati che coinvolgono dati raccolta, stoccaggio e uso e sociale, che degrada gli e gli ecosistemi personali, problema pubblico, effetti ambientali avversi estendono oltre la semplice ambientale. Preoccupazioni. (298 caratteri) Caratteristiche chiave rilevate: 1. Danni sistemici […] Sottolinea il degrado su larga scala, non solo gli effetti individuali. 2. Radici economiche […] Link alla raccolta, alla conservazione e all'uso dei dati. 3. Impatto trasversale […] Colpisce gli ambienti naturali, sociali e redazione di TECH-Zero shot ments. Oltre la privacy […] Posiriferisce al sottoprodotto economiche correlate come raccolta, stoccaggio, uso che interrompono la ecosistemi naturali, influenzando sia attraverso individuale e ambientale più interconnessi in modi e privacy degli individui 25 personali come questione ecologica o pubblica. Ciò si allinea con la definizione dell'inquinamento informazioni mentali e Fammi sapere se hai un alto COM MENT relativamente adeguatamente chiaro, abbastanza formulato, conciso dei dati come un enviconcise, sociali ipernimiche che sono adeguatamente formulato, inadeguatamente formulato relativamente chiaro, abbastanza (due espressioni), complesso con ulteriori (per la scelta di meno chiare) con lenge. allineamento a KRC RELE alto basso TECH-Zero tiro come qualsiasi regolazione! esempi, abbastanza concisi VANCE NIQUE Figura 14. Ingegneria rapida per la gestione dei termini: redazione di definizioni informate da KRC con ChatGPT, DeepSeek e Perplexity I tre risultati sembrano rilevanti per la gestione dei termini e questo metodo può essere considerato adatto per la redazione di definizioni terminologiche con l'assistenza di LLM. In effetti, la fornitura di KRC guida i LLM a produrre una definizione del nuovo significato emergente del termine. I risultati di ChatGPT e DeepSeek appaiono più appropriati, rispetto a Perplexity. Nell'appendice, nella figura 25, forniamo un esempio dei rischi dell'uso di prompt insufficientemente limitati quando si gestiscono termini sottoposti a spostamento semantico with LLMs. Revising and improving bio-definition by LLMs Nel test successivo, abbiamo chiesto agli strumenti GenAI di migliorare la definizione che abbiamo redatto senza l'aiuto di strumenti AI, sulla base di informazioni raccolte, vale a dire vari KRC, che proponiamo di chiamare "bio-definizione" (figura 15): Obiettivo Miglioramento della bio-definizione DATE 13/05/2025 LIMIT 300 characters PROMPT Improve this definition of the term ‚data pollution‛: specific type of pollution related to le tecnologie dell'informazione e l'era digitale caratterizzate dalla crescente generazione di dati che sta trasformando la vita professionale, sociale e quotidiana degli individui e del loro ambiente in un modo che sembra non essere in accordo con le loro capacità o bisogni di recuperare informazioni pertinenti; 32 Per evidenziare il doppio significato del termine, ARTES fornisce due registrazioni separate: una per il significato originale e un'altra per il nuovo significato emergente (figura 21-22), e una nota estesa sui termini concorrenti (figura 22). Figura 21. L'interfaccia ARTES DB mostra i due record per l'inquinamento dei dati per distinguere l'originale dal nuovo significato Figura 22. L'interfaccia ARTES DB mostra la voce per l'inquinamento dei dati 2, il concetto di nuova nascita, insieme alle informazioni sull'inquinamento dei dati 1 definite come termine (e concetto) simultaneo, compresa una nota esplicativa Infine, la figura 23 mostra i seguenti elementi dello schema concepito per la creazione di una collezione di prompt efficienti per la gestione dei termini assistita da LLM all'interno del quadro ARTES mediante approccio sperimentale: la pagina di partenza dell'interfaccia di raccolta dei prompt, un campo di testo per la registrazione del prompt progettato, un campo di testo per fornire un esempio dell'output prodotto, la dimensione di output richiesta (in caratteri o parole), una valutazione della qualità del prompt (sulla base dell'output ottenuto). 33 Figura 23. Uno schema concepito per creare una raccolta di prompts efficienti per la gestione dei termini assistita da LLM Osservazioni conclusive Questo studio ha esplorato il potenziale per l'integrazione degli strumenti GenAI nell'analisi terminologica, in particolare per la redazione di record di termini all'interno della base di conoscenze ARTES e del quadro pedagogico utilizzato per l'insegnamento della terminologia agli studenti di master in traduzione all'Université Paris Cité. Abbiamo selezionato il termine inquinamento dei dati che presenta un cambiamento semantico, come studio di caso, per condurre un'analisi esplorativa e costruire un protocollo per un'interazione efficiente con LLM e strumenti GenAI. Questo protocollo è ora in fase di integrazione nel curriculum di formazione terminologica all'interno del programma di Master. Abbiamo anche condotto un'indagine tra 50 studenti di Master in traduzione, che ha mostrato che la metà degli studenti utilizza LLM per la stesura di documenti semestrali, il che rafforza ulteriormente la necessità di guidarli nel loro uso efficiente. I risultati sperimentali del nostro studio evidenziano il valore degli strumenti corpus-linguistici nell'assistenza all'analisi terminologica, consentendo la costruzione e l'organizzazione della conoscenza concettuale, nonché la valutazione della qualità dell'output degli strumenti GenAI. Il protocollo progettato per l'integrazione dell'IA nell'analisi terminologica ha dimostrato che gli strumenti GenAI possono essere utili per la revisione e il miglioramento delle definizioni terminologiche bio-elaborate, ma che l'intervento umano è di primaria importanza. Questi risultati si allineano con i lavori recenti sull'integrazione dell'IA nell'insegnamento e nella ricerca (cfr. Kübler et al. 2024; Raus, Mattioda 2024; San Martín 2024; Kübler, Pecman 2025) e rafforzano le 34 raccomandazioni chiave che ne emergono, vale a dire la necessità di promuovere un approccio critico alle tecnologie dell'IA e di sviluppare metodi efficienti per valutare l'output generato dalle macchine. I risultati teorici del nostro studio evidenziano il ruolo cruciale delle analisi esplorative nel panorama attuale degli strumenti di IA in rapida evoluzione, in particolare nella progettazione di schemi efficaci per l'integrazione di GenAI e LLM. Al centro di questo processo c'è la necessità di un'analisi umana preliminare. La padronanza delle conoscenze e dei dati linguistici specifici del dominio è essenziale per valutare la qualità dei risultati di GenAI e per elaborare prompt efficaci per affrontare le risposte inesatte. Nel contesto della terminologia, ciò richiede competenze in concetti specializzati e l'applicazione di approcci basati su corpus all'analisi dei termini. Corpo linguistics emerges as a key method for informed interaction with GenAI tools and prompt engineering. Una sfida degna di nota incontrata durante il nostro studio è stato il pregiudizio cognitivo introdotto limitando deliberatamente le interazioni LLM, che richiedeva una notevole autodisciplina. In risposta, il protocollo proposto in questo documento sostiene un'integrazione sequenziale degli strumenti GenAI in varie fasi di recupero delle informazioni e di analisi terminologica. Future research will focus on testing and refining this protocol with translation studenti in corsi di terminologia. Il nostro obiettivo è quello di espandere la metodologia per coprire tutte le fasi della redazione dei documenti terminologici, con l'obiettivo di migliorare il recupero e la generazione di informazioni terminologicamente pertinenti in interazione con gli strumenti GenAI. Uno degli obiettivi fondamentali del protocollo è quello di sviluppare una collezione curata di prompt altamente efficaci per la creazione di record a termine. Il nostro studio ha gettato le basi per questo, offrendo un modello per la costruzione e la valutazione rapida, adattato per comprendere diversi modelli linguistici, tipi di attività e set di dati linguistici, e che continueremo a testare, adattare e perfezionare in ulteriori studi. REFERENCES Altameemi Yaser M. 2024: State-of-the-art Review of the Corpus Linguistics Field from the Beginning Until the Development of ChatGPT. – Theory and Practice in Language Studies 14(2), 423–431. Available at: https://doi.org/10.17507/tpls.1402.13. ARTES. Available at: https://artes.app.univ-paris-diderot.fr/artes-symfony/web/app.php. Ballier Nicolas, Cho Dahn, Faye Bilal, Ke Zong-You, Martikainen Hanna, Pecman Mojca, Wisniewski Guillaume, Yunès Jean-Baptiste, Zhu Lichao, Zimina-Poirot Maria 2021: The SPECTRANS System Description for the WMT21 Terminology Task. – ACL Rolling Review, a New Initiative of the Association for Computational Linguistics, 818– 825. Available at: http://www.statmt.org/wmt21/pdf/2021.wmt-1.80.pdf. Bénard Maud, Mestivier Alexandra, Kubler Natalie, Zhu Lichao, Bawden Rachel, de la Clergerie Eric, Romary Laurent, Huguin Mathilde, Nominé Jean-Francois, Peng Ziqian, Yvon François 2023: MaTOS: Traduction automatique pour la science ouverte [MaTOS: Machine Translation for Open Science]. – Actes de l'atelier 35 “Analyse et Recherche de Textes Scientifiques” (ARTS)@TALN 2023, 8–15. Available at: https://aclanthology.org/2023.jeptalnrecital-arts.2.pdf. Boonstra Lee 2025: Prompt Engineering. White paper. Available at: https://www.kaggle.com/whitepaper-prompt-engineering. Bourigault Didier, L’Homme Marie-Claude, Jacquemin Christian 2001: Recent Advances in Computational Terminology, Amsterdam/Philadelphia: John Benjamins. Bourigault Didier, Slodzian Monique 1999: Pour une terminologie textuelle [Towards a Textual Terminology]. – Terminologies nouvelles 19, 29–32. Casal J. Elliott, Kessler Matt 2023: Can Linguists Distinguish Between ChatGPT/AI and Human Writing? A Study of Research Ethics and Academic Publishing. – Research Methods in Applied Linguistics 2(3), 100068. Available at: https://doi.org/10.1016/j.rmal.2023.100068. ChatGPT, based on GPT-4-turbo, released on the 6th November 2023, OpenAI. Available at: https://chatgpt.com. Condamines Anne 2005: Linguistique de corpus et terminologie [Corpus Linguistics and Terminology]. – Langages 157. La terminologie: nature et enjeux, ed. L. Depecker, 36– 47. Condamines Anne 2022: Terminologie, Intelligence Artificielle et Psychologie cognitive: réflexions sur les interactions possibles dans l’étude de la variation en langues spécialisées [Terminology, Artificial Intelligence and Cognitive Psychology: Reflections on Possible Interactions in the Study of Variation in Specialised Languages]. – De Europa. European and Global Studies Journal, Special Issue on Multilingualism and Language Varieties in Europe in the Age of Artificial Intelligence, Università di Torino, 131–148. Condamines Anne, Rebeyrolle Josette 2001: Searching for and Identifying Conceptual Relationships via a Corpus-Based Approach to a Terminological Knowledge Base (CTKB). – Recent Advances in Computational Terminology, ed. D. Bourigault, M.- C. L’Homme, C. Jacquemin, Amsterdam/Philadelphia: John Benjamins, 127–148. Davies Mark 2025: Corpora and AI/LLM: Comparison of the Predictions of LLMs (ChatGPT and Gemini) to Actual Corpus Data (mainly from English-Corpora.org). White paper. Available at: https://www.english-corpora.org/ai-llms/english-corpora-with-aillms.pdf, alongside a video posted on the 18th of March 2025. Available at: https://youtu.be/WAzWoNzhZ9A?si=JT6TAhOMLkXjUoa4. DeepSeek, based on DeepSeek-V3-0324, 深度求索 (DeepSeek). Available at: https://chat.deepseek.com. EMT Competence Framework 2022. Available at: https://commission.europa.eu/system/files/202211/emt_competence_fwk_2022_en.pdf. 36 Falgas Julien, Robert Pascal 2023: Présenter l’IA comme une évidence, c’est empêcher de réfléchir au numérique (repris sur le titre: Comment le discours médiatique sur l’IA empêche d’envisager d’autres possibles) [Presenting AI as a Fact Prevents Reflection on Digital Technologies (based on the title: How Media Discourse on AI Prevents Considering Other Possibilities)]. – The conversation, 19 octobre 2023. Available at: https://theconversation.com/comment-le-discours-mediatique-sur-lia-empechedenvisager-dautres-possibles-211766. Finardi Kyria 2023: The Paradox of our Time and Role of Applied Linguists in it: Conférence donnée à l’occasion du webinaire 2023 de l’AFLA. Available at: http://www.aflaasso.org/webinaire-2023. Gledhill Christopher, Kübler Natalie 2015: How Trainee Translators Analyse LexicoGrammatical Patterns. – Journal of Social Sciences 11(3): Special issue on Phraseology, Phraseodidactics and Construction Grammar(s), ed. M. I. González-Rey, 162–178. Humbley John 2022: The Reception of Wüster’s General Theory of Terminology. – Theoretical Perspectives on Terminology: Explaining Terms, Concepts and Specialized Knowledge, ed. P. Faber, M.-C. L’Homme, Book coll. ‚Terminology and Lexicography Research and Practice‛, Amsterdam/Philadelphia: John Benjamins, 15–36. IATE. Available at: http://iate.europa.eu. IGI Global Dictionary. Available at: https://www.igi-global.com/dictionary. ISO – TC 37 Language and Terminology – ISO Standard 1087:2019(en) Terminology Work and Terminology Science: Vocabulary. Available at: https://www.iso.org/obp/ui/#iso:std:iso:1087:ed-2:v1:en. ISO – TC 37 Language and Terminology – ISO Standard 704:2022(en) Terminology Work – Principles and Methods. Available at: https://www.iso.org/obp/ui/en/#iso:std:iso:704:ed-4:v1:en. ISO/TC 37/SC 3/WG 6 Terminology Management and Artificial Intelligence – ISO Standard 5078:2025(en) Management of Terminology Resources – Terminology Extraction. Available at: https://www.iso.org/obp/ui/en/#iso:std:iso:5078:ed1:v1:en. ISO/TC 37/SC 3/WG 6 Terminology Management and Artificial Intelligence – ISO Standard 12620-1:2022 Management of Terminology Resources – Data Categories – Part 1: Specifications. Available at: https://www.iso.org/obp/ui/en/#iso:std:iso:12620:-1:ed-1:v1:en. Kilgarriff Adam, Baisa Vít, Bušta Jan, Jakubíček Miloš, Kovář Vojtěch, Michelfeit Jan, Rychlý Pavel, Suchomel Vít 2014: The Sketch Engine: Ten Years On. – Lexicography 1, 7–36. 37 Kübler Natalie, Martikainen Hanna, Mestivier Alexandra, Pecman Mojca 2024: Post-editing Neural Machine Translation in Specialised Languages: the Role of Corpora in the Translation of Phraseological Structures. – Recent Advances in Multiword Units in Machine Translation and Translation Technology, ed. I. J. Monti, G. Corpas Pastor, R. Mitkov, C. Manuel Hidalgo-Ternero, Current Issues in Linguistic Theory 366, Amsterdam/Philadelphia: John Benjamins, 57–78. Kübler Natalie, Pecman Mojca 2012: The ARTES Bilingual LSP Dictionary: from Collocation to Higher Order Phraseology. – Electronic Lexicography, ed. S. Granger, M. Paquot, Oxford: Oxford University Press, 187–209. Kübler Natalie, Pecman Mojca 2025: Corpus Linguistics: a Dinosaur or an Elephant in the IA Room? A Word from Terminology and Translation Studies Perspective: Phd Seminar – Winter school – Foreign Literatures and Languages school, 5–6 February 2025, Università di Verona, Italy. Leonardi Natascia 2025: Terminology Science, International Languages, and Knowledge Communication. – Terminology Throughout History. A discipline in the Making, ed. K. Warburton, J. Humbley, Terminology and Lexicography Research and Practice 24, Amsterdam/Philadelphia: John Benjamins Publishing Company, 148– 166. L’Homme Marie-Claude 2024a: Managing Polysemy in Terminological Resources. – Terminology 30(2), 216–249. L’Homme Marie-Claude 2024b: Seven Good Reasons for a Better Account of Fine-grained Polysemy in Terminological Resources. – Terminologija 31, 6–23. Available at: https://journals.lki.lt/terminologija/article/view/2407/2408. Lombard Alizée, Huyghe Richard, Barque Lucie, Gras Doriane 2023: Regular Polysemy and Novel Word-sense Identification. – The Mental Lexicon 18(1), 94–119. Lommel Arle 2024: The Rise of Large Language Models Informed by not so Large Corpora of Training Data. – Digital Translation 11/1, 73–84. Available at: https://doi.org/10.1075/dt.24006.lom. Meyer Ingrid 2001: Extracting Knowledge-Rich Contexts for Terminography: A Conceptual and Methodological Framework. – Recent Advances in Computational Terminology, ed. D. Bourigault, Ch. Jacquemin, M.-C. L’Homme, Amsterdam/Philadelphia: John Benjamins, 279–302. Meyer Ingrid, Bowker Lynne, Eck Karen 1992: Cogniterm: An Experiment in Building a Terminological Knowledge Base. – Proceedings of 5th EURALEX International Congress on Lexicography, Tampere, Finland. Tampere: Studia Translatologica, 159– 172. Michel Jean-Baptiste, Shen Yuan Kui, Aiden Aviva Presser, Veres Adrian, Gray Matthew K., Brockman William, The Google Books Team, Pickett Joseph P., Hoiberg Dale, 38 Clancy Dan, Norvig Peter, Orwant Jon, Pinker Steven, Nowak Martin A., Aiden Erez Lieberman 2011: Quantitative Analysis of Culture Using Millions of Digitized Books. – Science 331(6014), 176–82. Available at: https://pubmed.ncbi.nlm.nih.gov/21163965. Pecman Mojca 2012: Tentativeness in Term Formation: a Study of Neology as a Rhetorical Device in Scientific Papers. – Neology in Specialized Communication, ed. M. Teresa Cabré Castellví, Rosa Estopá Bagot, Maria C. Vargas Sierra. – Special issue of Terminology 18(1), 27–58. Pecman Mojca 2014: Variation as a Cognitive Device: How Scientists Construct Knowledge Through Term Formation. – Terminology 20(1), 1–24. Pecman Mojca 2018: Langue et construction de connaisSENSes. Energie lexico-discursive et potentiel sémiotique des sciences [Language and the Construction of Meaning and Knowledge: Lexico-Discursive Energy and the Semiotic Potential of Science]: monographie, préface de M.-C. L’Homme. Paris: Editions L’Harmattan. Pecman Mojca 2021: 10th Anniversary of the ARTES Terminological and Phraseological Database. – Svijet od riječi: terminološki i terminografski ogledi (“The world of words: Terminological and terminographic discussions), ed. I. Brač, A. Ostroški Anić, Izdavalacko izdanje Instituta za hrvatski jezik i jezikoslovlje (Publication of the Institut of Croatian language and linguistics, Zagreb), 301–324. Pecman Mojca, Kübler Natalie 2011: ARTES: An Online Lexical Database for Research and Teaching in Specialized Translation and Communication. – Proceedings from International Workshop on Lexical Resources (WoLeR) 2011 at ESSLLI, 1–5 August 2011, Ljubljana, Slovenia, 87–93. Available at: http://alpage.inria.fr/~sagot/pub/WoLeR_2011_proceedings.pdf. Pecman Mojca, Kübler Natalie 2022: Text Genres and Terminology. – Theoretical Perspectives on Terminology: Explaining Terms, Concepts and Specialized Knowledge, ed. P. Faber, M.-C. L’Homme, Book coll. Terminology and Lexicography Research and Practice, Amsterdam/Philadelphia: John Benjamins, 263–289. Perplexity, based on GPT-4o/Claude 4.0 Sonnet, released on the 6th of May 2025, Perplexity AI. Available at: https://www.perplexity.ai. Ptasznik Bartosz, Robert Lew 2025: Dictionaries Versus AI Tools Through the Eyes of English Majors: International Journal of Lexicography 38(2), 140–158. Available at: https://doi.org/10.1093/ijl/ecaf005. Rastier François 2021: Data vs corpora. – L’intelligence artificielle des textes. Des algorithmes à l’interprétation [The Artificial Intelligence of Texts: From Algorithms to Interpretation] 15, ed. D. Mayaffre, L. Vanni, coll. Lettres numériques, Paris: Éditions Honoré Champion, 203–246. 39 Raus Rachele, Mattioda Maria Margherita 2024: L’intelligence artificielle en salle de classe: la perception des étudiantes et des étudiants [Artificial Intelligence in the Classroom: Students’ Perceptions]. – Multilinguisme européen et IA: entre droit, traduction et didactique des langues/Multilinguismo europeo e IA tra diritto, traduzione e didattica delle lingue/European Multilingualism and Artificial Intelligence: The Impacts on Law, Translation and Language Teaching, ed. R. Raus, F. Bisiani, M. M. Mattioda, M. Tonti, De Europa, Special Issue, 221–231. Renouf Antoinette 2020: Semantic Neology. Challenges in Matching Corpus-based Semantic Change to Real-world Change. – Corpora and the Changing Society. Studies in the Evolution of English, ed. P. Rautionaho, A. Nurmi, J. Klemola, Amsterdam/Philadelphia: John Benjamins, 79–112. Riehmann Patrick, Gruendl Henning, Potthast Martin, Trenkmann Martin, Stein Benno, Fröhlich Bernd 2012: WORDGRAPH: Keyword-in-Context Visualization for NETSPEAK’s Wildcard Search. – IEEE Transactions on Visualization and Computer Graphics 18(9), 1411–1423. Available at: https://downloads.webis.de/publications/papers/riehmann_2012.pdf. San Martín Antonio P. 2024: What Generative Artificial Intelligence Means for Terminological Definitions. – Proceedings of the 3rd International Conference on Multilingual Digital Terminology Today (MDTT 2024), Granada: CEUR-WS. Available at: https://ceur-ws.org/Vol-3703/paper1.pdf. de Schryver Gilles-Maurice 2023: Generative AI and Lexicography: The Current State of the Art Using ChatGPT. – International Journal of Lexicography 36(4), 355–387. Schulhoff Sander, Michael Ilie, Nishant Balepur, Konstantine Kahadze, Amanda Liu, Chenglei Si, Yinheng Li, Aayush Gupta, HyoJung Han, Sevien Schulhoff, Pranav Sandeep Dulepet, Saurav Vidyadhara, Dayeon Ki, Sweta Agrawal, Chau Pham, Gerson Kroiz, Feileen Li, Hudson Tao, Ashay Srivastava, Hevander Da Costa, Saloni Gupta, Megan L. Rogers, Inna Goncearenco, Giuseppe Sarli, Igor Galynker, Denis Peskoff, Marine Carpuat, Jules White, Shyamal Anadkat, Alexander Hoyle, Philip Resnik 2025: The Prompt Report: A Systematic Survey of Prompt Engineering Techniques. Available at: https://arxiv.org/pdf/2406.06608. Termium Plus. Available at: https://www.btb.termiumplus.gc.ca. UNTERM. Available at: https://unterm.un.org/unterm2/en. Vezzani Federica, Di Nunzio Giorgio, Maria Costa Rute 2023: ISO Standards for Terminology Resources Management. Are They FAIR Enough? – Digital Translation 10/2, Amsterdam/Philadelphia: John Benjamins, 233–252. Available at: https://doi.org/10.1075/dt.00009.vez. Vitrine Linguistique. Available at: https://vitrinelinguistique.oqlf.gouv.qc.ca. 40 Wilkinson Mark D., Dumontier Michel, Aalbersberg IJsbrand Jan, Appleton Gabrielle 2016: The FAIR Guiding Principles for Scientific Data Management and Stewardship. – Scientific Data 3, 160018. Available at: https://doi.org/10.1038/sdata.2016.18. WIPO. Available at: https://wipopearl.wipo.int/fr/linguistic. Wüster Eugen 1968: The Machine Tool./La Machine-Outil. An Interlingual Dictonary of Basic Concepts Comprising an Alphabetcal Dictonnary and a Classified Vocabulary With Definitons and Illustrations: English-French Master Volume, Londres, Technical Press. Aslib, 173 p. Zhu Lichao, Zimina Maria, Bénard Maud, Namdar Behnoosh, Ballier Nicolas, Wisniewski Guillaume, Yunès Jean-Baptiste 2023: Investigating Techniques for a Deeper Understanding of Neural Machine Translation (NMT) Systems Through Data Filtering and Fine-tuning Strategies. – Proceedings of the Eighth Conference on Machine Translation, Singapore, Association for Computational Linguistics, 275–281. References of the texts on data pollution (used for the corpus and/or appearing in the outputs of GenAI tools) Ben-Shahar Omri 2018: Data Pollution. – University of Chicago Public Law & Legal Theory Paper Series 679, 104–159. Cao Yinzhi, Fangxiao Yu Alexander, Aday Andrew, Stahl Eric, Merwine Jon, Yang Junfeng 2018: Efficient Repair of Polluted Machine Learning Systems via Causal Unlearning. – Proceedings of 2018 ACM Asia Conference on Computer and Communications Security, Incheon, Republic of Korea, 4–8 June 2018 (ASIA CCS ’18). Castelluccia Claude, Kaafar Mohamed Ali 2009: Owner-Centric Networking (OCN): Toward a Data Pollution-Free Internet. – Proceedings of the 2009 Ninth Annual International Symposium on Applications and the Internet, 169–172. Gertsen Fred 2022: Data Pollution and Taxation: Master’s Thesis, Executive Master Cyber Security, Defended on the 31st of March 2022, Universiteit Leiden, Netherlands. Hasselbalch Gry 2021: Data Ethics of Power: A Human Approach in the Big Data and AI Era, Glos (UK): Edward Elgar. Hasselbalch Gry 2022: Data Pollution & Power, White Paper for a Global Sustainable Agenda on AI, The Sustainable AI Lab, Bonn University. Mori Leonardo, Francey Alizée, Mettler Tobias 2024: Data Pollution: Definition and Policy Responses. – Proceedings of the 16th IFIP WG 8.5 International Conference, Electronic Participation (ePart 2024), Ghent, Belgium, September 3–5 2024, 147–162. Zimmerli Walther Ch. 1986: Who is to Blame for Data Pollution? On Individual Moral Responsibility With Information Technology. – Philosophy and Technology II: 41 Information Technology and Computers in Theory and Practice, ed. C. Mitcham, A. Huning, Dordrecht/Boston: D. Reidel, 291–305. APPENDIX Figure 24 shows a prompt without the specification ‚with the exact wording found in the texts‛, and the output consisting of two erroneous, made-up contexts, where the definition of information pollution is credited to data pollution. Nevertheless, the proposal by ChatGPT that ‚data pollution encompasses the contamination of information sources…‛, can be regarded as true, if we take into account the semantic relation between data pollution and information pollution revealed by the discursive marker of meronymy ‚encompasses‛, and according to which information pollution is a part of data pollution. The reformulation by LLMs ‚The concept of data pollution includes information pollution‛ into ‚data pollution encompasses [definition of information pollution] …‛ is respectful of knowledge representation. However, in terminological analysis, it is paramount to distinguish semantically related terms, all the more so when they are near-like synonyms. GOAL Finding definitional contexts and their references MODEL ChatGPT-4-turbo DATE 13/05/2025 TECHNIQUE System prompting LIMIT 3 definitions PROMPT Find three most relevant definitions of the term ‚data pollution‛ in scientific literature and provide the sources for each definition found. Return the definitions in the list followed by the bibliographical reference of the source and its URL. OUTPUT Data pollution refers to the harmful ‚data emissions‛ leaked into the digital ecosystem, disrupting social institutions and public interests. This concept rethinks the harms the data economy creates and the way they have to be regulated. Ben-Shahar O. 2018: Data Pollution 679, University of Chicago Public Law & Legal Theory Paper Series. Available at: https://chicagounbound.uchicago.edu/public_law_and_legal_theory/699 Data pollution is the interrelated adverse impact that the generation, storing, handling, and processing of digital data has on our natural environment, social environment, and personal environment. It is the unsustainable handling, distribution, and generation of data resources. Hasselbalch G. et al. 2022: Data Pollution & Power - White Paper for a Global Sustainable Development Agenda on AI. Available at: https://www.researchgate.net/publication/362174889_Data_Pollution_Power__White_Paper_for_a_Global_Sustainable_Development_Agenda_on_AI_by_Gry_Hasselbalc h_with_contributions_from_the_Data_Pollution_Power_DPP_Group_at_Bonn_Sustainable_ AI_Lab