scieee AI-readable full text Open interactive document viewer

UniTermGPT: Offene Sprachressourcen und kollaborative Evaluation zur Terminologievielfalt im Zeitalter von ChatGPT

Heinisch, Barbara

Abstract

Poster presentation given at the Open Science Festival 2025 in Vienna on 8 September 2025: Das Projekt UniTermGPT lebt Open Science im Zusammenspiel von Sprache, Künstlicher Intelligenz und Fachkommunikation. Im Zentrum steht die Frage, wie Large Language Models (LLMs) wie ChatGPT mit der terminologischen Variation innerhalb des Deutschen umgehen (insbesondere in der Universitätsfachsprache in Österreich, Deutschland und Südtirol). Diese Variation ist Ausdruck kultureller und institutioneller Vielfalt, wird jedoch von LLMs häufig nicht berücksichtigt. UniTermGPT greift dieses Thema im Sinne partizipativer Forschung auf, die sich an den vier Säulen der offenen Wissenschaft der UNESCO-Empfehlungen orientiert: Die Säule „offenes Wissen“ wird abgedeckt, indem alle im Projekt gesammelten und entwickelten Daten und Ressourcen (ein Korpus mit Universitätstexten, Terminologieressourcen, Prompts und Annotationen) FAIR in Repositorien veröffentlicht werden und bedient damit indirekt auch die Säule „offene Wissenschaftsinfrastrukturen“. UniTermGPT baut auf Open Source-Technologien auf, etwa für die kollaborative Annotation. Auch die entwickelten Open Educational Resources sind offen zugänglich, nachnutzbar und übertragbar auf andere Fach- oder Sprachräume. Die Säule „Einbindung gesellschaftlicher Akteur*innen“ wird durch die partizipative Beteiligung von Praxisexpert*innen (Übersetzer*innen) als Co-Forschende in der Ausarbeitung der Methode und Analyse der Daten umgesetzt. Die Praxisrelevanz der Ergebnisse wird durch Empfehlungen für die Fachübersetzung mit LLMs gesichert. Die Säule „offener Dialog mit anderen Wissenssystemen“ wird durch die Berücksichtigung des Erfahrungswissens der Expert*innen abgedeckt. Außerdem versteht UniTermGPT Sprache als Träger institutionellen (Fach-)wissens und gesellschaftlicher Realitäten. Durch die gezielte Auseinandersetzung mit sprachlichen Varietäten wird deutlich, wie unterschiedliche Wissenssysteme in LLMs (nicht) repräsentiert werden. UniTermGPT steht damit für eine offene, kollaborative und kritische Forschungspraxis, die Open Science im Spannungsfeld zwischen technologischer Innovation und sprachlicher Vielfalt verwirklicht. Acknowledgement: The project University terminology in German in the age of ChatGPT (UniTermGPT) has received funding from the Autonomous Province of Bozen/Bolzano – Department for Innovation, Research and University in the frame of the EC-MCSA Seal of Excellence Programme

Full text

UniTermGPT: Offene Sprachressourcen und kollaborative Evaluation zur Terminologievielfalt im Zeitalter von ChatGPT Barbara Heinisch Institut für Angewandte Sprachforschung, Eurac Research, Italien Das Projekt University terminology in German in the age of ChatGPT (UniTermGPT) lebt Open Science im Zusammenspiel von Sprache, Künstlicher Intelligenz und Fachkommunikation. Im Zentrum steht die Frage, wie Large Language Models (LLMs) wie ChatGPT mit der terminologischen Variation innerhalb des Deutschen umgehen (insbesondere in der Universitätsfachsprache in Österreich, Deutschland, der Schweiz und Südtirol). Diese Variation ist Ausdruck kultureller und institutioneller Vielfalt, wird jedoch von LLMs häufig nicht berücksichtigt. UniTermGPT greift dieses Thema im Sinne partizipativer Forschung auf, die sich an den vier Säulen der offenen Wissenschaft der UNESCOEmpfehlungen orientiert. Dafür wird ein Korpus von Universitätstexten aus dem deutschsprachigen Raum erstellt, Terminologieressourcen gesammelt und mit Hilfe von Übersetzer*innen die Übersetzungsqualität von ChatGPT im Umgang mit varietätenspezifischer Terminologie evaluiert. Daraus werden Empfehlungen für die Praxis abgeleitet. Dieses Poster wurde durch das Programm ECMCSA Seal of Excellence von der Autonomen Provinz Bozen - Abteilung Innovation, Forschung, Universität und Museen finanziert, Projekt University terminologyin German in the ageof ChatGPT (UniTermGPT). Hintergrund Forschungsfragen und Ziel Open Science Festival 2025, Wien, 8. Sept. 2025 •Wie geht ChatGPT mit deutscher Universitätsterminologie aus Deutschland, Österreich, der Schweiz und Südtirol um? •Wie kann man in ChatGPT (durch Prompten) terminologische Variation berücksichtigen und qualitativ hochwertige Übersetzungen aus dem Deutschen ins Englische und umgekehrt erstellen? Das Ziel von UniTermGPT ist die Analyse, wie ChatGPT mit Terminologie der untersuchten deutschen Sprachvarietäten (abhängig vom Prompt) umgeht, sowie Prompt Engineering im Bereich der „terminology injection“ in der Fachübersetzung. Bild: Pillars of Open Science, UNESCO (2021) Recommendation on Open Science, CC BY-SA 3.0 Die Säule „Einbindung gesellschaftlicher Akteur*innen“ wird durch die partizipative Beteiligung von Praxisexpert*innen (Übersetzer*innen, Terminolog*innen) als CoForschende an der Ausarbeitung der Methode, der Auswahl des Annotationstools und der Analyse der Daten umgesetzt. Die Praxisrelevanz der Ergebnisse wird durch Empfehlungen für die Fachübersetzung mit LLMs sowie die Ausarbeitung eines Kurzdossiers gesichert. Die Säule „offenes Wissen“ wird abgedeckt, indem alle im Projekt gesammelten und entwickelten Daten und Ressourcen (ein Korpus mit Universitätstexten, Terminologieressourcen, Prompts und Annotationen) in Repositorien FAIR-öffentlicht werden und bedient damit indirekt auch die Säule „offene Wissenschaftsinfrastrukturen“, da bestehende Forschungsinfrastrukturen, wie CLARIN genutzt werden. Auch die im Zuge des Projekts verfassten wissenschaftlichen Veröffentlichungen sind überwiegend offen zugänglich. UniTermGPT baut auf Open Source-Technologien auf, etwa für die kollaborative Annotation (entwickelt diese jedoch nicht selbst). Auch die erarbeiteten Open Educational Resources (OER) sind offen (über OER-Plattformen) zugänglich, nachnutzbar und übertragbar auf andere Fachgebiete oder Sprachräume. Die Säule „offener Dialog mit anderen Wissenssystemen“ wird durch die Berücksichtigung des Erfahrungswissens der Expert*innen (Übersetzer*innen an deutschsprachigen Universitäten) abgedeckt. Gemeinsam mit diesen Expert*innen werden außerdem Empfehlungen für die Übersetzung mit ChatGPT erarbeitet, wodurch deren Wissen und Bedürfnisse Berücksichtigung finden. Außerdem versteht UniTermGPT Sprache als Träger institutionellen (Fach-)wissens und gesellschaftlicher Realitäten. Durch die gezielte Auseinandersetzung mit sprachlicher Vielfalt wird deutlich, wie unterschiedliche Wissenssysteme in LLMs (nicht) repräsentiert werden. UniTermGPT steht für eine offene, kollaborative und kritische Forschungspraxis, die technologische Entwicklungen mit Fragen von Ethik, Diversität und Verantwortung verknüpft. Das Projekt zeigt, wie Open Science im Spannungsfeld von technologischer Innovation und sprachlicher Vielfalt umgesetzt werden kann und liefert durch praktische Empfehlungen für den Einsatz von ChatGPT in der Übersetzung, ein wissenschaftspolitisches Kurzdossier sowie die Einbindung relevanter Akteur*innen eine Grundlage für Weiterentwicklungen und Anschlussprojekte. Damit versteht sich UniTermGPT als Brücke zwischen linguistischer Forschung, gängiger Sprachtechnologie und gesellschaftlichem Diskurs – für mehr Sichtbarkeit regionaler Varietäten, eine kritische Reflexion über den Einsatz von Large Language Models und eine offene Forschungspraxis, die sprachliche Vielfalt nicht nur abbildet, sondern fördert. UniTermGPT und Open Science Fazit Contact: [email protected]