scieee AI-readable full text Open interactive document viewer

Im Netz mittelhochdeutscher Wörter. Das 'Mittelhochdeutsche Wörterbuch' und seine Quellen

Brookshire, Patrick Daniel; Richter, Jonas

Abstract

This paper illustrates how existing interde­pendencies between various Middle High German dic­tionaries have, over time, lead to a dense network with ‘Mittelhochdeutsches Wörterbuch’ (‘Middle High German Dictionary’) at its core. This is due to the fact that it offers multiple interfaces that can be used to connect Middle High German words between different projects. One such interface is the lemma list, which has been around since the early days of the project, and another more recent one is the Federated Content Search of Text+ (a consortium of the National Research Data Infrastructure in Germany). In addition, we show how the digitally available primary source corpus can be reused by presenting a tool for cooccurrence analyses which also considers metadata, as well as a pilot study on Named Entity Recognition. With all of this, we not only highlight existing cooperation and collaboration efforts but also want to foster future inter­disciplinary research to let this network grow even more.

Full text

171 Kontakt Patrick D. Brookshire, Mittelhochdeutsches Wörterbuch/ Digitale Akademie, Akademie der Wissenschaften und der Literatur Mainz, Geschwister-Scholl-Str.2, 55131 Mainz, patrick.brookshir[email protected] https://orcid.org/0000-00025843-7577 Dr. Jonas Richter, Mittelhochdeutsches Wörterbuch, Niedersächsische Akademie der Wissenschaften zu Göttingen, Geiststraße10, 37073 Göttingen, [email protected] https://orcid.org/0000-00022924-6026 Patrick D. Brookshire und Jonas Richter Im Netz mittelhochdeutscher Wörter Das ‚Mittelhochdeutsche Wörterbuch‘ und seine Quellen Abstract This paper illustrates how existing interdependencies between various Middle High German dictionaries have, over time, lead to a dense network with ‘Mittelhochdeutsches Wörterbuch’ (‘Middle High German Dictionary’) at its core. This is due to the fact that it offers multiple interfaces that can be used to connect Middle High German words between different projects. One such interface is the lemma list, which has been around since the early days of the project, and another more recent one is the Federated Content Search of Text+ (a consortium of the National Research Data Infrastructure in Germany). In addition, we show how the digitally available primary source corpus can be reused by presenting a tool for cooccurrence analyses which also considers metadata, as well as a pilot study on Named Entity Recognition. With all of this, we not only highlight existing cooperation and collaboration efforts but also want to foster future interdisciplinary research to let this network grow even more. Keywords Corpus Linguistics; Digital Medieval Studies; Federated Content Search; Middle High German; Named Entity Recognition Patrick D. Brookshire und Jonas Richter: Im Netz mittelhochdeutscher Wörter. Das ‚Mittelhochdeutsche Wörterbuch‘ und seine Quellen. In: Das Mittelalter 2025, 30(1), 171–187. Heidelberg: Heidelberg University Publishing. DOI: https://doi.org/10.17885/heiup.mial.2025.1.25127 172 | Patrick D. Brookshire und Jonas Richter 1 Hintergrund Im Sommer1867, nur ein Jahr nach der Vollendung des ‚Mittelhochdeutschen Wörterbuchs‘ von Benecke-Müller-Zarncke (BMZ), bat der Verleger Salomon Hirzel Matthias Lexer, ein Handwörterbuch auszuarbeiten, das zugleich als Supplement und als alphabetischer Index zum BMZ dienen sollte.1 Für die Ausarbeitung benötigte Lexer ein Vielfaches der Zeit, die Hirzel1869 veranschlagt hatte, und das ‚Handwörterbuch‘ überstieg auch den geplanten Umfang deutlich. Hinzu kamen 400 Spalten mit Nachträgen, die Lexer seinem ‚Handwörterbuch‘ als Anhang beifügte.2 In der Altgermanistik etablierten sich BMZ und Lexer als Zweigespann, mit denen das Netz mittelhochdeutscher Wörter zu erkunden war– wenn auch nicht ohne Klagen darüber, dass der Zugriff über die zwei Alphabete im Lexer (Hauptteil und Nachträge) sowie im Nebeneinander der zwei Wörterbücher umständlich sei.3 Um die Verstrickungsgefahr in diesem Netz zu verringern, wurden 1997 bis 2000 DFG-finanziert die beiden Wörterbücher sowie das ‚Findebuch‘4 retrodigitalisiert, miteinander verlinkt und als ‚Mittelhochdeutsche Wörterbücher im Verbund‘ auf CD-ROM und im Internet veröffentlicht. Dieser Verbund ist mittlerweile im ‚Wörterbuchnetz‘ aufgegangen.5 Trotz dieser jüngeren, elektronischen Entwicklung sollte aber nicht vergessen werden, dass die systematische, werkübergreifende Vernetzung des mittelhochdeutschen Wortschatzes mit Matthias Lexer begann, der in seinem Handwörterbuch konsequent nachwies, wo im BMZ der entsprechende Eintrag zu finden ist. In gewisser Weise kann man das von Hirzel initiierte und von Lexer ausgearbeitete ‚Handwörterbuch‘ auch als einen kleinen Schritt in Richtung der FAIR-Prinzipien6 betrachten, da er die Auffindbarkeit (Findability) der BMZ-Daten erhöhte und sie für seine eigenen Wörterbucheinträge nachnutzte bzw. darauf aufbaute (Reusability). Die digitalen Möglichkeiten erlauben aber eine noch engere Verzahnung, als sie zu dieser Zeit erreicht werden konnte. In der erwähnten Retrodigitalisierung Ende der 1990er Jahre wurden die Einträge von BMZ, Lexer und ‚Findebuch‘ mit Hyperlinks verbunden, außerdem die Quellensiglen mit Nellmanns ‚Verzeichnis 1 Lexer1872, S. v. 2 Vgl. Gärtner1993. 3 Vgl. Nellmann1991, S.255. 4 Vgl. Gärtner, Gerhardt, Jährling u. a.1992. 5 https://woerterbuchnetz.de/ (Zugriff:11.03.2025). 6 ‚FAIR‘ (Wilkinson, Dumontier, Aalbersberg u. a.2016) steht für ‚Findability‘, ‚Accessibility‘, ‚Interoperability‘ und ‚Reusability‘. Im Netz mittelhochdeutscher Wörter | 173 der benutzten Werke‘7 verknüpft.8 Im neuen ‚Mittelhochdeutschen Wörterbuch‘ (MWB), das nach Vorarbeiten in den 1990ern seit 2000 als Langzeitprojekt im Akademienprogramm geführt wird und 2032 abgeschlossen sein soll, kommen weitere Verlinkungen hinzu.9 Einen besonderen Mehrwert stellt nach Gärtner und Plate die Verknüpfung von Belegstellen in den Wörterbuchartikeln mit Volltexten dar:10 Viele Quellen des MWB sind elektronisch ins System eingepflegt, so dass die verwendeten Belegzitate mit dem Volltext verknüpft bleiben. Bei der Nutzung des Online-Wörterbuchs kann also bei Bedarf eine Referenz angeklickt werden, um den Kontext des Belegs anzusehen. Die Verlinkung ist dabei bidirektional: Neben dem Volltext wird angezeigt, in welchen Artikeln die jeweiligen Textstellen zitiert sind. Als born-digital Wörterbuch mit hybrider Publikationsform (elektronisch und gedruckt) bemüht sich das Projekt, neben der Hauptarbeit, dem Erstellen der Wörterbuchartikel, seine Inhalte auch als nachnutzbare und vernetzungsfähige Daten aufzubereiten. Dazu dienen die Verwendung etablierter Standards der Datenmodellierung und die Bereitstellung verschiedener Schnittstellen (API), die einen automatisierten Zugriff auf die Daten des Projektes (und nicht nur auf die Wörterbuchartikel) ermöglichen. Durch digitale Methoden können interoperable Daten deutlich einfacher über Projektgrenzen hinaus geteilt oder über föderierte Architekturen gemeinsam durchsucht werden, ohne dass die Datensouveränität und die Sichtbarkeit der Einzelprojekte verlorengehen. Im folgenden Abschnitt wird zunächst auf Aspekte der Datenmodellierung innerhalb des MWBs eingegangen. Anschließend werden im 3. Abschnitt bereits existierende Schnittstellen zu anderen Projekten am Beispiel der Gesamtlemmaliste des Projekts sowie der föderierten Suche von Text+ vorgestellt. Als weitere Nachnutzungsmöglichkeiten von MWB-Daten thematisiert der 4. Abschnitt einerseits ein Tool zur Kookkurenzsuche und andererseits eine Pilotstudie zur automatischen Eigennamenerkennung in mittelhochdeutschen Texten. 2 Datenmodellierung Die beiden zentralen Ressourcen des MWB (Wörterbuchartikel und Primärquellen im Volltext) sind nach den Richtlinien der Text Encoding Initiative (TEI) in XML codiert und damit in hohem Maß nachnutzbar und interoperabel. Die Wortartikel 7 Vgl. Nellmann1997. 8 Vgl. Fournier2000. 9 Vgl. Diehl u. Hansen2016. 10 Vgl. Gärtner u. Plate2013. 174 | Patrick D. Brookshire und Jonas Richter liegen dabei als TEI Lex-0 vor, einem Substandard für lexikalische Ressourcen.11 Die Primärquellen im MWB-Textarchiv folgen hingegen dem generischeren TEIP5-Format, wobei streng zwischen dem tokenisierten Volltext mit vor allem typographischen Auszeichnungen und Stand-off-Annotationen für Lemmatisierungen unterschieden wird, sodass sich beide Ebenen unabhängig voneinander betrachten lassen. Die Nutzung sogenannter Feature Structures ermöglicht eine potentielle (spätere) Anreicherung mit beliebigen weiteren Annotationslayern.12 Hier können künftige korpuslinguistische Projekte ansetzen, die Flexionsoder Dependenzinformationen eingliedern, oder literaturwissenschaftliche Projekte mit narratologischen Annotationen. Die in der Frühphase des Projekts geschaffene Basis 11 Vgl. Tasovac, Romary, Banski u. a.2018. 12 Vgl. Griesinger u. Stolz2019, S.123 f. Abb. 1 | Beispielhafte Verlinkung zwischen MWB, BMZ, Lexer und ReM. Graphik: Patrick D. Brookshire und Jonas Richter. Im Netz mittelhochdeutscher Wörter | 175 eines lemmatisierten Belegarchivs wird im Rahmen der Wörterbucharbeit laufend ergänzt, indem bedarfsweise weitere Textstellen mit den Lemmata über IDs verknüpft werden (vgl. Abb.1). Automatische Verfahren wie der TreeTagger13 mit einer mittelhochdeutschen Parameterdatei14 ergänzen die manuellen Lemmatisierungen, auch wenn dieses Verfahren Lemmaformen der ‚Mittelhochdeutschen Begriffsdatenbank‘ (MHDBDB) ohne die im MWB verwendeten grammatischen Angaben erzeugt. Darüber hinaus wurden neuere Tools wie der RNN-Tagger15 bereits angetestet. Die TEI Feature Structures erlauben eine entsprechende Unsicherheitsmarkierung, sodass in den Daten selbst festgehalten wird, dass im MWB zwar jedes Token lemmatisiert ist, aber nicht alle Lemmatisierungen manuell geprüft sind. 3 Schnittstellen Das Netz mittelhochdeutscher Wörter und Projekte zeichnet sich seit der Jahrtausendwende durch Schnittstellen wie die Mittelhochdeutsche Gesamtlemmaliste aus, mit der IDs zwischen Projekten ausgetauscht werden können. Darüber hinaus ist es über die föderierte Architektur des NFDI-Konsortiums Text+ seit dem Jahr 2023 möglich, mittelhochdeutsche Daten über Projektgrenzen hinaus gemeinsam abzufragen. Mit diesen beiden Schnittstellen befassen sich exemplarisch die folgenden Unterabschnitte. 3.1 Mittelhochdeutsche Gesamtlemmaliste In der Vorbereitungsphase des MWB (1994–1999) wurde aus den Einträgen der Vorgängerwörterbücher (BMZ, Lexer samt Nachträgen und Findebuch) eine Lemmaliste kompiliert, die als zentrale Referenz von Anfang an eine Art Rückgrat des Projekts gebildet hat.16 Einander entsprechende Lemmata aus den älteren Wörterbüchern wurden dabei zusammengeführt. Das Resultat wurde für die Zwecke des MWB bearbeitet und stellt daher kein Gesamtverzeichnis aller Einträge des Vorgängerwörterbuchs dar, da diese unter anderem auch Eigennamen und Verweisformen enthielten. In dem resultierenden Lemmagerüst hat jedes Stichwort eine feste ID und ist mit den zugehörigen Einträgen in den Vorgängerwörterbüchern sowie den nach und nach im MWB entstehenden Artikeln verlinkt. Lemmatisierungen im Volltextarchiv sind 13 Vgl. Schmid1994. 14 Vgl. Echelmeyer, Reiter u. Schulz2017. 15 Vgl. Schmid2019. 16 Vgl. Plate u. Recker2001, S.177–181. 176 | Patrick D. Brookshire und Jonas Richter ebenfalls mit den Stichwörtern in dieser Gesamtlemmaliste verknüpft, die dadurch hervorragend als Rechercheinstrument für Fragestellungen zur mittelhochdeutschen Lexikographie und darüber hinaus taugt. So empfiehlt auch Hinkelmanns, die IDs der MWB-Lemmaliste, auf die auch das ‚Referenzkorpus Mittelhochdeutsch‘ (ReM) verweist, zur eindeutigen Identifizierung mittelhochdeutscher Lemmaformen zu nutzen.17 Wie sich daraus ein Netz mittelhochdeutscher Wörter entwickelt hat, illustriert Abbildung1. Sie zeigt, dass im MWB-Textarchiv allen Wortformen (Tokens) eindeutige IDs zugewiesen sind wie zum Beispiel edeler in Saget, edeler schribere (ReinFu K,2203).18 Diese ID wird dann über die Stand-off-Lemmatisierung mit der ID des MWB-Lemmas edele verlinkt, das über die Lemmaliste bidirektional mit den Äquivalenten edele, edel im BMZ bzw. edel, edele im Lexer verknüpft ist. Zusätzlich ist diese Textstelle auch ein Beleg im MWB-Artikel, sodass hier ebenfalls eine projektinterne bidirektionale Verlinkung vorliegt. Diese Vernetzung ist jedoch nicht auf Wörterbuchartikel beschränkt, wie beispielsweise das Token édele in édele uuîntrûbo uóne cýproie (Will 6ra,25) aus dem ReM zeigt. Insbesondere Projekte wie das ReM, die ihre Annotationen nicht alphabetisch vornehmen, profitieren dabei von der Tatsache, dass mit der Mittelhochdeutschen Gesamtlemmaliste das MWB auch Verweisziele für noch nicht publizierte Artikel bereithält, um so das Netz der mittelhochdeutschen Ressourcen weiter vergrößern zu können. 3.2 Föderierte Suche An dem von Hinkelmanns beschriebenen Befund, dass gerade lexikalische Ressourcen sich durch eine Vielzahl unterschiedlicher Datenformate auszeichnen,19 hat sich in den letzten Jahren nur bedingt etwas geändert. Umso wichtiger sind daher Bestrebungen, standardisierte Schnittstellen zu implementieren, die noch mehr Vernetzungen zwischen Projekten ermöglichen. Das MWB hat sich dabei wie das ‚Wörterbuchnetz‘ zunächst im Rahmen des Projektes ‚eHumanities-Zentrum für historische Lexikographie‘ (ZHistLex)20 und jüngst durch Anbindung an die Föderierte Suche (FCS, Federated Content Search) von Text+21 engagiert. Letztere eröffnet neue Möglichkeiten, da hiermit nicht nur lexikalische Ressourcen wie das MWB und seine Vorgängerwörterbücher, sondern auch die Quellentexte gemeinsam durchsucht werden können. Das kommt der Vision von Griesinger und 17 Vgl. Hinkelmanns2019, S.122. 18 Siglen folgen der MWB-Form– vgl. http://mhdwb-online.de/quellenverzeichnis.php (Zugriff:11.03.2025) 19 Vgl. Hinkelmanns2019, S.133. 20 Vgl. ebd., S.140 f., und Pietsch2020 sowie https://zhistlex.de/ (Zugriff: 11.03.2025). 21 Vgl. Brookshire u. Recker-Hamm2023. Im Netz mittelhochdeutscher Wörter | 177 Stolz, digitale Editionen und lexikalische Ressourcen unter Beachtung gemeinsamer Standards enger miteinander zu verbinden, schon recht nahe.22 Die FCS basiert auf standardisierten Abfragesprachen (OASIS-CQL23 für einfache Suchen, FCS-QL24 für Korpussuchen und LexCQL25 für lexikalische Suchen) sowie standardisierten Ergebnisformaten26 und Fehlerdiagnostiken. Ein projektspezifischer Endpunkt wie der des MWB-Textarchivs übersetzt dabei eine Suchanfrage gemäß der FCS-Syntax in eine interne (XQuery-)Syntax und transformiert die gefundenen (TEI-)Fragmente in das gemeinsame FCS-Format. Dadurch abstrahiert die gemeinsame Suche sowohl von der Datenhaltung als auch dem jeweiligen technischen Setup der Einzelprojekte. So findet zum Beispiel eine Suche nach ‚Terramer‘ über den FCS-Aggregator von Text+27 nicht nur Treffer in mittelhochdeutschen Projekten wie BMZ, MWB und ReM, sondern unter anderem auch im ‚Deutschen Zeitungsportal der Deutschen Digitalen Bibliothek‘, da die Ausgabe vom 4.10.1941 der ‚Kölnischen Zeitung‘ einen Auszug aus Wolframs von Eschenbach ‚Willehalm‘ enthält. Dieser Zufallsfund könnte für an der Rezeptionsgeschichte Interessierte eine wichtige Rolle spielen, zumal die entsprechende Quelle im Aggregator verlinkt ist. Besteht hingegen Interesse an der Person, kann mit derselben Suche der BMZArtikel gefunden werden, aus dem hervorgeht, dass er „[S]ohn des Kanabêus“ war,28 während die Treffer im MWB und ReM zu weiteren Belegstellen führen. Einer dieser MWB-Belege stammt aus WhvÖst (7724 f.) und wird im Aggregator bei einer MultiLayer-Korpussuche im sogenannten AdvancedDataView folgendermaßen angezeigt: Tabelle1 | Beispiel für FCS-AdvancedDataView-Layer.29 Layer ... s8 s9 s10 s11 s12 s13 s14 s15 ... text ... der kunc Terramer/ gewunne nie so manigen man./ ... lemma ... der künic Terramer ge-winnen nie sô manigen man ... pos ... DET NOUN PROPN VERB ADV ADV ADJ NOUN ... 22 Vgl. Griesinger u. Stolz2019, S.118, 121. 23 http://docs.oasis-open.org/search-ws/searchRetrieve/v1.0/os/part5-cql/searchRetrieve-v1.0os-part5-cql.html (Zugriff: 11.03.2025). 24 Vgl. van Uytvanck, Olsson, Schonefeld u. a.2023, S. 39–42. 25 Vgl. Körner, Eckart, Herold u. a.2023, S. 5 f. 26 Vgl. van Uytvanck, Olsson, Schonefeld u. a.2023, S.18–25. 27 https://fcs.text-plus.org/?&query=Terramer&queryType=cql (Zugriff: 11.03.2025). 28 https://woerterbuchnetz.de/?sigle=BMZ&lemid=T00393&hitidlist=2705807 (Zugriff: 11.03.2025). 29 https://fcs.text-plus.org/?&query=%5B%20word%20%3D%20%22Terramer%22%20%5D& queryType=fcs (Zugriff: 11.03.2025). 178 | Patrick D. Brookshire und Jonas Richter In Tabelle1 sieht man, dass die Korpussuche mit Layern arbeitet und sich auf diese Weise nicht nur durch Anbinden weiterer Projekte horizontal erweitern lässt, sondern auch vertikal durch weitere Annotationslayer. So ließen sich potentiell auch Angaben zur im MWB ausgezeichneten (Un-)Sicherheit der Lemmatisierungen integrieren, um die Nachnutzbarkeit zu erhöhen. Des Weiteren bieten sich auch die für das Netz mittelhochdeutscher Lemmata so zentralen IDs künftig als ein weiterer Layer an. Allerdings kann umgekehrt die Einführung eigener projektspezifischer Layer die Interoperabilität reduzieren, weshalb beide bislang noch nicht eingebunden wurden. 4 Nachnutzungsperspektiven Das MWB kann Anknüpfungspunkt für eine Reihe anderer digitaler mediävistischer Forschungsprojekte sein,30 wodurch sich wiederum Möglichkeiten für weitere Vernetzungen ergeben. Aus diesem Grund werden in den folgenden Teilabschnitten Nachnutzungsperspektiven der MWB-Daten aufgezeigt, die über die reine Wörterbucharbeit als Hilfestellung zum Verständnis mittelhochdeutscher Texte und die Vernetzung der Daten über IDs hinausgehen. So liegen etwa, wie bereits erwähnt, alle zentralen Ressourcen des MWB als TEI-XML vor, wodurch sie per se nachnutzbar und interoperabel sind.31 Die automatischen Lemmatisierungen der Primärquellen ermöglichen darüber hinaus statistische Analysen, die einen hohen Recall einfordern. Projektintern stehen den Redakteuren bereits Möglichkeiten zur Gruppierung von Belegen nach Textmetadaten zur Verfügung, die gerade bei großen Treffermengen die Sichtung erleichtern, womit sich Abschnitt 4.1 befasst. Hier könnten in Zukunft auch Tasks aus dem Bereich Natural Language Processing wie eine Genre-Identifikation oder Topic Modelling ansetzen. Mit den manuellen Annotationen lassen sich Deep Learning-Modelle umgekehrt durch ihre hohe Precision nicht nur zur Lemmatisierung, sondern zum Beispiel auch zur Eigennamenerkennung (nach-)trainieren und/oder evaluieren, wozu im Abschnitt 4.2 eine Pilotstudie präsentiert wird. 4.1 Kookkurrenzanalysen Ein Tool zur Suche nach Kookkurrenzen, das demnächst auch öffentlich verfügbar sein wird, erlaubt die Suche nach Wortformen oder Lemmata in Kombination mit Bedingungen für den Kontext (zum Beispiel ein bestimmtes Wort oder eine 30 Zur Forschungslandschaft vgl. z. B. Bleier, Fischer, Hiltmann u. a.2019. 31 Siehe oben unter2. Im Netz mittelhochdeutscher Wörter | 179 Wortart im rechten Kontext). Dabei ist es möglich, alle Lemmatisierungen auszuwerten oder die Suche auf die nicht-automatischen, lexikographisch geprüften Lemmatisierungen zu beschränken. So zeigt die Umgebungssuche beispielsweise, dass unter 1.504 Treffern zum Adjektiv reine häufig Kookkurrenzen mit den Substantiven maget (140), wîp (111) und got (135) vorkommen. Befunde, die die Wörterbücher nahelegen oder die der eigenen Erwartungshaltung entsprechen, werden in solchen Suchergebnissen intersubjektiv überprüfbar. Andererseits können auch weniger erwartete Kookkurrenzen wie reine man (150) gefunden werden. Der Großteil der Belege hierfür stammt aus dem ‚Märterbuch‘ und Rudolfs von Ems ‚Weltchronik‘, in denen mit dem Ausdruck überwiegend Heilige und biblische Gestalten bezeichnet werden. Bei der Artikelredaktion helfen solche Informationen, um verbreitete Verwendungstypen zu finden. Auch lassen sich gezielt Textstellen suchen, in denen reine zum Beispiel in der Nähe von Wortformen steht, die im Part-of-Speech (PoS) Tagging als Adjektive markiert sind, um zu prüfen, ob es auffallende Verbindungen wie mögliche (Teil-)Synonyme, Antonyme oder Paarformeln gibt. Das Tool ermöglicht zudem Suchanfragen, die über lexikographische Interessen hinausgehen. So könnte das Textarchiv beispielsweise nach Vorkommen bestimmter Phraseologismen durchsucht oder die Verwendung eines Wortes wie würfel (oder semantisch verwandter Wörter) in der Heldenepik unter die Lupe genommen werden, um eine Materialbasis für literaturgeschichtliche oder sprachwissenschaftliche Studien aufzubauen. Die Suchergebnisse lassen sich auch nach weiteren Kriterien sortieren. Die dafür nötigen Annotationen zur Entstehungsdatierung oder schreibsprachlichen Einordnung der Quellentexte entstanden im Zusammenhang mit dem ZHistLexProjekt und bedürfen weiterer Ausarbeitung. Ähnliches gilt für die TextsortenAnnotation der rund 1.800 Primärquellen im MWB-Quellenverzeichnis: Diese Daten stammen zu großen Teilen noch aus der Anfangsphase des MWB. Um sie zur Gruppierung oder Filterung der Texte beispielsweise in den Ergebnissen der Umgebungssuche verwenden zu können, ist eine Vereinheitlichung und ontologische Aufbereitung notwendig. Dafür stehen im Rahmen der Wörterbucharbeit jedoch weder Zeit noch Mittel zur Verfügung, künftige Projekte könnten aber diese Anlagen weiter ausbauen. So wäre etwa die Verknüpfung der MWB-Quellen mit der Textreihentypologie von Zeppezauer-Wachauer und Heiles, einem SKOS-Vokabular,32 wünschenswert. Der Nutzen solcher Datenanreicherung ist offensichtlich, würde er doch nicht nur eine Filterung des Primärquellenverzeichnisses ermöglichen, sondern auch anhand der Quellenzitate im Wörterbuch eine Auswertung des Wortschatzes nach diesen Metadaten erlauben. 32 Vgl. Zeppezauer-Wachauer u. Heiles2023. SKOS (Simple Knowledge Organization System) ist ein vom W3C empfohlener Standard zur Kodierung kontrollierter Vokabulare. 186 | Patrick D. Brookshire und Jonas Richter Gärtner, Kurt, Christoph Gerhardt, Jürgen Jährling u. a.: Findebuch zum mittelhochdeutschen Wortschatz. Stuttgart1992. Gärtner, Kurt u. Ralf Plate: Die Doppelfunktion des digitalen Textarchivs als Wörterbuchbasis und als Komponente der Online-Publikation. Am Beispiel des Mittelhochdeutschen Wörterbuchs. In: Ingelore Hafemann (Hg.): Perspektiven einer corpusbasierten historischen Linguistik und Philologie. Internationale Tagung des Akademienvorhabens „Altägyptisches Wörterbuch“ an der Berlin-Brandenburgischen Akademie der Wissenschaften, 12.–13. Dezember2011. Berlin2013, S.193–204. URN: urn:nbn:de:kobv:b4-opus-24400 Griesinger, Christian u. Michael Stolz: Sprachwissenschaftliche Erschließungsmethoden für digitale Editionen mittelhochdeutscher Texte. In: Bleier, Fischer, Hiltmann u. a.2019, S.112–128. Hinkelmanns, Peter: Mittelhochdeutsche Lexikographie und Semantic Web. Die Anbindung der ‚Mittelhochdeutschen Begriffsdatenbank‘ an Linked Open Data. In: Bleier, Fischer, Hiltmann u. a.2019, S.129–141. Körner, Erik, Thomas Eckart, Axel Herold u. a.: Federated Content Search for Lexical Resources (LexFCS): Specification. Version 0.1, 2023-05-04. https://doi. org/10.5281/zenodo.7986303 (Zugriff: 11.03.2025). Lexer, Matthias: Mittelhochdeutsches Handwörterbuch. Zugleich als Supplement und alphabetischer Index zum Mittelhochdeutschen Wörterbuch von Benecke-Müller-Zarncke. Band1, Stuttgart1872. Nellmann, Eberhard: Die mittelhochdeutschen Wörterbücher. Ihre Qualitäten, ihre Grenzen, ihre mögliche Erneuerung. In: Eijiro Iwasaki u. Yoshinori Shichiji (Hgg.): Begegnung mit dem „Fremden“: Grenzen– Traditionen– Vergleiche. Akten des VIII. Internationalen Germanisten-Kongresses, Tokyo1990. Bd. 4. Sektion 4, Kontrastive Syntax; Sektion5, Kontrastive Semantik, Lexikologie, Lexikographie; Sektion 6, Kontrastive Pragmatik. München1991, S.254–263. Nellmann, Eberhard: Quellenverzeichnis zu den mittelhochdeutschen Wörterbüchern. Ein kommentiertes Register zum ‚Benecke/Müller/Zarncke‘ und zum ‚Lexer‘. Stuttgart, Leipzig1997. Pietsch, Andre: Historische Wörterbücher und Wörterbuchsysteme in digitalen Umgebungen: Komponenten, Verknüpfungen, Darstellungsmittel, Nutzungsoptionen. In: ZHistLex-Papiere. 2020. https://zhistlex.de/papiere/pietsch_2020_ digitale_woerterbuecher_ZHistLex.pdf (Zugriff: 11.03.2025). Plate, Ralf u. Ute Recker: EDV für Wörterbuchzwecke und neue lexikographische Arbeitsweisen. Erfahrungen beim Aufbau des elektronischen Textund Belegarchivs für das mittelhochdeutsche Wörterbuch. In: Stephan Moser, Peter Stahl, Werner Wegstein u. a. (Hgg.): Maschinelle Verarbeitung altdeutscher Texte V: Beiträge zum Fünften Internationalen Symposion, Würzburg 4.–6. März1997. Berlin, New York2001, S.169–184. https://doi. org/10.1515/9783110909494.169 (Zugriff: 11.03.2025). Qi, Peng, Yuhao Zhang, Yuhui Zhang u. a.: Stanza: A Python Natural Language Processing Toolkit for Many Human Languages. In: Proceedings of the 58th Annual Meeting of the Association for Computational Linguistics: System Demonstrations,2020, S.101–108. Im Netz mittelhochdeutscher Wörter | 187 https://doi.org/10.18653/v1/2020.acldemos.14 (Zugriff: 11.03.2025). Ramshaw, Lance A. u. Mitchell P. Marcus: Text Chunking Using TransformationBased Learning. In: Proceedings of the Third ACL Workshop on Very Large Corpora. Cambridge1995, S. 82–94. https://aclanthology.org/W95-0107/ (Zugriff: 11.03.2025). Schmid, Helmut: Probabilistic Part-ofSpeech Tagging Using Decision Trees. In: Proceedings of the International Conference on New Methods in Language Processing. Manchester1994, S. 44–49. https://cis.uni-muenchen. de/~schmid/tools/TreeTagger/data/treetagger1.pdf (Zugriff: 11.03.2025). Schmid, Helmut: Deep Learning-Based Morphological Taggers and Lemmatizers for Annotating Historical Texts. In: Proceedings of the 3rd International Conference on Digital Access to Textual Cultural Heritage. Brüssel2019, S.133–137. https://doi.org/10.1145/3322905.3322915 (Zugriff: 11.03.2025). Tasovac, Toma, Laurent Romary, Piotr Banski u. a.: TEI Lex-0: A Baseline Encoding for Lexicographic Data. Version 0.9.3. DARIAH Working Group on Lexical Resources. 2018. https:// dariah-eric.github.io/lexicalresources/ pages/TEILex0/TEILex0.html (Zugriff: 11.03.2025). Tjong Kim Sang, Erik F. u. Fien De Meulder: Introduction to the CoNLL-2003 Shared Task: Language-Independent Named Entity Recognition. In: Proceedings of the seventh conference on Natural language learning at HLT-NAACL 4. Edmonton2003, S.142–147. https://doi.org/10.3115/1119176.1119195 (Zugriff: 11.03.2025). Uytvanck, Dieter van, Leif-Jöran Olsson, Oliver Schonefeld u. a.: CLARIN Federated Content Search (CLARIN-FCS)– Core2.0. Version1.0, 2023-04-26. https:// office.clarin.eu/v/CE-2017-1046-FCSSpecification-v20230426.pdf (Zugriff: 11.03.2025). Wilkinson, Mark D., Michel Dumontier, IJsbrand Jan Aalbersberg u. a.: The FAIR Guiding Principles for Scientific Data Management and Stewardship. In: Scientific Data 3, 160018 (2016). https:// doi.org/10.1038/sdata.2016.18 (Zugriff: 11.03.2025). Wolf, Thomas, Lysandre Debut, Victor Sanh u. a.: Transformers: State-of-theArt Natural Language Processing. In: Proceedings of the 2020 Conference on Empirical Methods in Natural Language Processing: System Demonstrations, 2020, S. 38–45. https://doi.org/10.18653/ v1/2020.emnlp-demos.6 (Zugriff: 11.03.2025). Zeppezauer-Wachauer, Katharina u. Marco Heiles: Eine digitale Textreihentypologie für deutschsprachige Texte des Mittelalters und der Frühen Neuzeit. Showcase eines kontrollierten Vokabulars in SKOS. In: Mittelalter. Interdisziplinäre Forschung und Rezeptionsgeschichte 6 (2023), S. 6–39. https://doi. org/10.26012/mittelalter-30680 (Zugriff: 11.03.2025).