scieee AI-readable full text Open interactive document viewer

NER: Von lexikon- bis chatbasiert

Beyer, Andrea; Schulz, Konstantin

Abstract

Der Vortrag ist Teil des Workshops, den das Daidolos-Projekt am 27.6.2025 im DHLab der Universität Freiburg veranstaltet hat. In ihm wird in die NLP-Methode des Named Entity Recognition (NER) eingeführt.

Full text

NER: Von lexikon-bis chatbasiert Universität Freiburg, 27.6.2025 Dr. Andrea Beyer & Konstantin Schulz (Humboldt-Universität zu Berlin) NER 01 NER-Methoden 02 NER & Chatbots 03 NER-Einsatz 04 NER: Lexikon – KI-Methoden – LLM 01 | NER Named Entity Recognition & Classification (NER) ─Methode des Information Retrieval, d.h. der automatischen Extraktion von Informationen aus einem Textkorpus ─Named Entities: Begriffe, die über einen Namen eindeutig einer Kategorie zugewiesen werden können, z.B. Cicero = Person, Roma = Ort, Galli = Volk, ecclesia = Organisation, consulibus Antonio et Cicerone = Datum ─Ziel: Identifizierung und Klassifikation von Entitäten ─Anwendungsfelder: Text generieren, Meinungsforschung, Übersetzen, Textklassifikation, soziale Netzwerkanalysen, Zeitleisten, … ─Erweitertes Ziel: Disambiguierung von Entitäten, Verlinkung von Entitäten Ressourcen zur Entwicklung von NER-Systemen ─Typologien: Quelle für Guidelines von Annotationen ─Lexika und Wissensdatenbanken: Lexika bieten wortwörtlich Entitäten, Wissensdatenbanken bieten Informationen über referenzierte Entitäten ─Vektorbasierte Sprachmodelle: Wortvektoren repräsentieren die Bedeutung eines Wortes im Kontext (Word Embeddings); sie entstehen durch das Trainieren eines Modells ohne gelabelte Daten (Feature Learning) ─Korpora: Daten ohne Label: Einsatz beim Training von generischen Sprachmodellen und Wortvektoren Daten mit Label: Einsatz beim Evaluieren und beim Training spezialisierter KI-Modelle Herausforderungen: Daten und Methoden ─Kleine Community, eher unterfinanziert und wenig datenaffin; Datenarbeit wird nicht als Forschung betrachtet ─Latein und Altgriechisch = sog. low-resource languages, d.h. eher kleine Korpora ─Geringe Ressourcen, v.a. existieren zu wenig qualitativ hochwertig annotierte Datensets für das Training ─Geringe Anzahl an robusten Sprachmodellen ─Mangelnde Standards, z.B. bei Annotationsrichtlinien, Dokumentation etc. Herausforderungen: Korpora Probleme aufgrund dynamischer Sprachentwicklung ─Normalisierung, z. B. parvum vs. paruum ─Genre-Spezifika: Metaphern, Metonymien, poetische Ausdrücke verschleiern die Entität, z.B. urbs für Roma, tonans für Jupiter ─Ambiguität: Homonyme, z.B. Name des Sohnes = Vatername, Romanus für römisch oder Römer ─Mehrwort-Ausdrücke, d.h. mehr als ein Wort mit verschiedenen Konstruktionsmöglichkeiten, z.B. vallum Hadriani, Ser. Sullae Ser. Filii mit unterschiedlicher Spannweite, z.B. rebus Sancti Vincentii Matiscensis, oder mit Überlappungen, z.B. Guillelmus de Sancti Stephano de Ponte Lösungsansätze ─Erhöhung der Datenmenge Mehr annotierte Texte für unterschiedliche Genres und Epochen Ausweitung der Annotationskategorien ─Verbesserung der Datenqualität Standardisierte Guidelines für Annotationen Multi-Layer-Annotationen, z. B. Pompeianam villam = 1. Layer: Ortsangabe, Villa in Pompeji; 2. Layer: Ortsangabe, Villa des Pompeius; 3. Layer: Ortsangabe; Villa von Cicero (Pompeianum) ─semi-automatische Annotation KI annotiert automatisch und Mensch korrigiert Fehler der KI 02 | NER-Methoden Forschungsvorhaben: Ps.-Sallust In Ciceronem ─Frage: Welche Unterschiede gibt es zwischen authentischen Invektiven und declamationes als Invektive? ─Beispiel Adressat: Wer ist der eigentliche Adressat einer Invektive? Der Diffamierte, die Senatoren, der Sprecher (als invertiertes Lob)? Welche Namen kommen wie oft vor? Zu welcher Kategorie von Entität gehören sie? Wie verteilen sich die namentlichen Anreden über eine Rede? Wie häufig wird der Diffamierte direkt (2.Sg.) oder die Senatoren (2.Pl.) angesprochen? Wie häufig und wie wird über den Diffamierten indirekt (3.Sg.) gesprochen? In welcher Beziehung stehen die Ich-Aussagen (1.Sg.) und die direkte Anrede? ─Kategorie: Genremerkmal, Diskursstruktur ─Referenzkorpus 1: Ps.-Cicero, In Sallustium ─Referenzkorpus 2: Cicero, In Pisonem Identifikation und Klassifikation von NE Identifiziere und klassifiziere alle Named Entities im lateinischen Text (Anhang) nach Person (PERSON), Location (LOC), Organisation (ORG) und Nationalities or religious or political groups (NORP) . Gib eine Liste dieser Entitäten nach folgendem Muster aus: Beispiel 1: M. Tulli = PERSON / Beispiel 2: Romam = LOC /Beispiel 3: romanus = NORP Zähle alle Named Entities und gib das Ergebnis nach dem Schema an: PERSON: | LOC: | ORG: | NORP: Claude-Sonnet-4, 28.5.2025: https://poe.com/s/ghbVWYE43HIn8NO4wk7M Vergleich Claude-Sonnet-4 und NER-Tagger Chatbot: Fabios, Scipiones etc. richtig Romule Arpinas korrekt NER-Tagger: Götter erkannt, aber IOM nicht als eine Entität Pompeianum und Tusculanum als Person, nicht als Ort Plautiae falsch als Person Dyrrhachio nicht als Ort Vorkommen Typ Bibulum PERSON Caesarem PERSON Cicero PERSON Cicero PERSON Cicero PERSON Dyrrhachio PERSON Iuppiter PERSON M. Crassi PERSON M. Pisonem PERSON M. Tulli PERSON M. Tulli PERSON M. Tullius PERSON Maximus PERSON Minerva PERSON P. Crassi PERSON Plautiae PERSON Pompeianam PERSON Pompeianum PERSON Scipionis Africani PERSON Sestio PERSON Sullam PERSON Terentia PERSON Tusculanum PERSON Vatini PERSON Vergleich Claude-Sonnet-4 und NER-Tagger Vorkommen Typ Tusculanam LOC Romam LOC Porcia LOC Italia LOC Arpinas LOC Arpinas LOC Scipiones NORP Romule NORP Romanum NORP Paulos NORP Fabios NORP Chatbot: alle Orte korrekt Arpinas als NORP 1x falsch Romanum richtig patres conscripti richtig Gesetzesnamen zurecht nicht aufgeführt NER-Tagger: Scipiones, Romulus, Paulos, Fabios alle falsch als NORP Porcia falsch als Ort Rangreihenfolge der Entitäten PERSON Chatbot: Cicero korrekt M. Crassi fehlerhaft mit 2 NER-Tagger: patres conscripti manuell ergänzt Fehler der Identifikation setzen sich fort, s. Dyrrhachio, Plautiae etc. Gib die Entität PERSON in einer Rangreihenfolge absteigend aus. M. Tulli, M. Tullius und Cicero sind die gleiche Person. Zähle diese Entität nur als eine einzige. Beispiel 1: Cicero: Anzahl | Beispiel 2: Terentia: Anzahl Claude-Sonnet-4, 28.5.2025: https://poe.com/s/tsGYP32RaBsOn6JQsBIf Berechne für die Entitäten "Cicero" und "patres conscripti" für jede Nennung die prozentuale Position im Gesamttext (xAchse) und die Anzahl der Erwähnung pro Abschnitt (y-Achse). Gib das Ergebnis als stacked area plot aus, bei dem die Fläche für Cicero blau und die Fläche für "patres conscripti" orange ausgefüllt ist. Claude-Sonnet-4, 28.5.2025: https://poe.com/s/tWYU5sYCl7dQT9IUgFvR Vergleich Chatbot –NER-Tagger Vergleich Chatbot –Morphologie-Tagger Claude-Sonnet-4, 31.5.2025: https://poe.com/s/pkAISA3xMbW2O9yGrkKK Fazit Chatbots können überwiegend fehlerfrei Entitäten identifizieren und klassifizieren, soweit sie modern als Entitäten verstanden werden (Götter gehören nicht dazu). Sie können die Daten nicht zuverlässig aggregieren, d.h. nicht korrekt mit den Ergebnissen rechnen. Sie können Daten visualisieren, allerdings gilt auch hier: kein Zahlenverständnis (z. B. Nullpunkt, 100%) garbage in = garbage out 04 | NER-Einsatz