Korpustranslatologie
Abstract
Dieses Kapitel stellt die theoretischen Ansätzen des Funktionalismus, der Descriptive Translation Studies und der Universalientheorie als Motivation und als theoretische Grundlage dar, sich mit Translationsdaten in Form von Korpora auseinanderzusetzen. Es wird vor allem auf die produktorientierte Perspektive in der translatologischen Korpusforschung eingegangen. Ein methodisches Kapitel führt Grundbegriffe der Korpusanalyse ein und stellt beispielhaft Top-down- und Bottom-up-Zugänge in der Korpusarbeit dar. Prozessorientierte Perspektiven -- mit Blick auf kognitionsorientierte oder informationstheoretische Forschung -- werden ebenfalls aufgegriffen.
Full text
Kapitel 3 Korpustranslatologie Oliver Czuloa& Ekaterina Lapshinova-Koltunskib aInstitut für Translatologie gGmbH bUniversität Hildesheim Dieses Kapitel stellt die theoretischen Ansätzen des Funktionalismus, der Descriptive Translation Studies und der Universalientheorie als Motivation und als theoretische Grundlage dar, sich mit Translationsdaten in Form von Korpora auseinanderzusetzen. Es wird vor allem auf die produktorientierte Perspektive in der translatologischen Korpusforschung eingegangen. Ein methodisches Kapitel führt Grundbegriffe der Korpusanalyse ein und stellt beispielhaft Top-downund Bottom-upZugänge in der Korpusarbeit dar. Prozessorientierte Perspektiven – mit Blick auf kognitionsorientierte oder informationstheoretische Forschung – werden ebenfalls aufgegriffen. 1 Einführung Die im späteren 20. Jahrhundert aufgekommenen funktionalen Translationstheorien (u. a. Nord 1989, Reiss & Vermeer 1984, Holz-Mänttäri 1984) lösten die Dichotomie der „freien“ vs. der „nahen“ Übersetzung auf und schlugen stattdessen ausgehend vom Übersetzungsauftrag – der den Zweck und das Zielpublikum definiert – ein Spektrum an Strategien vor, die sich zwischen den beiden genannten Polen bewegen können. Die Beschaffenheit des Translats, d.h. des Produkts eines Translationsprozesses, hängt somit nicht allein vom Ausgangstext ab, sondern ist von verschiedenen Faktoren und den damit zusammenhängenden strategischen Erwägungen abhängig. Mit dieser Sichtweise rückt die Frage ins Blickfeld, welche Faktoren die Beschaffenheit des Translats wie beeinflussen, wobei inzwischen neben dem Übersetzungsauftrag zahlreiche andere situative Variablen wie z. B. das Kompetenzniveau der Translatoren, das Trägermedium des Translats etc. von Interesse sind. Oliver Czulo & Ekaterina Lapshinova-Koltunski. 2026. Korpustranslatologie. In Oliver Czulo, Martin Kappus & Felix Hoberg (Hrsg.), Digitale Translatologie, 35–48. Berlin: Language Science Press. DOI: 10.5281/zenodo.17523034
Oliver Czulo & Ekaterina Lapshinova-Koltunski Es sind vor allem die Ausführungen von Toury (insbes. 1995) und Baker (insbes. 1996) sowie die zunehmende Verfügbarkeit von Sprachdaten, die in den 1990er Jahren die Entstehung einer Korpustranslatologie anstoßen. Anfangs konzentrierten die Untersuchungen sich auf die Frage, welche Faktoren translationsspezifisch, oder genauer gesagt übersetzungsspezifisch sind, also was Übersetzungen von Nicht-Übersetzungen systematisch unterscheidet. Steht zu Beginn das (geschriebene) Produkt im Vordergrund, werden nach und nach Methoden – korpusbasierte wie andere – entwickelt, um auch Auswirkungen verschiedener Variablen auf den Übersetzungsprozess zu untersuchen. Vergleichbare Untersuchungen setzen fürs Dolmetschen später als fürs Übersetzen ein. Zum einen liegt dies darin mitbegründet, dass gesprochensprachliche Daten nicht so leicht verfügbar sind wie geschriebensprachliche Daten: Erstere müssen erst transkribiert werden.1Zum anderen kann man vermuten, dass ein hinderlicher Umstand war, dass das Dolmetschen nicht in gleicher Weise in den Wissenschaftsinstitutionen verankert ist wie das Übersetzen: Dolmetschprofessuren etwa sind deutlich seltener zu finden. In jüngerer Vergangenheit weitet sich der Blick über das Geschriebene und Gesprochene hinaus auch auf multimediale Aspekte der Translation. Neben den Forschungsinteressen spielen didaktische und praktische Aspekte, d.h. der Einsatz von Korpora als Wissensquelle in der Lehre und in der Translationspraxis, früh eine Rolle in der Korpustranslatologie. 2 Theoretische Grundlagen der Korpustranslatologie Die Korpustranslatologie bedient sich in vielerlei Hinsicht der Grundlagen und Erkenntnisse der Korpuslinguistik2und ist stark empirisch geprägt. Sie passt somit zur Kategorisierung der Translation Studies von Holmes (2000) als empirische Wissenschaft. Biber u. a. (1998) zufolge besteht der Korpusansatz darin, Gebrauchsmuster in natürlich vorkommenden Texten zu analysieren. Grundlage ist dafür eine Sammlung von Texten, die man als das Korpus bezeichnet. Die Analyse bedient sich der Unterstützung von Computern und bringt Beobachtungen • auf der qualitativen Ebene, also anhand von Einzelbeispielen, die meist tiefgehend analysiert werden, oft mit dem Ziel, daraus verallgemeinerbare Kategorien abzuleiten, und 1Jüngste Fortschritte in der automatischen Transkription können hier Abhilfe schaffen. 2Eine eingehende theoretische sowie praktische Einführung in die Korpuslinguistik findet sich in (Lemnitzer & Zinsmeister 2015). 36
3 Korpustranslatologie • auf der quantitativen Ebene, also anhand einer Vielzahl von Einzelbeobachtungen, die anhand bestehender Kategorisierung eingeordnet, ausgezählt und interpretiert werden, hervor. Dabei schließen diese beiden Ebenen einander nicht aus: Qualitativ hergeleitete Kategorien lassen sich quantitativ auf ihre Anwendbarkeit und Aussagekraft überprüfen; ebenso natürlich Kategorien, die quantitativ, z. B. über statistische Rechenverfahren, gewonnen wurden. Untersucht man quantitative Befunde, können Fundstellen auffallen, die nicht oder nicht so richtig in eine bestehende Kategorisierung passen; diese muss dann auf Grundlage qualitativer Analysen überarbeitet werden. Legt man sich nicht von vorneherein ausschließlich auf eine der beiden Herangehensweisen fest, wird sich so ein wechselseitiges, einander ergänzendes Verfahren ergeben. Viele korpusbasierte Studien im Bereich der Translatologie folgen der Annahme, dass übersetzte Texte bestimmte sprachliche Gemeinsamkeiten aufweisen, die nicht oder nur in geringerem Maße in nicht übersetzten Originaltexten vorkommen. Es gibt verschiedene Namen für diese übersetzungsspezifische Phänomene. Mona Baker spricht von Translationsuniversalia und meint dabei, dass diese vom Einfluss der spezifischen Sprachpaare unabhängig sind (Baker 1993: 243). Toury (1995) postuliert zwei „Gesetze“ der Übersetzung, wobei er diese ausdrücklich als probabilistische Tendenzen ansieht. Das law of growing standardization sagt aus: „in translation, textual relations obtaining in the original are often modified [...] in favour of (more) habitual options offered by a target repertoire“ (Toury 1995: 268): Übersetzungen orientieren sich demzufolge eher als Originaltexte an etablierten Normen in Grammatik und Lexik der Zielsprache. Dem Gegenüber steht das law of interference (Toury 1995: 275), demzufolge Eigenschaften des Ausgangstexts tendenziell in den Zieltext übertragen werden. Diese beiden scheinbar widersprüchlichen „Gesetze“ bestimmen in einer Wechselwirkung die sprachlichen die Eigenschaften des übersetzten Texts mit. Baker (1996) führt auf Grundlage von Vorläuferstudien vier Universalien auf (s. u.), die in der Folge vielfach erforscht, teils angezweifelt und später um weitere Universalien erweitert wurden. Chesterman (2004) klassfiziert die Universalien in Sund T-Universalien, d.h. Übersetzungsuniversalien, die entweder von der Ausgangsoder Zielsprache abhängig sind. Während die S-Universalien Wechselwirkungen zwischen Übersetzungen und ihren Ausgangstexten erklären sollen, beziehen sich die T-Universalien auf Unterschiede zwischen Übersetzungen und Originalen in der Zielsprache. Die ursprünglich von Baker aufgeführten Universalien sieht Pym (2008) alle als Varianten von Tourys law of growing standardization an, sie würden somit nach Chesterman unter die T-Universalien fallen. 37
Oliver Czulo & Ekaterina Lapshinova-Koltunski Eine weitere Bezeichnung dieser Phänomene ist Translationese, ein Begriff, der von Gellerstam (1986) geprägte wurde. Translationese ließe sich ins Deutsche mit „Übersetzungssprech“ oder „übersetzungstypischer Sprache“ übersetzen: Dies drückt pointiert aus, dass Übersetzungen ihren ganz eigenen Sprachstil haben, was sie, so betonen auch einige Forscher, zu einem Gegenstand echten Forsschungsinteresses jenseits einer reinen „Defizitdiskussion“ – also in einfachen Worten gesagt der oft gestellten Frage, was in der Übersetzung „verloren geht“ – macht. Zu den am häufigsten erforschten Phänomenen gehören: •Shining-through (Teich 2003) bzw. Durchscheinen, also die Tendenz, die Häufigkeit von Ausgangstextmerkmalen zu reproduzieren, anstatt den Konventionen der Zielsprache zu folgen; •(Über-)Normalisierung (Baker 1993, 1996), d. h. die Tendenz, sich an die typischen Merkmale der Zielsprache anzupassen und diese sogar übertrieben häufig zu verwenden; •Explizierung (Baker 1996, Olohan & Baker 2000), die Tendenz, die Inhalte deutlicher auszudrücken, anstatt sie implizit zu belassen; •Simplifizierung (Toury 1995), die Tendenz, die bei der Übersetzung verwendete Sprache zu vereinfachen und eindeutiger zu machen. Nicht alle Phänomene sind als rein sprachsystembezogen zu verstehen: Phänomene wie z. B. eine Tendenz zur Simplifizierung können anderweitige Ursache haben, etwa unterschiedliche Textsortenkonventionen oder kognitive Entlastungseffekte beim Übersetzen. Diese Übersetzungsphänomene werden im Translationsprodukt anhand von Beobachtungen über die Verteilung (Distribution) spezifischer sprachlicher Merkmale untersucht. Dafür werden verschiedene statistische Methoden und Techniken eingesetzt, die weiter unten in den Abschnitten 3.2 und 3.3 beschrieben werden. Anhand dieser Distributionen lassen sich übersetzte Texte von original verfassten Texten sogar automatisch unterscheiden (Volansky u. a. 2015, Baroni & Bernardini 2006). Die Phänomene wurden in den letzten Jahren in verschiedenen Kontexten untersucht, wie z. B. in verschiedenen Textsorten (Evert & Neumann 2017, Lapshinova-Koltunski 2017), für verschiedene Modalitäten wie geschrieben und gesprochen (Lapshinova-Koltunski u. a. 2021, He u. a. 2016, Kajzer-Wietrzny 2012) für verschiedene Produzierenden wie z. B. professionelle Übersetzende, Novizen oder Laien (Bizzoni & Lapshinova-Koltunski 2021, Kunilovskaya & 38
3 Korpustranslatologie Lapshinova-Koltunski 2020, Popović 2020, De Sutter u. a. 2017, Rubino u.a. 2016) und verschiedene Übersetzungsmethoden wie automatisch, händisch oder kombiniert (Popović u. a. 2023, Konovalova & Toral 2022, van der Werff u. a. 2022, Vanmassenhove u. a. 2021, Čulo u.a. 2017). 3 Grundbegriffe und Methoden der Korpusanalyse 3.1 Grundbegriffe Ein Korpus wird von Lemnitzer & Zinsmeister (2015: 39) als „Sammlung schriftlicher oder gesprochener Äußerungen in einer oder mehreren Sprachen“ definiert. Die Grenze zwischen einem Korpus und einer Datensammlung ziehen Lemnitzer und Zinsmeister anhand des Kriteriums, dass Korpora ganze Texte oder große Textausschnitte umfassen; allerdings betonen sie, dass diese Grenze nicht absolut definierbar sei. Sprechen wir heute über ein Korpus, meinen wir oft eine digitalisierte Sammlung. Bei der Zusammenstellung eines Korpus sind verschiedenste Kriterien denkbar, wobei einige Kriterien recht grundlegend für die wahrscheinlich meisten Korpora sind, insbesondere: •Repräsentativität: Ein Korpus soll ausreichend Material enthalten, um davon verallgemeinerbare Aussagen ableiten zu können. Diese Größe ist allerdings nicht fest bestimmbar, d. h. man kann keine absoluten Zahlen angeben, ab wann ein Korpus repräsentativ ist, zumal verschiedene Phänomene unterschiedlich häufig auftreten. Hier kommen oft Erfahrungswerte zum Einsatz, oder man kann ein Korpus sukzessive erweitern und dabei überprüfen, ob Beobachtungen, die man zuvor gemacht hat, auch auf das größere Korpus zutreffen. •Balanciertheit (also Ausgewogenheit): Ein Korpus soll Texte aus ausreichend verschiedenen Quellen umfassen, um verallgemeinerbare Aussagen machen zu können. In einem Korpus beispielsweise, das Texte von frühen Lernern einer Sprache enthält, um deren typische Fehler zu untersuchen, sollten nicht nur Texte einer oder sehr weniger Personen enthalten sein, da dies keine Verallgemeinerung auf weitere Personen erlauben würde.3 Korpora können nach Lemnitzer & Zinsmeister (2015) drei verschiedene Datentypen enthalten. 3Dieses Kriterium gilt natürlich dann, wenn es dem Ziel der Untersuchung entspricht. Anders würde es sich verhalten, würde man beispielsweise den Schreibstil nur einer Person in einem Genre untersuchen wollen. 39
Oliver Czulo & Ekaterina Lapshinova-Koltunski •Primärdaten: Dies ist das Material, anhand dessen bzw. über das wir Erkenntnisse gewinnen wollen, z. B. ein übersetzter Text, ein transkribiertes Gespräch oder eine Videoaufnahme. •Annotationen: In unserem Fall sind dies linguistische Beschreibungen von Einheiten in den Primärdaten, z. B. das Labeln von Wortarten oder die Markierung von Sprechpausen. •Metadaten: Diese beschreiben kontextuelle Aspekte der Entstehung der Primärdaten, also z. B. das Alter der Textproduzenten oder die Entstehungszeit von Texten. Es gibt eine ganze Reihe von Korpustypen, etwa Fachsprachenkorpora, Korpora von Sprachenlernern oder multimediale Korpora. Oft lässt sich ein Korpus mehreren Typen zuordnen, z. B. ist ein Korpus mit Videoaufnahmen, in denen Grundbegriffe der Physik erklärt werden, ein multimediales Fachsprachenkorpus. In einem solchen Korpus könnte neben den zu Hilfe genommen Bildern auch interessant sein, mit welchen Gesten bestimmte Aussagen gemeinsam vorkommen und ob sich zwischen Gesten und Gesagtem ein Zusammenhang erkennen lässt. So könnte man z. B. hypothetisieren, dass ein „entweder [...], oder [...]“ durch markante Handbewegungen begleitet wird, die relativ zu zwei verschiedene Positionen vor dem Körper der Sprecher – einmal links, einmal rechts der Körpermitte – erfolgen. Für die Translatologie sind zwei Arten von Korpora von besonderem Interesse: das Parallelkorpus und das Vergleichskorpus. Der Klassifikation von Granger (2003)4folgend gelten folgende Definitionen: •Parallelkorpus: Eine Sammlung von Originaltexten und deren Übersetzungen, bei denen jedem Originaltext mindestens eine Übersetzung zugewiesen ist. •Vergleichskorpus: Das mehrsprachige Vergleichskorpus ist eine Sammlung von Originalen und/oder Übersetzungen in mehreren Sprachen aus demselben Genre. Das einsprachige Vergleichskorpus enthält aus derselben 4Die Begriffe Parallelkorpus und Vergleichskorpus wurden und werden teils noch heute uneinheitlich verwendet, so gibt es Autoren, die die Benennungen genau umgekehrt verwenden wie hier dargestellt. Die Granger’schen Definitionen haben sich inzwischen aber erfahrungsgemäß weitestgehend etabliert. 40
3 Korpustranslatologie Sprache Originale und Übersetzungen oder Erstsprachlertexte5und Lernertexte. Im ersteren Fall sind die Übersetzungen nicht notwendigerweise Übersetzungen der Originaltexte. Um Übersetzungsbeziehungen zwischen sprachlichen Einheiten oder die Effekte der Ausgangssprache (nach Chesterman S-Universalien) zu untersuchen, ist ein Parallelkorpus erforderlich. Zum Beispiel kann ein beobachteter ungewöhnlich hoher Anteil an Nomen in übersetzten Texte ein Effekt der Ausgangssprache sein, die einen höheren Anteil an Nomen verwendet als in der Zielsprache üblich ist (also ein Durchscheinen). Andererseits kann der erhöhte Anteil an Nomen auch durch Überanpassungen an Konventionen der Zielsprache verursacht sein (also eine Normalisierung, nach Chesterman in der Gruppe der TUniversalien), was wiederum mit Hilfe monolingualer vergleichbarer Korpora zu überprüfen wäre. Darüber hinaus könnte es sich auch um ein „drittes Phänomen“ handeln, also eines, das nicht von Ausgangsoder Zielsprache abhängig ist. Dies könnte beispielsweise ein kognitiver Effekt des Übersetzungsprozesses sein, dass etwa Übersetzende tendenziell auf Nomen zurückgriffen, weil es ihnen kognitiv einfacher fiele, die Formulierungen so zu verfassen. Um letztere Annahme genauer zu beleuchten, genügen rein produktbasierte Korpora nicht, hierfür sind Prozesskorpora nötig, die Aspekte des Übersetzungsprozesses enthalten. Die Korpustranslatologie geht in der Regel deskriptiv vor und beschreibt Gebrauchsmuster in Texten. Dies kann entweder, wie eben dargelegt, hypothesengeleitet (top-down) erfolgen oder auch datengeleitet (bottom-up) ablaufen. Die beiden Herangehensweisen können kombiniert werden. 3.2 Top-down-Analyse Bei einer Top-down-Analyse werden ein existierendes theoretisches Modell oder Ergebnisse und Beobachtungen aus vorhergehenden Studien als Ausgangspunkt genutzt. Darauf aufbauend werden Hypothesen gebildet, die mittels Tests verworfen oder bestätigt werden können. Um sie zu testen, müssen Hypothesen operationalisiert werden: Es müssen beobachtbare Phänomene benannt werden, deren Erscheinungsbild als abhängige Variable von einer oder mehrerer unabhängigen Variablen beeinflusst wird. Üblicherweise formuliert man eine so genannte Nullhypothese, die keinen Zusammenhang zwischen unabhängigen und abhängigen Variablen sieht. Die Alternativhypothese geht im Gegensatz dazu von einem 5„Erstprachler“ oder wissenschaftlich oft „L1-Sprecher“ werden umgangssprachlich als „Muttersprachler“ bezeichnet, wobei ja nicht ausgemacht ist, dass dies die Sprache einer Mutter eines Textproduzenten ist. Hier meint Erstsprache die im gegebenen Kontext stärkste Sprache von Textproduzenten, d. h. nicht notwendigerweise die Sprache, die zuerst gelernt wurde. 41
Oliver Czulo & Ekaterina Lapshinova-Koltunski Zusammenhang zwischen den unabhängigen Variablen und den abhängigen Variablen aus. Weiterhin müssen die sprachlichen Merkmale definiert werden, die für ein Phänomen stehen und in Korpora gesucht werden können. Die beobachtete(n) Ausprägung(en) der sprachlichen Merkmale werden (ggf. statistisch) ausgewertet und in Bezug auf Hypothesen oder Fragestellungen interpretiert. Zum Beispiel wird in Arbeiten im Bereich der kontrastiven Pragmatik (House 1997) ausgesagt, dass die deutsche Sprache inhaltsorientierter (unpersönlicher im Stil) als die englische Sprache ist, welche adressatenorientierter (durch persönlichere Ansprache) funktioniert. Auf diesen Beobachtungen aufbauend könnte man eine Hypothese aufstellen, dass Übersetzungen aus dem Deutschen ins Englische aufgrund von Einflüssen der Ausgangssprache inhaltsorientierter als vergleichbare Originale im Englischen sind. Hier wären die unabhängigen Variablen also die sprachlichen Konventionen der Ausgangsund der Zielsprache sowie die Übersetzungsrichtung; die Häufigkeit der Produktion von inhaltsvs. adressatenorientierten Merkmalen wären davon abhängig. Die Nullhypothese würde besagen, dass kein Unterschied in der Häufigkeit unpersönlicher vs. persönlicher Ausdrücke zwischen übersetzten Texten und Originaltexten im Englischen bestünde; die Alternativhypothese würde unsere eben formulierte Annahme enthalten, dass die aus dem Deutschen übersetzten englischen Texte unpersönlicher gestaltet wären. Um dies korpusbasiert zu untersuchen zu können, muss zunächst festgelegt werden, welche sprachlichen Ausdrücke im Deutschen und Englischen jeweils als inhaltsbzw. adressatenorientiert gelten. Die Inhaltsorientierung spiegelt sich z. B. in der Verwendung von Passivkonstruktionen, zu-Infinitiven und Reflexivverben wider. Also werden im Korpus die Häufigkeiten von Passivund Reflexivverben und zu-Infinitiven ermittelt. Passivkonstruktionen im Englischen lassen sich beispielsweise als Abfolge von einem Hilfsoder Modalverb in finiter Form (is, are, was, were, has, have, can etc.), gefolgt von einem optionalen Adverb (always, recently, etc.), gefolgt von einem optionalen Verb to be im Gerundium oder als Partizip II (been, being) und gefolgt von Partizip II eines beliebigen Verbes definieren: is always being done, has been asked, were written, could be clarified. Anhand der ermittelten Häufigkeiten dieser sprachlichen Merkmale kann untersucht werden, ob englische Übersetzungen aus dem Deutschen tatsächlich eine signifikant höhere Anzahl inhaltsorientierter Merkmale haben als die vergleichbaren Originale im Englischen. Trifft dies zu, wäre die aufgestellte Hypothese aber noch nicht bestätigt: Es muss zusätzlich noch im deutsch-englischen Parallelkorpus anhand der deutschen Originale überprüft werden, ob die unpersönlichen Ausdrücke tatsächlich aus dem Deutschen übersetzt wurden. Ist dies nicht der Fall, würde man nicht von einem Durchscheinen ausgehen, sondern 42
3 Korpustranslatologie könnte u. a. annehmen, dass eine zielsprachliche Konvention beim Übersetzen ungewöhnlich oft verwendet wurde, was eher dem Phänomen der Normalisierung zuzuordnen wäre. Anhand dieses Beispiels wird deutlich, wie ein theoriegetriebener bzw. hypothesengeleiteter Ansatz in der Korpustranslatologie eingesetzt wird: Bereits existierende Vorarbeiten und Theorien werden für die Hypothesenbildung genutzt, außerdem soweit angegeben auch als Informationsquelle für die zu untersuchenden sprachlichen Merkmale. 3.3 Bottom-up-Analyse Bottom-up-Ansätze werden auch als datengesteuert oder datengeleitet bezeichnet. Bei diesen Ansätzen werden zunächst Beobachtungen festgehalten, die mit einem notwendigen Minimum an Konzepten auskommen. Für die Interpretation der Beobachtungen werden theoretische Ansätze verwendet oder gebildet. Bottom-up-Ansätze arbeiten mit so genannten shallow features, d. h. oberflächlichen sprachlichen Merkmalen, die automatisch leicht zu ermitteln sind und keine besonders theorieabhängige Fundierung haben, wie etwa Wortarten.6Schon eine einfache Statistik über die Verteilung von Wortarten kann informativ sein: In einem Bottom-up-Ansatz würde man z. B. für ein Vergleichskorpus zunächst die Häufigkeitsverteilung aller Wortarten in übersetzten und Originaltexten beschreiben, um dann Abweichungen in den Verteilungen genauer unter die Lupe zu nehmen. Anders als bei einem Top-down-Ansatz würde man nicht von vorneherein bestimmte Verteilungen vermuten. Daneben wird auch mit so genannten N-Grammen gearbeitet, wobei Gramme eine kontinuierliche Abfolge von Elementen meint und Nfür eine beliebige Zahl steht. N-Gramme können auf der Grundlage verschiedener Größen berechnet werden, z. B. Wortformen, Wortarten oder Tokens (d. h. alle sprachlichen Oberflächenelemente, also Wörter, Satzzeichen, Emojis, ...). Ein Satz wie Ich bin ein Satz. würde folgende Tri-Gramme, also Abfolgen mit jeweils drei Elementen ergeben: • Wortformen: Ich bin ein // bin ein Satz • Wortarten: Pronomen–Vollverb–Artikel // Vollverb–Artikel–Nomen 6Streng genommen ist auch die Definition von Wortarten durchaus theorieabhängig, aber es haben sich gerade im Bereich der Korpusanalyse einige Konventionen durchgesetzt, die als quasi „theorieneutral“ gelten und aufgrund ihres häufigen Einsatzes Ergebnisse vergleichbar machen. 43