Full text
Kapitel 4 CAT-Tools: Komponenten und Konzepte Martin Kappus Zürcher Hochschule für Angewandte Wissenschaften In den letzten Jahren wurden die Diskussionen zum Thema Sprachund Übersetzungstechnologie von neuen Entwicklungen wie neuronaler maschineller Übersetzung und generativen KI-Werkzeugen wie Large Language Models (LLMs) dominiert. Aus der professionellen Übersetzung sind aber traditionelle Übersetzungstechnologien wie Computer-Assisted-Translation Tools (CAT-Tools) immer noch nicht wegzudenken. In diesem Artikel werden die wichtigsten Konzepte und Komponenten von CAT-Tools erläutert. Dabei wird auch diskutiert, warum CAT-Tools auch heute noch eine wichtige Rolle spielen. Darüber hinaus wird aufgezeigt, welche Möglichkeiten es gibt, traditionelle Übersetzungstechnologien wie CAT-Tools mit neuronalen maschinellen Übersetzungssystemen und LLMs kombiniert werden können und wie effizientere Verknüpfungen in der Zukunft aussehen könnten 1 Einleitung In den vergangenen Jahren haben sich die Diskussionen im Bereich der Übersetzungstechnologie in erster Linie auf generative Technologien wie neuronale maschinelle Übersetzungssysteme und generative KI-Systeme, wie die sogenannten Large Language Models (LLMs) konzentriert. Dabei sind etablierte Technologien wie CAT-Tools aus dem Fokus geraten, obwohl diese Anwendungen auch gegenwärtig noch ein wichtiger Bestandteil des Werkzeugkastens von professionellen Übersetzer:innen sind. Während maschinelle Überstezungssysteme automatisch Übersetzungen generieren (oft ohne menschliches Eingreifen), unterstützen CAT-Tools menschliche Übersetzer:innen, indem sie frühere Übersetzungen, Terminologie und Qualitätsprüfungen bereitstellen, wodurch der Übersetzungsprozess effizienter und konsistenter gestaltet wird. Dieser Artikel gibt Martin Kappus. 2026. CAT-Tools: Komponenten und Konzepte. In Oliver Czulo, Martin Kappus & Felix Hoberg (Hrsg.), Digitale Translatologie, 49–63. Berlin: Language Science Press. DOI: 10.5281/zenodo.17523036
Martin Kappus einen Überblick über die Geschichte von CAT-Tools, erklärt wichtige Komponenten von CAT-Tools und zeigt Unterschiede zwischen verschiedenen CAT-Tools anhand verschiedener Kategorien auf. Abschließend wird die Relevanz von CATTools auch und gerade in Zeiten von neuronaler maschineller Übersetzung und generativer KI diskutiert1. 2 Geschichte Die Geschichte der CAT-Tools lässt sich grob in zwei Phasen unterteilen. Einerseits in die Phase der konzeptuellen Vorüberlegungen, die überhaupt zur Entwicklung und zur kommerziellen Verwendung von CAT-Tools geführt haben. Andererseits in die Phase der Weiterentwicklungen, die diese kommerziellen Produkte im Anschluss bis heute durchlaufen haben. Eine detailliertere Darstellung der geschichtlichen Entwicklung der Übersetzungstechnologie findet man in Chan (2023). 2.1 Vorläufer Ein Anstoß für die Entwicklung der ersten Übersetzungs-Werkzeuge, wie wir sie heute kennen, war die Enttäuschung Mitte der 1960er Jahre über mangelnde Fortschritte bei der Entwicklung produktiver maschineller Übersetzungssysteme, wie sie im ALPAC-Report deutlich zum Ausdruck kommt: „We have no useful machine translation [and] there is no immediate or predictableprospect of useful machine translation“ (Automatic Language Processing Advisory Committee 1966; vgl. auch Hutchins 1996). In den späten 1970er Jahren verlagerte sich daher der Schwerpunkt von der vollautomatischen maschinellen Übersetzung auf die so genannte „menschlich unterstützte maschinelle Übersetzung“ (d.h. die Vorund/oder Nachbearbeitung von MT) oder „maschinell unterstützte menschliche Übersetzung“ (d. h. die Verwendung von Sprachtechnologiewerkzeugen). Anstatt neue Übersetzungen automatisch zu erstellen, wurde die Wiederverwendung bereits vorhandener Übersetzungen und Terminologie immer wichtiger. Es wurden Datenbanksysteme entwickelt, um frühere Übersetzungen einfach speichern und abrufen zu können. Die ersten Vorschläge für so genannte Überset1Prinzipell sind KI-Tools wie neuronale maschinelle Übersetzung und LLMs, wenn sie für translatorische Zwecke genutzt werden, auch CAT-Tools (R. Krüger p. K.). In diesem Artikel wird der Begriff CAT-Tool von anderen Übersetzungstechnologien dadurch abgegrenzt, dass bei den traditionellen CAT-Tool-Komponenten wie Translation Memory und Terminologiedatenbank bestehende Ressourcen wiederverwendet werden, während bei der neuronalen maschinellen Übersetzung und bei der Nutzung von LLMs neue Texte automatisert generiert werden. 50
4 CAT-Tools: Komponenten und Konzepte zungsarchive, die als Vorläufer der heutigen Translation Memory Tools angesehen werden können, findet man bei Krollmann (1971) und dann 1979 bei Peter Arthern bei der Europäischen Kommission (Hutchins 1998: 294). Anlass für den Vorschlag von Arthern war die Tatsache, dass die Texte der Europäischen Kommission zu dieser Zeit sehr repetitiv waren, was dazu führte, dass die Übersetzer:innen bestimmte Passagen mehr als einmal übersetzen mussten. Die ersten kommerziellen Translation-Memory-Systeme kamen jedoch erst Anfang der 1990er Jahre auf den Markt. 2.2 Geschichte der kommerziellen CAT-Tools Der IBM Translation Manager (1980er Jahre) ist eines der frühesten Beispiele für ein CAT-Tool. Es war ein umfangreiches System, das auf Großrechnern lief und Übersetzungsspeicher (Translation Memory, TM) sowie Terminologiedatenbanken nutzte. In den 1980er Jahren entwickelte das Unternehmen ALPS eines der ersten CAT-Systeme, das eine Kombination aus Textverarbeitung und Übersetzungsspeicher bot. Es war speziell für große Unternehmen gedacht. In den frühen 90er Jahren kamen weitere kommerzielle Terminologieund TranslationMemory-Systeme auf den Markt wie z.B MultiTerm (1990) sowie die Translator´s Workbench (1994), beide von Trados (D. Brockmann p. K.), STAR Transit im Jahr 1991 (Nimdzi 2022), Deja Vu im Jahr 1993 (Lejosne 2018) und etwas später Wordfast. Die Nachfolger zwei dieser Systeme (STAR Transit und Trados Studio) sind heute noch auf dem Markt, obwohl sie mit den ursprünglichen Versionen nicht mehr viel gemeinsam haben. Ein wichtiger Faktor für den Erfolg dieser Systeme war die Entwicklung der ersten grafischen Benutzeroberflächen. Die ersten Windows-basierten Versionen von Translation-Memory-Tools wurden viel beliebter als die früheren Versionen, die auf DOS basierten.2Die Kerntechnologie von CAT-Tools hat sich in den letzten Jahren nicht verändert. So haben sich beispielsweise die Algorithmen, die für den Vergleich und das Matching von zu übersetzendem Text mit Translation-Memory-Inhalten verwendet werden, seit der Einführung von Translation-Memory-Tools nicht wesentlich verändert. Eine bemerkenswerte Ausnahme ist der Versuch, kleinere Einheiten innerhalb der Translation-Memory-Inhalte zu verwenden (das so genannte SubsegmentMatching), das in verschiedenen CAT-Tools zu finden ist (siehe auch Garcia 2014: 82–83). Neuere Entwicklungen konzentrieren sich auf die Integration anderer Systeme (z. B. NMT) oder die Kombination von Projektmanagementfunktionen und erweiterten Funktionen für die Übersetzungsproduktion (z. B. Online-Vorschau, 2Ausführlichere Übersichten über die frühe Geschichte der Übersetzungstechnologie finden sich bei Hutchins (1998) und Garcia (2014). 51
Martin Kappus Predictive Typing) in einem einzigen Tool. Ein weiterer wichtiger Schritt in der Entwicklung von Übersetzungsmanagementsystemen und CAT-Tools war der Übergang von rein desktop-basierten Anwendungen zum web-basierten Zugriff auf Übersetzungstools (s.u.). CAT-Tools haben sich also über die Jahre von einfachen Übersetzungsspeichern zu komplexen, kollaborativen Plattformen entwickelt. Sie integrieren maschinelle Übersetzung, Terminologieverwaltung, Workflow-Management und mehr. 3 Komponenten Oft werden die Begriffe CAT-Tool und Translation-Memory-System synonym verwendet. Allerdings haben CAT-Tools einen breiteren Funktionsumfang, während ein Translation-Memory-System auf die Verwaltung und Nutzung von gespeicherten Übersetzungen spezialisiert ist. Letztlich ist das Translation Memory eine spezifische Komponente oder Funktionlität innerhalb eines CAT-Tools, die sich ausschließlich auf die Speicherung und Wiederverwendung von Übersetzungen konzentriert. In den folgende Abschnitten werden das Translation Memory und andere wichtige Komponenten von CAT-Tools genauer vorgestellt. 3.1 Translation Memory Translation Memorys, im Deutschen auch Übersetzungsspeicher, werden vielfach als das Herzstück von CAT-Tools bezeichnet. Translation Memorys sind Datenbanken, in denen Übersetzungen während der Übersetzung in der Regel als Satzpaare (sogenannte Übersetzungseinheiten), bestehend aus Ausgangssatz und der dazugehörigen Übersetzung, abgespeichert werden. Die in der Datenbank gespeicherten Übersetzungen werden den Übersetzer:innen im weiteren Verlauf der Übersetzungsarbeit oder bei späteren Übersetzungen immer dann vorgeschlagen, wenn derselbe oder ein ähnlicher Ausgangssatz im zu übersetzenden Text vorkommt. Die Übersetzer:innen können die vorgeschlagene Übersetzung dann übernehmen, anstatt den selben Ausgangssatz noch einmal zu übersetzen. Vor der Übersetzung werden die zu übersetzenden Texte in kleinere Einheiten zerlegt, die dann einerseits zur Übersetzung angezeigt werden und andererseits als Grundlage für die Suche in der Datenbank (dem Translation Memory) dienen. Dieser Vorgang wird als Segmentierung bezeichnet. Die Segmentierung basiert in der Regel darauf, dass bestimmte (Satz-)Zeichen (wie Punkte, Fragezeichen), aber auch nicht druckbare Zeichen (wie Tabulatoren oder Absatzmarken) 52
4 CAT-Tools: Komponenten und Konzepte als Indikatoren für das Ende eines Segments verwendet werden (zusammen mit anderen Merkmalen wie Leerzeichen und nachfolgenden Großbuchstaben). Die meisten auf dem Markt erhältlichen CAT-Tools zielen auf eine Segmentierung auf Satzebene ab, d.h. der vorliegende Text wird in einzelne Sätze zerlegt. In den früheren Versionen von CAT-Tools wurden neben den eigentlichen Übersetzungen (Satzpaaren) nur wenige Zusatzinformationen gespeichert. Typischerweise wurden Informationen zu den Benutzer:innen, die die Übersetzungseinheit erstellt oder zuletzt bearbeitet haben, sowie Datum und Uhrzeit der Erstellung der Übersetzungseinheit und der letzten Bearbeitung mit abgespeichert. Mittlerweile bieten die meisten CAT-Tools die Möglichkeit, eigene Felder anzulegen, in denen Metadaten verschiedener Datentypen verwaltet werden können. Oft werden diese Felder verwendet, um Translation-Memory-Inhalte mit Informationen wie dem Namen des Kunden, dem Fachgebiet oder Informationen zum Übersetzungsprojekt zu speichern. Diese Informationen können verwendet werden, um die Suche im Translation Memory auf bestimmte bereits angefertigte Übersetzungen einzuschränken, die für die anstehende Übersetzung besonders relevant sind. Differenzierte Metadaten können aber auch hilfreich sein, um aus großen TMs zielgerichtet Teilmengen für das Training/Fine-Tuning von MÜSystemen oder LLMs zu extrahieren. Seit Ende der 2000er Jahre speichern einige CAT-Tools neben den Übersetzungen und den benutzerspezifischen Metadaten auch Kontextinformationen im Translation Memory. Dabei handelt es sich in der Regel um die Information, welches Segment/welcher Satz dem aktuellen Segment/Satz vorausgeht bzw. folgt. Stimmt neben der Übersetzung aus dem Translation Memory auch der Kontext der Übersetzungseinheit mit dem zu übersetzenden Satz überein, ist die Wahrscheinlichkeit höher, dass die Übersetzung aus dem Translation Memory auch für die neue Übersetzung adäquat ist. 3.2 Terminologiekomponente Die meisten CAT-Tools verfügen neben dem Translation Memory über eine weitere Datenbank, in der Terminologieeinträge verwaltet werden können und für die Übersetzung bereitgestellt werden. Eine Terminologiedatenbank ist eine spezialisierte Datenbank, die zur Verwaltung, Speicherung und Pflege von Fachbegriffen und deren Definitionen und anderen Metadaten verwendet wird. Bei den Einträgen in der Terminologiedatenbank kann es sich um Einzelwörter, Abkürzungen aber auch um Mehrwortbegriffe handeln. Terminologiedatenbanken unterscheiden sich von Translation Memorys nicht nur in der Größe der gespeicherten Einträge (Satz/Segment im Translation Memory vs. Einzelwort- /Mehrwortbegriffe in der Terminologedatenbank), in Terminologiedatenbanken 53
Martin Kappus werden auch oft mehr als zwei Sprachen verwaltet und sie zeichnen sich durch eine größere Anzahl von oft strukturierten Metadaten aus, die man in Translation Memorys so kaum findet. Beim Übersetzen werden den Übersetzer:innen Vorschläge aus der Termdatenbank in der Zielsprache angezeigt, wenn der entsprechende Begriff aus der Termdatenbank im Ausgangstext vorkommt. Verschiedene CAT-Tools unterscheiden sich in Bezug auf die Terminologiekomponenten im Hinblick auf: • die Art ihrer Einbindung • die Flexibilität der Terminologiekomponente • deren Funktionsumfang. Dementsprechend verwenden verschiedene Hersteller auch verschiedene Bezeichnungen für die Terminologiekomponenten ihrer Tools (Termdatenbank, Terminologieverwaltung, u. a.). Im Folgenden wird die Benennung Terminologiekomponente verwendet. Einige CAT-Tools bieten die Terminologiekomponente als eigenständige Anwendung an, die jedoch eng in die Übersetzungsumgebung der Tools integiert sind. Beispiele dafür sind Trados MultiTerm, TermStar und Cross-Term. Die Idee hinter diesem Ansatz ist, eine eigenständige Oberfläche für die ausführlichere Erstellung und Bearbeitung von Terminologiebeständen zur Verfügung zu stellen. In der Übersetzungsumgebung werden die für die Übersetzung relevanten Ergebnisse aus den Terminologiedatenbanken angezeigt. Darüber hinaus gibt es nur begrenzte Funktionalitäten zur Bearbeitung der Terminologiebestände. Andere CAT-Tools beinhalten alle Funktionalitäten der Terminologiekomponenten im CAT-Tool selbst. Diese Unterscheidung geht in der Regel mit Unterschieden in der Flexibilität der Termbankstrukturen einher. Die Tools mit eigenständigen Anwendungen für die Terminologverwaltung erlauben meist eine freiere Definition von Terminologiedatenbanken, wohingegen bei den CAT-Tools, bei denen die Terminologiekomponente integriert ist (wie z. B. Phrase oder memoQ), die Struktur der Termdatenbank (also die Anzahl, Art und Benennung der verfügbaren Felder) oft vorgegeben ist. Beide Ansätze haben Vorund Nachteile. So ermöglicht eine flexiblere Handhabung der Termbankstruktur eine bessere Anpassung auch an komplexere Anforderungen im Bereich der Terminologieverwaltung, wie sie gerade in größeren Organisationen an der Tagesordnung sind. Allerdings bringt diese Flexibilität Nachteile beim Datenaustausch zwischen verschiedenen Termdatenbanken mit sich, da nicht von einer gemeinsamen Struktur ausgegangen werden kann. Eine Reihe von Artikeln 54
4 CAT-Tools: Komponenten und Konzepte über wichtige Themen aus dem Bereich der Terminologie in der Redaktion und Übersetzung findet man im Sammelband von Hennig & Tjarks-Sobhani (2016). 3.3 Editor Eine wichtige Komponente in einem CAT-Tool ist der Editor in dem die Übersetzer:innen ihre Übersetzungen erstellen und bearbeiten können. Im Unterschied zu herkömmlichen Texteditoren müssen die Editoren von CAT-Tools standardmäßig die Verarbeitung zweisprachiger Texte ermöglichen. Dazu wird in der Regel die einsprachige zu übersetzende Datei zunächst segmentiert und dann in ein Format umgewandelt, das Platz für die Übersetzung zur Verfügung stellt. Die Übersetzung wird direkt an dieser zweisprachigen Datei vorgenommen. Nach Abschluss der Übersetzung wird aus der zweisprachigen Datei eine einsprachige Datei in der Zielsprache erzeugt. Bis Anfang der 2000er Jahre nutzten viele CATTools das Textverarbeitungssystem MS Word als Editor für die Übersetzer:innen. Die Verbindung zum Translation Memory (und die Terminologie) wurde über Makros und Symbolleisten in Word zur Verfügung gestellt. Mithilfe dieser Makros wurde der Text anhand von Sonderformatierungen und geschützten Zeichen segmentiert und die Platzhalter für die Übersetzung in den Text eingefügt. Ein Vorteil dieses Ansatzes ist die Tatsache, dass die meisten Anwender mit MS Word und seinen Funktionalitäten bereits vertraut sind. Allerdings hatte diese Herangehensweise auch Nachteile, so war die Segmentierung der Texte im Editor nur bedingt geschützt und eine Datei mit beschädigter Segmentierung konnte nicht in eine einsprachig zielsprachige Datei konvertiert werden. Da Ende der 1990er Jahre und Anfang der 2000er Jahre neben Worddateien auch immer mehr andere Dateiformate übersetzt werden mussten, wurden erste eigenständige Editoren für CAT-Tools entwickelt. Für diese Editoren werden die Ausgangsdateien in ein anderes (meist XML-basiertes) Format konvertiert. In diesen modernen Editoren werden Formatierungen und Strukturinformationen meist in Form von sogenannten Tags angezeigt. Beim Übersetzen müssen diese Tags von den Übersetzer:innen entsprechend im Zieltext platziert werden, wobei verschiedene CATTools unterschiedliche Mechanismen bzw. Tastenkombinationen bieten, damit das Platzieren der Tags möglichst effizient ausgeführt werden kann. Einfache Formatierungen (z. B. Kursivschrift, Fettdruck) werden oft direkt in der Übersetzungsansicht so angezeigt, wie sie im fertigen Dokument erscheinen (WYSIWYG), während komplexere Formatierungen nur über die Labels der Tags sichtbar sind. 55
Martin Kappus 4 Verschiedene Kategorien von CAT-Tools Obwohl fast alle CAT-Tools die gleichen Kernfunktionen bieten, gibt es eine Reihe von Unterschieden, anhand derer CAT-Tools bis zu einem gewissen Grad kategorisiert werden können. Die Zuordnung einzelner Produkte zu diesen Kategorien ist jedoch nicht immer eindeutig, und einige Tools können (je nach Konfiguration und Verwendungszweck) mehreren Kategorien zugeordnet werden. 4.1 Art der Plattform: Desktop-basiert vs. cloud-basiert 4.1.1 Desktop-basierte CAT-Tools Bis ca. 2010 waren alle führenden CAT-Tools desktop-basiert. Desktop-basierte Software wirddirektauf dem lokalen Computer installiert und ausgeführt. Dieser Ansatz hat sowohl Vorals auch Nachteile gegenüber anderen Plattformen. Die Daten und Programme befinden sich physisch auf der Festplatte der jeweiligen Benutzer:innen (oder auf einem anderen im Netzwerk zugänglichen Laufwerk). Dadurch haben die Benutzer:innen die volle Kontrolle über ihre Daten. Ein Arbeiten ist auch offline (d.h. ohne Internetzugang) möglich. Insbesondere im Vergleich zu den ersten Implementierungen von web-basierten CAT-Tools verfügen desktop-basierte CAT-Tools über einen größeren Funktionsumfang. Dieser Unterschied hat sich jedoch in den letzten Jahren deutlich verringert. Bei desktopbasierten CAT-Tools müssen die für die Abwicklung eines Überstezungsauftrags oder -projekts notwendigen Daten und Dateien auf dem lokalen Rechner verwaltet werden, d.h. es müssen entsprechende Verzeichnisse für die verschiedenen im Prozess anfallenden Daten angelegt werden (manuell oder automatisiert). Dies kann bei einer größeren Organisation oder einem größeren Auftragsvolumen zu recht komplexen Dateistrukturen führen. Außerdem ist der gleichzeitige Zugriff mehrerer Benutzer:innen auf Translation-Memoryund Terminologedaten bei desktop-basierten CAT-Tools nicht ohne Weiteres möglich. Selbst wenn die Daten an einem Speicherort abgelegt werden, der für mehrere Personen zugänglich ist, sind die zugrunde liegenden Datenbanken oft nicht für den gleichzeitigen Zugriff mehrerer Benutzer:innen ausgelegt. 4.1.2 Cloud-basierte CAT-Tools Mit der Weiterentwicklung des Internets und der zunehmenden Verbreitung von Breitbandanschlüssen entstanden Ende der 2000er und Anfang der 2010er Jahre die ersten cloud-basierten CAT-Tools. Schon im Jahr 2012 wurden die Vor56
4 CAT-Tools: Komponenten und Konzepte und Nachteile von cloud-basiertern CAT-Tools von Muegge thematisert (Muegge 2012). Cloud-basierte Systeme werden nicht auf dem lokalen Computer, sondern auf Servern eines Anbieters installiert und über das Internet bereitgestellt. Benutzer- :innen greifen über einen Webbrowser oder spezielle Clients auf die Software zu. Ein großer Vorteil cloud-basierter CAT-Tools besteht darin, dass sie unabhängig vom Betriebssystem auf jedem Computer laufen, der mit dem Internet verbunden ist. Viele der am weitesten verbreiteten kommerziellen desktop-basierten CAT-Tools (z. B. Trados, memoQ, STAR Transit, across) können nur auf Computern mit dem Betriebssystem Windows installiert werden. Benutzer:innen, die ein anderes Betriebssystem wie MacOS oder Linux verwenden, können diese Anwendungen nicht oder nur mit größerem technischen Aufwand, wie z. B. mit der Verwendung von virtuellen Umgebungen, einsetzen. Da ein Großteil der Rechenleistung auf den Servern des jeweiligen Anbieters erfolgt, sind auf Seiten der Benutzer:innen auch keine so leistungsstarken Rechner wie bei desktop-basierten Tools erforderlich. Die Ablage aller benötigten Daten erfolgt bei cloud-basierten Systemen ebenfalls auf den Servern der Anbieter und die erforderlichen Strukturen werden dort meist automatisiert von den Systemen angelegt, so dass sich die Benutzer:innen nicht darum kümmern müssen. Cloud-basierte CAT-Tools sind über das Internet zugänglich und bieten den Vorteil, dass mehrere Benutzer:innen gleichzeitig und ortsunabhängig an einem Projekt arbeiten können. Dies erleichtert die Zusammenarbeit an Projekten in Teams, da auch die für die jeweiligen Schritte benötigten Dateien automatisch den jeweiligen Benutzer:innen zugewiesen werden und nicht manuell im Dateisystem verwaltet und verschoben werden müssen. 4.1.3 Client-Server-Anwendungen Ein Sonderfall, der nicht in die oben genannten Kategorien fällt, sind die so genannten Client-Server-Anwendungen. Sie stellen eine Erweiterung von Desktopbasierten CAT-Tools dar und können einige der Nachteile von reinen DesktopTools ausgleichen. Noch vor dem Aufkommen von Cloud-basierten CAT-Tools boten mehrere CAT-Tool-Hersteller Client-Server-Lösungen an, bei denen die Anwendersoftware (die Client-Software) lokal auf den Rechnern der Anwender:innen installiert wird, die Daten (z. B. Translation-Memory-Daten oder Terminologie-Daten) aber auf einem Server liegen. So können verschiedene Anwender:innen gleichzeitig auf die Daten zugreifen. Diese Daten können auf internen Servern der jeweiligen Organisation gespeichert werden, was eine höhere Datensicherheit für die Organisation mit sich bringt. Die Client-Software 57