Richtlinien zur Auswahl von Translation Memory
Phrase Custom AI nutzt Translation Memories (TMs), um benutzerdefinierte Modelle für die maschinelle Übersetzung (MT) zu erstellen, die sich an spezifische Terminologie und einen vorgegebenen Stil halten. Das führt im Vergleich zur generischen maschinellen Übersetzung zu einer verbesserten Übersetzungsqualität (und damit zu verkürzten Nachbearbeitungszeiten) für diese Inhaltstypen.
Der wichtigste Faktor, der die Effektivität des Anpassungsprozesses beeinflussen kann, ist die Verwendung der Translation Memories. Dies sind allgemeine Richtlinien, die dabei helfen können, zu bestimmen, welche Daten für diesen Zweck verwendet werden sollen:
-
Einzelne Domäne:
Es ist am besten, wenn sich der Datensatz auf Inhalte konzentriert, die einen einzigen Stil und eine einzige Terminologie abdecken. Wenn der Datensatz eine Mischung aus Domänen enthält (z. B. sowohl juristische Fachbegriffe einer Webseite als auch Produktbeschreibungen), kann das Modell Schwierigkeiten haben, den gewünschten Stil zu erlernen.
-
Eindeutiger Inhaltstyp:
Das benutzerdefinierte MT-Modell baut auf generischen Modellen auf, die mit riesigen Mengen öffentlicher Daten aus dem Internet trainiert wurden. Wenn das Translation Memory Daten enthält, die denen der generischen Modelle, auf denen diese basieren, sehr ähnlich sind, bietet der Anpassungsprozess nur einen geringen Mehrwert.
-
Datenqualität:
Das Modell geht davon aus, dass jedes Satzpaar im Translation Memory ein Beispiel für die Ausgabe ist, die es voraussichtlich produzieren soll. Das Translation Memory muss von hoher Qualität sein – idealerweise basiert es auf professionellen, von Menschen erstellten Übersetzungen. Die Datenbereinigungs-Pipeline kann dabei helfen, die schädlichsten Teile des Datensatzes herauszufiltern.
-
Erwartetes Volumen:
Damit die Anpassung in Bezug auf den ROI Wirkung zeigt, muss der Datensatz den Großteil der Daten repräsentieren, bei denen die MT-Qualität einen wesentlichen Unterschied macht. Wenn beispielsweise ein Teil der MT-Ausgabe von menschlichen Übersetzern nachbearbeitet werden soll, müssen die Daten zur Maximierung des ROI repräsentativ für den Inhalt sein, der nachbearbeitet wird.
Das Erstellen eines Datensatzes für automatisierte Asset-Kuration folgt einem etwas anderen Prozess.
Um einen Datensatz zum Trainieren einer benutzerdefinierten MT-Engine zu erstellen, folge diesen Schritten:
-
Auf der Seite klickst du auf Train a custom MT engine.
Die Seite öffnet sich.
-
Gib einen Namen für den Datensatz an.
-
Die Sprachauswahl bietet verschiedene Optionen:
-
Um einen allgemeinen Sprachdatensatz zu erstellen, wähle in den Auswahlfeldern für Quell- und Zielsprache sowie Gebietsschema jeweils dieselbe Sprache aus.
-
Um einen gebietsschemaspezifischen Datensatz zu erstellen, wähle die Quell- und Zielsprache aus der ersten Dropdown-Liste aus und gib anschließend die Quell- und Zielgebietsschemata in der zweiten Dropdown-Liste an.
Es können auch mehrere Zielgebietsschemata (d. h. verschiedene Varianten derselben Sprache) hinzugefügt werden, um mehr Datenquellen zu nutzen.
-
Um einen Datensatz mit mehreren Quell- und Zielgebietsschemata zu erstellen, wähle zunächst die Quell- und Zielsprache aus der ersten Dropdown-Liste aus, gib dann die Quell- und Zielgebietsschemata in der zweiten Dropdown-Liste an (verschiedene Varianten derselben Zielsprache können hinzugefügt werden) und klicke auf + Add more locale pairs.
Das Fenster erscheint.
-
-
Klicke auf Add translation memories.
Die Seite öffnet sich mit einer Suchfunktion
.
-
Um dem Datensatz ein TM hinzuzufügen, klicke auf das Symbol
. Das TM wird der Spalte hinzugefügt.
Es können mehrere TMs bis zu einem Maximum von 200 TMs und maximal 8 Millionen Segmenten hinzugefügt werden. Ein Datensatz sollte idealerweise mindestens 10.000 Segmente enthalten.
Wenn du auf den TM-Namen klickst, wird die Auswahl auf der translation memory page angezeigt.
Klicke auf das Symbol
, um das TM aus der Spalte zu entfernen.
-
Klicke auf Importieren.
Die Seite öffnet sich.
-
Überprüfe die angezeigten Details und klicke, wenn alles stimmt, auf Continue.
Die Seite öffnet sich.
-
Wende die erforderlichen Filter an und klicke auf Create.
Der Datensatz wird erstellt und der Liste auf der Seite mit dem Anfangsstatus und dem Status in der Spalte hinzugefügt.