Richtlinien zur Auswahl von Translation Memory
Phrase Individuell KI nutzt Translation Memorys (TMs), um Individuell maschinelle Übersetzung (MT)-Modelle zu erstellen, die spezifische Terminologie und Stil einhalten, was zu einer verbesserten Übersetzungsqualität (und damit zu verkürzten Post-Editing-Zeiten) für diese Content-Typen im Vergleich zu generischer maschineller Übersetzung führt.
Der wichtigste Faktor, der die Effektivität des Anpassungsprozesses beeinflussen kann, sind die verwendeten Translation Memorys. Dies sind allgemeine Richtlinien, die helfen können zu bestimmen, welche Daten für diesen Zweck zu verwenden sind:
-
Einzelner Fachbereich:
Es ist am besten, wenn sich das Dataset auf Content konzentriert, der einen einzelnen Stil und eine einzelne Terminologie abdeckt. Wenn das Dataset eine Mischung aus Fachbereichen enthält (z. B. sowohl die rechtlichen Begriffe einer Website als auch die Produktbeschreibungen), kann das Modell möglicherweise nicht lernen, welcher Stil gewünscht ist.
-
Einzigartiger Content-Typ:
Das benutzerdefinierte MT-Modell baut auf generischen Modellen auf, die mit riesigen Mengen öffentlicher Daten aus dem Internet trainiert wurden. Wenn das Translation Memory Daten enthält, die den generischen Daten, die zum Aufbau der generischen Modelle verwendet wurden, sehr ähnlich sind, wird der Anpassungsprozess keinen großen Gewinn bringen.
-
Datenqualität:
Das Modell geht davon aus, dass jedes Satzpaar im Translation Memory ein Beispiel für den Output ist, den es produzieren soll. Das Translation Memory muss von guter Qualität sein, idealerweise erstellt aus professionellen menschlichen Übersetzungen. Die Datenbereinigungs-Pipeline kann helfen, die schädlichsten Teile des Datasets zu filtern.
-
Erwartetes Volumen:
Damit die Anpassung im Hinblick auf den ROI wirkungsvoll ist, muss das Dataset repräsentativ für den Großteil der Daten sein, bei denen die MT-Qualität einen größeren Einfluss hat. Wenn beispielsweise ein Teil des MT-Outputs von menschlichen Übersetzern einem Post-Editing unterzogen werden soll, müssen die Daten zur Maximierung des ROI repräsentativ für den Content sein, der einem Post-Editing unterzogen wird.
Das Erstellen eines Datasets für automated asset curation folgt einem etwas anderen Prozess.
Um ein Dataset für das Training einer Individuell MT-Engine zu Erstellen, befolgen Sie diese Schritte:
-
Klicken Sie auf der Seite auf Individuelle MT Engine trainieren.
Die Seite öffnet sich.
-
Geben Sie einen Namen für das Dataset an.
-
Die Sprachauswahlfelder bieten verschiedene Optionen:
-
Um ein allgemeines Sprach-Dataset zu erstellen, wählen Sie in den Auswahlfeldern für Ausgangssprache und Zielsprache sowie Sprache dieselbe Ausgangssprache und Zielsprache aus.
-
Um ein sprachspezifisches Dataset zu erstellen, wählen Sie die Ausgangssprache und Zielsprache aus der ersten Dropdown-Liste aus und geben Sie dann die Ausgangssprache und Zielsprache aus der zweiten Dropdown-Liste an.
Es können auch mehrere Zielsprachen (d. h. verschiedene Varianten derselben Sprache) hinzugefügt werden, um mehr Datenquellen zu nutzen.
-
Um ein Dataset mit mehreren Ausgangs- und Zielsprachen zu erstellen, wählen Sie die Ausgangssprache und Zielsprache aus der ersten Dropdown-Liste aus, geben Sie die Ausgangssprache und Zielsprache aus der zweiten Dropdown-Liste an (verschiedene Varianten derselben Zielsprache können hinzugefügt werden) und klicken Sie auf + Sprache hinzufügen.
Das Fenster erscheint.
-
-
Klicken Sie auf Translation Memory hinzufügen.
Die Seite öffnet sich mit einer Suchfunktion
.
-
Um ein TM zum Datensatz hinzuzufügen, klicken Sie auf das Symbol
. Das TM wird zur Spalte hinzugefügt.
Es können mehrere TMs bis zu einem Maximum von 200 TMs und maximal 8 Millionen Segmenten hinzugefügt werden. Ein Datensatz sollte idealerweise mindestens 10.000 Segmente enthalten.
Durch Klicken auf den TM-Namen wird die Auswahl auf der Translation Memory-Seite angezeigt.
Klicken Sie auf das Symbol
, um das TM aus der Spalte zu entfernen.
-
Klicke auf Speichern.
Die Seite öffnet sich.
-
Überprüfen Sie die angezeigten Details und klicken Sie bei Richtigkeit auf weiter.
Die Seite öffnet sich.
-
Wenden Sie die erforderlichen Filter an und klicken Sie auf erstellen.
Der Datensatz wird erstellt und der Liste auf der Seite mit dem anfänglichen Status und dem Status in der Spalte hinzugefügt.