Custom AI

Automatisierte Asset-Kuration

Inhalte werden von Phrase Language AI maschinell aus dem Englischen übersetzt.

Das Kuratieren von Translation Memorys ist ein seit Langem bestehendes, allgegenwärtiges Problem, und die manuelle Bereinigung ist ein mühsamer Prozess. Saubere Translation Memorys führen zu besseren Referenzen für Linguisten und einer qualitativ hochwertigeren maschinellen Übersetzung, was besonders für Phrase NextMT relevant ist, da es über fortschrittliche Funktionen zur Nutzung von Sprachressourcen wie Translation Memorys und Glossaren verfügt.

Erstellen eines Datensatzes für AAC

Um einen Datensatz zum Zweck der Verwendung eines kuratierten TM in TMS zu erstellen, befolgen Sie diese Schritte:

  1. Klicken Sie auf der Seite Datasets auf Clean a translation memory.

    Die Seite Dataset details öffnet sich.

  2. Geben Sie einen Namen für den Datensatz an.

  3. Die Sprachauswahl bietet verschiedene Optionen:

    1. Um einen allgemeinen Sprachdatensatz zu erstellen, wählen Sie dieselbe Ausgangssprache und Zielsprache in der Ausgangs- und Zielsprachen- sowie Sprachauswahl aus.

    2. Um einen sprachspezifischen Datensatz zu erstellen, wählen Sie die Ausgangssprache und Zielsprache aus der ersten Dropdown-Liste aus und geben Sie dann die Ausgangs- und Zielsprache aus der zweiten Dropdown-Liste an.

      Es können auch mehrere Zielsprachen (d. h. verschiedene Varianten derselben Sprache) hinzugefügt werden, um mehr Datenquellen zu nutzen.

    3. Um einen Datensatz mit mehreren Ausgangs- und Zielsprachen zu erstellen, wählen Sie die Ausgangssprache und Zielsprache aus der ersten Dropdown-Liste aus, geben Sie die Ausgangs- und Zielsprache aus der zweiten Dropdown-Liste an (verschiedene Varianten derselben Zielsprache können hinzugefügt werden) und klicken Sie auf + Add more locale pairs.

    Das Fenster Input data wird angezeigt.

  4. Klicken Sie auf Add translation memories.

    Die Seite Choose translation memories öffnet sich mit einer Suchfunktion Search.

  5. Um dem Datensatz ein TM hinzuzufügen, klicken Sie auf das Symbol Add TM. Das TM wird der Spalte Selected hinzugefügt.

    Es können mehrere TMs bis zu einem Maximum von 200 TMs und maximal 8 Millionen Segmenten hinzugefügt werden. Ein Datensatz sollte idealerweise mindestens 10.000 Segmente enthalten.

    Durch Klicken auf den TM-Namen wird die Auswahl auf der translation memory page angezeigt.

    Klicken Sie auf das Symbol Remove TM, um das TM aus der Spalte Selected zu entfernen.

  6. Klicke auf Speichern.

    Die Seite Dataset details öffnet sich.

  7. Überprüfen Sie die dargestellten Details und klicken Sie bei Richtigkeit auf weiter.

    Die Seite Cleaning filters wird geöffnet.

  8. Wenden Sie die erforderlichen Filter an und klicken Sie auf erstellen.

    Der Datensatz wird erstellt und der Liste auf der Seite Datasets mit dem anfänglichen Status Cleaning und dem Status Cleaning TM in der Spalte Created for hinzugefügt.

Reinigungsfilter für AAC

Phrase Custom KI ermöglicht das Kuratieren von Translation Memories mit Hilfe von KI-gestützten und regelbasierten Reinigungsfiltern. Es werden Standardeinstellungen bereitgestellt, die für neue Benutzer geeignet sein können.

Dieser Prozess bewahrt die ursprünglichen TM-Segment-Metadaten und TM-Tags, was es Benutzern ermöglicht, den TM-Nutzen bei der Verwendung der bereinigten TMs in TMS beizubehalten.

Die verfügbaren Filter umfassen sowohl regelbasierte Filter als auch KI-basierte Filter:

  • Regelbasiert

    Filter, die mit klar definierten Regeln arbeiten, die für Menschen leicht verständlich sind. Diese Filterkategorie umfasst Datumsbereich, Mindestanzahl an Zeichen, Satzpaarlänge, Längenverhältnis, Nicht übersetzbare Elemente, Duplikate, Fast-Duplikate.

  • KI-basiert

    Filter, die den Content des Textes selbst analysieren, um eine Entscheidung zu treffen, anstatt einfach einer festen Reihe von Regeln zu folgen. Diese Filterkategorie umfasst Nicht übereinstimmende Ausgangssprache und Zielsprache und Spracherkennung.

Datumsbereich

Schließt Segmente außerhalb der festgelegten Daten aus. Das End- und Startdatum werden zusammen mit dem Datum der letzten Änderung eines Segments einbezogen.

Nicht übereinstimmende Ausgangssprache und Zielsprache

Dieser Filter bestimmt, wie gut die Segmente hinsichtlich Bedeutung und semantischer Ähnlichkeit ein Match ergeben, und entfernt die am schlechtesten bewerteten. Die Satzpaar-Ausrichtung wird mithilfe der LASER-Metrik gemessen.

Eine KI-Engine wird verwendet, um zu überprüfen, ob die Ausgangssprache und die Zielsprache dasselbe bedeuten oder wie sehr sie dasselbe bedeuten. Die empfohlene Einstellung verwirft die 10% schlechtesten Segmente, während die 90% besten Segmente beibehalten werden.

Erweiterte Einstellungen ermöglichen das Ändern der Ausrichtung oder können als Filter basierend auf der rohen Ähnlichkeits-Kennzahl unter Verwendung einer Zahl zwischen 0 und 1 dienen (wobei 1 für vollständiges Abschließen der Ausrichtung steht). Vorsicht ist geboten, wenn die rohe Ähnlichkeitskennzahl verwendet wird, da jedes Sprachpaar eine unterschiedliche Verteilung von Kennzahlen aufweist und was für ein Sprachpaar als gute Kennzahl gilt, für ein anderes eine unzureichende Kennzahl sein kann.

Typischerweise sind Segmente unter 0,5 nicht sehr gut und Segmente nahe oder über 1 sind Segmente, die in beiden Sprachen gleich sind.

Beispiele:

Die Zeichenfolge "Hello, World!" 1 2 3\" hat 19 Zeichen und 10 Buchstaben.

Mindestanzahl an Zeichen und Buchstaben

Zeichenanzahl beinhaltet alle Zeichen. Dies umfasst alle Buchstaben, Leerzeichen sowie Satz- und Sonderzeichen. Zu Schulungszwecken kann es nützlich sein, Segmente zu verwerfen, die keine Buchstaben enthalten.

Die Buchstabenanzahl zählt nur Buchstaben wie im englischen Alphabet, aber auch komplexere Zeichen mit diakritischen Zeichen oder chinesische Schriftzeichen. Ein chinesisches Zeichen wird als ein Buchstabe gezählt, selbst wenn es mehr als ein Zeichen darstellt. Für zeichenbasierte Sprachen sind die Standardwerte 1, für wortbasierte Sprachen sind die Standardwerte jedoch 4 (Zeichen) und 3 (Buchstaben). Der Mindestwert beträgt 1 und der Höchstwert beträgt 500.

Wenn Sie viele kurze Segmente in Daten speichern (zum Beispiel Akronyme), halten Sie die Filterwerte niedrig.

Beispiel:

Die Zeichenfolge "Hello, World!" 1 2 3\" hat 19 Zeichen und 10 Buchstaben.

Satzpaarlänge

Dieser Filter entfernt alle Segmente, die länger als der von Benutzern festgelegte Schwellenwert sind.

Die Gesamtzahl der Zeichen umfasst alle Zeichen - Buchstaben, Leerzeichen und Satzzeichen - sowohl aus der Ausgangssprache als auch aus der Zielsprache. Berücksichtigen Sie die Art der Sprache (zum Beispiel Chinesisch und Englisch); wenn die Ausgangssprache nicht CJK-ähnlich ist und die Zielsprache CJK ist (oder umgekehrt), wird dieser Filter ignoriert.

Längenverhältnis

Dieser Filter identifiziert Segmente, bei denen die Länge beim Vergleich des Ausgangssegments und des Zielsegments signifikant höher ist. Einige Übersetzungen nehmen bei der Übersetzung von einer Ausgangssprache in eine Zielsprache an Länge zu oder ab. Zu lange oder zu kurze Übersetzungen können auf Segmente mit geringer Qualität hinweisen.

Wenn die Ausgangssprache nicht CJK-ähnlich ist und die Zielsprache (oder umgekehrt) ist, wird dieser Filter ignoriert.CJK

Einige Sprachen sind wortreicher als andere, daher sind 200% ein guter Standardwert. Wenn die Zielsprache der Ausgangssprache ähnelt oder mehr Daten herausgefiltert werden müssen, kann der Wert niedriger sein.

Beispiele:

Eine Sprache ist CJK - das Verhältnis ist 1. Es wird nicht verworfen:

{"source": "This is a sentence.", "target": "这是一个句子。", "ratio": 1}

Die deutsche Übersetzung ist von vergleichbarer Länge wie die englische Ausgangssprache und wird nicht verworfen:

{"source": "This is a sentence.", "target": "Dies ist ein Satz.", "ratio": 1.1}

Die deutsche Übersetzung ist wesentlich länger als die englische Ausgangssprache und wird verworfen:

{"source": "This is a sentence.", "target": "Dies ist ein Satz mit zusätzlichen unnötigen Füllungen.", "ratio": 3.1}

Nicht übersetzbare Elemente

Nicht übersetzbare Elemente sind Segmente, bei denen das Ausgangssegment und das Zielsegment identisch sind. Schließt alle nicht übersetzbaren Satzpaare aus, bei denen der Zieltext gegenüber dem Ausgangstext unverändert bleibt.

Duplikate

Es werden Gruppen von Segmenten erstellt, die denselben Ausgangssatz haben. Aus jeder Gruppe wird nur das beste Segment beibehalten; wenn der Ausgangssatz eines Segments also eindeutig ist, wird es automatisch beibehalten. Andernfalls wird das Segment mit der höchsten Ähnlichkeits-Kennzahl beibehalten.

Nahezu-Duplikate

Beim Testen auf Nahezu-Duplikate wird die (leicht bereinigte Version) eines Ausgangssatzes normalisiert; alle Nicht-Buchstaben-Zeichen (einige Beispiele: “,?)!-) werden durch ein Leerzeichen ersetzt und alle Buchstaben werden kleingeschrieben.

Unter Verwendung des normalisierten Ausgangssatzes werden Gruppen von Segmenten erstellt, die denselben normalisierten Ausgangssatz haben. Aus jeder Gruppe wird nur das beste Segment beibehalten, sodass der normalisierte Ausgangssatz eines Segments eindeutig ist und automatisch beibehalten wird. Andernfalls wird das Segment mit der höchsten Ähnlichkeits-Kennzahl beibehalten.

Sprachidentifizierung

Eine KI-Engine wird verwendet, um die Ausgangssprache und Zielsprache basierend auf den Sätzen zu identifizieren. Ein Segment wird nur entfernt, wenn die Engine eine (Ausgangs-/Ziel-)Sprache erkennt (kürzere Sätze reichen für die Engine beispielsweise oft nicht aus, um eine Sprache zu bestimmen) und die Sprache von der erwarteten Sprache abweicht.

QPS

Der QPS-Filter ermöglicht es, die Satzpaare mit der niedrigsten Qualität im Translation Memory zu entfernen, um sicherzustellen, dass die resultierenden Segmente von höchster Qualität sind.

Der QPS-Filter kann auf zwei Arten konfiguriert werden:

  1. Entfernen eines festgelegten Prozentsatzes an Satzpaaren mit den niedrigsten QPS-Kennzahlen. Die Empfehlung liegt bei 10 %.

  2. Auswählen einer Kennzahl-Schwelle. Verwenden Sie die erweiterten Einstellungen, um Satzpaare zu eliminieren, die unter eine anpassbare QPS-Schwelle fallen. Der empfohlene Startwert ist 50.

Diese beiden Optionen bieten eine automatisierte Kuratierung des Translation Memory, um sie an die Qualitätsziele der Benutzer anzupassen.

Verwendung kuratierter Translation Memorys in TMS

Der Bereinigungsprozess für Translation Memory, der mehrere Stunden dauern kann, muss Abschließen sein, bevor eine kuratierte TM verwendet werden kann.

Um eine kuratierte TM in TMS zu verwenden, befolgen Sie diese Schritte:

  1. Klicken Sie auf Open More Menu und wählen Sie Herunterladen Download aus.

    Das Fenster Herunterladen öffnet sich.

  2. Wählen Sie Herunterladen (.tmx) aus.

Dies löst einen Datensatz-exportieren-Prozess aus, der nur wenige Minuten dauern wird. Die resultierende kuratierte TM im .TMX Format kann dann als neue, kuratierte TM mit einer Größe von bis zu 1 Gb in TMS hochgeladen werden.

Wenn zwei oder mehr Bereinigungsprozesse für dieselbe TM durchgeführt wurden, kann im Tab Cleaning history auf verschiedene Versionen zugegriffen werden.

War dieser Beitrag hilfreich?

Sorry about that! In what way was it not helpful?

The article didn’t address my problem.
I couldn’t understand the article.
The feature doesn’t do what I need.
Other reason.

Note that feedback is provided anonymously so we aren't able to reply to questions.
If you'd like to ask a question, submit a request to our Support team.
Thank you for your feedback.