Custom AI

Zurücksetzen der Filter

Inhalte werden von Phrase Language AI maschinell aus dem Englischen übersetzt.

Die wichtigsten Aspekte beim Training von MT-Engines sind nicht nur das Volumen, sondern auch die Datenqualität. Die Datenbereinigung ist ein allgegenwärtiges Problem und die manuelle Bereinigung ist mühsam. Saubere Daten führen zu einem schnelleren Training und zu qualitativ hochwertigeren Modellen.

Phrase Custom AI wandelt Translation Memories mithilfe von KI-gestützten und regelbasierten Bereinigungsfiltern in Datensätze um. Die vorgegebenen Standardeinstellungen sollten für neue Nutzer geeignet sein.

Die verfügbaren Filter umfassen sowohl regelbasierte als auch ML-basierte Filter:

  • regelbasiert

    Filter, die mit klar definierten Regeln arbeiten, die für Menschen leicht verständlich sind. Diese Filterkategorie umfasst Datumsbereich, Mindestzeichenanzahl, Satzpaarlänge, Längenverhältnis, Nicht übersetzbare Elemente, Duplikate, Fast-Duplikate.

  • ML-basiert

    Filter, die den Inhalt des Textes selbst analysieren, um eine Entscheidung zu treffen, anstatt einfach einem festen Regelsatz zu folgen. Diese Filterkategorie umfasst nicht übereinstimmende Quell- und Zieltexte sowie Spracherkennung.

Alle Filter werten die bereinigten Versionen der Segmente aus; dabei werden beispielsweise mehrere Leerzeichen auf eines reduziert und Phrase Tags entfernt.

Datumsbereich

Schließt Segmente außerhalb der festgelegten Daten aus. Das End- und Startdatum werden zusammen mit dem Datum der letzten Änderung eines Segments einbezogen.

Fehlabgleich von Ausgangs- und Zieltext

Dieser Filter bestimmt, wie gut die Segmente in Bezug auf Bedeutung und semantische Ähnlichkeit übereinstimmen, und entfernt die am schlechtesten bewerteten. Die Ausrichtung der Satzpaare wird mithilfe der LASER-Metrik gemessen.

Eine KI-Engine wird verwendet, um zu prüfen, ob der Ausgangs- und Zieltext dasselbe bedeuten oder inwieweit sie dasselbe bedeuten. Die empfohlene Einstellung verwirft die 10 % schlechtesten Segmente und behält die 90 % besten Segmente bei.

Erweiterte Einstellungen ermöglichen das Ändern der Ausrichtung oder können als Filter basierend auf dem Rohähnlichkeitswert unter Verwendung einer Zahl zwischen 0 und 1 dienen (wobei 1 eine vollständige Ausrichtung bedeutet). Vorsicht ist geboten, wenn der Rohähnlichkeitswert verwendet wird, da jedes Sprachpaar eine andere Verteilung der Werte aufweist und was für ein Sprachpaar als guter Wert gilt, für ein anderes ein unbefriedigender Wert sein kann.

Normalerweise sind Segmente unter 0,5 nicht sehr gut, und Segmente nahe oder über 1 sind Segmente, die in beiden Sprachen gleich sind.

**Examples**

Ausgangssprache „Super.“, "target": „Super.“, "similarity": 1.05

Ausgangssprache „Hello“, "target": "http://wwww.sdsadsa.com", "similarity": 0.3

Mindestanzahl an Zeichen und Buchstaben

Zeichenanzahl umfasst alle Zeichen. Dies beinhaltet alle Buchstaben, Leerzeichen sowie Satzzeichen und Symbole. Zu Trainingszwecken kann es nützlich sein, Segmente zu verwerfen, die keine Buchstaben enthalten.

Buchstabenanzahl zählt nur Buchstaben wie im englischen Alphabet, aber auch komplexere Buchstaben mit diakritischen Zeichen oder chinesische Schriftzeichen. Ein chinesisches Schriftzeichen wird als ein Buchstabe gezählt, auch wenn es mehr als einen Buchstaben darstellt. Für zeichenbasierte Sprachen sind die Standardwerte 1, für wortbasierte Sprachen sind die Standardwerte jedoch 4 (Zeichen) und 3 (Buchstaben). Der Mindestwert ist 1 und der Höchstwert ist 500.

Wenn viele kurze Segmente in den Daten vorkommen (zum Beispiel Akronyme), sollten die Filterwerte niedrig gehalten werden.

Beispiel:

Die Zeichenfolge "Hallo, Welt!" 1 2 3" hat 19 Zeichen und 10 Buchstaben.

Länge des Satzpaares

Dieser Filter entfernt alle Segmente, die länger sind als der vom Nutzer festgelegte Schwellenwert. Der Grund für diesen Filter liegt darin, dass die meisten NMT-Systeme nicht mit Segmenten trainiert werden, die länger sind als ihr interner Schwellenwert. 

Zum Beispiel beträgt der interne Schwellenwert von NextMT 200 Token, was ungefähr 100 - 1.000 Wörtern entspricht. Um eine benutzerdefinierte Engine mit kürzeren Sätzen zu trainieren, sollte dieser Wert unter dem Standardwert liegen.

Die Gesamtzahl der Zeichen umfasst alle Zeichen - Buchstaben, Leerzeichen und Satzzeichen - sowohl aus dem Quell- als auch aus dem Zielsatz. Wird die Ausgangssprache nicht als CJK-ähnlich eingestuft und ist die Zielsprache CJK (oder umgekehrt), wird dieser Filter ignoriert.

Längenverhältnis

Dieser Filter identifiziert Segmente, deren Länge beim Vergleich von Quell- und Zielsegment signifikant höher ist. Einige Übersetzungen nehmen bei der Übersetzung von einer Ausgangs- in eine Zielsprache an Länge zu oder ab. Zu lange oder zu kurze Übersetzungen können auf qualitativ minderwertige Trainingsdaten hinweisen.

Wenn die Ausgangssprache nicht CJK-ähnlich ist und die Zielsprache es ist (oder umgekehrt), wird dieser Filter ignoriert.CJK

Einige Sprachen sind wortreicher als andere, daher sind 200 % ein guter Standardwert. Wenn die Zielsprache der Ausgangssprache ähnelt oder mehr Daten herausgefiltert werden müssen, kann der Wert niedriger sein.

**Examples**

Eine Sprache ist CJK - das Verhältnis ist 1. Es wird nicht verworfen:

Ausgangssprache Dies ist ein Satz. 1

Die deutsche Übersetzung ist von vergleichbarer Länge wie die englische Quelle und wird nicht verworfen:

Ausgangssprache „This is a sentence.“, „target“: „Dies ist ein Satz.“, „ratio“: 1.1

Die deutsche Übersetzung ist wesentlich länger als die englische Quelle und wird verworfen:

Ausgangssprache „This is a sentence.“, „target“: „Dies ist ein Satz mit zusätzlichen unnötigen Füllungen.“, „ratio“: 3.1

Nicht übersetzbare Elemente

Nicht übersetzbare Segmente sind Segmente, bei denen Ausgangs- und Zielsegment identisch sind. Schließt alle nicht übersetzbaren Satzpaare aus, bei denen der Zieltext gegenüber dem Quelltext unverändert bleibt.

Doppelte Einträge

Es werden Gruppen von Segmenten erstellt, die denselben Quellsatz haben. Aus jeder Gruppe wird nur das beste Segment behalten, sodass der Quellsatz eines Segments eindeutig ist und automatisch behalten wird. Andernfalls wird das Segment mit dem höchsten Ähnlichkeitswert beibehalten.

Nahezu doppelte Einträge

Beim Test auf Fast-Duplikate wird die leicht bereinigte Version eines Quellsatzes normalisiert; alle Nicht-Buchstaben-Zeichen (einige Beispiele: “,?)!-) werden durch ein Leerzeichen ersetzt und alle Buchstaben in Kleinbuchstaben umgewandelt.

Unter Verwendung des normalisierten Quellsatzes werden Gruppen von Segmenten erstellt, die denselben normalisierten Quellsatz aufweisen. Aus jeder Gruppe wird nur das beste Segment beibehalten, sodass der normalisierte Quellsatz eines Segments eindeutig ist und automatisch beibehalten wird. Andernfalls wird das Segment mit dem höchsten Ähnlichkeitswert beibehalten.

Spracherkennung

Eine KI-Engine wird verwendet, um die Quell- und Zielsprache basierend auf den Sätzen zu identifizieren. Ein Segment wird nur entfernt, wenn die Engine eine (Quell-/Ziel-)Sprache erkennt – kürzere Sätze reichen beispielsweise oft nicht aus, um eine Sprache zuverlässig zu bestimmen – und die erkannte Sprache von der erwarteten abweicht.

QPS

Der QPS-Filter entfernt die qualitativ minderwertigsten Satzpaare im Datensatz, um sicherzustellen, dass die resultierenden KI-Modelle mit den hochwertigsten verfügbaren Daten trainiert werden. Im Allgemeinen gilt: Je höher die Qualität der Trainingsdaten, desto besser ist die Leistung des angepassten Modells.

Der QPS-Filter kann auf zwei Arten konfiguriert werden:

  1. Entfernen eines bestimmten Prozentsatzes von Satzpaaren mit den niedrigsten QPS-Werten. Die Empfehlung liegt bei 10 %.

  2. Auswahl eines Schwellenwerts für die Bewertung. Die erweiterten Einstellungen können genutzt werden, um Satzpaare zu eliminieren, die unter einen anpassbaren QPS-Schwellenwert fallen. Der empfohlene Ausgangspunkt ist 50.

Diese beiden Optionen ermöglichen eine automatisierte Datensatzkuration, um sie an die Qualitätsziele der Nutzer anzupassen.

War dieser Beitrag hilfreich?
★ ★ ★ ★ ★

Sorry about that! In what way was it not helpful?

The article didn’t address my problem.
I couldn’t understand the article.
The feature doesn’t do what I need.
Other reason.

Note that feedback is provided anonymously so we aren't able to reply to questions.
If you'd like to ask a question, submit a request to our Support team.
Thank you for your feedback.