Custom AI

Filtres de nettoyage

Le contenu est traduit de l’anglais par Phrase Language AI.

Les aspects les plus importants de l'entraînement des moteurs de TA ne reposent pas uniquement sur le volume, mais sur la qualité des données. Le nettoyage des données est un problème omniprésent et le nettoyage manuel est laborieux. Des données propres conduisent à un entraînement plus rapide et à des modèles de meilleure qualité.

Phrase Custom AI adapte les mémoires de traduction en jeux de données à l'aide de filtres de nettoyage basés sur des règles et sur l'IA. Les paramètres par défaut fournis devraient convenir aux nouveaux utilisateurs.

L'ensemble des filtres disponibles comprend à la fois des filtres basés sur des règles et des filtres basés sur l'apprentissage automatique :

  • basé sur des règles

    Filtres qui fonctionnent avec des règles clairement définies et facilement compréhensibles par les humains. Cette catégorie de filtres inclut Plage de dates, Nombre minimal de caractères, Longueur de la paire de phrases, Ratio de longueur, Éléments non traduisibles, Doublons, Quasi-doublons.

  • Basé sur l'apprentissage automatique

    Filtres qui analysent le contenu du texte lui-même pour prendre une décision, plutôt que de simplement suivre un ensemble fixe de règles. Cette catégorie de filtres inclut Source et cible mal alignées et Identification de la langue.

Tous les filtres évaluent des versions nettoyées des segments ; entre autres, les espaces multiples sont réduits à un seul et les tags sont supprimés.

Plage de dates

Exclut les segments en dehors des dates définies. Les dates de début et de fin sont incluses, ainsi que la date de dernière modification d'un segment.

Désalignement de la source et de la cible

Ce filtre détermine dans quelle mesure les segments correspondent en termes de sens et de similarité sémantique, en supprimant les moins bien notés. L'alignement des paires de phrases est mesuré à l'aide de la métrique LASER.

Un moteur d'IA est utilisé pour s'assurer que le texte source et le texte cible véhiculent la même signification, ou pour mesurer leur degré de similitude. Le paramètre recommandé élimine les 10 % de segments de moindre qualité tout en conservant les 90 % de segments de meilleure qualité.

Les paramètres avancés permettent de modifier l'alignement ou peuvent constituer un filtre basé sur le score de similarité brut en utilisant un nombre compris entre 0 et 1 (1 signifiant un alignement complet). Il convient d'être prudent en utilisant le score de similarité brut, car chaque paire de langues présente une distribution de scores différente et ce qui est considéré comme un bon score pour une paire peut s'avérer insuffisant pour une autre.

En règle générale, les segments dont le score est inférieur à 0,5 ne sont pas de très bonne qualité, tandis que ceux avoisinant ou dépassant 1 indiquent une correspondance identique entre les deux langues.

**Examples**

Source « Super. », « target » : « Super. », « similarity » : 1.05

Source "Hello", "target": "http://wwww.sdsadsa.com", "similarity": 0.3

Nombre minimal de caractères et de lettres

Nombre de caractères inclut tous les caractères. Cela inclut toutes les lettres, les espaces et la ponctuation ainsi que les symboles. À des fins de formation, il peut être utile d'écarter les segments qui ne contiennent aucune lettre.

Nombre de lettres compte uniquement les lettres telles que celles de l'alphabet anglais, mais aussi les caractères plus complexes avec des signes diacritiques ou les caractères chinois. Un caractère chinois est compté comme une lettre, même s'il représente plus d'un caractère. Pour les langues basées sur les caractères, les valeurs par défaut sont 1, mais pour les langues basées sur les mots, les valeurs par défaut sont 4 (caractères) et 3 (lettres). La valeur minimale est 1 et la valeur maximale est 500.

Si vous conservez beaucoup de segments courts dans les données (par exemple des acronymes), maintenez les valeurs de filtre basses.

Exemple :

La chaîne \"Hello, World!" 1 2 3" comporte 19 caractères et 10 lettres.

Longueur de la paire de phrases

Ce filtre supprime tous les segments plus longs que la valeur seuil définie par les utilisateurs. La raison de ce filtre est que la plupart des systèmes NMT ne s'entraîneront pas réellement sur des segments plus longs que leur seuil interne. 

Par exemple, le seuil interne de NextMT est de 200 jetons, ce qui équivaut à environ 100 - 1 000 mots. Pour entraîner un moteur personnalisé sur des phrases plus courtes, définissez cette valeur plus bas que la valeur par défaut.

Le nombre total de caractères inclut tous les caractères - lettres, espaces et ponctuation - provenant à la fois des phrases source et cible. Prenez en compte le type de langue (par exemple le chinois et l'anglais) ; si la langue source n'est pas de type CJK et que la langue cible est CJK (ou inversement), ce filtre sera ignoré.

Rapport de longueur

Ce filtre identifie les segments dont la longueur est nettement supérieure lors de la comparaison du segment source et du segment cible. Certaines traductions augmentent ou diminuent en longueur lors du passage d'une langue source à une langue cible. Des traductions trop longues ou trop courtes peuvent indiquer des données d'entraînement de faible qualité.

Si la langue source n'est pas de type CJK et que la langue cible l'est (ou inversement), ce filtre sera ignoré.CJK

Certaines langues sont plus prolixes que d'autres, ainsi 200 % constitue une bonne valeur par défaut. Si la langue cible est similaire à la langue source, ou si davantage de données doivent être filtrées, la valeur peut être inférieure.

**Examples**

Une langue est CJK - le ratio est de 1. Il ne sera pas rejeté :

Source « This is a sentence. », « target » : « 这是一个句子。 », « ratio » : 1

La traduction allemande est d'une longueur comparable à celle de la source anglaise et ne sera pas rejetée :

Source « This is a sentence. », « target » : « Dies ist ein Satz. », « ratio » : 1.1

La traduction allemande est beaucoup plus longue que la source anglaise et sera rejetée :

Source « This is a sentence. », « target » : « Dies ist ein Satz mit zusätzlichen unnötigen Füllungen. », « ratio » : 3.1

Éléments non traduisibles

Les éléments non traduisibles sont des segments où les segments source et cible sont identiques. Exclut toutes les paires de phrases non traduisibles où le texte cible reste inchangé par rapport au texte source.

En double

Des groupes de segments sont créés ayant la même phrase source. De chaque groupe, seul le meilleur segment est conservé ; ainsi, si la phrase source d'un segment est unique, il est automatiquement conservé. Sinon, le segment ayant le score de similarité le plus élevé est conservé.

Presque en double

Lors du test de quasi-doublons, la (version légèrement plus propre d'une) phrase source est normalisée ; tous les caractères non alphabétiques (quelques exemples : “,?)!-) sont remplacés par un espace et toutes les lettres sont mises en minuscules.

En utilisant la phrase source normalisée, des groupes de segments ayant la même phrase source normalisée sont créés. De chaque groupe, seul le meilleur segment est conservé, de sorte que la phrase source normalisée d'un segment est unique et est automatiquement conservée. Sinon, le segment ayant le score de similarité le plus élevé est conservé.

Identification de la langue

Un moteur d'IA est utilisé pour identifier la langue source et la langue cible en fonction des phrases. Un segment n'est supprimé que si le moteur reconnaît une langue (source/cible) (par exemple, les phrases plus courtes ne suffisent souvent pas au moteur pour déterminer une langue) et que la langue est différente de celle attendue.

QPS

Le filtre QPS supprime les paires de phrases de la plus faible qualité dans le jeu de données afin de garantir que les modèles d'IA résultants sont entraînés sur les données de la plus haute qualité disponible. En général, plus la qualité des données d'entraînement est élevée, meilleures sont les performances du modèle personnalisé.

Le filtre QPS peut être configuré de deux manières :

  1. Suppression d'un pourcentage spécifié de paires de phrases ayant les scores QPS les plus bas. La recommandation est de 10 %.

  2. Sélection d'un seuil de score. Utilisez les paramètres avancés pour éliminer les paires de phrases tombant en dessous d'un seuil QPS ajustable. Le point de départ recommandé est 50.

Ces deux options permettent une curation automatisée des jeux de données afin de s'aligner sur les objectifs de qualité des utilisateurs.

Cet article vous a-t-il été utile ?
★ ★ ★ ★ ★

Sorry about that! In what way was it not helpful?

The article didn’t address my problem.
I couldn’t understand the article.
The feature doesn’t do what I need.
Other reason.

Note that feedback is provided anonymously so we aren't able to reply to questions.
If you'd like to ask a question, submit a request to our Support team.
Thank you for your feedback.