Custom AI

Curation de ressources automatisée

Le contenu est traduit de l’anglais par Phrase Language AI.

La curation des mémoires de traduction est un problème omniprésent de longue date et le nettoyage manuel est un processus laborieux. Des mémoires de traduction propres conduisent à de meilleures références pour les linguistes et à une traduction automatique de meilleure qualité, ce qui est particulièrement pertinent pour Phrase NextMT, étant donné ses capacités avancées à tirer parti des ressources linguistiques, comme les mémoires de traduction et les glossaires.

Créer un jeu de données pour AAC

Pour créer un jeu de données dans le but d'utiliser une MT curée dans un TMS, suivez ces étapes :

  1. Sur la page Jeux de données, cliquez sur Nettoyer une mémoire de traduction.

    La page Détails du jeu de données s'ouvre.

  2. Indiquez un nom pour le jeu de données.

  3. Les sélecteurs de langue permettent diverses options :

    1. Pour créer un jeu de données de langue générale, sélectionnez les mêmes langues source et cible dans les sélecteurs de langue et de paramètre linguistique source et cible.

    2. Pour créer un jeu de données spécifique à un paramètre linguistique, sélectionnez les langues source et cible dans la première liste déroulante, puis spécifiez les paramètres linguistiques source et cible dans la deuxième liste déroulante.

      Plusieurs paramètres linguistiques cible (c'est-à-dire différentes variantes de la même langue) peuvent également être ajoutés pour tirer parti de davantage de sources de données.

    3. Pour créer un jeu de données avec plusieurs paramètres linguistiques source et cible, sélectionnez les langues source et cible dans la première liste déroulante, spécifiez les paramètres linguistiques source et cible dans la deuxième liste déroulante (différentes variantes de la même langue cible peuvent être ajoutées) et cliquez sur + Ajouter plus de paires de paramètres linguistiques.

    La fenêtre Données d'entrée apparaît.

  4. Cliquez sur Ajouter des mémoires de traduction.

    La page Choisir des mémoires de traduction s'ouvre avec une fonctionnalité de recherche Search.

  5. Pour ajouter une MT au jeu de données, cliquez sur l'icône Add TM. La MT est ajoutée à la colonne Sélectionné.

    Plusieurs MT peuvent être ajoutées jusqu'à un maximum de 200 MT et un maximum de 8 millions de segments. Un jeu de données devrait idéalement contenir au moins 10 000 segments.

    Cliquer sur le nom de la MT présentera la sélection sur la page de mémoire de traduction.

    Cliquez sur l'icône Remove TM pour retirer la MT de la colonne Sélectionné.

  6. Cliquez sur Enregistrer.

    La page Détails du jeu de données s'ouvre.

  7. Examinez les détails tels qu'ils sont présentés et, s'ils sont corrects, cliquez sur Continuer.

    La page Filtres de nettoyage s'ouvre.

  8. Appliquez les filtres requis et cliquez sur Créer.

    Le jeu de données est créé et ajouté à la liste sur la page Jeux de données avec le statut initial de Nettoyage et le statut de Nettoyage de MT dans la colonne Créé pour.

Filtres de nettoyage pour AAC

L'IA personnalisée de Phrase permet de gérer les mémoires de traduction avec l'aide de filtres de nettoyage basés sur des règles et sur l'IA. Des paramètres par défaut sont fournis, ce qui peut convenir aux nouveaux utilisateurs.

Ce processus préserve les métadonnées de segment de MT et les balises de MT d'origine, ce qui permet aux utilisateurs de maintenir l'effet de levier de la MT lors de l'utilisation des MT nettoyées dans le TMS.

L'ensemble des filtres disponibles comprend à la fois des filtres basés sur des règles et des filtres basés sur l'apprentissage automatique :

  • Basé sur des règles

    Filtres qui fonctionnent avec des règles clairement définies et facilement compréhensibles par les humains. Cette catégorie de filtre inclut Plage de dates, Nombre minimum de caractère, Longueur de la paire de phrases, Ratio de longueur, Non traduisibles, Doublons, Quasi-doublons.

  • Basé sur l'apprentissage automatique

    Filtres qui analysent le contenu du texte lui-même pour prendre une décision, plutôt que de simplement suivre un ensemble fixe de règles. Cette catégorie de filtre inclut Source et cible mal alignées et Identification de la langue.

Plage de dates

Exclut les segments en dehors des dates définies. Les dates de début et de fin sont incluses ainsi que la date de dernière modification d'un segment.

Source et cible mal alignées

Ce filtre détermine la qualité de la correspondance des segments en termes de sens et de similarité sémantique, en supprimant les moins bien notés. L'alignement des paires de phrases est mesuré à l'aide de la métrique LASER.

Un moteur d'IA est utilisé pour vérifier que le texte source et le texte cible signifient la même chose ou dans quelle mesure ils signifient la même chose. Le paramètre recommandé rejette les 10 % de segments les moins bons tout en conservant les 90 % de segments les meilleurs.

Les paramètres avancés permettent de modifier l'alignement ou peuvent servir de filtre basé sur le score de similarité brut en utilisant un nombre compris entre 0 et 1 (1 signifiant un alignement complet). La prudence est de mise si vous utilisez le score de similarité brut, car chaque paire de langues a une distribution de scores différente et ce qui est considéré comme un bon score pour une paire de langues peut être un score insatisfaisant pour une autre.

En général, les segments inférieurs à 0,5 ne sont pas très bons et les segments proches ou supérieurs à 1 sont des segments identiques dans les deux langues.

Exemples :

La chaîne "Hello, World! 1 2 3\" comporte 19 caractères et 10 lettres.

Nombre minimal de caractères et de lettres

Le nombre de caractères inclut tous les caractères. Cela inclut toutes les lettres, les espaces, ainsi que la ponctuation et les symboles. À des fins de formation, il peut être utile d'ignorer les segments qui ne contiennent aucune lettre.

Le nombre de lettres ne compte que les lettres telles que celles de l'alphabet anglais, mais aussi des caractères plus complexes avec des signes diacritiques ou des caractères chinois. Un caractère chinois est compté comme une lettre, même s'il représente plus d'un caractère. Pour les langues basées sur les caractères, les valeurs par défaut sont 1, mais pour les langues basées sur les mots, les valeurs par défaut sont 4 (caractères) et 3 (lettres). La valeur minimale est 1 et la valeur maximale est 500.

Si vous conservez un grand nombre de segments courts dans les données (par exemple des acronymes), maintenez les valeurs de filtre à un niveau bas.

Exemple :

La chaîne "Hello, World! 1 2 3\" comporte 19 caractères et 10 lettres.

Longueur de la paire de phrases

Ce filtre supprime tous les segments qui sont plus longs que la valeur seuil définie par les utilisateurs.

Le nombre total de caractères inclut tous les caractères - lettres, espaces et ponctuation - provenant à la fois des phrases source et cible. Prenez en compte le type de langue (par exemple le chinois et l'anglais) ; si la langue source n'est pas de type CJK et que la langue cible est CJK (ou inversement), ce filtre sera ignoré.

Rapport de longueur

Ce filtre identifie les segments dont la longueur est significativement plus élevée lors de la comparaison du segment source et du segment cible. Certaines traductions augmentent ou diminuent en longueur lors de la traduction d'une langue source vers une langue cible. Des traductions trop longues ou trop courtes peuvent indiquer des segments de faible qualité.

Si la langue source n'est pas de type CJK et que la langue cible l'est (ou inversement), ce filtre sera ignoré.CJK

Certaines langues sont plus prolixes que d'autres, donc 200 % est une bonne valeur par défaut. Si la langue cible est similaire à la langue source, ou si davantage de données doivent être filtrées, la valeur peut être inférieure.

Exemples :

Une langue est CJK - le rapport est de 1. Il ne sera pas écarté :

{"source": "This is a sentence.", "target": "这是一个句子。", "ratio": 1}

La traduction allemande est d'une longueur comparable à la source anglaise et ne sera pas écartée :

{"source": "This is a sentence.", "target": "Dies ist ein Satz.", "ratio": 1.1}

La traduction allemande est beaucoup plus longue que la source anglaise et sera écartée :

{"source": "This is a sentence.", "target": "Dies ist ein Satz mit zusätzlichen unnötigen Füllungen.", "ratio": 3.1}

Non-translatables

Les éléments non traduisibles sont des segments où les segments source et cible sont identiques. Exclut toutes les paires de phrases à ne pas traduire où le texte cible reste identique au texte source.

Duplicates

Des groupes de segments sont créés avec la même phrase source. Dans chaque groupe, seul le meilleur segment est conservé ; ainsi, si la phrase source d'un segment est unique, il est automatiquement conservé. Sinon, le segment avec le score de similarité le plus élevé est conservé.

Near-duplicates

Lors du test des quasi-doublons, la (version légèrement plus propre d'une) phrase source est normalisée ; tous les caractères non alphabétiques (quelques exemples : “,?)!-) sont remplacés par un Espace et toutes les lettres sont converties en minuscules.

En utilisant la phrase source normalisée, des groupes de segments ayant la même phrase source normalisée sont créés. Dans chaque groupe, seul le meilleur segment est conservé ; ainsi, la phrase source normalisée d'un segment est unique et est automatiquement conservée. Sinon, le segment avec le score de similarité le plus élevé est conservé.

Identification de la langue

Un moteur d'IA est utilisé pour identifier la langue source et la langue cible en fonction des phrases. Un segment est retiré uniquement si le moteur reconnaît une langue (source/cible) (par exemple, les phrases plus courtes ne suffisent souvent pas au moteur pour déterminer une langue) et que la langue est différente de celle attendue.

QPS

Le filtre QPS permet de retirer les paires de phrases de moindre qualité dans la mémoire de traduction afin de garantir que les segments résultants sont de la plus haute qualité.

Le filtre QPS peut être configuré de deux manières :

  1. Retirer un pourcentage spécifié de paires de phrases ayant les scores QPS les plus bas. La recommandation est de 10 %.

  2. Sélectionner un seuil de score. Utiliser les paramètres avancés pour éliminer les paires de phrases tombant en dessous d'un seuil de QPS réglable. Le point de départ recommandé est 50.

Ces deux options fournissent une curation automatisée de la mémoire de traduction pour s'aligner sur les objectifs de qualité des utilisateurs.

Utiliser des MT curées dans TMS

Le processus de nettoyage de la mémoire de traduction, qui peut prendre plusieurs heures, doit être Terminer avant qu'une MT curée puisse être utiliser.

Pour utiliser une MT curée dans TMS, suivez ces étapes :

  1. Cliquez sur le Open More Menu et sélectionner téléchargement Download.

    La fenêtre Télécharger s'ouvre.

  2. Sélectionner Télécharger (.tmx).

Cela déclenchera un processus d'exporter de jeu de données qui ne prendra que quelques minutes. La MT curée résultante au format .TMX peut ensuite être téléversée dans TMS en tant que nouvelle MT curée d'une taille maximale de 1 Go.

Si deux processus de nettoyage ou plus ont été effectués sur la même MT, différentes versions sont accessibles dans l'onglet Historique de nettoyage.

Cet article vous a-t-il été utile ?

Sorry about that! In what way was it not helpful?

The article didn’t address my problem.
I couldn’t understand the article.
The feature doesn’t do what I need.
Other reason.

Note that feedback is provided anonymously so we aren't able to reply to questions.
If you'd like to ask a question, submit a request to our Support team.
Thank you for your feedback.