Custom AI

Créer un jeu de données

Le contenu est traduit de l’anglais par Phrase Language AI.

Directives de sélection de la mémoire de traduction

Phrase Custom AI exploite les mémoires de traduction (TMs) pour créer des modèles de traduction automatique (MT) personnalisés qui respectent une terminologie et un style spécifiques, ce qui améliore la qualité de la traduction (et, par conséquent, réduit le temps de post-édition) pour ces types de contenu par rapport à la traduction automatique générique.

Le facteur le plus important pouvant influencer l'efficacité du processus de personnalisation réside dans les mémoires de traduction utilisées. Voici des directives générales qui peuvent aider à déterminer quelles données utiliser à cette fin :

  • Domaine unique :

    Il est préférable que le jeu de données se concentre sur un contenu présentant un style et une terminologie uniques. Si le jeu de données contient un mélange de domaines (par exemple, à la fois les termes juridiques d'un site web et les descriptions de produits), le modèle risque de ne pas réussir à capter le style souhaité.

  • Type de contenu unique :

    Le modèle de traduction automatique personnalisé s'appuie sur des modèles génériques entraînés sur de vastes quantités de données publiques collectées sur Internet. Si la mémoire de traduction contient des données assez similaires aux données génériques utilisées pour construire les modèles génériques, le processus de personnalisation n'apportera pas grand-chose.

  • Qualité des données :

    Le modèle supposera que chaque paire de phrases dans la mémoire de traduction est un exemple de la sortie qu'il sera censé produire. La mémoire de traduction doit être de bonne qualité, idéalement créée à partir de traductions humaines professionnelles. Le pipeline de nettoyage des données peut aider à filtrer les parties les plus nuisibles du jeu de données.

  • Volume attendu :

    Pour que la personnalisation ait un impact en termes de retour sur investissement, le jeu de données doit être représentatif de la majeure partie des données où la qualité de la traduction automatique aura plus d'impact. Par exemple, si une partie de la sortie de la traduction automatique doit être post-éditée par des traducteurs humains, pour maximiser le retour sur investissement, les données doivent être représentatives du contenu qui sera post-édité.

La création d'un jeu de données pour la curation automatisée d'actifs suit un processus légèrement différent.

Pour créer un jeu de données dans le but d'entraîner un moteur de traduction automatique personnalisé, suivez ces étapes :

  1. Depuis la page Datasets, cliquez sur Train a custom MT engine.

    La page Dataset details s'ouvre.

  2. Indiquez un nom pour le jeu de données.

  3. Les sélecteurs de langue offrent diverses options :

    1. Pour créer un jeu de données linguistique général, sélectionnez les mêmes langues source et cible dans les sélecteurs de langue et de paramètres régionaux source et cible.

    2. Pour créer un jeu de données spécifique à des paramètres régionaux, sélectionnez les langues source et cible dans la première liste déroulante, puis spécifiez les paramètres régionaux source et cible dans la deuxième liste déroulante.

      Il est également possible d'ajouter plusieurs paramètres régionaux cibles (c'est-à-dire différentes variantes de la même langue) pour tirer parti de davantage de sources de données.

    3. Pour créer un jeu de données avec plusieurs paramètres régionaux source et cible, sélectionnez les langues source et cible dans la première liste déroulante, spécifiez les paramètres régionaux source et cible dans la deuxième liste déroulante (différentes variantes de la même langue cible peuvent être ajoutées) et cliquez sur + Add more locale pairs.

    La fenêtre Input data apparaît.

  4. Cliquez sur Add translation memories.

    La page Choose translation memories s'ouvre avec une fonctionnalité de recherche Search.

  5. Pour ajouter une mémoire de traduction au jeu de données, cliquez sur l'icône Add TM. La mémoire de traduction est ajoutée à la colonne Selected.

    Plusieurs mémoires de traduction peuvent être ajoutées, avec un maximum de 200 mémoires de traduction et 8 millions de segments. Un jeu de données devrait idéalement contenir au moins 10 000 segments.

    En cliquant sur le nom de la mémoire de traduction, vous accéderez à la page translation memory page.

    Cliquez sur l'icône Remove TM pour supprimer la mémoire de traduction de la colonne Selected.

  6. Cliquez sur Enregistrer.

    La page Dataset details s'ouvre.

  7. Vérifiez les détails présentés et, s'ils sont corrects, cliquez sur Continue.

    La page Cleaning filters s'ouvre.

  8. Appliquez les filtres requis et cliquez sur Create.

    Le jeu de données est créé et ajouté à la liste sur la page Datasets avec le statut initial Cleaning et le statut Training MT dans la colonne Created for.

Cet article vous a-t-il été utile ?
★ ★ ★ ★ ★

Sorry about that! In what way was it not helpful?

The article didn’t address my problem.
I couldn’t understand the article.
The feature doesn’t do what I need.
Other reason.

Note that feedback is provided anonymously so we aren't able to reply to questions.
If you'd like to ask a question, submit a request to our Support team.
Thank you for your feedback.