Directives de sélection de la mémoire de traduction
Phrase Custom AI exploite les mémoires de traduction (TMs) pour créer des modèles de traduction automatique (MT) personnalisés qui respectent une terminologie et un style spécifiques, ce qui améliore la qualité de la traduction (et, par conséquent, réduit le temps de post-édition) pour ces types de contenu par rapport à la traduction automatique générique.
Le facteur le plus important pouvant influencer l'efficacité du processus de personnalisation réside dans les mémoires de traduction utilisées. Voici des directives générales qui peuvent aider à déterminer quelles données utiliser à cette fin :
-
Domaine unique :
Il est préférable que le jeu de données se concentre sur un contenu présentant un style et une terminologie uniques. Si le jeu de données contient un mélange de domaines (par exemple, à la fois les termes juridiques d'un site web et les descriptions de produits), le modèle risque de ne pas réussir à capter le style souhaité.
-
Type de contenu unique :
Le modèle de traduction automatique personnalisé s'appuie sur des modèles génériques entraînés sur de vastes quantités de données publiques collectées sur Internet. Si la mémoire de traduction contient des données assez similaires aux données génériques utilisées pour construire les modèles génériques, le processus de personnalisation n'apportera pas grand-chose.
-
Qualité des données :
Le modèle supposera que chaque paire de phrases dans la mémoire de traduction est un exemple de la sortie qu'il sera censé produire. La mémoire de traduction doit être de bonne qualité, idéalement créée à partir de traductions humaines professionnelles. Le pipeline de nettoyage des données peut aider à filtrer les parties les plus nuisibles du jeu de données.
-
Volume attendu :
Pour que la personnalisation ait un impact en termes de retour sur investissement, le jeu de données doit être représentatif de la majeure partie des données où la qualité de la traduction automatique aura plus d'impact. Par exemple, si une partie de la sortie de la traduction automatique doit être post-éditée par des traducteurs humains, pour maximiser le retour sur investissement, les données doivent être représentatives du contenu qui sera post-édité.
La création d'un jeu de données pour la curation automatisée d'actifs suit un processus légèrement différent.
Pour créer un jeu de données dans le but d'entraîner un moteur de traduction automatique personnalisé, suivez ces étapes :
-
Depuis la page , cliquez sur Train a custom MT engine.
La page s'ouvre.
-
Indiquez un nom pour le jeu de données.
-
Les sélecteurs de langue offrent diverses options :
-
Pour créer un jeu de données linguistique général, sélectionnez les mêmes langues source et cible dans les sélecteurs de langue et de paramètres régionaux source et cible.
-
Pour créer un jeu de données spécifique à des paramètres régionaux, sélectionnez les langues source et cible dans la première liste déroulante, puis spécifiez les paramètres régionaux source et cible dans la deuxième liste déroulante.
Il est également possible d'ajouter plusieurs paramètres régionaux cibles (c'est-à-dire différentes variantes de la même langue) pour tirer parti de davantage de sources de données.
-
Pour créer un jeu de données avec plusieurs paramètres régionaux source et cible, sélectionnez les langues source et cible dans la première liste déroulante, spécifiez les paramètres régionaux source et cible dans la deuxième liste déroulante (différentes variantes de la même langue cible peuvent être ajoutées) et cliquez sur + Add more locale pairs.
La fenêtre apparaît.
-
-
Cliquez sur Add translation memories.
La page s'ouvre avec une fonctionnalité de recherche
.
-
Pour ajouter une mémoire de traduction au jeu de données, cliquez sur l'icône
. La mémoire de traduction est ajoutée à la colonne .
Plusieurs mémoires de traduction peuvent être ajoutées, avec un maximum de 200 mémoires de traduction et 8 millions de segments. Un jeu de données devrait idéalement contenir au moins 10 000 segments.
En cliquant sur le nom de la mémoire de traduction, vous accéderez à la page translation memory page.
Cliquez sur l'icône
pour supprimer la mémoire de traduction de la colonne .
-
Cliquez sur Enregistrer.
La page s'ouvre.
-
Vérifiez les détails présentés et, s'ils sont corrects, cliquez sur Continue.
La page s'ouvre.
-
Appliquez les filtres requis et cliquez sur Create.
Le jeu de données est créé et ajouté à la liste sur la page avec le statut initial et le statut dans la colonne .