Custom AI

Créer un jeu de données

Le contenu est traduit de l’anglais par Phrase Language AI.

Directives de sélection de la mémoire de traduction

L'IA personnalisée de Phrase exploite les mémoires de traduction pour Créer des modèles de TA personnalisés qui respectent une terminologie et un style spécifiques, ce qui conduit à une meilleure qualité de traduction (et donc à une réduction des temps de post-édition) pour ces types de contenu par rapport à la traduction automatique générique.

Le facteur le plus important pouvant influencer l'efficacité du processus de personnalisation est la mémoire de traduction utilisée. Voici des directives générales qui peuvent aider à déterminer quelles données utiliser à cette fin :

  • Domaine unique :

    Il est préférable que le jeu de données se concentre sur un contenu couvrant un style et une terminologie uniques. Si le jeu de données contient un mélange de domaines (par exemple, à la fois les conditions juridiques d'un site web et les descriptions de produits), le modèle peut ne pas réussir à apprendre quel est le style souhaité.

  • Type de contenu unique :

    Le modèle de TA personnalisé s'appuie sur des modèles génériques entraînés sur de vastes quantités de données publiques collectées sur Internet. Si la mémoire de traduction contient des données assez similaires aux données génériques utilisées pour construire les modèles génériques, le processus de personnalisation n'apportera pas grand-chose.

  • Qualité des données :

    Le modèle supposera que chaque paire de Phrase dans la mémoire de traduction est un exemple de la sortie qu'il sera censé produire. La mémoire de traduction doit être de bonne qualité, idéalement créée à partir de traductions humaines professionnelles. Le pipeline de nettoyage des données peut aider à filtrer les parties les plus nuisibles du jeu de données.

  • Volume attendu :

    Pour que la personnalisation ait un impact en termes de retour sur investissement, le jeu de données doit être représentatif de la majeure partie du contenu où la qualité de la TA aura le plus d'impact. Par exemple, si une partie de la sortie de la TA doit être post-éditée par des traducteurs humains, pour maximiser le retour sur investissement, les données doivent être représentatives du contenu qui sera post-édité.

La création d'un jeu de données pour la curation automatisée d'actifs suit un processus légèrement différent.

Pour Créer un jeu de données dans le but d'entraîner un moteur de TA personnalisé, suivez ces étapes :

  1. Depuis la page Datasets, cliquez sur Entraîner un moteur de TA personnalisé.

    La page Détails du jeu de données s'ouvre.

  2. Indiquez un nom pour le jeu de données.

  3. Les sélecteurs de langue permettent diverses options :

    1. Pour créer un jeu de données de langue générale, sélectionnez les mêmes langue source et langue cible dans les sélecteurs de langue source et cible et de paramètre linguistique.

    2. Pour créer un jeu de données spécifique à un paramètre linguistique, sélectionnez les langue source et langue cible dans la première liste déroulante, puis spécifiez les paramètre linguistique source et paramètre linguistique cible dans la deuxième liste déroulante.

      Plusieurs paramètre linguistique cible (c.-à-d. différentes variantes de la même langue) peuvent également être ajoutés pour tirer parti de davantage de sources de données.

    3. Pour créer un jeu de données avec plusieurs paramètre linguistique source et cible, sélectionnez les langue source et langue cible dans la première liste déroulante, spécifiez les paramètre linguistique source et cible dans la deuxième liste déroulante (différentes variantes de la même langue cible peuvent être ajoutées) et cliquez sur + Ajouter plus de paires de paramètres linguistiques.

    La fenêtre Données d'entrée apparaît.

  4. Cliquez sur Ajouter des mémoires de traduction.

    La page Choisir des mémoires de traduction s'ouvre avec une fonctionnalité de recherche Search.

  5. Pour ajouter une MT au jeu de données, cliquez sur l'icône Add TM. La MT est ajoutée à la colonne Sélectionné.

    Plusieurs MT peuvent être ajoutées jusqu'à un maximum de 200 MT et un maximum de 8 millions de segments. Un jeu de données devrait idéalement contenir au moins 10 000 segments.

    Cliquer sur le nom de la MT présentera la sélection sur la page de mémoire de traduction.

    Cliquez sur l'icône Remove TM pour retirer la MT de la colonne Sélectionné.

  6. Cliquez sur Enregistrer.

    La page Détails du jeu de données s'ouvre.

  7. Vérifiez les détails tels qu'ils sont présentés et, s'ils sont corrects, cliquez sur Continuer.

    La page Filtres de nettoyage s'ouvre.

  8. Appliquez les filtres requis et cliquez sur Créer.

    Le jeu de données est créé et ajouté à la liste sur la page Datasets avec le statut initial de Cleaning et le statut de Training TA dans la colonne Created for.

Cet article vous a-t-il été utile ?

Sorry about that! In what way was it not helpful?

The article didn’t address my problem.
I couldn’t understand the article.
The feature doesn’t do what I need.
Other reason.

Note that feedback is provided anonymously so we aren't able to reply to questions.
If you'd like to ask a question, submit a request to our Support team.
Thank you for your feedback.