Custom AI

Creare un dataset

Contenuti tradotti automaticamente dall'inglese con Phrase Language AI.

Linee guida per la selezione della memoria di traduzione

Phrase Custom AI sfrutta le memoria di traduzione (TM) per creare modelli di traduzione automatica (MT) personalizzati che aderiscono a terminologia e stile specifici, portando a una migliore qualità della traduzione (e quindi a tempi di post-editing ridotti) per questi tipi di contenuto rispetto alla traduzione automatica generica.

Il fattore più importante che può influenzare l'efficacia del processo di personalizzazione sono le memoria di traduzione utilizzate. Queste sono linee guida generali che possono aiutare a determinare quali dati usare per questo scopo:

  • Dominio singolo:

    È preferibile che il dataset si concentri su contenuto che copre uno stile e una terminologia singoli. Se il dataset contiene un misto di domini (ad esempio, sia i termini legali di un sito web che le descrizioni dei prodotti), il modello potrebbe non riuscire ad apprendere quale sia lo stile desiderato.

  • Tipo di contenuto univoco:

    Il motore MT personalizzato si basa su modelli generici addestrati su enormi quantità di dati pubblici raccolti da Internet. Se la memoria di traduzione contiene dati piuttosto simili ai dati generici utilizzati per creare i modelli generici, non si otterrà molto dal processo di personalizzazione.

  • Qualità del contenuto:

    Il modello presumerà che ogni coppia di frasi nella memoria di traduzione sia un esempio dell'output che ci si aspetta che produca. La memoria di traduzione deve essere di buona qualità, idealmente creata da traduzioni umane professionali. La pipeline di pulizia del contenuto può aiutare a filtrare le parti più dannose del dataset.

  • Volume previsto:

    Affinché la personalizzazione sia efficace in termini di ROI, il dataset deve essere rappresentativo della maggior parte del contenuto in cui la qualità della MT avrà un impatto maggiore. Ad esempio, se parte dell'output della MT deve essere sottoposto a post-editing da parte di traduttori umani, per massimizzare il ROI i dati devono essere rappresentativi del contenuto che verrà sottoposto a post-editing.

La creazione di un dataset per la cura automatizzata delle risorse segue un processo leggermente diverso.

Per creare un dataset allo scopo di addestrare un motore MT Personalizzato, seguire questi passaggi:

  1. Dalla pagina Datasets, fai clic su Addestra un motore MT Personalizzato.

    Si apre la pagina Dettagli dataset.

  2. Fornisci un nome per il dataset.

  3. I selettori di lingua consentono varie opzioni:

    1. Per creare un dataset di lingua generale, seleziona la stessa lingua di origine e di destinazione nei selettori di lingua e impostazioni locali di origine e destinazione.

    2. Per creare un dataset specifico per le impostazioni locali, seleziona la lingua di origine e di destinazione dal primo elenco a discesa, quindi specifica le impostazioni locali di origine e di destinazione dal secondo elenco a discesa.

      È possibile aggiungere anche più impostazioni locali di destinazione (ovvero diverse varianti della stessa lingua) per sfruttare più origini dati.

    3. Per creare un dataset con più impostazioni locali di origine e di destinazione, seleziona la lingua di origine e di destinazione dal primo elenco a discesa, specifica le impostazioni locali di origine e di destinazione dal secondo elenco a discesa (è possibile aggiungere diverse varianti della stessa lingua di destinazione) e fai clic su + Aggiungere altre coppie di impostazioni locali.

    Viene visualizzata la finestra Dati di input.

  4. Fai clic su Aggiungere memorie di traduzione.

    Si apre la pagina Scegli memorie di traduzione con una funzionalità di ricerca Search.

  5. Per aggiungere una TM al dataset, fai clic sull'icona Add TM. La TM viene aggiunta alla colonna Selezionato.

    È possibile aggiungere più TM fino a un massimo di 200 TM e un massimo di 8 milioni di segmenti. Un dataset dovrebbe idealmente contenere almeno 10.000 segmenti.

    Facendo clic sul nome della TM verrà presentata la selezione nella pagina memoria di traduzione.

    Fai clic sull'icona Remove TM per rimuovere la TM dalla colonna Selezionato.

  6. Clicca su Salva.

    Si apre la pagina Dettagli dataset.

  7. Rivedi i dettagli come presentati e, se corretti, fai clic su Continuare.

    Si apre la pagina Filtri di pulizia.

  8. Applica i filtri richiesti e fai clic su Creare.

    Il dataset viene creato e aggiunto all'elenco nella pagina Datasets con lo stato iniziale di Cleaning e lo stato di Training MT nella colonna Created for.

Questo articolo ti è stato utile?

Sorry about that! In what way was it not helpful?

The article didn’t address my problem.
I couldn’t understand the article.
The feature doesn’t do what I need.
Other reason.

Note that feedback is provided anonymously so we aren't able to reply to questions.
If you'd like to ask a question, submit a request to our Support team.
Thank you for your feedback.