Linee guida per la selezione della memoria di traduzione
Phrase Custom AI sfrutta le memorie di traduzione (TM) per creare modelli di traduzione automatica (MT) personalizzati che aderiscono a terminologia e stile specifici, portando a una migliore qualità della traduzione (e quindi a tempi di post-editing ridotti) per questi tipi di contenuto rispetto alla traduzione automatica generica.
Il fattore più importante che può influenzare l'efficacia del processo di personalizzazione è rappresentato dalle memorie di traduzione utilizzate. Queste sono linee guida generali che possono aiutare a determinare quali dati utilizzare per questo scopo:
-
Dominio singolo:
È preferibile che il dataset si concentri su contenuti che coprono uno stile e una terminologia specifici. Se il dataset contiene un misto di domini (ad esempio, sia i termini legali di un sito web che le descrizioni dei prodotti), il modello potrebbe non riuscire ad apprendere quale sia lo stile desiderato.
-
Tipo di contenuto univoco:
Il modello di MT personalizzato si basa su modelli generici addestrati su enormi quantità di dati pubblici raccolti da Internet. Se la memoria di traduzione contiene dati piuttosto simili a quelli generici utilizzati per creare i modelli generici, non si otterrà molto dal processo di personalizzazione.
-
Qualità dei dati:
Il modello presumerà che ogni coppia di frasi nella memoria di traduzione rappresenti un esempio dell'output atteso. La memoria di traduzione deve essere di buona qualità, idealmente creata da traduzioni umane professionali. La pipeline di pulizia dei dati può aiutare a filtrare le parti più dannose del dataset.
-
Volume previsto:
Affinché la personalizzazione sia efficace in termini di ROI, il dataset deve essere rappresentativo della maggior parte dei dati in cui la qualità della MT avrà un impatto maggiore. Ad esempio, se parte dell'output della MT deve essere post-editato da traduttori umani, per massimizzare il ROI i dati devono essere rappresentativi del contenuto che verrà post-editato.
La creazione di un dataset per la cura automatizzata delle risorse segue un processo leggermente diverso.
Per creare un dataset allo scopo di addestrare un motore di MT personalizzato, segui questi passaggi:
-
Dalla pagina , fai clic su Train a custom MT engine.
Si apre la pagina .
-
Fornisci un nome per il dataset.
-
I selettori della lingua consentono varie opzioni:
-
Per creare un dataset linguistico generale, seleziona la stessa lingua e locale di origine e di destinazione nei rispettivi selettori.
-
Per creare un dataset specifico per un locale, seleziona le lingue di origine e di destinazione dal primo elenco a discesa, quindi specifica i locali di origine e di destinazione dal secondo elenco a discesa.
È inoltre possibile aggiungere più locali di destinazione (ovvero diverse varianti della stessa lingua) per sfruttare più fonti di dati.
-
Per creare un dataset con più locali di origine e di destinazione, seleziona le lingue di origine e di destinazione dal primo elenco a discesa, specifica i locali di origine e di destinazione dal secondo elenco a discesa (possono essere aggiunte diverse varianti della stessa lingua di destinazione) e fai clic su + Add more locale pairs.
Viene visualizzata la finestra .
-
-
Fai clic su Add translation memories.
Si apre la pagina con una funzionalità di ricerca
.
-
Per aggiungere una TM al dataset, fai clic sull'icona
. La TM viene aggiunta alla colonna .
È possibile aggiungere più TM fino a un massimo di 200 TM e un massimo di 8 milioni di segmenti. Un dataset dovrebbe idealmente contenere almeno 10.000 segmenti.
Facendo clic sul nome della TM verrà presentata la selezione nella translation memory page.
Fai clic sull'icona
per rimuovere la TM dalla colonna .
-
Clicca su Salva.
Si apre la pagina .
-
Rivedi i dettagli presentati e, se corretti, fai clic su Continue.
Si apre la pagina .
-
Applica i filtri richiesti e fai clic su Create.
Il dataset viene creato e aggiunto all'elenco nella pagina con lo stato iniziale di e lo stato di nella colonna .