Custom AI

Filtri di pulizia

Contenuti tradotti automaticamente dall'inglese con Phrase Language AI.

Gli aspetti più importanti dell'addestramento dei motori di MT non sono solo il volume, ma la qualità dei dati. La pulizia dei dati è un problema pervasivo e la pulizia manuale è laboriosa. Dati puliti portano a un addestramento più rapido e a modelli di qualità superiore.

Phrase Custom AI adatta le memorie di traduzione in set di dati con l'aiuto di filtri di pulizia basati su regole e potenziati dall'IA. Le impostazioni predefinite fornite dovrebbero essere adatte ai nuovi utenti.

Il set di filtri disponibili include sia filtri basati su regole che filtri basati su ML:

  • valutazione basata su regole

    Filtri che operano con regole chiaramente definite e facilmente comprensibili dagli esseri umani. Questa categoria di filtri include Intervallo di date, Conteggio minimo di caratteri, Lunghezza della coppia di frasi, Rapporto di lunghezza, Elementi non traducibili, Duplicati, Quasi duplicati.

  • Basato su ML

    Filtri che analizzano il contenuto del testo stesso per prendere una decisione, invece di seguire semplicemente una serie fissa di regole. Questa categoria di filtri include Origine e destinazione non allineate e Identificazione della lingua.

Tutti i filtri effettuano la valutazione sulle versioni pulite dei segmenti; tra le altre cose, gli spazi multipli vengono ridotti a uno e i tag di Phrase vengono rimossi.

Intervallo di tempo

Esclude i segmenti al di fuori delle date impostate. Le date di inizio e fine sono incluse insieme alla data dell'ultima modifica di un segmento.

origine e destinazione disallineate

Questo filtro determina quanto bene i segmenti corrispondono in termini di significato e somiglianza semantica, rimuovendo quelli con la valutazione peggiore. L'allineamento della coppia di frasi viene misurato utilizzando la metrica LASER.

Viene impiegato un motore di IA per verificare se il testo di origine e quello di destinazione esprimono lo stesso significato, oppure per valutare il grado di somiglianza. L'impostazione consigliata scarta il 10% dei segmenti peggiori mantenendo il 90% dei segmenti migliori.

Le impostazioni avanzate consentono di modificare l'allineamento o possono fungere da filtro basato sul punteggio di somiglianza grezzo utilizzando un numero compreso tra 0 e 1 (1 significa allineamento completo). Si consiglia cautela se si utilizza il punteggio di somiglianza grezzo, poiché ogni coppia di lingue ha una diversa distribuzione dei punteggi e ciò che è considerato un buon punteggio per una coppia di lingue potrebbe essere un punteggio insoddisfacente per un'altra.

In genere, i segmenti con un punteggio inferiore a 0,5 sono considerati di bassa qualità, mentre quelli con punteggi prossimi o superiori a 1 risultano identici in entrambe le lingue.

**Examples**

Origine \"Super.\", \"target\": \"Super.\", \"similarity\": 1.05

Origine \"Hello\", \"target\": \"http://wwww.sdsadsa.com\", \"similarity\": 0.3

Conteggio minimo di caratteri e lettere

Conteggio caratteri include tutti i caratteri. Ciò include tutte le lettere, gli spazi bianchi, la punteggiatura e i simboli. Ai fini dell'addestramento, può essere utile scartare i segmenti che non contengono lettere.

Conteggio lettere conta solo le lettere come quelle dell'alfabeto inglese, ma anche caratteri più complessi con diacritici o caratteri cinesi. Un carattere cinese viene conteggiato come una lettera, anche se rappresenta più di un carattere. Per le lingue basate sui caratteri i valori predefiniti sono 1, ma per le lingue basate sulle parole i valori predefiniti sono 4 (caratteri) e 3 (lettere). Il valore minimo è 1 e il valore massimo è 500.

Se si mantengono molti segmenti brevi nei dati (ad esempio acronimi), mantenere bassi i valori del filtro.

Esempio:

La stringa \"Hello, World!" 1 2 3\" ha 19 caratteri e 10 lettere.

Lunghezza della coppia di frasi

Questo filtro rimuove tutti i segmenti più lunghi del valore soglia impostato dagli utenti. Il motivo di questo filtro è che la maggior parte dei sistemi NMT non si addestra effettivamente su segmenti più lunghi della loro soglia interna. 

Ad esempio, la soglia interna di NextMT è di 200 token, che equivalgono a circa 100 - 1.000 parole. Per addestrare un motore personalizzato su frasi più brevi, impostare questo valore più in basso rispetto a quello predefinito.

Il conteggio totale dei caratteri include tutti i caratteri - lettere, spazi bianchi e punteggiatura - sia dalla frase di origine che da quella di destinazione. Prendi in considerazione il tipo di lingua (ad esempio cinese e inglese); se la lingua di partenza non è simile al CJK e la lingua di arrivo è CJK (o viceversa), questo filtro verrà ignorato.

Rapporto di lunghezza

Questo filtro identifica i segmenti in cui la lunghezza è significativamente maggiore quando si confrontano il segmento di partenza e il segmento di arrivo. Alcune traduzioni aumentano o diminuiscono di lunghezza quando si traduce da una lingua di partenza a una lingua di arrivo. Traduzioni troppo lunghe o troppo brevi possono indicare dati di addestramento di bassa qualità.

Se la lingua di partenza non è simile al CJK e la lingua di arrivo lo è (o viceversa), questo filtro verrà ignorato.CJK

Alcune lingue sono più prolisse di altre, quindi il 200% è un buon valore predefinito. Se la lingua di arrivo è simile alla lingua di partenza, o se è necessario filtrare più dati, il valore può essere inferiore.

**Examples**

Una lingua è CJK - il rapporto è 1. Non verrà scartato:

Origine \"This is a sentence.\", \"target\": \"这是一个句子。\", \"ratio\":" 1

La traduzione tedesca ha una lunghezza paragonabile a quella della fonte inglese e non verrà scartata:

Origine \"This is a sentence.\", \"target\":" \"Dies ist ein Satz.\", \"ratio\":" 1.1

La traduzione tedesca è molto più lunga della fonte inglese e verrà scartata:

Origine \"This is a sentence.\", \"target\":" \"Dies ist ein Satz con aggiunte non necessarie.\", \"ratio\": 3.1

Non traducibili

I segmenti non traducibili sono segmenti in cui il segmento di partenza e quello di arrivo sono identici. Esclude tutte le coppie di frasi non traducibili in cui il testo di arrivo rimane invariato rispetto al testo di partenza.

Duplicati

Vengono creati gruppi di segmenti che hanno la stessa frase di partenza. Da ogni gruppo viene mantenuto solo il segmento migliore, quindi se la frase di partenza di un segmento è unica, viene mantenuta automaticamente. Altrimenti, viene mantenuto il segmento con il punteggio di similarità più alto.

Quasi duplicati

Durante il test per i quasi-duplicati, la (versione leggermente più pulita di) una frase sorgente viene normalizzata; tutti i caratteri non alfabetici (alcuni esempi: “,?)!-) vengono sostituiti con uno spazio e tutte le lettere vengono rese minuscole.

Utilizzando la frase sorgente normalizzata, vengono creati gruppi di segmenti che hanno la stessa frase sorgente normalizzata. Da ogni gruppo, viene mantenuto solo il segmento migliore, in modo che la frase sorgente normalizzata di un segmento sia unica e venga mantenuta automaticamente. Altrimenti, viene mantenuto il segmento con il punteggio di similarità più alto.

Identificazione della lingua

Viene utilizzato un motore di IA per identificare la lingua sorgente e quella di destinazione in base alle frasi. Un segmento viene rimosso solo se il motore riconosce una lingua (sorgente/destinazione) (ad esempio, frasi più brevi spesso non sono sufficienti affinché il motore determini una lingua) e la lingua è diversa da quella prevista.

QPS

Il filtro QPS rimuove le coppie di frasi di qualità inferiore nel dataset per garantire che i modelli di IA risultanti siano addestrati sui dati di qualità più elevata disponibili. Generalmente, maggiore è la qualità dei dati di addestramento, migliore è la prestazione del modello personalizzato.

Il filtro QPS può essere configurato in due modi:

  1. Rimozione di una percentuale specificata di coppie di frasi con i punteggi QPS più bassi. La raccomandazione è del 10%.

  2. Selezione di una soglia di punteggio. Utilizzare le impostazioni avanzate per eliminare le coppie di frasi che scendono al di sotto di una soglia QPS regolabile. Il punto di partenza consigliato è 50.

Queste due opzioni forniscono una selezione automatica del dataset per allinearsi agli obiettivi di qualità degli utenti.

Questo articolo ti è stato utile?
★ ★ ★ ★ ★

Sorry about that! In what way was it not helpful?

The article didn’t address my problem.
I couldn’t understand the article.
The feature doesn’t do what I need.
Other reason.

Note that feedback is provided anonymously so we aren't able to reply to questions.
If you'd like to ask a question, submit a request to our Support team.
Thank you for your feedback.