Custom AI

Filtry čištění

Obsah je strojově přeložen z angličtiny s použitím Phrase Language AI.

Nejdůležitějším aspektem trénování MT enginů není jen objem, ale kvalita dat. Čištění dat je všudypřítomný problém a ruční čištění je pracné. Čistá data vedou k rychlejšímu trénování a modelům vyšší kvality.

Phrase vlastní umělá inteligence přizpůsobuje překladové paměti do datových sad s pomocí čisticích filtrů založených na umělé inteligenci a pravidlech. Výchozí nastavení jsou poskytována a měla by být vhodná pro nové uživatele.

Sada dostupných filtrů zahrnuje jak filtry založené na pravidlech, tak filtry založené na strojovém učení:

  • Založené na pravidlech

    Filtry, které pracují s jasně definovanými pravidly, jež jsou pro lidi snadno srozumitelná. Tato kategorie filtrů zahrnuje Časový rozsah, Minimální počet znaků, Délka páru vět, Poměr délek, Nepřeložitelné výrazy, Duplicity, Téměř duplicitní segmenty.

  • Založené na strojovém učení

    Filtry, které analyzují obsah samotného textu, aby se rozhodly, namísto pouhého dodržování pevně stanovené sady pravidel. Tato kategorie filtrů zahrnuje Nesoulad zdroje a cíle a Identifikace jazyka.

Všechny filtry provádějí vyhodnocení na vyčištěných verzích segmentů; mimo jiné jsou vícenásobné mezery redukovány na jednu a značky Phrase tags jsou odstraněny.

Časový rozsah

Vyloučí segmenty mimo nastavená data. Datum zahájení a ukončení je zahrnuto spolu s datem poslední úpravy segmentu.

Nesoulad zdroje a cíle

Tento filtr určuje, jak dobře segmenty odpovídají z hlediska významu a sémantické podobnosti, a odstraňuje ty nejhůře hodnocené. Zarovnání páru vět se měří pomocí metriky LASER.

Nástroj umělé inteligence se používá ke kontrole, zda zdrojový a cílový text znamenají totéž nebo do jaké míry znamenají totéž. Doporučené nastavení zahodí 10 % nejhorších segmentů a ponechá 90 % nejlepších segmentů.

Pokročilé nastavení umožňuje změnu zarovnání nebo může sloužit jako filtr založený na hrubém skóre podobnosti pomocí čísla mezi 0 a 1 (1 znamená Dokončit zarovnání). Při použití hrubého skóre podobnosti se doporučuje opatrnost, protože každý jazykový pár má jinou distribuci skóre a to, co je považováno za dobré skóre pro jeden jazykový pár, může být neuspokojivé skóre pro jiný.

Segmenty pod 0,5 obvykle nejsou příliš dobré a segmenty blízké nebo nad 1 jsou segmenty, které jsou v obou jazycích stejné.

Příklady:

{"source": "Super.", "target": "Super.", "similarity": 1.05}

{"source": "Hello", "target": "http://wwww.sdsadsa.com", "similarity": 0.3}

Minimální počet znaků a písmen

Počet znaků zahrnuje všechny znaky. To zahrnuje všechna písmena, mezery, interpunkci a symboly. Pro účely trénování může být užitečné zahodit segmenty, které neobsahují žádná písmena.

Počet písmen počítá pouze písmena, jako je anglická abeceda, ale také složitější znaky s diakritikou nebo čínské znaky. Jeden čínský znak se počítá jako jedno písmeno, i když představuje více než jeden znak. Pro jazyky založené na znacích jsou výchozí hodnoty 1, ale pro jazyky založené na slovech jsou výchozí hodnoty 4 (znaky) a 3 (písmena). Minimální hodnota je 1 a maximální hodnota je 500.

Pokud v datech uchováváte mnoho krátkých segmentů (například zkratky), udržujte hodnoty filtru nízké.

Příklad:

Řetězec "Hello, World!" 1 2 3" má 19 znaků a 10 písmen.

Délka páru vět

Tento filtr odstraní všechny segmenty, které jsou delší než prahová hodnota nastavená uživateli. Důvodem pro tento filtrovat je, že většina systémů NMT ve skutečnosti nebude trénovat na segmentech, které jsou delší než jejich interní prahová hodnota. 

Například interní prahová hodnota NextMT je 200 tokenů, což odpovídá přibližně 100 - 1 000 slovům. Chcete-li trénovat Vlastní nástroj na kratších větách, nastavte tuto hodnotu na nižší, než je výchozí.

Celkový počet znak zahrnuje všechny znak - písmena, mezery a interpunkci - ze zdroj i cíl vět. Vezměte v úvahu typ jazyk (například čínština a angličtina); pokud zdroj jazyk není typu CJK a cíl jazyk je CJK (nebo naopak), bude tento filtrovat ignorován.

Poměr délky

Tento filtrovat identifikuje segment, kde je délka při porovnání zdroj segment a cíl segment výrazně vyšší. Některé překlady se při překladu ze zdroj do cíl jazyk prodlužují nebo zkracují. Příliš dlouhé nebo příliš krátké překlady mohou naznačovat nekvalitní trénovací data.

Pokud zdroj jazyk není typu CJK a cíl jazyk je (nebo naopak), bude tento filtrovat ignorován.CJK

Některé jazyk jsou obšírnější než jiné, takže 200 % je dobrá výchozí hodnota. Pokud je cíl jazyk podobný zdroj jazyk, nebo je třeba filtrovat více dat, může být hodnota nižší.

Příklady:

Jeden jazyk je CJK - poměr je 1. Nebude vyřazeno:

{"zdroj": "This is a sentence.", "cíl": "这是一个句子。", "ratio": 1}

Německý překlad je srovnatelně dlouhý jako anglický zdroj a nebude vyřazen:

{"zdroj": "This is a sentence.", "cíl": "Dies ist ein Satz.", "poměr": 1.1}

Německý překlad je mnohem delší než anglický zdroj a bude vyřazen:

{"zdroj": "This is a sentence.", "cíl": "Dies ist ein Satz mit zusätzlichen unnötigen Füllungen.", "poměr": 3.1}

Nepřekládaný text

Nepřekládaný text jsou segmenty, kde jsou zdrojový a cílový segment stejné. Vyloučí všechny páry segmentů s nepřekládaný text, kde cílový text zůstává nezměněn oproti zdrojovému segmentu.

Duplicity

Vytvoří se skupiny segmentů, které mají stejný zdrojový segment. Z každé skupiny se ponechá pouze nejlepší segment, takže pokud je zdrojový segment unikátní, je automaticky ponechán. V opačném případě se ponechá segment s nejvyšším skóre podobnosti.

Téměř duplicitní segmenty

Při testování na téměř duplicitní segmenty se (mírně upravená verze) zdrojového segmentu normalizuje; všechny znaky, které nejsou písmeny (některé příklady: “,?)!-), jsou nahrazeny Space a všechna písmena jsou převedena na malá.

Pomocí normalizovaného zdrojového segmentu se vytvoří skupiny segmentů, které mají stejný normalizovaný zdrojový segment. Z každé skupiny se ponechá pouze nejlepší segment, takže pokud je normalizovaný zdrojový segment unikátní, je automaticky ponechán. V opačném případě se ponechá segment s nejvyšším skóre podobnosti.

Identifikace jazyk

K identifikaci zdrojového a cílového jazyk na základě segmentů se používá nástroj umělá inteligence. Segment je odstraněn pouze v případě, že nástroj rozpozná (zdrojový/cílový) jazyk (například kratší segmenty často nástroji k určení jazyk nestačí) a tento jazyk se liší od očekávaného.

QPS

Filtr QPS odstraňuje ze sady dat páry segmentů s nejnižší kvalitou, aby bylo zajištěno, že výsledné modely umělá inteligence budou trénovány na datech nejvyšší dostupné kvality. Obecně platí, že čím vyšší je kvalita trénovacích dat, tím lépe přizpůsobený model funguje.

Filtr QPS lze konfigurovat dvěma způsoby:

  1. Odstranění zadaného procenta párů segmentů s nejnižším skóre QPS. Doporučení je 10 %.

  2. Výběr prahové hodnoty skóre. Použijte pokročilé nastavení k odstranění dvojic vět, které nedosahují nastavitelné prahové hodnoty QPS. Doporučený výchozí bod je 50.

Tyto dvě možnosti poskytují automatizovanou správu datové sady pro dosažení souladu s cíli kvality uživatelů.

Byl pro vás tento článek užitečný?

Sorry about that! In what way was it not helpful?

The article didn’t address my problem.
I couldn’t understand the article.
The feature doesn’t do what I need.
Other reason.

Note that feedback is provided anonymously so we aren't able to reply to questions.
If you'd like to ask a question, submit a request to our Support team.
Thank you for your feedback.