Custom AI

Automatizovaná správa aktiv

Obsah je strojově přeložen z angličtiny s použitím Phrase Language AI.

Správa překladových pamětí je dlouhodobý a všudypřítomný problém a ruční čištění je pracný proces. Čisté překladové paměti vedou k lepším referencím pro lingvisty a kvalitnějšímu strojovému překladu, což je obzvláště důležité pro Phrase NextMT, vzhledem k jeho pokročilým schopnostem využívat jazyková aktiva, jako jsou překladové paměti a glosáře.

Vytvořit datovou sadu pro AAC

Chcete-li vytvořit datovou sadu za účelem použití spravované TM v TMS, postupujte podle těchto kroků:

  1. Na stránce Datové sady klikněte na Vyčistit překladovou paměť.

    Otevře se stránka Podrobnosti datové sady.

  2. Zadejte název datové sady.

  3. Výběry jazyka umožňují různé možnosti:

    1. Chcete-li vytvořit datovou sadu pro obecný jazyk, vyberte stejný zdrojový a cílový jazyk ve výběrech zdrojového a cílového jazyka a kódu jazyka.

    2. Chcete-li vytvořit datovou sadu specifickou pro kód jazyka, vyberte zdrojový a cílový jazyk z prvního rozevíracího seznamu a poté určete zdrojový a cílový kód jazyka z druhého rozevíracího seznamu.

      Lze také přidat více cílových kódů jazyka (tj. různé varianty stejného jazyka) pro využití více zdrojů dat.

    3. Chcete-li vytvořit datovou sadu s více zdrojovými a cílovými kódy jazyka, vyberte zdrojový a cílový jazyk z prvního rozevíracího seznamu, určete zdrojový a cílový kód jazyka z druhého rozevíracího seznamu (lze přidat různé varianty stejného cílového jazyka) a klikněte na + přidat další páry kódů jazyka.

    Zobrazí se okno Vstupní data.

  4. Klikněte na přidat překladové paměti.

    Otevře se stránka Vybrat překladové paměti s funkcí vyhledávání Search.

  5. Chcete-li přidat TM do datové sady, klikněte na ikonu Add TM. TM je přidána do sloupce Vybrané.

    Lze přidat více TM, maximálně však 200 TM a maximálně 8 milionů segmentů. Datová sada by měla ideálně obsahovat alespoň 10 000 segmentů.

    Kliknutím na název TM se zobrazí výběr na stránce překladové paměti.

    Kliknutím na ikonu Remove TM odeberete TM ze sloupce Vybrané.

  6. Klikněte na Uložit.

    Otevře se stránka Podrobnosti datové sady.

  7. Zkontrolujte zobrazené podrobnosti a pokud jsou správné, klikněte na pokračovat.

    Otevře se stránka Filtry čištění.

  8. Použijte požadované filtry a klikněte na vytvořit.

    Datová sada je vytvořena a přidána do seznamu na stránce Datové sady s počátečním stavem Čištění a stavem Čištění TM ve sloupci Vytvořeno pro.

Filtry čištění pro AAC

Phrase Custom umělá inteligence umožňuje spravovat překladové paměti s pomocí filtrů čištění založených na umělé inteligenci a pravidlech. K dispozici jsou výchozí nastavení, která mohou být vhodná pro nové uživatele.

Tento proces zachovává původní metadata segmentu TM a značky TM, což uživatelům umožňuje udržet si pákový efekt TM při používání vyčištěných TM v TMS.

Sada dostupných filtrů zahrnuje jak filtry založené na pravidlech, tak filtry založené na strojovém učení:

  • Založené na pravidlech

    Filtry, které pracují s jasně definovanými pravidly, jež jsou pro lidi snadno srozumitelná. Tato kategorie filtrů zahrnuje Časový rozsah, Minimální počet znaků, Délka páru vět, Poměr délky, Nepřeložitelné položky, Duplicity, Téměř duplicitní položky.

  • Založené na strojovém učení

    Filtry, které analyzují obsah samotného textu, aby se rozhodly, namísto pouhého dodržování pevně stanovené sady pravidel. Tato kategorie filtrů zahrnuje Nesoulad zdroje a cíle a Identifikace jazyka.

Časový rozsah

Vyloučí segmenty mimo nastavená data. Data konce a začátku jsou zahrnuta spolu s datem poslední úpravy segmentu.

Zdroj a cíl nejsou zarovnány

Tento filtr určuje, jak dobře se segmenty shodují z hlediska významu a sémantické podobnosti, a odstraňuje ty nejhůře hodnocené. Zarovnání dvojic vět se měří pomocí metriky LASER.

Nástroj umělé inteligence se používá ke kontrole, zda zdrojový a cílový text znamenají totéž, nebo do jaké míry znamenají totéž. Doporučené nastavení zahodí 10 % nejhorších segmentů a ponechá 90 % nejlepších segmentů.

Pokročilé nastavení umožňuje změnit zarovnání nebo může sloužit jako filtr založený na hrubém skóre shody pomocí čísla mezi 0 a 1 (1 znamená úplná shoda). Při použití hrubého skóre shody se doporučuje opatrnost, protože každý jazykový pár má jinou distribuci skóre a to, co je považováno za dobré skóre pro jeden jazykový pár, může být neuspokojivé skóre pro jiný.

Segmenty pod 0,5 obvykle nejsou příliš dobré a segmenty blízké nebo vyšší než 1 jsou segmenty, které jsou v obou jazycích stejné.

Příklady:

Řetězec \"Hello, World!" 1 2 3\" má 19 znaků a 10 písmen.

Minimální počet znaků a písmen

Počet znaků zahrnuje všechny znaky. To zahrnuje všechna písmena, mezery, interpunkci a symboly. Pro účely trénování může být užitečné zahodit segmenty, které neobsahují žádná písmena.

Počet písmen počítá pouze písmena, jako je tomu v anglické abecedě, ale také složitější znaky s diakritikou nebo čínské znaky. Jeden čínský znak se počítá jako jedno písmeno, i když představuje více než jeden znak. Pro jazyky založené na znacích jsou výchozí hodnoty 1, ale pro jazyky založené na slovech jsou výchozí hodnoty 4 (znaky) a 3 (písmena). Minimální hodnota je 1 a maximální hodnota je 500.

Pokud v datech uchováváte mnoho krátkých segmentů (například zkratky), udržujte hodnoty filtru nízké.

Příklad:

Řetězec \"Hello, World!" 1 2 3\" má 19 znaků a 10 písmen.

Délka dvojice vět

Tento filtrovat odstraní všechny segment, které jsou delší než prahová hodnota nastavená uživateli.

Celkový počet znak zahrnuje všechny znak - písmena, mezery a interpunkci - ze zdroj i cíl věta. Vezměte v úvahu typ jazyk (například čínština a angličtina); pokud zdroj jazyk není typu CJK a cíl jazyk je CJK (nebo naopak), bude tento filtrovat ignorován.

Poměr délky

Tento filtrovat identifikuje segment, kde je délka při porovnání zdroj segment a cíl segment výrazně vyšší. Některé překlady se při překladu ze zdroj do cíl jazyk prodlužují nebo zkracují. Příliš dlouhé nebo příliš krátké překlady mohou naznačovat nekvalitní segment.

Pokud zdroj jazyk není typu CJK a cíl jazyk je (nebo naopak), bude tento filtrovat ignorován.CJK

Některé jazyky jsou obšírnější než jiné, takže 200 % je dobrá výchozí hodnota. Pokud je cíl jazyk podobný zdroj jazyk, nebo je potřeba filtrovat více dat, může být hodnota nižší.

Příklady:

Jeden jazyk je CJK – poměr je 1. Nebude vyřazeno:

{"zdroj": "This is a sentence.", "cíl": "这是一个句子。", "ratio": 1}

Německý překlad je srovnatelně dlouhý jako anglický zdroj a nebude vyřazen:

{"zdroj": "This is a sentence.", "cíl": "Dies ist ein Satz.", "poměr": 1.1}

Německý překlad je mnohem delší než anglický zdroj a bude vyřazen:

{"zdroj": "This is a sentence.", "cíl": "Dies ist ein Satz mit zusätzlichen unnötigen Füllungen.", "poměr": 3.1}

Nepřekládaný text

Nepřekládaný text jsou segmenty, kde jsou zdroj a cíl stejné. Vyloučí všechny páry vět s nepřekládaný text, kde cíl text zůstává nezměněn oproti zdroj text.

Duplicity

Vytvoří se skupiny segmentů, které mají stejný zdroj větu. Z každé skupiny je ponechán pouze nejlepší segment, takže pokud je zdroj věta segmentu unikátní, je automaticky ponechán. V opačném případě je ponechán segment s nejvyšším skóre podobnosti.

Téměř duplicitní segmenty

Při testování na téměř duplicitní segmenty se (mírně upravená verze) zdroj věty normalizuje; všechny znaky, které nejsou písmeny (některé příklady: “,?)!-), jsou nahrazeny Space a všechna písmena jsou převedena na malá.

Pomocí normalizované zdroj věty se vytvoří skupiny segmentů, které mají stejnou normalizovanou zdroj větu. Z každé skupiny je ponechán pouze nejlepší segment, takže pokud je normalizovaný zdroj segmentu unikátní, je automaticky ponechán. V opačném případě je ponechán segment s nejvyšším skóre podobnosti.

Identifikace jazyk

K identifikaci zdroj a cíl jazyk na základě vět se používá nástroj umělá inteligence. Segment je odebrán pouze tehdy, pokud nástroj rozpozná (zdroj/cíl) jazyk (například kratší věty často nástroji k určení jazyk nestačí) a jazyk se liší od očekávaného.

QPS

Filtrovat QPS umožňuje odebrat páry vět s nejnižší kvalitou z překladová paměť, aby bylo zajištěno, že výsledné segmenty budou mít nejvyšší kvalitu.

Filtrovat QPS lze nakonfigurovat dvěma způsoby:

  1. Odebrání zadaného procenta párů vět s nejnižší skóre QPS. Doporučení je 10 %.

  2. Výběr prahové hodnoty skóre. Použít pokročilé nastavení k eliminaci párů vět, které nedosahují nastavitelné prahové hodnoty QPS. Doporučený výchozí bod je 50.

Tyto dvě možnosti poskytují automatizovanou správu překladové paměti pro dosažení souladu s cíli kvality uživatelů.

Použití upravených TM v TMS

Proces čištění překladové paměti, který může trvat několik hodin, musí být Dokončit, než bude možné použít upravenou TM.

Chcete-li použít upravenou TM v TMS, postupujte podle těchto kroků:

  1. Klikněte na Open More Menu a vyberte stáhnout Download.

    Otevře se okno Stáhnout.

  2. Vybrat Stáhnout (.tmx).

Tím se spustí proces exportu datové sady, který bude trvat jen několik minut. Výslednou upravenou TM ve formát .TMX lze poté nahrát do TMS jako novou, upravenou TM o velikosti až 1 Gb.

Pokud byly u stejné TM provedeny dva nebo více procesů čištění, lze k různým verzím přistupovat v záložce Historie čištění.

Byl pro vás tento článek užitečný?

Sorry about that! In what way was it not helpful?

The article didn’t address my problem.
I couldn’t understand the article.
The feature doesn’t do what I need.
Other reason.

Note that feedback is provided anonymously so we aren't able to reply to questions.
If you'd like to ask a question, submit a request to our Support team.
Thank you for your feedback.