Pokyny pro výběr překladová paměť
Phrase Vlastní umělá inteligence využívá překladová paměť k Vytvořit vlastní strojový překlad (MT) modely, které dodržují specifickou terminologii a styl, což vede k lepší kvalitě překladu (a tím ke zkrácení doby post-editace) u těchto typů obsah ve srovnání s obecným strojový překlad.
Nejdůležitějším faktorem, který může ovlivnit efektivitu procesu přizpůsobení, je použité překladová paměť. Toto jsou obecné pokyny, které mohou Nápověda určit, jaká data použít pro tento účel:
-
Jednotná doména:
Nejlepší je, pokud se datová sada zaměřuje na obsah pokrývající jednotný styl a terminologii. Pokud datová sada obsahuje směs doména (např. právní podmínky webových stránek i popisy produktů), model se nemusí naučit, jaký je požadovaný styl.
-
Jedinečný typ obsah:
Vlastní MT model staví na obecných modelech trénovaných na obrovském množství veřejných dat shromážděných z internetu. Pokud překladová paměť obsahuje data, která jsou velmi podobná obecným datům použitým k vytvoření obecných modelů, procesem přizpůsobení se mnoho nezíská.
-
Kvalita dat:
Model bude předpokládat, že každý pár vět v překladové paměti je příkladem výstup, který se od něj očekává. Překladová paměť musí být kvalitní, ideálně vytvořená z profesionálních lidských překladů. Nápověda pro čištění dat může pomoci filtrovat nejškodlivější části datové sady.
-
Očekávaný objem:
Aby bylo přizpůsobení efektivní z hlediska návratnosti investic (RoI), musí být datová sada reprezentativní pro většinu dat, kde bude mít kvalita MT větší dopad. Pokud má být například část výstup MT podrobena post-editace lidskými překladateli, pro maximalizaci návratnosti investic musí být data reprezentativní pro obsah, který bude podroben post-editace.
Vytvoření datové sady pro automatizovanou kuraci aktiv má mírně odlišný proces.
Chcete-li Vytvořit datovou sadu za účelem trénování Vlastní MT nástroj, postupujte podle těchto kroků:
-
Na stránce klikněte na Vytvořit vlastní MT nástroj.
Otevře se stránka .
-
Zadejte název datové sady.
-
Výběry jazyka umožňují různé možnosti:
-
Chcete-li vytvořit datovou sadu obecného jazyka, vyberte stejný zdroj a cíl jazyk ve výběrech zdroj a cíl jazyk a kód jazyka.
-
Chcete-li vytvořit datovou sadu specifickou pro kód jazyka, vyberte zdroj a cíl jazyk ze seznamu první rozevírací seznam a poté určete zdroj a cíl kód jazyka ze seznamu druhý rozevírací seznam.
Lze také přidat více cíl kód jazyka (tj. různé varianty stejného jazyk) pro využití více zdroj dat.
-
Chcete-li vytvořit datovou sadu s více zdroj a cíl kód jazyka, vyberte zdroj a cíl jazyk ze seznamu první rozevírací seznam, určete zdroj a cíl kód jazyka ze seznamu druhý rozevírací seznam (lze přidat různé varianty stejného cíl jazyk) a klikněte na + přidat více kód jazyka párů.
Zobrazí se okno .
-
-
Klikněte na přidat překladová paměť.
Otevře se stránka s funkcí vyhledávání
.
-
Chcete-li k datové sadě přidat TM, klikněte na ikonu
. TM se přidá do sloupce .
Lze přidat více TM, maximálně však 200 TM a maximálně 8 milionů segmentů. Datová sada by měla ideálně obsahovat alespoň 10 000 segmentů.
Kliknutím na název TM se výběr zobrazí na stránce překladová paměť.
Kliknutím na ikonu
odeberete TM ze sloupce .
-
Klikněte na Uložit.
Otevře se stránka .
-
Zkontrolujte zobrazené podrobnosti a pokud jsou správné, klikněte na pokračovat.
Otevře se stránka .
-
Použijte požadované filtry a klikněte na vytvořit.
Datová sada je vytvořena a přidána do seznamu na stránce s počátečním stavem a stavem ve sloupci .