Segmentace je rozdělení zdrojových textů na menší části. To zlepšuje vyhledávání dříve přeloženého textu z překladové paměti. Segmenty jsou zobrazeny v editoru a lze je filtrovat. Pokud má projekt kroky pracovního postupu, změny v segmentech jsou zobrazeny v podokně změn překladu.
Výchozí pravidla segmentace odpovídají specifikům každého podporovaného jazyka a lze je přizpůsobit.
Úlohy importované se špatnou segmentací, jako jsou špatně formátované soubory dokumentů nebo použití nevhodného přizpůsobení segmentace, mohou ovlivnit hodnoty shody TM. Doporučuje se věnovat nějaký čas kontrole a přípravě zdrojového souboru před importem; běžným problémem je nesprávné použití konců řádků oproti koncům odstavců.
Příklad:
Dobrá segmentace:
-
Překladové paměti s vícejazyčnými cílovými jazyky jsou podporovány a lze je použít obousměrně.
Hodnota shody 100 %.
Špatná segmentace
-
Překladové paměti s vícejazyčnými cílovými jazyky jsou podporovány.
Hodnota shody 100 %.
-
a lze je použít obousměrně.
Hodnota shody 63 %.
Přizpůsobená pravidla segmentace lze použít na úlohy a šablony projektů. Pokud projekt vyžaduje přizpůsobené pravidlo segmentace, bude nutné pro tento projekt vytvořit šablonu. Pokud jsou nastavena jako primární, vlastní segmentace pravidla se použijí na všechny nové úlohy importované pro daný zdroj jazyk.
Existují dva typy segmentace pravidel:
-
Zkratky do souboru .XLSX
-
regulární výraz souborů .SRX
Chcete-li použít Vlastní pravidla, stáhnout výchozí pravidla, upravit je, nahrát upravený soubor a poté je použít na určené úlohy.
Upozornění
Při přidávání Vlastní segmentace pravidel pro zdroj jazyk bez Space (zatímco cíl jazyk bude používat Space jako oddělovač slov) zajistěte, aby byly k cíl segmentům rozděleným pomocí Vlastní pravidla přidány úvodní nebo koncové Space; to odděluje slova v překladu. Zatímco se to děje automaticky u segmentů vytvořených výchozími segmentace pravidly, v ručně rozdělit segmentech nebo segmentech vytvořených dalšími Vlastní segmentace pravidly nejsou přidány žádné Space.
Chcete-li stáhnout výchozí segmentace pravidla, postupujte podle těchto kroků:
-
Na stránce nastavení
přejděte dolů do sekce a klikněte na segmentace.
Otevře se stránka .
-
Klikněte na Stáhnout XLSX/SRX.
Otevře se okno .
-
Vybrat formát:
-
XLSX poskytuje seznam zkratek.
-
SRX poskytuje pravidla pro regulární výraz.
-
-
Vybrat jazyk, který má být upraven, ze seznamu v rozevírací nabídce.
-
Klikněte na Stáhnout.
Soubor je stažen do vašeho systému.
Chcete-li stáhnout dříve nahrané pravidlo segmentace, postupujte podle těchto kroků:
-
Na stránce nastavení
přejděte dolů do sekce a klikněte na segmentace.
Otevře se stránka .
-
Pokud se sloupec Soubor nezobrazuje, klikněte na Přizpůsobit a Povolit jej.
-
Kliknutím na název souboru stáhnete pravidlo.
Zkratky lze určit pro jednotlivé jazyky, po kterých by neměly být vytvářeny nové segmenty.
Chcete-li upravit zkratky, postupujte podle těchto kroků:
-
Otevřete stažený soubor .XLSX v editoru.
-
Změnit obsah pomocí následujícího formátování:
Soubor XLSX musí mít dva sloupce bez záhlaví.
-
Sloupec 1: Zkratka, která má být určena
-
Sloupec 2: Určení chování segmentace
-
ABBR_UPPER_NUM
Nový segment nebude vytvořen, pokud po zkratce následuje Space a poté číslo, symbol (matematické znaky, symboly měn, dingbaty atd.) nebo slovo začínající velkým písmenem.
-
ABBR_NUM
Nový segment nebude vytvořen, pokud po zkratce následuje Space a poté číslo.
-
-
-
Uložit upravený soubor .XLSX.
Úprava souborů .SRX je složitý proces vhodný pouze pro uživatele zkušené v používání regulárních výrazů
V souboru SRX lze změnit několik pravidel:
-
Import textu ze souboru XLSX bez segmentace; jedna buňka se rovná jeden segment.
-
Import textu s novým řádkem za účelem rozdělit jeden segment na dva.
-
Použít dvojtečku (nebo jakýkoli jiný znak) jako oddělovač pro segment.
-
Zakázat použití středníku (nebo jakéhokoli jiného znaku) jako oddělovače segmentů.
-
Odebrání zkratky ze seznamu (text bude segmentován).
Tato pravidla jsou založena na znacích; jako oddělovač segmentů lze použít pouze jeden znak. Skupiny znaků (například: <p>) nelze použít jako oddělovač segmentů.
Chcete-li upravit soubor SRX, postupujte takto:
-
Otevřete soubor v textovém editoru, jako je Notepad ++.
-
Upravit pomocí regulárních výrazů nebo zcela odebrat vnitřní segmentaci.
Příklad:
-
<rule break=\"no\">Seznam pravidel, kde nebude segment rozdělen. Tj. seznam zkratek
-
<rule> <beforebreak>Regulární výraz pro znak před koncem segmentu (například na konci věty „. ? ! :“). Pokud například nechcete segmentovat text za dvojtečkou, jednoduše odstraňte
:z každého kódu<rule><beforebreak>. -
<rule> <afterbreak>Regulární výraz pro znak po konci segmentu (například na začátku nové věty; Space a velké písmeno).
-
-
Uložit upravený soubor SRX.
Chcete-li nahrát upravená nebo nová pravidla segmentace, postupujte takto:
-
Na stránce nastavení
přejděte dolů do sekce a klikněte na Segmentation.
Otevře se stránka .
-
Klikněte na Nový.
Otevře se stránka .
-
Vyberte z rozevíracího seznamu.
-
Zadejte pravidla.
-
Klikněte na Vybrat soubor.
Otevře se okno pro výběr souboru.
-
Vyberte upravený soubor pravidel k nahrání.
-
Zaškrtněte , pokud mají být vlastní pravidla segmentace primárními pravidly segmentace pro vybraný jazyk.
-
Klikněte na Vytvořit.
Otevře se stránka a pravidlo bylo přidáno do seznamu.
Chcete-li použít vlastní pravidla při importu zakázky nebo nakonfigurovat délku cílového segmentu, postupujte podle těchto kroků:
-
V 8. fázi vytváření zakázky klikněte na Segmentace a délka segmentu v .
Otevře se rozevírací nabídka .
-
Vyberte upravená pravidla z rozevíracího seznamu .
-
Volitelně můžete nakonfigurovat limit pro délku cílového segmentu na základě požadavků projektu (např. překlad titulků):
-
Vyberte a zadejte preferované procento pro omezení délky segmentu na základě zdrojového segmentu.
-
Vyberte a zadejte počet znaků pro omezení délky segmentu podle počtu znaků.
-
-
Klikněte na Vytvořit.
Zakázka je vytvořena a přidána do seznamu pomocí zadaných pravidel segmentace.
Odeberte všechna vnitřní pravidla segmentace ze souboru SRX, čímž ponecháte pouze základní segmentaci celého odstavce, elementu nebo buňky, která je aplikována. Toto pravidlo segmentace lze použít pro každý typ souboru (MS Word, XML, HTML, Excel atd.).
Příklad:
Tento příklad XLSX importovaný s výchozí segmentací bude mít 3 segmenty: Petře!, Počkej! a Ahoj.
Pokud je veškerá vnitřní segmentace odebrána a zůstane pouze základní segmentace založená na buňce, pak existují pouze dva segmenty: Petře! Počkej! a Ahoj.
Upravte soubor SRX tak, abyste odebrali všechna výchozí pravidla segmentace, tj. kód mezi <!-- break rules --> a </languagerule>.
Příklad:
Kaskádování může způsobit, že tato zakázka nebude fungovat. V takovém případě otevřete upravený soubor SRX v programu Notepad++, najděte dva atributy elementu header a oba změňte na no.