Сегментация — это разделение текстов оригинала на меньшие части. Это улучшает поиск ранее переведенного текста в памяти переводов. Сегменты отображаются в редакторе и могут быть фильтрованы. Если в проекте есть этапы рабочего процесса, изменения в сегментах отображаются на панели изменений перевода.
Правила сегментации по умолчанию соответствуют специфике каждого поддерживаемого языка и могут быть настроены.
Задания, импортированные с ошибками сегментации, такими как плохо форматированные файлы документов или неправильная настройка сегментации, могут повлиять на значения совпадений в памяти переводов (TM). Рекомендуется уделить время проверке и подготовке оригинала перед импортом; распространенной проблемой является неправильное использование разрывов строк вместо разрывов абзацев.
Пример:
Хорошая сегментация:
-
Поддерживаются базы памяти переводов с многоязычными языками перевода и могут использоваться двунаправленно.
Значение совпадения 100%.
Плохая сегментация:
-
Поддерживаются базы памяти переводов с многоязычными языками перевода.
Значение совпадения 100%.
-
и могут использоваться двунаправленно.
Значение совпадения 63%.
Пользовательские правила сегментации можно применять к заданиям и шаблонам проектов. Если для проекта требуется пользовательское правило сегментации, для этого проекта необходимо создать шаблон. При установке в качестве основных пользовательские правила сегментации применяются ко всем новым заданиям, импортированным для этого оригинала на языке.
Существует два типа правил сегментации:
-
Сокращения в файле .XLSX
-
Регулярное выражение файлов .SRX
Чтобы использовать пользовательские правила, скачайте правила по умолчанию, измените их, загрузите измененный файл, а затем примените их к указанным заданиям.
Осторожно
При добавлении пользовательских правил сегментации для оригинала на языке CJK без пробелов (в то время как в переводе пробелы будут использоваться в качестве разделителя слов) убедитесь, что начальные или конечные пробелы добавлены в сегменты перевода, разделенные пользовательским правилом; это разграничивает слова в переводе. Хотя это происходит автоматически в сегментах, сформированных правилами сегментации по умолчанию, пробелы не добавляются в разделенных вручную сегментах или сегментах, образованных дополнительными пользовательскими правилами сегментации.
Чтобы скачать правила сегментации по умолчанию, выполните следующие действия:
-
На странице «Настройки»
прокрутите вниз раздел и нажмите «Сегментация».
Откроется страница .
-
Нажмите «Экспорт XLSX/SRX».
Откроется окно .
-
Выбрать формат:
-
XLSX предоставляет список сокращений.
-
SRX предоставляет правила регулярное выражение.
-
-
Выберите язык для настройки из выпадающего список.
-
Нажмите Скачать.
Файл выполняется скачивание в вашу систему.
Чтобы выполнить скачивание ранее загруженного правила сегментация, выполните следующие действия:
-
На странице «Настройки»
прокрутите вниз раздел и нажмите «Сегментация».
Откроется страница .
-
Если столбец Файл не отображается, нажмите Настроить, чтобы Включить его.
-
Нажмите на имя файла, чтобы выполнить скачивание правила.
Сокращения можно указать для отдельных языков, после которых новые сегменты не должны создаваться.
Чтобы редактировать сокращения, выполните следующие действия:
-
Откройте скачанный файл .XLSX в редакторе.
-
Измените содержимое, используя следующее форматирование:
Файл XLSX должен содержать два столбца без заголовков.
-
Столбец 1: Указываемое сокращение
-
Столбец 2: Определение поведения сегментация
-
ABBR_UPPER_NUM
Новый сегмент не будет создан, если после сокращения следует пробел, а затем число, символ (математический, знаки валют, спецсимволы и т. д.) или слово, начинающееся с заглавной буквы.
-
ABBR_NUM
Новый сегмент не будет создан, если после сокращения следует пробел, а затем число.
-
-
-
Сохранить отредактированный файл .XLSX.
Редактировать файлы .SRX — сложный процесс, подходящий только для пользователей, имеющих опыт работы с регулярными выражениями
Существует несколько правил, которые можно изменить в файле SRX:
-
Импортировать текст из файла XLSX без сегментация; одна ячейка равна одному сегмент.
-
Импортировать текст с новой строкой, чтобы разделить один сегмент на два.
-
Использовать двоеточие (или любой другой символ) в качестве разделителя сегмент.
-
Запретить использование точки с запятой (или любого другого символ) в качестве разделителя сегмент.
-
Удаление аббревиатуры из список (текст будет сегментирован).
Эти правила основаны на символ; в качестве разделителя сегмент можно использовать только один символ. Группы символ (например: <p>) нельзя использовать в качестве разделителя сегмент.
Чтобы редактировать файл SRX, выполните следующие действия:
-
Откройте файл в текстовом редакторе, например Notepad ++.
-
Редактировать с использованием регулярных выражений или полностью удалить внутреннюю сегментацию.
Например:
-
<rule break="no">Список правил, где сегмент не будет разделен. Т.е. список аббревиатур
-
<rule> <beforebreak>Регулярное выражение для символа перед разрывом (например, в конце предложения «. ? ! :»). Если вы, например, не хотите сегментировать текст после двоеточия, просто Удалить
:из каждого кода<rule><beforebreak>. -
<rule> <afterbreak>Регулярное выражение для символа после разрыва (например, в начале нового предложения; каталог и заглавная буква).
-
-
Сохраните измененный файл SRX.
Чтобы загрузить измененные или новые правила сегментации, выполните следующие действия:
-
На странице «Настройки»
прокрутите вниз раздел и нажмите «Сегментация».
Откроется страница .
-
Нажмите «Создать».
Откроется страница .
-
Выберите из раскрывающегося списка.
-
Укажите для правила.
-
Нажмите Выбрать файл.
Откроется окно выбора файла.
-
Выберите измененный файл правил для загрузки.
-
Установите флажок , если пользовательские правила сегментации будут основными правилами сегментации для выбранного языка.
-
Нажмите «Создать».
Откроется страница , и правило будет добавлено в список.
Чтобы использовать пользовательские правила при импорте задания или настроить длину перевода сегмента, выполните следующие действия:
-
На этапе 8 создания задания нажмите Сегментация и длина сегмента в разделе .
Откроется раскрывающийся список параметров .
-
Выберите измененные правила из раскрывающегося списка .
-
При необходимости настройте ограничение длины перевода сегмента в соответствии с требованиями проекта (например, для перевода субтитров):
-
Выберите и введите предпочтительный процент, чтобы ограничить длину сегмента на основе оригинала сегмента.
-
Выберите и введите количество символов, чтобы ограничить длину сегмента по количеству символов.
-
-
Нажмите «Создать».
Задание создается и добавляется в список с использованием указанных правил сегментации.
Удалите все inner правила сегментации из SRX-файла, оставив только базовую сегментацию всего абзаца, элемента или применяемой ячейки. Это правило сегментации можно применить к любому типу файлов (MS Word, XML, HTML, Excel и т. д.).
Например:
Этот пример XLSX, импортированный с сегментацией по умолчанию, будет иметь 3 сегмента: Peter!, Wait! и Hello.
Если вся внутренняя сегментация удалена и осталась только базовая сегментация на основе ячейки, то остается только два сегмента: Peter! Wait! и Hello.
Отредактируйте SRX-файл, чтобы удалить все правила сегментации по умолчанию, т. е. код между <!-- break rules --> и </languagerule>.
Например:
Каскадирование может привести к тому, что этот пример не будет работать. В таком случае откройте отредактированный SRX-файл в Notepad++, найдите два атрибута элемента header и измените оба на no.