Custom AI

Автоматизированное курирование ресурсов

Контент автоматически переведен с английского языка с помощью Phrase Language AI.

Курирование памяти переводов — это давняя распространенная проблема, а ручная очистка — трудоемкий процесс. Чистая память переводов обеспечивает лучшие справочные материалы для лингвистов и более качественный машинный перевод, что особенно актуально для Phrase NextMT, учитывая его расширенные возможности использования языковых ресурсов, таких как память переводов и глоссарии.

Создать набор данных для AAC

Чтобы создать набор данных для использования курируемой памяти переводов (TM) в TMS, выполните следующие действия:

  1. На странице Наборы данных нажмите Очистить память переводов.

    Откроется страница Сведения о наборе данных.

  2. Укажите название набора данных.

  3. Селекторы языка позволяют использовать различные параметры:

    1. Чтобы создать набор данных для общего языка, выберите одинаковые оригинал и перевод в селекторах языка и языкового стандарта оригинала и перевода.

    2. Чтобы создать набор данных для конкретного языкового стандарта, выберите оригинал и перевод из первого раскрывающегося списка, затем укажите языковые стандарты оригинала и перевода из второго раскрывающегося списка.

      Также можно добавить несколько языковых стандартов перевода (т.е. различные варианты одного и того же языка) для использования большего количества источников данных.

    3. Чтобы создать набор данных с несколькими языковыми стандартами оригинала и перевода, выберите оригинал и перевод из первого раскрывающегося списка, укажите языковые стандарты оригинала и перевода из второго раскрывающегося списка (можно добавить различные варианты одного и того же языка перевода) и нажмите + добавить языковые пары.

    Откроется окно Входные данные.

  4. Нажмите добавить память переводов (TM).

    Откроется страница Выбрать память переводов (TM) с функцией поиска Search.

  5. Чтобы добавить память переводов (TM) в набор данных, нажмите значок Add TM. Память переводов (TM) будет добавлена в столбец Выбранные.

    Можно добавить несколько единиц памяти переводов (TM), максимум до 200 единиц и максимум 8 миллионов сегментов. В идеале набор данных должен содержать не менее 10 000 сегментов.

    Нажатие на имя память переводов (TM) откроет выбор на странице памяти переводов.

    Нажмите значок Remove TM, чтобы удалить память переводов (TM) из столбца Выбрано.

  6. Нажмите «Сохранить».

    Откроется страница Сведения о наборе данных.

  7. Просмотрите представленные данные и, если они верны, нажмите продолжить.

    Откроется страница Фильтры очистки.

  8. Примените необходимые фильтры и нажмите создать.

    Набор данных создан и добавлен в список на странице Наборы данных с начальным статус Очистка и статус Очистка памяти переводов (TM) в столбце Создано для.

Фильтры очистки для AAC

Phrase Custom искусственный интеллект (ИИ) позволяет курировать память переводов (TM) с помощью фильтров очистки на основе искусственный интеллект (ИИ) и правил. Предоставляются настройки по умолчанию, которые могут подойти новым пользователям.

Этот процесс сохраняет исходные метаданные сегмента памяти переводов (TM) и теги памяти переводов (TM), что позволяет пользователям сохранять эффективность памяти переводов (TM) при использовании очищенных память переводов (TM) в TMS.

Набор доступных фильтров включает как фильтры на основе правил, так и фильтры на основе машинного обучения:

  • На основе правил

    Фильтры, которые работают с четко определенными правилами, легко понятными для людей. Эта категория фильтров включает Диапазон дат, Минимальное количество символов, Длина пары предложений, Соотношение длины, Непереводимые элементы, Дубликаты, Почти дубликаты.

  • На основе машинного обучения

    Фильтры, которые анализируют контент самого текста для принятия решения, а не просто следуют фиксированному набору правил. Эта категория фильтров включает Несоответствие оригинала и перевода и Идентификация языка.

Диапазон дат

Исключает сегменты вне установленных дат. Конечная и начальная даты включены вместе с датой последнего изменения сегмента.

Несоответствие оригинала и перевода

Этот фильтр определяет, насколько хорошо сегменты совпадают по значению и семантическому сходству, удаляя сегменты с наихудшей оценкой. Выравнивание пары предложений измеряется с помощью метрики LASER.

Система искусственного интеллекта (ИИ) используется для проверки того, означают ли оригинал и перевод одно и то же, или насколько они близки по значению. Рекомендуемая настройка позволяет Сбросить 10% наихудших сегментов, сохраняя 90% наилучших сегментов.

Дополнительные настройки позволяют изменить выравнивание или могут служить фильтром на основе необработанной оценки совпадения с использованием числа от 0 до 1 (1 означает полное совпадение). Рекомендуется соблюдать осторожность при использовании необработанной оценки совпадения, так как каждая языковая пара имеет разное распределение оценок, и то, что считается хорошей оценкой для одной языковой пары, может быть неудовлетворительной оценкой для другой.

Как правило, сегменты ниже 0,5 не очень хороши, а сегменты, близкие к 1 или превышающие ее, — это сегменты, которые одинаковы на обоих языках.

Примеры:

Строка \"Hello, World!" 1 2 3\" содержит 19 символов и 10 букв.

Минимальное количество символов и букв

Количество символов включает все символы. Это включает все буквы, пробелы, знаки препинания и символы. Для целей обучения может быть полезно Сбросить сегменты, которые не содержат букв.

Количество букв учитывает только буквы, например, английского алфавита, а также более сложные символы с диакритическими знаками или китайские иероглифы. Один китайский иероглиф считается за одну букву, даже если он представляет собой более одного символа. Для языков, основанных на символах, значения по умолчанию равны 1, но для языков, основанных на словах, значения по умолчанию равны 4 (символа) и 3 (буквы). Минимальное значение — 1, а максимальное — 500.

Если в данных сохраняется много коротких сегментов (например, аббревиатур), установите низкие значения фильтра.

Пример:

Строка \"Hello, World!" 1 2 3\" содержит 19 символов и 10 букв.

Длина пары предложений

Этот фильтр удаляет все сегменты, которые длиннее порогового значения, установленного пользователями.

Общее количество символов включает все символы — буквы, пробелы и знаки препинания — как из оригинала, так и из перевода предложений. Учитывайте тип языка (например, китайский и английский); если оригинал не является CJK-подобным, а перевод — CJK (или наоборот), этот фильтр будет проигнорирован.

Соотношение длины

Этот фильтр определяет сегменты, длина которых значительно выше при сравнении оригинала сегмента и перевода сегмента. Длина некоторых переводов увеличивается или уменьшается при переводе с оригинала на перевод языка. Слишком длинные или слишком короткие переводы могут указывать на низкое качество сегментов.

Если оригинал не является CJK-подобным, а перевод — (или наоборот), этот фильтр будет проигнорирован.CJK

Некоторые языки более многословны, чем другие, поэтому 200% — это хороший вариант по умолчанию. Если перевод похож на оригинал или требуется отфильтровать больше данных, значение может быть ниже.

Примеры:

Один язык — CJK, соотношение равно 1. Он не будет отброшен:

{"source": "This is a sentence.", "target": "这是一个句子。", "ratio": 1}

Немецкий перевод сопоставим по длине с английским оригиналом и не будет отброшен:

{"source": "This is a sentence.", "target": "Dies ist ein Satz.", "ratio": 1.1}

Немецкий перевод намного длиннее английского оригинала и будет отброшен:

{"source": "This is a sentence.", "target": "Dies ist ein Satz mit zusätzlichen unnötigen Füllungen.", "ratio": 3.1}

Непереводимые элементы

Непереводимые — это сегменты, в которых оригинал и перевод совпадают. Исключает все пары предложений, которые являются непереводимыми, где текст перевода остается таким же, как текст оригинала.

Дубликаты

Создаются группы сегментов, имеющие одинаковый оригинал предложения. Из каждой группы сохраняется только лучший сегмент, поэтому если оригинал сегмента уникален, он сохраняется автоматически. В противном случае сохраняется сегмент с наивысшей оценкой сходства.

Почти дубликаты

При проверке на наличие почти дубликатов оригинал предложения (в слегка очищенном виде) нормализуется; все небуквенные символы (некоторые примеры: “,?)!-) заменяются на каталог, а все буквы приводятся к нижнему регистру.

С использованием нормализованного оригинала предложения создаются группы сегментов, имеющие одинаковый нормализованный оригинал предложения. Из каждой группы сохраняется только лучший сегмент, поэтому если нормализованный оригинал сегмента уникален, он сохраняется автоматически. В противном случае сохраняется сегмент с наивысшей оценкой сходства.

Идентификация языка

Для определения языка оригинала и перевода на основе предложений используется система искусственного интеллекта (ИИ). Сегмент удаляется только в том случае, если система распознает язык (оригинала/перевода) (например, коротких предложений часто недостаточно для того, чтобы система определила язык) и этот язык отличается от ожидаемого.

ОЦЕНКА КАЧЕСТВА (QPS)

Фильтр Оценка качества (QPS) позволяет удалить пары предложений с самым низким качеством из памяти переводов, чтобы гарантировать высочайшее качество полученных сегментов.

Фильтр Оценка качества (QPS) можно настроить двумя способами:

  1. Удаление указанного процента пар предложений с самыми низкими оценками Оценка качества (QPS). Рекомендуемое значение — 10%.

  2. Выбор порогового значения оценки. Использовать расширенные настройки, чтобы удалить пары предложений, которые не достигают настраиваемого порога Оценка качества (QPS). Рекомендуемая начальная точка — 50.

Эти две опции обеспечивают автоматизированную обработку памяти переводов (TM) для соответствия целям пользователей в отношении качества.

Использование очищенных память переводов (TM) в TMS

Процесс очистки памяти переводов (TM), который может занять несколько часов, должен Завершить перед тем, как можно будет использовать очищенную память переводов (TM).

Чтобы использовать очищенную память переводов (TM) в TMS, выполните следующие действия:

  1. Нажмите Open More Menu и выбрать скачивание Download.

    Откроется окно Скачать.

  2. выбрать Скачать (.tmx).

Это запустит процесс экспортировать набора данных, который займет всего несколько минут. Полученная очищенная память переводов (TM) в формате .TMX может быть затем загружена в TMS как новая очищенная память переводов (TM) размером до 1 Гб.

Если для одной и той же памяти переводов (TM) было выполнено два или более процессов очистки, доступ к различным версиям можно получить на вкладке История очистки.

Была ли эта статья полезной?

Sorry about that! In what way was it not helpful?

The article didn’t address my problem.
I couldn’t understand the article.
The feature doesn’t do what I need.
Other reason.

Note that feedback is provided anonymously so we aren't able to reply to questions.
If you'd like to ask a question, submit a request to our Support team.
Thank you for your feedback.