Custom AI

Создать набор данных

Контент автоматически переведен с английского языка с помощью Phrase Language AI.

Рекомендации по выбору памяти переводов

Phrase Custom AI использует базы переводов (ТМ) для создания пользовательских моделей машинного перевода (МП), которые соответствуют определённой терминологии и стилю, что приводит к повышению качества перевода (и, соответственно, сокращению времени постредактирования) для этих типов контента по сравнению с обычным машинным переводом.

Наиболее важным фактором, влияющим на эффективность процесса настройки, является использование памяти переводов. Это общие рекомендации, которые могут помочь определить, какие данные использовать для этой цели:

  • Один домен:

    Лучше всего, если набор данных сосредоточен на контенте, охватывающем единый стиль и терминологию. Если набор данных содержит смесь доменов (например, юридических терминов веб-сайта и описаний продуктов), модель может не суметь освоить требуемый стиль.

  • Уникальный тип контента:

    Пользовательская модель машинного перевода строится на основе общих моделей, обученных на огромных объемах общедоступных данных, собранных из интернета. Если память переводов содержит данные, которые весьма схожи с общими данными, используемыми для создания общих моделей, процесс настройки не принесет значительной пользы.

  • Качество данных:

    Модель будет исходить из того, что каждая пара предложений в памяти переводов является примером результата, который от нее ожидается. Память переводов должна быть качественной, в идеале созданной на основе профессиональных переводов, выполненных человеком. Процесс очистки данных может помочь отфильтровать наиболее нежелательные части набора данных.

  • Ожидаемый объем:

    Чтобы настройка была эффективной с точки зрения окупаемости инвестиций (RoI), набор данных должен быть репрезентативным для основной части данных, где качество машинного перевода будет иметь наибольшее значение. Например, если часть результатов машинного перевода будет подвергаться постредактированию переводчиками, для максимизации окупаемости инвестиций данные должны быть репрезентативными для контента, который будет подвергаться постредактированию.

Создание набора данных для автоматизированного курирования активов имеет несколько иной процесс.

Чтобы создать набор данных для обучения пользовательского движка машинного перевода, выполните следующие действия:

  1. На странице Datasets нажмите Train a custom MT engine.

    Откроется страница Dataset details.

  2. Укажите имя для набора данных.

  3. Селекторы языка предоставляют различные варианты:

    1. Чтобы создать общий языковой набор данных, выберите одинаковые исходный и целевой языки в селекторах языка и локали для исходного и целевого языков.

    2. Чтобы создать набор данных для конкретной локали, выберите исходный и целевой языки из первого раскрывающегося списка, а затем укажите исходную и целевую локали из второго раскрывающегося списка.

      Также можно добавить несколько целевых локалей (т. е. различные варианты одного и того же языка), чтобы использовать больше источников данных.

    3. Чтобы создать набор данных с несколькими исходными и целевыми локалями, выберите исходный и целевой языки из первого раскрывающегося списка, укажите исходную и целевую локали из второго раскрывающегося списка (можно добавить различные варианты одного и того же целевого языка), затем нажмите + Add more locale pairs.

    Появится окно Input data.

  4. Нажмите Add translation memories.

    Откроется страница Choose translation memories с функцией поиска Search.

  5. Чтобы добавить память переводов в набор данных, нажмите значок Add TM. Память переводов добавляется в столбец Selected.

    Можно добавить несколько баз переводов — максимум 200 баз и до 8 миллионов сегментов. В идеале набор данных должен содержать не менее 10 000 сегментов.

    При нажатии на имя памяти переводов откроется страница translation memory page, где будет отображена соответствующая информация.

    Нажмите значок Remove TM, чтобы удалить память переводов из столбца Selected.

  6. Нажмите Сохранить.

    Откроется страница Dataset details.

  7. Проверьте представленные сведения и, если они верны, нажмите Continue.

    Откроется страница Cleaning filters.

  8. Примените необходимые фильтры и нажмите Create.

    Набор данных создается и добавляется в список на странице Datasets с начальным статусом Cleaning и статусом Training MT в столбце Created for.

Была ли эта статья полезной?
★ ★ ★ ★ ★

Sorry about that! In what way was it not helpful?

The article didn’t address my problem.
I couldn’t understand the article.
The feature doesn’t do what I need.
Other reason.

Note that feedback is provided anonymously so we aren't able to reply to questions.
If you'd like to ask a question, submit a request to our Support team.
Thank you for your feedback.