Custom AI

Создать набор данных

Контент автоматически переведен с английского языка с помощью Phrase Language AI.

Рекомендации по выбору памяти переводов

Phrase Custom AI использует память переводов для создания пользовательских моделей машинного перевода (МТ), которые придерживаются определенной терминологии и стиля, что приводит к улучшению качества перевода (и, следовательно, сокращению времени на постредактирование) для этих типов контента по сравнению с общим машинным переводом.

Наиболее важным фактором, который может повлиять на эффективность процесса настройки, является используемая память переводов. Это общие рекомендации, которые могут помочь определить, какие данные использовать для этой цели:

  • Одна отрасль:

    Лучше всего, если набор данных сосредоточен на контенте, охватывающем единый стиль и терминологию. Если набор данных содержит смесь отраслей (например, юридические термины веб-сайта и описания продуктов), модель может не научиться тому, какой стиль является желаемым.

  • Уникальный тип контента:

    Пользовательский машинный перевод (МТ) строится на основе общих моделей, обученных на огромных объемах общедоступных данных, собранных из интернета. Если память переводов содержит данные, которые весьма схожи с общими данными, используемыми для создания общих моделей, процесс настройки не принесет значительной пользы.

  • Качество данных:

    Модель будет исходить из того, что каждая пара предложений в памяти переводов является примером результата, который она должна выдавать. Память переводов должна быть качественной, в идеале созданной на основе профессиональных переводов, выполненных человеком. Конвейер очистки данных может помочь отфильтровать наиболее вредные части набора данных.

  • Ожидаемый объем:

    Чтобы настройка была эффективной с точки зрения окупаемости инвестиций (RoI), набор данных должен быть репрезентативным для основной массы контента, где качество машинного перевода (МТ) будет иметь наибольшее значение. Например, если часть результата машинного перевода (МТ) будет подвергаться постредактированию переводчиками, для максимизации окупаемости инвестиций (RoI) данные должны быть репрезентативными для контента, который будет подвергаться постредактированию.

Создание набора данных для автоматизированного курирования активов имеет немного другой процесс.

Чтобы создать набор данных для обучения пользовательской системы машинного перевода (МТ), выполните следующие действия:

  1. На странице Наборы данных нажмите Создать пользовательскую систему машинного перевода (МТ).

    Откроется страница Сведения о наборе данных.

  2. Укажите имя для набора данных.

  3. Селекторы языка позволяют выбрать различные параметры:

    1. Чтобы создать набор данных общего языка, выберите одинаковые оригинал и перевод в селекторах оригинала и перевода языка и языкового стандарта.

    2. Чтобы создать набор данных для конкретного языкового стандарта, выберите оригинал и перевод из первого раскрывающегося списка, затем укажите оригинал и перевод языкового стандарта из второго раскрывающегося списка.

      Также можно добавить несколько языковых стандартов перевода (т. е. различные варианты одного и того же языка) для использования дополнительных источников данных.

    3. Чтобы создать набор данных с несколькими оригиналами и переводами языковых стандартов, выберите оригинал и перевод из первого раскрывающегося списка, укажите оригинал и перевод языкового стандарта из второго раскрывающегося списка (можно добавить различные варианты одного и того же языка перевода) и нажмите + Добавить языковые стандарты.

    Появится окно Входные данные.

  4. Нажмите Добавить память переводов (TM).

    Откроется страница Выбрать память переводов (TM) с функцией поиска Search.

  5. Чтобы добавить память переводов (TM) в набор данных, нажмите значок Add TM. Память переводов (TM) будет добавлена в столбец Выбранные.

    Можно добавить несколько единиц памяти переводов (TM), максимум до 200 единиц и до 8 миллионов сегментов. Набор данных в идеале должен содержать не менее 10 000 сегментов.

    При нажатии на название памяти переводов (TM) выбор отобразится на странице памяти переводов.

    Нажмите значок Remove TM, чтобы удалить память переводов (TM) из столбца Выбранные.

  6. Нажмите «Сохранить».

    Откроется страница Сведения о наборе данных.

  7. Проверьте представленные сведения и, если они верны, нажмите Продолжить.

    Откроется страница Фильтры очистки.

  8. Примените необходимые фильтры и нажмите Создать.

    Набор данных создается и добавляется в список на странице Datasets с начальным статусом Cleaning и статусом Training MT в столбце Created for.

Была ли эта статья полезной?

Sorry about that! In what way was it not helpful?

The article didn’t address my problem.
I couldn’t understand the article.
The feature doesn’t do what I need.
Other reason.

Note that feedback is provided anonymously so we aren't able to reply to questions.
If you'd like to ask a question, submit a request to our Support team.
Thank you for your feedback.