Рекомендации по выбору памяти переводов
Phrase Custom AI использует память переводов для создания пользовательских моделей машинного перевода (МТ), которые придерживаются определенной терминологии и стиля, что приводит к улучшению качества перевода (и, следовательно, сокращению времени на постредактирование) для этих типов контента по сравнению с общим машинным переводом.
Наиболее важным фактором, который может повлиять на эффективность процесса настройки, является используемая память переводов. Это общие рекомендации, которые могут помочь определить, какие данные использовать для этой цели:
-
Одна отрасль:
Лучше всего, если набор данных сосредоточен на контенте, охватывающем единый стиль и терминологию. Если набор данных содержит смесь отраслей (например, юридические термины веб-сайта и описания продуктов), модель может не научиться тому, какой стиль является желаемым.
-
Уникальный тип контента:
Пользовательский машинный перевод (МТ) строится на основе общих моделей, обученных на огромных объемах общедоступных данных, собранных из интернета. Если память переводов содержит данные, которые весьма схожи с общими данными, используемыми для создания общих моделей, процесс настройки не принесет значительной пользы.
-
Качество данных:
Модель будет исходить из того, что каждая пара предложений в памяти переводов является примером результата, который она должна выдавать. Память переводов должна быть качественной, в идеале созданной на основе профессиональных переводов, выполненных человеком. Конвейер очистки данных может помочь отфильтровать наиболее вредные части набора данных.
-
Ожидаемый объем:
Чтобы настройка была эффективной с точки зрения окупаемости инвестиций (RoI), набор данных должен быть репрезентативным для основной массы контента, где качество машинного перевода (МТ) будет иметь наибольшее значение. Например, если часть результата машинного перевода (МТ) будет подвергаться постредактированию переводчиками, для максимизации окупаемости инвестиций (RoI) данные должны быть репрезентативными для контента, который будет подвергаться постредактированию.
Создание набора данных для автоматизированного курирования активов имеет немного другой процесс.
Чтобы создать набор данных для обучения пользовательской системы машинного перевода (МТ), выполните следующие действия:
-
На странице нажмите Создать пользовательскую систему машинного перевода (МТ).
Откроется страница .
-
Укажите имя для набора данных.
-
Селекторы языка позволяют выбрать различные параметры:
-
Чтобы создать набор данных общего языка, выберите одинаковые оригинал и перевод в селекторах оригинала и перевода языка и языкового стандарта.
-
Чтобы создать набор данных для конкретного языкового стандарта, выберите оригинал и перевод из первого раскрывающегося списка, затем укажите оригинал и перевод языкового стандарта из второго раскрывающегося списка.
Также можно добавить несколько языковых стандартов перевода (т. е. различные варианты одного и того же языка) для использования дополнительных источников данных.
-
Чтобы создать набор данных с несколькими оригиналами и переводами языковых стандартов, выберите оригинал и перевод из первого раскрывающегося списка, укажите оригинал и перевод языкового стандарта из второго раскрывающегося списка (можно добавить различные варианты одного и того же языка перевода) и нажмите + Добавить языковые стандарты.
Появится окно .
-
-
Нажмите Добавить память переводов (TM).
Откроется страница с функцией поиска
.
-
Чтобы добавить память переводов (TM) в набор данных, нажмите значок
. Память переводов (TM) будет добавлена в столбец .
Можно добавить несколько единиц памяти переводов (TM), максимум до 200 единиц и до 8 миллионов сегментов. Набор данных в идеале должен содержать не менее 10 000 сегментов.
При нажатии на название памяти переводов (TM) выбор отобразится на странице памяти переводов.
Нажмите значок
, чтобы удалить память переводов (TM) из столбца .
-
Нажмите «Сохранить».
Откроется страница .
-
Проверьте представленные сведения и, если они верны, нажмите Продолжить.
Откроется страница .
-
Примените необходимые фильтры и нажмите Создать.
Набор данных создается и добавляется в список на странице с начальным статусом и статусом в столбце .