Самым важным аспектом обучения движков МТ является не только объем, но и качество данных. Очистка данных — это повсеместная проблема, а ручная очистка трудоемка. Чистые данные ведут к более быстрому обучению и более качественным моделям.
Пользовательский искусственный интеллект (ИИ) Phrase адаптирует память переводов в наборы данных с помощью Справки фильтров очистки на основе искусственного интеллекта (ИИ) и правил. Предоставленные настройки по умолчанию должны подойти новым пользователям.
Набор доступных фильтров включает как фильтры на основе правил, так и фильтры на основе машинного обучения:
-
На основе правил
Фильтры, которые работают с четко определенными правилами, легко понятными для людей. Эта категория фильтров включает , , , , , , .
-
На основе машинного обучения
Фильтры, которые анализируют контент самого текста для принятия решения, а не просто следуют фиксированному набору правил. Эта категория фильтров включает и .
Все фильтры выполняют оценку на очищенных версиях сегментов; помимо прочего, множественные пробелы сокращаются до одного, а теги Phrase удаляются.
Диапазон дат
Исключает сегменты вне заданных дат. Дата начала и окончания включены, наряду с датой последнего изменения сегмента.
Несоответствие оригинала и перевода
Этот фильтр определяет, насколько хорошо сегменты соответствуют друг другу по значению и семантическому сходству, удаляя сегменты с наихудшей оценкой. Выравнивание пары предложений измеряется с использованием метрики LASER.
Система искусственного интеллекта (ИИ) используется для проверки того, означают ли оригинал и перевод одно и то же или насколько они совпадают. Рекомендуемая настройка позволяет Сбросить 10% худших сегментов, сохраняя при этом 90% лучших сегментов.
Дополнительные настройки позволяют изменять выравнивание или могут служить фильтром на основе необработанной оценки сходства с использованием числа от 0 до 1 (1 означает полное выравнивание). Рекомендуется соблюдать осторожность при использовании необработанной оценки сходства, так как каждая языковая пара имеет разное распределение оценок, и то, что считается хорошей оценкой для одной языковой пары, может быть неудовлетворительной оценкой для другой.
Как правило, сегменты ниже 0,5 не очень хороши, а сегменты, близкие к 1 или превышающие его, — это сегменты, которые одинаковы на обоих языках.
Примеры:
{\"source\": \"Super.\", \"target\": \"Super.\", \"similarity\": 1.05}
{\"source\": \"Hello\", \"target\": \"http://wwww.sdsadsa.com\", \"similarity\": 0.3}
Минимальное количество символов и букв
Количество символов включает все символы. Это включает все буквы, пробелы, знаки препинания и символы. Для целей обучения может быть полезно Сбросить сегменты, которые не содержат никаких букв.
Количество букв учитывает только буквы, такие как в английском алфавите, а также более сложные символы с диакритическими знаками или китайские символы. Один китайский символ считается как одна буква, даже если он представляет более одного символа. Для языков, основанных на символах, значения по умолчанию равны 1, но для языков, основанных на словах, значения по умолчанию равны 4 (символа) и 3 (буквы). Минимальное значение — 1, а максимальное значение — 500.
Если в данных сохраняется много коротких сегментов (например, аббревиатур), держите значения фильтра низкими.
Пример:
Длина пары предложений
Этот фильтр удаляет все сегменты, которые длиннее порогового значения, установленного пользователями. Причина использования этого фильтра заключается в том, что большинство систем NMT на самом деле не обучаются на сегментах, которые длиннее их внутреннего порога.
Например, внутренний порог NextMT составляет 200 токенов, что равно примерно 100 - 1 000 слов. Чтобы обучить Пользовательский система на более коротких предложениях, установите это значение ниже значения по умолчанию.
Общее количество символ включает все символ — буквы, пробелы и знаки препинания — как из оригинал, так и из перевод предложений. Примите во внимание тип язык (например, китайский и английский); если оригинал язык не является CJK-подобным, а перевод язык является CJK (или наоборот), этот фильтр будет проигнорирован.
Соотношение длины
Этот фильтр определяет сегменты, где длина значительно выше при сравнении оригинал сегмент и перевод сегмент. Некоторые переводы увеличиваются или уменьшаются в длине при переводе с оригинал на перевод язык. Слишком длинные или слишком короткие переводы могут указывать на низкое качество обучающих данных.
Если оригинал язык не является CJK-подобным, а перевод язык является (или наоборот), этот фильтр будет проигнорирован.CJK
Некоторые языки более многословны, чем другие, поэтому 200% — это хорошее значение по умолчанию. Если перевод язык похож на оригинал язык, или требуется отфильтровать больше данных, значение может быть ниже.
Примеры:
Один язык — CJK, соотношение равно 1. Он не будет отброшен:
{"оригинал": "This is a sentence.", "перевод": "这是一个句子。", "соотношение": 1}
Немецкий перевод сопоставим по длине с английским оригинал и не будет отброшен:
{"оригинал": "This is a sentence.", "перевод": "Dies ist ein Satz.", "соотношение": 1.1}
Немецкий перевод намного длиннее английского оригинал и будет отброшен:
{"оригинал": "This is a sentence.", "перевод": "Dies ist ein Satz mit zusätzlichen unnötigen Füllungen.", "ratio": 3.1}
Непереводимые элементы
Непереводимые элементы — это сегменты, в которых оригинал и перевод совпадают. Исключает все пары предложений, являющиеся непереводимыми элементами, где текст перевода остается неизменным по сравнению с оригиналом.
Дубликаты
Создаются группы сегментов, имеющие одинаковый оригинал. Из каждой группы сохраняется только лучший сегмент, поэтому если оригинал сегмента уникален, он сохраняется автоматически. В противном случае сохраняется сегмент с наивысшей оценкой сходства.
Почти дубликаты
При проверке на наличие почти дубликатов (слегка очищенная версия) оригинала нормализуется; все небуквенные символы (некоторые примеры: “,?)!-) заменяются на каталог, а все буквы приводятся к нижнему регистру.
Используя нормализованный оригинал, создаются группы сегментов, имеющие одинаковый нормализованный оригинал. Из каждой группы сохраняется только лучший сегмент, поэтому нормализованный оригинал сегмента является уникальным и сохраняется автоматически. В противном случае сохраняется сегмент с наивысшей оценкой сходства.
Идентификация языка
Для идентификации оригинала и языка перевода на основе предложений используется система искусственного интеллекта (ИИ). Сегмент удаляется только в том случае, если система распознает язык (оригинал/перевод) (например, коротких предложений часто недостаточно для того, чтобы система определила язык) и этот язык отличается от ожидаемого.
ОЦЕНКА КАЧЕСТВА (QPS)
Фильтр Оценка качества (QPS)<1> фильтровать удаляет пары предложений с самым низким качеством из набора данных, чтобы гарантировать, что результирующие модели искусственного интеллекта (ИИ) обучаются на данных самого высокого качества. Как правило, чем выше качество обучающих данных, тем лучше работает настроенная модель.
Фильтр Оценка качества (QPS) можно настроить двумя способами:
-
Удаление указанного процента пар предложений с самыми низкими оценками Оценка качества (QPS). Рекомендация составляет 10%.
-
Выбор порога оценки. Используйте расширенные настройки, чтобы исключить пары предложений, которые не достигают настраиваемого порога Оценка качества (QPS). Рекомендуемая начальная точка — 50.
Эти два варианта обеспечивают автоматизированную обработку набора данных в соответствии с целями пользователей в отношении качества.