Самыми важными аспектами обучения систем машинного перевода являются не только объём, но и качество данных. Очистка данных — это повсеместная проблема, а ручная очистка трудоемка. Чистые данные ведут к более быстрому обучению и более качественным моделям.
Phrase Custom AI преобразует память переводов в наборы данных с помощью фильтров очистки, основанных на ИИ и правилах. Настройки по умолчанию должны подойти новым пользователям.
Набор доступных фильтров включает как фильтры на основе правил, так и фильтры на основе машинного обучения:
-
На базе правил
Фильтры, которые работают с четко определенными правилами, легко понятными человеку. Эта категория фильтров включает , , , , , , .
-
На основе машинного обучения
Фильтры, которые анализируют содержание самого текста для принятия решения, а не просто следуют фиксированному набору правил. Эта категория фильтров включает и .
Все фильтры оценивают очищённые версии сегментов; помимо прочего, последовательности из нескольких пробелов заменяются одним, а tags удаляются.
Диапазон дат
Исключает сегменты вне заданных дат. Конечная и начальная даты включены вместе с датой последнего изменения сегмента.
Несоответствие исходника и перевода
Этот фильтр определяет, насколько хорошо сегменты соответствуют друг другу по смыслу и семантическому сходству, удаляя сегменты с наихудшей оценкой. Выравнивание пар предложений измеряется с помощью метрики LASER.
ИИ-движок используется для проверки того, означают ли исходный и целевой тексты одно и то же или насколько они близки по значению. Рекомендуемая настройка отбрасывает 10% наихудших сегментов, сохраняя 90% наилучших.
Расширенные настройки позволяют изменять выравнивание или могут служить фильтром на основе необработанной оценки сходства с использованием числа от 0 до 1 (1 означает полное выравнивание). Рекомендуется соблюдать осторожность при использовании необработанной оценки сходства, так как каждая языковая пара имеет разное распределение оценок, и то, что считается хорошей оценкой для одной языковой пары, может быть неудовлетворительной оценкой для другой.
Как правило, сегменты с показателем ниже 0,5 считаются низкокачественными, а сегменты с оценкой, близкой к 1 или выше, идентичны в обоих языках.
**Examples**
Оригинал "Super.", "target": "Super.", "similarity": ## 1.05.
Оригинал "Привет", "target": "http://wwww.sdsadsa.com", "similarity": ## 0.3.
Минимальное количество символов и букв
Количество символов включает все символы. Это включает все буквы, пробелы, знаки препинания и символы. Для целей обучения может быть полезно отбрасывать сегменты, которые не содержат никаких букв.
Количество букв учитывает только буквы, такие как в английском алфавите, а также более сложные символы с диакритическими знаками или китайские иероглифы. Один китайский иероглиф считается за одну букву, даже если он представляет собой более одного символа. Для языков, основанных на символах, значения по умолчанию равны 1, но для языков, основанных на словах, значения по умолчанию равны 4 (символа) и 3 (буквы). Минимальное значение равно 1, а максимальное значение равно 500.
Если вы сохраняете много коротких сегментов в данных (например, аббревиатуры), держите значения фильтра низкими.
Пример:
Длина пары предложений
Этот фильтр удаляет все сегменты, которые длиннее порогового значения, установленного пользователями. Причина этого фильтра заключается в том, что большинство систем NMT на самом деле не будут обучаться на сегментах, которые длиннее их внутреннего порога.
Например, внутренний порог NextMT составляет 200 токенов, что соответствует примерно 100–1000 словам. Чтобы обучить пользовательский движок на более коротких предложениях, установите это значение ниже значения по умолчанию.
Общее количество символов включает все символы — буквы, пробелы и знаки препинания — как из исходного, так и из целевого предложений. Примите во внимание тип языка (например, китайский и английский); если исходный язык не является CJK-подобным, а целевой язык — CJK (или наоборот), этот фильтр будет проигнорирован.
Соотношение длины
Этот фильтр определяет сегменты, длина которых значительно различается при сравнении исходного и целевого сегментов. Длина некоторых переводов увеличивается или уменьшается при переводе с исходного языка на целевой. Слишком длинные или слишком короткие переводы могут указывать на низкое качество обучающих данных.
Если исходный язык не является CJK-подобным, а целевой язык — CJK (или наоборот), этот фильтр будет проигнорирован.
Некоторые языки более многословны, чем другие, поэтому 200% — хорошее значение по умолчанию. Если целевой язык похож на исходный или требуется отфильтровать больше данных, значение может быть ниже.
**Examples**
Один из языков — CJK, коэффициент равен 1. Он не будет отброшен:
Оригинал \"This is a sentence.\", \"target\": \"这是一个句子。\", \"ratio\": ## 1.
Немецкий перевод сопоставим по длине с английским исходником и не будет отброшен:
Оригинал \"This is a sentence.\", \"target\": \"Dies ist ein Satz.\", \"ratio\": ## 1.1.
Немецкий перевод намного длиннее английского исходника и будет отброшен:
Оригинал \"This is a sentence.\", \"target\": \"Dies ist ein Satz mit zusätzlichen unnötigen Füllungen.\", \"ratio\": ## 3.1.
Непереводимые элементы
Непереводимые сегменты — это сегменты, в которых исходный и целевой тексты совпадают. Исключает все непереводимые пары предложений, в которых целевой текст остается таким же, как исходный.
Дубликаты
Создаются группы сегментов, имеющих одинаковое исходное предложение. Из каждой группы сохраняется только лучший сегмент, поэтому, если исходное предложение сегмента уникально, оно сохраняется автоматически. В противном случае сохраняется сегмент с наивысшим показателем сходства.
Микродубликаты
При проверке на наличие почти дубликатов (слегка очищенная версия) исходного предложения нормализуется; все небуквенные символы (некоторые примеры: “,?)!-) заменяются пробелом, а все буквы приводятся к нижнему регистру.
С использованием нормализованного исходного предложения создаются группы сегментов, имеющие одинаковое нормализованное исходное предложение. Из каждой группы сохраняется только лучший сегмент, поэтому нормализованное исходное предложение сегмента является уникальным и автоматически сохраняется. В противном случае сохраняется сегмент с наивысшим показателем сходства.
Идентификация языка
Для определения исходного и целевого языка на основе предложений используется механизм ИИ. Сегмент удаляется только в том случае, если механизм распознаёт (исходный/целевой) язык (например, часто коротких предложений недостаточно для определения языка) и обнаруженный язык отличается от ожидаемого.
QPS
Фильтр QPS удаляет пары предложений с самым низким качеством из набора данных, чтобы гарантировать, что результирующие модели ИИ обучаются на данных наивысшего доступного качества. Как правило, чем выше качество обучающих данных, тем лучше работает настроенная модель.
Фильтр QPS можно настроить двумя способами:
-
Удаление указанного процента пар предложений с самыми низкими показателями QPS. Рекомендуемое значение — 10%.
-
Выбор порогового значения показателя. Используйте расширенные настройки для исключения пар предложений, которые не достигают настраиваемого порогового значения QPS. Рекомендуемое начальное значение — 50.
Эти две опции обеспечивают автоматизированное курирование набора данных в соответствии с целями пользователя по качеству.