Custom AI

清理过滤器

文本由 Phrase Language AI 从英语机器翻译而得。

训练机器翻译引擎的关键不仅在于数据量,更在于数据质量。数据清理是一个普遍存在的问题,且手动清理非常费力。干净的数据能加快训练速度,并提升模型质量。

Phrase Custom AI 利用 AI 驱动和基于规则的清洗过滤器,将翻译记忆库转换为数据集。提供的默认设置应适用于新用户。

可用的过滤器集包括基于规则的过滤器和基于机器学习的过滤器:

  • 基于规则

    以人类易于理解的明确定义规则运行的过滤器。此过滤器类别包括 日期范围、最小字符数、句对长度、长度比、不可译内容、重复项、近似重复项。

  • 基于机器学习

    通过分析文本本身的内容来做出决定,而不是仅仅遵循一组固定规则的过滤器。此过滤器类别包括 源语言与目标语言不匹配 和 语言识别。

所有过滤器均在已清理的片段版本上进行评估;除其他事项外,多个空格会被缩减为一个,Phrase 标签 会被移除。

日期范围

排除设定日期之外的片段。结束日期和开始日期,以及片段的最后修改日期,均包含在内。

源语言与目标语言不匹配

此过滤器确定片段在含义和语义相似度方面的匹配程度,并移除评分最低的片段。句对对齐使用 LASER 指标进行衡量。

AI引擎用于检查源文本和目标文本的含义是否相同,或其含义的重合程度。推荐设置会丢弃最差的10%的片段,同时保留最好的90%的片段。

高级设置允许更改对齐方式,或者可以作为基于原始相似度得分的过滤器,使用0到1之间的数字(1表示完全对齐)。如果使用原始相似度得分,请务必谨慎,因为每种语言对的得分分布都不同,对于一种语言对来说是好的得分,对于另一种语言对来说可能是不理想的得分。

通常,低于0.5的片段质量不高,而接近或超过1的片段在两种语言中是相同的。

示例:

{\"source\":\"Super.\", \"target\":\"Super.\", \"similarity\":1.05}

{\"source\":\"Hello\", \"target\": \"http://wwww.sdsadsa.com\", \"similarity\":0.3}

最小字符数和字母数

字符数包含所有字符。这包括所有字母、空格、标点以及其他符号。出于训练目的,丢弃不包含任何字母的片段可能很有用。

字母数仅计算字母,例如英文字母表中的字母,但也包括带有变音符号的更复杂字符或中文字符。一个中文字符被计为一个字母,即使它代表多个字符。对于基于字符的语言,默认值为1;但对于基于单词的语言,默认值为4(字符)和3(字母)。最小值为1,最大值为500。

如果数据中包含大量短片段(例如缩写词),请将过滤器的阈值设置得较低。

示例:

字符串 \"Hello, World!"1 2 3\" 包含19个字符和10个字母。

句对长度

此过滤器会移除所有长度超过用户所设阈值的句段。使用此过滤器的原因是,大多数NMT系统实际上不会针对超过其内部阈值的句段进行训练。 

例如,NextMT的内部阈值为200个标记,约等于100到1,000个单词。若要针对较短的句子训练自定义引擎,请将此值设置得低于默认值。

总字符数包含所有字符——即源句和目标句中的字母、空格和标点符号。请考虑语言类型(例如中文和英文);如果源语言不是CJK类语言而目标语言是CJK(反之亦然),则此过滤器将被忽略。

长度比率

此过滤器用于识别源句段与目标句段相比长度明显过大的句段。从源语言翻译为目标语言时,某些译文的长度会增加或减少。过长或过短的译文可能表明训练数据质量较低。

如果源语言不是CJK类语言而目标语言是(反之亦然),则此过滤器将被忽略。CJK

有些语言比其他语言更冗长,因此200%是一个不错的默认值。如果目标语言与源语言相似,或者需要过滤掉更多数据,则该值可以设置得更低。

示例:

一种语言是CJK:比率为1。它不会被丢弃:

{\"source\":\"This is a sentence.\", \"target\": \"这是一个句子。\", \"ratio\":1}

德语翻译的长度与英语源文本相当,不会被丢弃:

{\"source\":\"This is a sentence.\", \"target\":\"Dies ist ein Satz.\", \"ratio\":1.1}

德语翻译比英语源文本长得多,将被丢弃:

{\"source\":\"This is a sentence.\", \"target\":\"Dies ist ein Satz mit zusätzlichen unnötigen Füllungen.\", \"ratio\":3.1}

不可翻译内容

不可翻译内容是指源片段和目标片段相同的片段。排除所有目标文本与源文本保持不变的不可翻译句子对。

重复项

创建具有相同源句子的片段组。从每组中仅保留最佳片段,因此如果一个片段的源句子是唯一的,它会被自动保留。否则,保留相似度得分最高的片段。

近似重复项

在测试近似重复项时,源句子(略微清理后的版本)会被标准化;所有非字母字符(例如:“,?)!-)都会被替换为空格,并且所有字母都会转换为小写。

使用归一化后的源句子,创建具有相同归一化源句子的片段组。从每个组中,仅保留最佳片段,因此片段的归一化源句子是唯一的,并会被自动保留。否则,保留相似度得分最高的片段。

语言识别

使用 AI 引擎根据句子识别源语言和目标语言。仅当引擎识别出(源/目标)语言(例如,较短的句子通常不足以让引擎确定语言)且该语言与预期不同时,才会删除片段。

QPS

QPS 过滤器会删除数据集中质量最低的句子对,以确保生成的 AI 模型是在可用的最高质量数据上进行训练的。通常,训练数据的质量越高,定制模型的表现就越好。

QPS 过滤器可以通过两种方式进行配置:

  1. 删除指定百分比的QPS分数最低的句子对。建议比例为 10%。

  2. 选择分数阈值。使用高级设置来剔除低于可调 QPS 阈值的句子对。建议的起始值为 50。

这两个选项提供了自动化的数据集整理功能,以符合用户的质量目标。

这篇文章有帮助吗?
★ ★ ★ ★ ★

Sorry about that! In what way was it not helpful?

The article didn’t address my problem.
I couldn’t understand the article.
The feature doesn’t do what I need.
Other reason.

Note that feedback is provided anonymously so we aren't able to reply to questions.
If you'd like to ask a question, submit a request to our Support team.
Thank you for your feedback.