训练机器翻译引擎的关键不仅在于数据量,更在于数据质量。数据清理是一个普遍存在的问题,且手动清理非常费力。干净的数据能加快训练速度,并提升模型质量。
Phrase Custom AI 利用 AI 驱动和基于规则的清洗过滤器,将翻译记忆库转换为数据集。提供的默认设置应适用于新用户。
可用的过滤器集包括基于规则的过滤器和基于机器学习的过滤器:
-
基于规则
以人类易于理解的明确定义规则运行的过滤器。此过滤器类别包括 、、、、、、。
-
基于机器学习
通过分析文本本身的内容来做出决定,而不是仅仅遵循一组固定规则的过滤器。此过滤器类别包括 和 。
所有过滤器均在已清理的片段版本上进行评估;除其他事项外,多个空格会被缩减为一个,Phrase 标签 会被移除。
日期范围
排除设定日期之外的片段。结束日期和开始日期,以及片段的最后修改日期,均包含在内。
源语言与目标语言不匹配
此过滤器确定片段在含义和语义相似度方面的匹配程度,并移除评分最低的片段。句对对齐使用 LASER 指标进行衡量。
AI引擎用于检查源文本和目标文本的含义是否相同,或其含义的重合程度。推荐设置会丢弃最差的10%的片段,同时保留最好的90%的片段。
高级设置允许更改对齐方式,或者可以作为基于原始相似度得分的过滤器,使用0到1之间的数字(1表示完全对齐)。如果使用原始相似度得分,请务必谨慎,因为每种语言对的得分分布都不同,对于一种语言对来说是好的得分,对于另一种语言对来说可能是不理想的得分。
通常,低于0.5的片段质量不高,而接近或超过1的片段在两种语言中是相同的。
示例:
{\"source\":\"Super.\", \"target\":\"Super.\", \"similarity\":1.05}
{\"source\":\"Hello\", \"target\": \"http://wwww.sdsadsa.com\", \"similarity\":0.3}
最小字符数和字母数
字符数包含所有字符。这包括所有字母、空格、标点以及其他符号。出于训练目的,丢弃不包含任何字母的片段可能很有用。
字母数仅计算字母,例如英文字母表中的字母,但也包括带有变音符号的更复杂字符或中文字符。一个中文字符被计为一个字母,即使它代表多个字符。对于基于字符的语言,默认值为1;但对于基于单词的语言,默认值为4(字符)和3(字母)。最小值为1,最大值为500。
如果数据中包含大量短片段(例如缩写词),请将过滤器的阈值设置得较低。
示例:
句对长度
此过滤器会移除所有长度超过用户所设阈值的句段。使用此过滤器的原因是,大多数NMT系统实际上不会针对超过其内部阈值的句段进行训练。
例如,NextMT的内部阈值为200个标记,约等于100到1,000个单词。若要针对较短的句子训练自定义引擎,请将此值设置得低于默认值。
总字符数包含所有字符——即源句和目标句中的字母、空格和标点符号。请考虑语言类型(例如中文和英文);如果源语言不是CJK类语言而目标语言是CJK(反之亦然),则此过滤器将被忽略。
长度比率
此过滤器用于识别源句段与目标句段相比长度明显过大的句段。从源语言翻译为目标语言时,某些译文的长度会增加或减少。过长或过短的译文可能表明训练数据质量较低。
如果源语言不是CJK类语言而目标语言是(反之亦然),则此过滤器将被忽略。CJK
有些语言比其他语言更冗长,因此200%是一个不错的默认值。如果目标语言与源语言相似,或者需要过滤掉更多数据,则该值可以设置得更低。
示例:
一种语言是CJK:比率为1。它不会被丢弃:
{\"source\":\"This is a sentence.\", \"target\": \"这是一个句子。\", \"ratio\":1}
德语翻译的长度与英语源文本相当,不会被丢弃:
{\"source\":\"This is a sentence.\", \"target\":\"Dies ist ein Satz.\", \"ratio\":1.1}
德语翻译比英语源文本长得多,将被丢弃:
{\"source\":\"This is a sentence.\", \"target\":\"Dies ist ein Satz mit zusätzlichen unnötigen Füllungen.\", \"ratio\":3.1}
不可翻译内容
不可翻译内容是指源片段和目标片段相同的片段。排除所有目标文本与源文本保持不变的不可翻译句子对。
重复项
创建具有相同源句子的片段组。从每组中仅保留最佳片段,因此如果一个片段的源句子是唯一的,它会被自动保留。否则,保留相似度得分最高的片段。
近似重复项
在测试近似重复项时,源句子(略微清理后的版本)会被标准化;所有非字母字符(例如:“,?)!-)都会被替换为空格,并且所有字母都会转换为小写。
使用归一化后的源句子,创建具有相同归一化源句子的片段组。从每个组中,仅保留最佳片段,因此片段的归一化源句子是唯一的,并会被自动保留。否则,保留相似度得分最高的片段。
语言识别
使用 AI 引擎根据句子识别源语言和目标语言。仅当引擎识别出(源/目标)语言(例如,较短的句子通常不足以让引擎确定语言)且该语言与预期不同时,才会删除片段。
QPS
QPS 过滤器会删除数据集中质量最低的句子对,以确保生成的 AI 模型是在可用的最高质量数据上进行训练的。通常,训练数据的质量越高,定制模型的表现就越好。
QPS 过滤器可以通过两种方式进行配置:
-
删除指定百分比的QPS分数最低的句子对。建议比例为 10%。
-
选择分数阈值。使用高级设置来剔除低于可调 QPS 阈值的句子对。建议的起始值为 50。
这两个选项提供了自动化的数据集整理功能,以符合用户的质量目标。