翻译记忆库选择指南
Phrase Custom AI 利用翻译记忆库 (TM) 来创建符合特定术语和风格的自定义机器翻译 (MT) 模型,与通用机器翻译相比,这些内容类型在翻译质量上会有所提高(从而减少译后编辑时间)。
影响定制过程有效性的最重要因素是所使用的翻译记忆库。以下是可帮助确定用于此目的的数据的一般指南:
-
单一领域:
如果数据集专注于涵盖单一风格和术语的内容,效果最佳。如果数据集包含混合领域(例如,既有网站的法律条款,又有产品描述),模型可能无法学习到所需的风格。
-
独特内容类型:
自定义机器翻译模型是在基于从互联网收集的大量公共数据训练的通用模型基础上构建的。如果翻译记忆库包含的数据与用于构建通用模型的通用数据非常相似,那么定制过程将不会有太大收获。
-
数据质量:
模型将假定翻译记忆库中的每一对句子都是其预期输出的示例。翻译记忆库必须具有良好的质量,最好是由专业的人工翻译创建的。数据清洗流程有助于过滤掉数据集中最有害的部分。
-
预期容量:
为了使定制在投资回报率方面产生影响,数据集需要能够代表机器翻译质量影响最大的大部分数据。例如,如果部分机器翻译输出需要由人工译员进行译后编辑,为了最大化投资回报率,数据需要能够代表将要进行译后编辑的内容。
为 自动化资产策划 创建数据集的过程略有不同。
要为训练自定义机器翻译引擎创建数据集,请遵循以下步骤:
-
在页面中,点击训练自定义机器翻译引擎。
页面随即打开。
-
为数据集提供一个名称。
-
语言选择器允许进行各种选项设置:
-
要创建通用语言数据集,请在源语言和目标语言及区域设置选择器中选择相同的源语言和目标语言。
-
要创建特定于区域设置的数据集,请从第一个下拉列表中选择源语言和目标语言,然后从第二个下拉列表中指定源区域设置和目标区域设置。
也可以添加多个目标区域设置(即同一语言的不同变体)以利用更多数据源。
-
要创建包含多个源区域设置和目标区域设置的数据集,请从第一个下拉列表中选择源语言和目标语言,从第二个下拉列表中指定源区域设置和目标区域设置(可以添加同一目标语言的不同变体),然后点击+ 添加更多区域设置对。
窗口随即出现。
-
-
点击添加翻译记忆库。
页面打开,其中包含搜索功能
。
-
要将翻译记忆库添加到数据集,请点击
图标。该翻译记忆库已添加到列中。
最多可添加200个翻译记忆库,且最多包含800万个句段。数据集理想情况下应至少包含 10,000 个句段。
点击翻译记忆库名称将在翻译记忆库页面上显示所选项。
点击
图标,将翻译记忆库从列中移除。
-
点击保存。
页面随即打开。
-
查看所显示的详细信息,如果正确,请点击继续。
页面随即打开。
-
应用所需的筛选器并点击创建。
数据集已创建并添加到页面上的列表中,其初始状态为,且列中的状态为。