Custom AI

创建数据集

文本由 Phrase Language AI 从英语机器翻译而得。

翻译记忆库选择指南

Phrase Custom AI 利用翻译记忆库 (TMs) 来创建自定义机器翻译 (MT) 模型,这些模型遵循特定的术语和风格,与通用机器翻译相比,这些内容类型的翻译质量得到了提高(从而减少了译后编辑时间)。

影响自定义过程有效性的最重要因素是所使用的翻译记忆库。这些是一般性指南,可以帮助确定用于此目的的数据:

  • 单一领域:

    如果数据集专注于涵盖单一风格和术语的内容,效果最好。如果数据集包含混合领域(例如,网站的法律条款和产品描述),模型可能无法学习到所需的风格是什么。

  • 唯一内容类型:

    自定义机器翻译引擎建立在基于从互联网收集的大量公共数据训练的通用模型之上。如果翻译记忆库包含的数据与用于构建通用模型的通用数据非常相似,那么自定义过程将不会有太大收获。

  • 数据质量:

    模型将假设翻译记忆库中的每一对句子都是它预期产生的输出示例。翻译记忆库必须具有高质量,理想情况下应由专业的人工翻译创建。数据清洗流程可以帮助筛选出数据集中最有害的部分。

  • 预期容量:

    为了使自定义在投资回报率方面产生影响,数据集需要代表机器翻译质量将产生更大影响的大部分数据。例如,如果部分机器翻译输出将由人工译员进行译后编辑,为了最大化投资回报率,数据需要代表将要进行译后编辑的内容。

自动化资产管理 创建数据集的过程略有不同。

要创建用于训练自定义机器翻译引擎的数据集,请遵循以下步骤:

  1. 数据集 页面,点击 训练自定义机器翻译引擎

    数据集详情 页面打开。

  2. 为数据集提供一个名称。

  3. 语言选择器允许进行各种选项设置:

    1. 要创建通用语言数据集,请在原文/源语和译文语言及区域选择器中选择相同的原文/源语和译文语言。

    2. 要创建特定区域的数据集,请从第一个下拉列表中选择原文/源语和译文语言,然后从第二个下拉列表中指定原文/源语和译文区域。

      也可以添加多个译文区域(即同一语言的不同变体)以利用更多数据源。

    3. 要创建具有多个原文/源语和译文区域的数据集,请从第一个下拉列表中选择原文/源语和译文语言,从第二个下拉列表中指定原文/源语和译文区域(可以添加同一译文语言的不同变体),然后点击 + 添加更多区域对

    输入数据 窗口出现。

  4. 点击 添加翻译记忆库

    选择翻译记忆库 页面打开,并带有搜索功能 Search

  5. 要将翻译记忆库添加到数据集,请点击 Add TM 图标。翻译记忆库已添加到 已选择 列。

    最多可添加 200 个翻译记忆库,且最多包含 800 万个片段。数据集理想情况下应至少包含 10,000 个片段。

    点击翻译记忆库名称将在 翻译记忆库页面 上显示该选择。

    点击 Remove TM 图标以从 已选择 列中移除翻译记忆库。

  6. 点击保存

    数据集详情 页面打开。

  7. 查看所呈现的详细信息,如果正确,请点击 继续

    清理过滤器 页面打开。

  8. 应用所需的过滤器并点击 创建

    数据集已创建并添加到 Datasets 页面上的列表,其初始状态为 CleaningCreated for 列中的状态为 Training MT

这篇文章有帮助吗?

Sorry about that! In what way was it not helpful?

The article didn’t address my problem.
I couldn’t understand the article.
The feature doesn’t do what I need.
Other reason.

Note that feedback is provided anonymously so we aren't able to reply to questions.
If you'd like to ask a question, submit a request to our Support team.
Thank you for your feedback.