Custom AI

Criar um conjunto de dados

O conteúdo de toda a Central de Ajuda é traduzido automaticamente de inglês pelo Phrase Language AI.

Diretrizes de seleção de memória de tradução

O Phrase Custom IA aproveita memórias de tradução (TMs) para criar modelos de tradução automática (tradução automática) personalizados que aderem a terminologia e estilo específicos, levando a uma melhor qualidade de tradução (e, portanto, reduzindo os tempos de pós-edição) para esses tipos de conteúdo quando comparados à tradução automática genérica.

O fator mais importante que pode influenciar a eficácia do processo de personalização são as memórias de tradução usadas. Estas são diretrizes gerais que podem ajudar a determinar quais dados usar para este propósito:

  • Domínio único:

    É melhor se o conjunto de dados se concentrar em conteúdo que abrange um único estilo e terminologia. Se o conjunto de dados contiver uma mistura de domínios (por exemplo, tanto os termos legais de um site quanto as descrições de produtos), o modelo pode falhar em aprender qual é o estilo desejado.

  • Tipo de conteúdo exclusivo:

    O modelo de tradução automática personalizado baseia-se em modelos genéricos treinados com grandes quantidades de dados públicos coletados da internet. Se a memória de tradução contiver dados bastante semelhantes aos dados genéricos usados para criar os modelos genéricos, não haverá muito a ganhar com o processo de personalização.

  • Qualidade dos dados:

    O modelo assumirá que cada par de frases na memória de tradução é um exemplo da saída que se espera que ele produza. A memória de tradução deve ser de boa qualidade, idealmente criada a partir de traduções humanas profissionais. O pipeline de limpeza de dados pode ajudar a filtrar as partes mais prejudiciais do conjunto de dados.

  • Volume esperado:

    Para que a personalização seja impactante em termos de ROI, o conjunto de dados precisa ser representativo da maior parte dos dados onde a qualidade da tradução automática terá mais impacto. Por exemplo, se parte da saída da tradução automática for pós-editada por tradutores humanos, para maximizar o ROI, os dados precisam ser representativos do conteúdo que será pós-editado.

Criar um conjunto de dados para curadoria automatizada de ativos tem um processo ligeiramente diferente.

Para criar um conjunto de dados com o objetivo de treinar um mecanismo de tradução automática personalizado, siga estas etapas:

  1. Na página Datasets, clique em Treinar um mecanismo de tradução automática Personalizado.

    A página Detalhes do conjunto de dados abre.

  2. Forneça um nome para o conjunto de dados.

  3. Os seletores de idioma permitem várias opções:

    1. Para criar um conjunto de dados de idioma geral, selecione o mesmo texto original e tradução nos seletores de texto original e tradução de idioma e local.

    2. Para criar um conjunto de dados específico de local, selecione o texto original e a tradução na primeira lista suspensa e, em seguida, especifique o texto original e a tradução de local na segunda lista suspensa.

      Múltiplos locais de tradução (ou seja, variantes diferentes do mesmo idioma) para aproveitar mais fontes de dados também podem ser adicionados.

    3. Para criar um conjunto de dados com múltiplos locais de texto original e tradução, selecione o texto original e a tradução na primeira lista suspensa, especifique o texto original e a tradução de local na segunda lista suspensa (variantes diferentes da mesma tradução de idioma podem ser adicionadas) e clique em + Adicionar mais pares de local.

    A janela Dados de entrada aparece.

  4. Clique em Adicionar memória de tradução.

    A página Escolher memória de tradução abre com uma funcionalidade de pesquisa Search.

  5. Para adicionar uma memória de tradução ao conjunto de dados, clique no ícone Add TM. A memória de tradução é adicionada à coluna Selecionado.

    Múltiplas memórias de tradução podem ser adicionadas até um máximo de 200 memórias de tradução e um máximo de 8 milhões de segmentos. Um conjunto de dados deve conter, idealmente, pelo menos 10.000 segmentos.

    Clicar no nome da memória de tradução apresentará a seleção na página de memória de tradução.

    Clique no ícone Remove TM para remover a memória de tradução da coluna Selecionado.

  6. Clique em Gravar.

    A página Detalhes do conjunto de dados abre.

  7. Revise os detalhes conforme apresentados e, se estiverem corretos, clique em Continuar.

    A página Filtros de limpeza abre.

  8. Aplique os filtros necessários e clique em Criar.

    O conjunto de dados é criado e adicionado à lista na página Datasets com o estado inicial de Cleaning e o estado de Tradução automática na coluna Created for.

Esse artigo foi útil?

Sorry about that! In what way was it not helpful?

The article didn’t address my problem.
I couldn’t understand the article.
The feature doesn’t do what I need.
Other reason.

Note that feedback is provided anonymously so we aren't able to reply to questions.
If you'd like to ask a question, submit a request to our Support team.
Thank you for your feedback.