Custom AI

Curadoria automatizada de ativos

O conteúdo de toda a Central de Ajuda é traduzido automaticamente de inglês pelo Phrase Language AI.

A curadoria de memórias de tradução é um problema persistente de longa data e a limpeza manual é um processo trabalhoso. Memórias de tradução limpas levam a melhores referências para linguistas e a uma tradução automática de maior qualidade, o que é especialmente relevante para Phrase NextMT, dada a sua capacidade avançada de aproveitar ativos de idioma, como memórias de tradução e glossários.

Criar um conjunto de dados para AAC

Para criar um conjunto de dados com o objetivo de usar uma memória de tradução com curadoria no TMS, siga estas etapas:

  1. Na página Conjuntos de dados, clique em Limpar uma memória de tradução.

    A página Detalhes do conjunto de dados abre.

  2. Forneça um nome para o conjunto de dados.

  3. Os seletores de idioma permitem várias opções:

    1. Para criar um conjunto de dados de idioma geral, selecione o mesmo texto original e tradução nos seletores de texto original e tradução de idioma e local.

    2. Para criar um conjunto de dados específico de local, selecione o texto original e a tradução na primeira lista suspensa e, em seguida, especifique o texto original e a tradução de local na segunda lista suspensa.

      Vários locais de tradução (ou seja, variantes diferentes do mesmo idioma) para aproveitar mais fontes de dados também podem ser adicionados.

    3. Para criar um conjunto de dados com vários locais de texto original e tradução, selecione o texto original e a tradução na primeira lista suspensa, especifique o texto original e a tradução de local na segunda lista suspensa (variantes diferentes do mesmo idioma de tradução podem ser adicionadas) e clique em + adicionar mais pares de local.

    A janela Dados de entrada aparece.

  4. Clique em adicionar memória de tradução.

    A página Escolher memória de tradução abre com uma funcionalidade de pesquisa Search.

  5. Para adicionar uma memória de tradução ao conjunto de dados, clique no ícone Add TM. A memória de tradução é adicionada à coluna Selecionado.

    Várias memórias de tradução podem ser adicionadas até um máximo de 200 memórias de tradução e um máximo de 8 milhões de segmentos. Um conjunto de dados deve conter, idealmente, pelo menos 10.000 segmentos.

    Clicar no nome da memória de tradução apresentará a seleção na página de memória de tradução.

    Clique no ícone Remove TM para remover a memória de tradução da coluna Selecionado.

  6. Clique em Gravar.

    A página Detalhes do conjunto de dados abre.

  7. Revise os detalhes conforme apresentados e, se estiverem corretos, clique em continuar.

    A página Filtros de limpeza é aberta.

  8. Aplique os filtros necessários e clique em criar.

    O conjunto de dados é criado e adicionado à lista na página Conjuntos de dados com o estado inicial de Limpando e o estado de Limpando memória de tradução na coluna Criado para.

Filtros de limpeza para AAC

O Phrase Custom IA permite curar memórias de tradução com a ajuda de filtros de limpeza baseados em regras e IA. São fornecidas configurações padrão que podem ser adequadas para novos usuários.

Este processo preserva os metadados do segmento da memória de tradução e as tags da memória de tradução originais, o que permite aos usuários manter o aproveitamento da memória de tradução ao usar as memórias de tradução limpas no TMS.

O conjunto de filtros disponíveis inclui filtros baseados em regras e filtros baseados em aprendizado de máquina:

  • Baseado em regras

    Filtros que operam com regras claramente definidas que são facilmente compreensíveis por humanos. Esta categoria de filtro inclui Intervalo de datas, Contagem mínima de caractere, Comprimento do par de frases, Proporção de comprimento, Não traduzíveis, Duplicatas, Quase duplicatas.

  • Baseado em aprendizado de máquina

    Filtros que analisam o conteúdo do texto em si para tomar uma decisão, em vez de simplesmente seguir um conjunto fixo de regras. Esta categoria de filtro inclui Texto original e tradução desalinhados e Identificação de idioma.

Intervalo de datas

Exclui segmentos fora das datas definidas. As datas de início e fim são incluídas juntamente com a data da última modificação de um segmento.

Texto original e tradução desalinhados

Este filtrar determina quão bem os segmentos têm correspondência em termos de significado e similaridade semântica, removendo os com pior pontuação. O alinhamento do par de idiomas é medido usando a métrica LASER.

Um mecanismo de IA é usado para verificar se o texto original e a tradução significam a mesma coisa ou o quanto significam a mesma coisa. A configuração recomendada Descartar os 10% piores segmentos enquanto mantém os 90% melhores segmentos.

As configurações avançadas permitem alterar o alinhamento ou podem ser um filtrar baseado na pontuação de similaridade bruta usando um número entre 0 e 1 (1 significando Concluir alinhamento). Recomenda-se cautela ao usar a pontuação de similaridade bruta, pois cada par de idiomas tem uma distribuição diferente de pontuações, e o que é considerado uma boa pontuação para um par de idiomas pode ser uma pontuação insatisfatória para outro.

Normalmente, segmentos abaixo de 0,5 não são muito bons, e segmentos próximos ou acima de 1 são segmentos que são iguais em ambos os idiomas.

Exemplos:

A string \"Hello, World!" 1 2 3\" tem 19 caracteres e 10 letras.

Contagem mínima de caractere e letra

Contagem de caractere inclui todos os caracteres. Isso inclui todas as letras, espaços em branco, pontuação e símbolos. Para fins de treinamento, pode ser útil Descartar segmentos que não contenham letras.

Contagem de letras conta apenas letras, como as do alfabeto inglês, mas também caracteres mais complexos com diacríticos ou caracteres chineses. Um caractere chinês é contado como uma letra, mesmo que represente mais de um caractere. Para idiomas baseados em caractere, os valores padrão são 1, mas para idiomas baseados em palavras, os valores padrão são 4 (caracteres) e 3 (letras). O valor mínimo é 1 e o valor máximo é 500.

Se mantiver muitos segmentos curtos nos dados (por exemplo, siglas), mantenha os valores do filtrar baixos.

Exemplo:

A string \"Hello, World!" 1 2 3\" tem 19 caracteres e 10 letras.

Comprimento do par de frases

Este filtrar remove todos os segmentos que são mais longos do que o valor limite definido pelos usuários.

A contagem total de caractere inclui todos os caracteres - letras, espaços em branco e pontuação - tanto do texto original quanto das frases da tradução. Leve em consideração o tipo de idioma (por exemplo, chinês e inglês); se o idioma do texto original não for do tipo CJK e o idioma da tradução for CJK (ou vice-versa), este filtrar será ignorado.

proporção de comprimento

Este filtrar identifica segmentos onde o comprimento é significativamente maior ao comparar o segmento do texto original e o segmento da tradução. Algumas traduções aumentam ou diminuem de comprimento ao traduzir de um idioma do texto original para um idioma da tradução. Traduções muito longas ou muito curtas podem indicar segmentos de baixa qualidade.

Se o idioma do texto original não for do tipo CJK e o idioma da tradução for (ou vice-versa), este filtrar será ignorado.CJK

Alguns idiomas são mais prolixos que outros, portanto 200% é um bom padrão. Se o idioma da tradução for semelhante ao idioma do texto original, ou se for necessário filtrar mais dados, o valor pode ser menor.

Exemplos:

Um idioma é CJK - a proporção é 1. Não será descartado:

{"source": "This is a sentence.", "target": "这是一个句子。", "ratio": 1}

A tradução alemã tem um comprimento comparável ao do texto original em inglês e não será descartada:

{"source": "This is a sentence.", "target": "Dies ist ein Satz.", "ratio": 1.1}

A tradução alemã é muito mais longa que o texto original em inglês e será descartada:

{"source": "This is a sentence.", "target": "Dies ist ein Satz mit zusätzlichen unnötigen Füllungen.", "ratio": 3.1}

Non-translatables

Não traduzíveis são segmentos onde o segmento do texto original e o segmento da tradução são iguais. Exclui todos os pares de frases não traduzíveis onde o texto original permanece inalterado na tradução.

Duplicatas

São criados grupos de segmentos que possuem o mesmo texto original. De cada grupo, apenas o melhor segmento é mantido, portanto, se o texto original de um segmento for único, ele é mantido automaticamente. Caso contrário, o segmento com a maior pontuação de similaridade é mantido.

Quase duplicatas

Ao testar quase duplicatas, a (versão ligeiramente mais limpa de) um texto original é normalizada; todos os caracteres que não são letras (alguns exemplos: “,?)!-) são substituídos por um espaço e todas as letras são renderizadas em minúsculas.

Usando o texto original normalizado, são criados grupos de segmentos que possuem o mesmo texto original normalizado. De cada grupo, apenas o melhor segmento é mantido, portanto, o texto original normalizado de um segmento é único e é mantido automaticamente. Caso contrário, o segmento com a maior pontuação de similaridade é mantido.

Identificação de idioma

Um mecanismo de IA é usado para identificar o idioma do texto original e da tradução com base nas frases. Um segmento só é removido se o mecanismo reconhecer um idioma (de texto original/tradução) (como exemplo, frases mais curtas muitas vezes não são suficientes para o mecanismo determinar um idioma) e o idioma for diferente do esperado.

QPS

O filtro QPS torna possível remover os pares de frases de menor qualidade na memória de tradução para garantir que os segmentos resultantes sejam da mais alta qualidade.

O filtro QPS pode ser configurado de duas maneiras:

  1. Remover uma porcentagem especificada de pares de frases com as menores pontuações de QPS. A recomendação é 10%.

  2. Selecionar um limite de pontuação. Use as configurações avançadas para eliminar pares de frases que fiquem abaixo de um limite de QPS ajustável. O ponto de partida recomendado é 50.

Estas duas opções fornecem curadoria automatizada de memória de tradução para alinhar com os objetivos de qualidade dos usuários.

Usando memórias de tradução curadas no TMS

O processo de limpeza de memória de tradução, que pode levar várias horas, deve Concluir antes que uma memória de tradução curada possa ser usada.

Para usar uma memória de tradução curada no TMS, siga estas etapas:

  1. Clique em Open More Menu e Selecionar download Download.

    A janela Download abre.

  2. Selecionar Download (.tmx).

Isso acionará um processo de exportar conjunto de dados que levará apenas alguns minutos. A memória de tradução curada resultante no formato .TMX pode então ser carregada para o TMS como uma nova memória de tradução curada de até 1 Gb de tamanho.

Se dois ou mais processos de limpeza tiverem sido realizados na mesma memória de tradução, diferentes versões podem ser acessadas na aba Histórico de limpeza.

Esse artigo foi útil?

Sorry about that! In what way was it not helpful?

The article didn’t address my problem.
I couldn’t understand the article.
The feature doesn’t do what I need.
Other reason.

Note that feedback is provided anonymously so we aren't able to reply to questions.
If you'd like to ask a question, submit a request to our Support team.
Thank you for your feedback.