Custom AI

Filtros de limpieza

El contenido se traduce automáticamente del inglés por Phrase Language AI.

Los aspectos más importantes del entrenamiento de motores de MT no son solo el volumen, sino la calidad de los datos. La limpieza de datos es un problema generalizado y la limpieza manual es laboriosa. Los datos limpios conducen a un entrenamiento más rápido y a modelos de mayor calidad.

Phrase Custom AI adapta las memorias de traducción a conjuntos de datos con la ayuda de filtros de limpieza basados en reglas y potenciados por IA. La configuración predeterminada proporcionada debería ser adecuada para los nuevos usuarios.

El conjunto de filtros disponibles incluye tanto filtros basados en reglas como filtros basados en ML:

  • basado en reglas

    Filtros que operan con reglas claramente definidas que son fácilmente comprensibles para los humanos. Esta categoría de filtros incluye rango de fechas, recuento mínimo de caracteres, longitud del par de oraciones, relación de longitud, elementos no traducibles, duplicados, casi duplicados.

  • Basados en ML

    Filtros que analizan el contenido del texto en sí para tomar una decisión, en lugar de simplemente seguir un conjunto fijo de reglas. Esta categoría de filtros incluye origen y destino desalineados y identificación de idioma.

Todos los filtros evalúan versiones limpias de los segmentos; entre otras cosas, los espacios múltiples se reducen a uno y se eliminan las etiquetas de Phrase.

Rango de fechas

Excluye los segmentos fuera de las fechas establecidas. Las fechas de inicio y fin se incluyen junto con la fecha de la última modificación de un segmento.

fuente y meta desalineadas

Este filtro determina qué tan bien se corresponden los segmentos en cuanto a significado y similitud semántica, eliminando aquellos con la peor calificación. La alineación del par de oraciones se mide utilizando la métrica LASER.

Se utiliza un motor de IA para comprobar que el texto original y el traducido signifiquen lo mismo, o en qué medida lo hacen. La configuración recomendada descarta el 10% de los peores segmentos mientras conserva el 90% de los mejores segmentos.

La configuración avanzada permite cambiar la alineación o puede ser un filtro basado en la puntuación de similitud sin procesar utilizando un número entre 0 y 1 (1 significa alineación completa). Se recomienda precaución si se utiliza la puntuación de similitud sin procesar, ya que cada par de idiomas tiene una distribución de puntuaciones diferente y lo que se considera una buena puntuación para un par de idiomas puede ser una puntuación insatisfactoria para otro.

Normalmente, los segmentos por debajo de 0.5 no son muy buenos y los segmentos cercanos o superiores a 1 son segmentos que son iguales en ambos idiomas.

**Ejemplos**

Fuente: \"Super.\", \"target\": \"Super.\", \"similarity\": ## 1.05.

Fuente: \"Hello\", \"target\": \"http://wwww.sdsadsa.com\", \"similarity\": ## 0.3.

Recuento mínimo de caracteres y letras

Recuento de caracteres incluye todos los caracteres. Esto incluye todas las letras, espacios en blanco, puntuación y símbolos. Para fines de entrenamiento, puede ser útil descartar los segmentos que no contengan ninguna letra.

Recuento de letras cuenta solo letras como las del alfabeto inglés, pero también caracteres más complejos con diacríticos o caracteres chinos. Un carácter chino se cuenta como una letra, incluso si representa más de un carácter. Para los idiomas basados en caracteres, los valores predeterminados son 1, pero para los idiomas basados en palabras, los valores predeterminados son 4 (caracteres) y 3 (letras). El valor mínimo es 1 y el valor máximo es 500.

Si tienes muchos segmentos cortos en los datos (por ejemplo, acrónimos), mantén los valores de filtro bajos.

Ejemplo:

La cadena "¡Hola, mundo!" 1 2 3" tiene 19 caracteres y 10 letras.

Longitud del par de frases

Este filtro elimina todos los segmentos que son más largos que el valor de umbral establecido por los usuarios. La razón de este filtro es que la mayoría de los sistemas de NMT en realidad no se entrenarán con segmentos que sean más largos que su umbral interno. 

Por ejemplo, el umbral interno de NextMT es de 200 tokens, lo que equivale aproximadamente a entre 100 y 1,000 palabras. Para entrenar un motor personalizado con oraciones más cortas, establece este valor por debajo del predeterminado.

El recuento total de caracteres incluye todos los caracteres (letras, espacios en blanco y puntuación) tanto de la oración de origen como de la de destino. Ten en cuenta el tipo de idioma (por ejemplo, chino e inglés); si el idioma de origen no es similar al CJK y el idioma de destino es CJK (o viceversa), este filtro se ignorará.

Relación de longitud

Este filtro identifica los segmentos en los que la longitud es significativamente mayor al comparar el segmento de origen y el segmento de destino. Algunas traducciones aumentan o disminuyen en longitud al traducir de un idioma de origen a uno de destino. Las traducciones demasiado largas o demasiado cortas pueden indicar datos de entrenamiento de baja calidad.

Si el idioma de origen no es similar al CJK y el idioma de destino lo es (o viceversa), este filtro se ignorará.CJK

Algunos idiomas son más extensos que otros, por lo que 200% es un valor predeterminado adecuado. Si el idioma de destino es similar al idioma de origen, o si es necesario filtrar más datos, el valor puede ser menor.

**Ejemplos**

Un idioma es CJK: la proporción es 1. No se descartará:

Fuente: "This is a sentence.", "target": "这是一个句子。", "ratio": ## 1.

La traducción al alemán tiene una longitud comparable a la de la fuente en inglés y no se descartará:

Fuente: "This is a sentence.", "target": "Dies ist ein Satz.", "ratio": ## 1.1.

La traducción al alemán es mucho más larga que la de la fuente en inglés y se descartará:

Fuente: "This is a sentence.", "target": "Dies ist ein Satz mit zusätzlichen unnötigen Füllungen.", "ratio": ## 3.1.

No traducibles

Los elementos no traducibles son segmentos en los que los segmentos de origen y de destino son iguales. Excluye todos los pares de oraciones no traducibles en los que el texto de destino permanece sin cambios respecto al texto de origen.

Duplicados

Se crean grupos de segmentos que tienen la misma oración de origen. De cada grupo, solo se conserva el mejor segmento, por lo que si la oración de origen de un segmento es única, se conserva automáticamente. De lo contrario, se conserva el segmento con la puntuación de similitud más alta.

Duplicados parciales

Al realizar pruebas de duplicados cercanos, se normaliza (la versión ligeramente más limpia de) una oración fuente; todos los caracteres que no son letras (algunos ejemplos: “,?)!-) se reemplazan por un espacio y todas las letras se escriben en minúsculas.

Utilizando la oración fuente normalizada, se crean grupos de segmentos que tienen la misma oración fuente normalizada. De cada grupo, solo se conserva el mejor segmento, por lo que la oración fuente normalizada de un segmento es única y se conserva automáticamente. De lo contrario, se conserva el segmento con la puntuación de similitud más alta.

identificación del idioma

Se utiliza un motor de IA para identificar el idioma de origen y de destino basándose en las oraciones. Un segmento se elimina únicamente si el motor detecta un idioma (de origen/destino) (ya que, por ejemplo, las oraciones cortas a menudo no permiten determinar el idioma) y éste resulta ser diferente al esperado.

QPS

El filtro QPS elimina los pares de oraciones de menor calidad en el conjunto de datos para garantizar que los modelos de IA resultantes se entrenen con los datos de mayor calidad disponibles. Por lo general, cuanto mayor sea la calidad de los datos de entrenamiento, mejor será el rendimiento del modelo personalizado.

El filtro QPS se puede configurar de dos maneras:

  1. Eliminar un porcentaje especificado de pares de oraciones con las puntuaciones QPS más bajas. La recomendación es del 10%.

  2. Seleccionar un umbral de puntuación. Usa la configuración avanzada para eliminar los pares de oraciones que caigan por debajo de un umbral QPS ajustable. El punto de partida recomendado es 50.

Estas dos opciones proporcionan una curación automatizada del conjunto de datos para alinearse con los objetivos de calidad de los usuarios.

¿Fue útil este artículo?
★ ★ ★ ★ ★

Sorry about that! In what way was it not helpful?

The article didn’t address my problem.
I couldn’t understand the article.
The feature doesn’t do what I need.
Other reason.

Note that feedback is provided anonymously so we aren't able to reply to questions.
If you'd like to ask a question, submit a request to our Support team.
Thank you for your feedback.