Los aspectos más importantes del entrenamiento de motores de MT no son solo el volumen, sino la calidad de los datos. Limpiar datos es un problema generalizado y la limpieza manual es laboriosa. Los datos limpios conducen a un entrenamiento más rápido y a modelos de mayor calidad.
Phrase Custom IA adapta memorias de traducción en conjuntos de datos con la Ayuda de filtros de limpieza basados en reglas y potenciados por IA. Se proporciona una configuración predeterminada que debería ser adecuada para los nuevos usuarios.
El conjunto de filtros disponible incluye tanto filtros basados en reglas como filtros basados en aprendizaje automático:
-
Basado en reglas
Filtros que operan con reglas claramente definidas que son fácilmente comprensibles por los humanos. Esta categoría de filtrar incluye , , , , , , .
-
Basado en aprendizaje automático
Filtros que analizar el contenido del texto en sí para tomar una decisión, en lugar de simplemente seguir un conjunto fijo de reglas. Esta categoría de filtrar incluye y .
Todos los filtros evalúan versiones limpias de los segmentos; entre otras cosas, los espacios múltiples se reducen a uno y se eliminan las etiquetas de Phrase.
Intervalo de fechas
Excluye segmentos fuera de las fechas establecidas. Las fechas de inicio y fin se incluyen junto con la fecha de la última modificación de un segmento.
Fuente y meta desalineadas
Este filtro determina qué tan bien coinciden los segmentos en términos de significado y similitud semántica, eliminando los peor calificados. La alineación del par de segmento se mide utilizando la métrica LASER.
Se utiliza un motor de IA para comprobar que el texto fuente y el texto meta signifiquen lo mismo o cuánto de lo mismo significan. La configuración recomendada Descartar el 10% de los peores segmentos mientras mantiene el 90% de los mejores segmentos.
La configuración avanzada permite cambiar la alineación o puede ser un filtrar basado en la puntuación de similitud bruta usando un número entre 0 y 1 (1 significa Completar alineación). Se recomienda precaución si utiliza la puntuación de similitud bruta, ya que cada combinación tiene una distribución diferente de puntuación y lo que se considera una buena puntuación para una combinación puede ser una puntuación insatisfactoria para otra.
Normalmente, los segmentos por debajo de 0.5 no son muy buenos y los segmentos cercanos o superiores a 1 son segmentos que son iguales en ambos idiomas.
Ejemplos:
{"source": "Super.", "target": "Super.", "similarity": 1.05}
{"source": "Hello", "target": "http://wwww.sdsadsa.com", "similarity": 0.3}
Recuento mínimo de carácter y letras
Recuento de carácter incluye todos los caracteres. Esto incluye todas las letras, espacios en blanco, puntuación y símbolos. Para fines de entrenamiento, puede ser útil Descartar los segmentos que no contengan ninguna letra.
Recuento de letras cuenta solo las letras, como las del alfabeto inglés, pero también caracteres más complejos con diacríticos o caracteres chinos. Un carácter chino se cuenta como una letra, incluso si representa más de un carácter. Para los idiomas basados en caracteres, los valores predeterminados son 1, pero para los idiomas basados en palabras, los valores predeterminados son 4 (caracteres) y 3 (letras). El valor mínimo es 1 y el valor máximo es 500.
Si mantiene muchos segmentos cortos en los datos (por ejemplo, acrónimos), mantenga los valores de filtrar bajos.
Ejemplo:
Longitud del par de oraciones
Este filtro elimina todos los segmentos que son más largos que el valor de umbral establecido por los usuarios. La razón de este filtro es que la mayoría de los sistemas NMT no se entrenarán realmente con segmentos que sean más largos que su umbral interno.
Por ejemplo, el umbral interno de NextMT es de 200 tokens, lo que equivale aproximadamente a 100 - 1,000 palabras. Para entrenar un motor Personalizar con oraciones más cortas, establezca este valor por debajo del predeterminado.
El recuento total de carácter incluye todos los caracteres - letras, espacios en blanco y puntuación - tanto de la fuente como de las oraciones meta. Tenga en cuenta el tipo de idioma (por ejemplo, chino e inglés); si el idioma fuente no es similar al CJK y el idioma meta es CJK (o viceversa), este filtro será ignorado.
Relación de longitud
Este filtro identifica segmentos donde la longitud es significativamente mayor al comparar el segmento fuente y el segmento meta. Algunas traducciones aumentan o disminuyen en longitud al traducir de un idioma fuente a un idioma meta. Las traducciones demasiado largas o demasiado cortas pueden indicar datos de entrenamiento de baja calidad.
Si el idioma fuente no es similar al CJK y el idioma meta sí lo es (o viceversa), este filtro será ignorado.CJK
Algunos idiomas son más verbosos que otros, por lo que 200% es un valor predeterminado adecuado. Si el idioma meta es similar al idioma fuente, o si se necesita filtrar más datos, el valor puede ser menor.
Ejemplos:
Un idioma es CJK - la relación es 1. No será descartado:
{"source": "This is a sentence.", "target": "这是一个句子。", "ratio": 1}
La traducción al alemán es de una longitud comparable a la fuente en inglés y no será descartada:
{"source": "This is a sentence.", "target": "Dies ist ein Satz.", "ratio": 1.1}
La traducción al alemán es mucho más larga que la fuente en inglés y será descartada:
{"fuente": "This is a sentence.", "meta": "Dies ist ein Satz mit zusätzlichen unnötigen Füllungen.", "ratio": 3.1}
No traducibles
Los no traducibles son segmentos donde los segmentos fuente y meta son iguales. Excluye todos los pares de oraciones no traducibles donde el texto meta permanece sin cambios respecto al texto fuente.
Duplicados
Se crean grupos de segmentos que tienen la misma oración fuente. De cada grupo, solo se conserva el mejor segmento, por lo que si la oración fuente de un segmento es única, se conserva automáticamente. De lo contrario, se conserva el segmento con la puntuación de similitud más alta.
Duplicados cercanos
Al probar duplicados cercanos, la (versión ligeramente más limpia de) una oración fuente se normaliza; todos los caracteres que no son letras (algunos ejemplos: “,?)!-) se reemplazan con un espacio y todas las letras se escriben en minúsculas.
Utilizando la oración fuente normalizada, se crean grupos de segmentos que tienen la misma oración fuente normalizada. De cada grupo, solo se conserva el mejor segmento, por lo que la oración fuente normalizada de un segmento es única y se conserva automáticamente. De lo contrario, se conserva el segmento con la puntuación de similitud más alta.
Identificación de idioma
Se utiliza un motor de IA para identificar el idioma fuente y meta basándose en las oraciones. Un segmento solo se elimina si el motor reconoce un idioma (fuente/meta) (como ejemplo, las oraciones más cortas a menudo no son suficientes para que el motor determine un idioma) y el idioma es diferente al esperado.
QPS
El filtro QPS elimina los pares de oraciones de menor calidad en el conjunto de datos para garantizar que los modelos de IA resultantes se entrenen con los datos de mayor calidad disponibles. Generalmente, cuanto mayor sea la calidad de los datos de entrenamiento, mejor será el rendimiento del modelo personalizado.
El filtro QPS se puede configurar de dos maneras:
-
Eliminar un porcentaje especificado de pares de oraciones con las puntuaciones de QPS más bajas. La recomendación es del 10%.
-
Seleccionar un umbral de puntuación. Usar la configuración avanzada para eliminar pares de oraciones que caigan por debajo de un umbral de QPS ajustable. El punto de partida recomendado es 50.
Estas dos opciones proporcionan una curación automatizada del conjunto de datos para alinearse con los objetivos de calidad de los usuarios.