Custom AI

Depuración de recursos automatizada

El contenido se traduce automáticamente del inglés por Phrase Language AI.

La curación de memorias de traducción es un problema persistente desde hace mucho tiempo y la limpieza manual es un proceso laborioso. Las memorias de traducción limpias conducen a mejores referencias para los lingüistas y a una traducción automática de mayor calidad, lo cual es especialmente relevante para Phrase NextMT, dadas sus capacidades avanzadas para aprovechar activos de idioma, como memorias de traducción y glosarios.

Crear un conjunto de datos para AAC

Para crear un conjunto de datos con el fin de utilizar una TM curada en TMS, sigue estos pasos:

  1. En la página Conjuntos de datos, haz clic en Limpiar una memoria de traducción.

    Se abre la página Detalles del conjunto de datos.

  2. Proporciona un nombre para el conjunto de datos.

  3. Los selectores de idioma permiten varias opciones:

    1. Para crear un conjunto de datos de idioma general, selecciona los mismos idiomas fuente y meta en los selectores de idioma y localización fuente y meta.

    2. Para crear un conjunto de datos específico de localización, selecciona los idiomas fuente y meta de la primera lista desplegable y, a continuación, especifica las localizaciones fuente y meta de la segunda lista desplegable.

      También se pueden agregar múltiples localizaciones meta (es decir, diferentes variantes del mismo idioma) para aprovechar más fuentes de datos.

    3. Para crear un conjunto de datos con múltiples localizaciones fuente y meta, selecciona los idiomas fuente y meta de la primera lista desplegable, especifica las localizaciones fuente y meta de la segunda lista desplegable (se pueden agregar diferentes variantes del mismo idioma meta) y haz clic en + Agregar más pares de localización.

    Aparece la ventana Datos de entrada.

  4. Haz clic en Agregar memorias de traducción.

    Se abre la página Elegir memorias de traducción con una funcionalidad de búsqueda Search.

  5. Para agregar una TM al conjunto de datos, haz clic en el icono Add TM. La TM se agrega a la columna Seleccionado.

    Se pueden agregar múltiples TM hasta un máximo de 200 TM y un máximo de 8 millones de segmentos. Un conjunto de datos debería contener idealmente al menos 10,000 segmentos.

    Al hacer clic en el nombre de la TM se presentará la selección en la página de memoria de traducción.

    Haga clic en el icono Remove TM para eliminar la TM de la columna Seleccionado.

  6. Haz clic en Guardar.

    Se abre la página Detalles del conjunto de datos.

  7. Revise los detalles tal como se presentan y, si son correctos, haga clic en Continuar.

    Se abre la página Filtros de limpieza.

  8. Aplique los filtros necesarios y haga clic en Crear.

    El conjunto de datos se crea y se añade a la lista en la página Conjuntos de datos con el estado inicial de Limpieza y el estado de Limpieza de TM en la columna Creado para.

Filtros de limpieza para AAC

Phrase Custom IA permite curar memorias de traducción con la ayuda de filtros de limpieza basados en reglas y potenciados por IA. Se proporciona una configuración predeterminada que puede ser adecuada para nuevos usuarios.

Este proceso conserva los metadatos del segmento de TM originales y las etiquetas de TM, lo que permite a los usuarios mantener el apalancamiento de la TM al utilizar las TM limpiadas en el TMS.

El conjunto de filtros disponibles incluye tanto filtros basados en reglas como filtros basados en aprendizaje automático:

  • Basado en reglas

    Filtros que operan con reglas claramente definidas que son fácilmente comprensibles para los humanos. Esta categoría de filtros incluye Rango de fechas, Recuento mínimo de caracteres, Longitud del par de oraciones, Relación de longitud, No traducibles, Duplicados, Casi duplicados.

  • Basado en aprendizaje automático

    Filtros que analizan el contenido del texto en sí para tomar una decisión, en lugar de simplemente seguir un conjunto fijo de reglas. Esta categoría de filtros incluye Fuente y meta desalineadas y Identificación de idioma.

Rango de fechas

Excluye segmentos fuera de las fechas establecidas. Las fechas de inicio y fin se incluyen junto con la fecha de la última modificación de un segmento.

Fuente y meta desalineadas

Este filtro determina qué tan bien coinciden los segmentos en términos de significado y similitud semántica, eliminando los peor calificados. La alineación de pares de oraciones se mide utilizando la métrica LASER.

Se utiliza un motor de IA para comprobar que el texto fuente y el texto meta signifiquen lo mismo o en qué medida significan lo mismo. La configuración recomendada descarta el 10% de los peores segmentos mientras conserva el 90% de los mejores segmentos.

La configuración avanzada permite cambiar la alineación o puede ser un filtro basado en la puntuación de similitud sin procesar usando un número entre 0 y 1 (1 significa alineación completa). Se recomienda precaución si utiliza la puntuación de similitud sin procesar, ya que cada combinación tiene una distribución de puntuaciones diferente y lo que se considera una buena puntuación para una combinación puede ser una puntuación insatisfactoria para otra.

Por lo general, los segmentos por debajo de 0.5 no son muy buenos y los segmentos cercanos o superiores a 1 son segmentos que son iguales en ambos idiomas.

Ejemplos:

La cadena "¡Hola, mundo!" 1 2 3\" tiene 19 caracteres y 10 letras.

Recuento mínimo de caracteres y letras

El recuento de caracteres incluye todos los caracteres. Esto incluye todas las letras, espacios en blanco, puntuación y símbolos. Para fines de capacitación, puede ser útil descartar los segmentos que no contengan letras.

El recuento de letras solo cuenta letras como las del alfabeto inglés, pero también caracteres más complejos con diacríticos o caracteres chinos. Un carácter chino se cuenta como una letra, incluso si representa más de un carácter. Para los idiomas basados en caracteres, los valores predeterminados son 1, pero para los idiomas basados en palabras, los valores predeterminados son 4 (caracteres) y 3 (letras). El valor mínimo es 1 y el valor máximo es 500.

Si mantiene muchos segmentos cortos en los datos (por ejemplo, acrónimos), mantenga los valores de filtrar bajos.

Ejemplo:

La cadena "¡Hola, mundo!" 1 2 3\" tiene 19 caracteres y 10 letras.

Longitud del par de oraciones

Este filtro elimina todos los segmentos que son más largos que el valor de umbral establecido por los usuarios.

El recuento total de caracteres incluye todos los caracteres (letras, espacios en blanco y puntuación) tanto de la fuente como de las oraciones meta. Tenga en cuenta el tipo de idioma (por ejemplo, chino e inglés); si el idioma fuente no es similar a CJK y el idioma meta es CJK (o viceversa), este filtro se ignorará.

Relación de longitud

Este filtro identifica segmentos donde la longitud es significativamente mayor al comparar el segmento fuente y el segmento meta. Algunas traducciones aumentan o disminuyen en longitud al traducir de un idioma fuente a un idioma meta. Las traducciones demasiado largas o demasiado cortas pueden indicar segmentos de baja calidad.

Si el idioma fuente no es similar a CJK y el idioma meta lo es (o viceversa), este filtro se ignorará.CJK

Algunos idiomas son más verbosos que otros, por lo que 200% es un valor predeterminado adecuado. Si el idioma meta es similar al idioma fuente, o se necesita filtrar más datos, el valor puede ser menor.

Ejemplos:

Un idioma es CJK: la relación es 1. No se descartará:

{"fuente": "This is a sentence.", "meta": "这是一个句子。", "ratio": 1}

La traducción al alemán tiene una longitud comparable a la fuente en inglés y no se descartará:

{"fuente": "This is a sentence.", "meta": "Dies ist ein Satz.", "relación": 1.1}

La traducción al alemán es mucho más larga que la fuente en inglés y se descartará:

{"fuente": "This is a sentence.", "meta": "Dies ist ein Satz mit zusätzlichen unnötigen Füllungen.", "relación": 3.1}

No traducibles

Los no traducibles son segmentos donde el segmento fuente y el segmento meta son iguales. Excluye todos los pares de oraciones no traducibles donde el texto meta permanece sin cambios respecto al texto fuente.

Duplicados

Se crean grupos de segmentos que tienen la misma oración fuente. De cada grupo, solo se conserva el mejor segmento, por lo que si la oración fuente de un segmento es única, se conserva automáticamente. De lo contrario, se conserva el segmento con la puntuación de similitud más alta.

Casi duplicados

Al probar casi duplicados, la (versión ligeramente más limpia de) una oración fuente se normaliza; todos los caracteres que no son letras (algunos ejemplos: “,?)!-) se reemplazan con un espacio y todas las letras se muestran en minúsculas.

Usando la oración fuente normalizada, se crean grupos de segmentos que tienen la misma oración fuente normalizada. De cada grupo, solo se conserva el mejor segmento, por lo que la oración fuente normalizada de un segmento es única y se conserva automáticamente. De lo contrario, se conserva el segmento con la puntuación de similitud más alta.

Identificación de idioma

Se usa un motor de IA para identificar el idioma fuente y meta basándose en las oraciones. Un segmento solo se elimina si el motor reconoce un idioma (fuente/meta) (como ejemplo, las oraciones más cortas a menudo no son suficientes para que el motor determine un idioma) y el idioma es diferente al esperado.

QPS

El filtro QPS permite eliminar los pares de oraciones de menor calidad en la memoria de traducción para asegurar que los segmentos resultantes sean de la más alta calidad.

El filtro QPS se puede configurar de dos maneras:

  1. Eliminar un porcentaje especificado de pares de oraciones con las puntuaciones de QPS más bajas. La recomendación es del 10%.

  2. Seleccionar un umbral de puntuación. Use la configuración avanzada para eliminar los pares de oraciones que caigan por debajo de un umbral de QPS ajustable. El punto de partida recomendado es 50.

Estas dos opciones proporcionan una curación automatizada de la memoria de traducción para alinearse con los objetivos de calidad de los usuarios.

Usar TM curadas en TMS

El proceso de limpieza de la memoria de traducción, que puede tardar varias horas, debe Completar antes de que se pueda usar una TM curada.

Para usar una TM curada en TMS, siga estos pasos:

  1. Haga clic en Open More Menu y Seleccionar descargar Download.

    Se abre la ventana Descargar.

  2. Seleccionar Descargar (.tmx).

Esto activará un proceso de exportar conjunto de datos que solo tardará unos minutos. La TM curada resultante en formato .TMX se puede cargar entonces a TMS como una TM nueva y curada de hasta 1 Gb de tamaño.

Si se han realizado dos o más procesos de limpieza en la misma TM, se puede acceder a diferentes versiones en la pestaña Historial de limpieza.

¿Fue útil este artículo?

Sorry about that! In what way was it not helpful?

The article didn’t address my problem.
I couldn’t understand the article.
The feature doesn’t do what I need.
Other reason.

Note that feedback is provided anonymously so we aren't able to reply to questions.
If you'd like to ask a question, submit a request to our Support team.
Thank you for your feedback.