VA | EN

La UA presenta en Miami las conclusiones de una competición científica de traducción automática al aragonés, aranés y asturiano

Más de 2000 frases de calidad en aragonés, aranés y asturiano están ahora disponibles para poder evaluar el rendimiento de sistemas de traducción automática que trabajen con estas lenguas, gracias a una investigación realizada por la Universidad de Alicante (UA) y la Universitat Oberta de Catalunya (UOC), que ha sido presentada por el investigador de la UA, Juan Antonio Pérez Ortiz, en el congreso internacional Empirical Methods in Natural Language Processing (EMNLP), celebrado en Miami (EE. UU).

Durante este congreso científico del área de la inteligencia artificial (uno de los dos congresos más prestigiosos en el campo de la lingüística computacional y el procesamiento del lenguaje natural) tuvo lugar un taller centrado en la traducción automática que reunió a participantes de empresas e instituciones académicas de todo el mundo para presentar sus avances.

Dentro de dicho taller de traducción automática, investigadores de la UA, liderados por los profesores Juan Antonio Pérez Ortiz y Felipe Sánchez Martínez, y de la UOC, liderados por el profesor Antoni Oliver González, han organizado durante los últimos meses una competición científica, cuyas principales conclusiones han sido presentadas por el profesor Juan Antonio Pérez Ortiz en Miami y por representantes de algunos de los equipos participantes.

Esta competición, según ha explicado el profesor de la UA, “ofrecía una serie de frases en español y pedía a los participantes que aplicaran técnicas innovadoras de inteligencia artificial para obtener sistemas de traducción automática que las tradujeran a aragonés, aranés o asturiano”.

Posteriormente, según ha añadido, “las traducciones de cada equipo se comparaban con las frases que cuidadosamente han revisado las academias para así medir el rendimiento de cada uno de los sistemas presentados, poder compararlos entre ellos y aprender de los mejores”.

El investigador de la UA ha señalado que “este tipo de competiciones son habituales para otros idiomas y tienen como objetivo avanzar el conocimiento en traducción automática y a la vez fomentar el progreso de la tecnología en beneficio de la diversidad lingüística”.

Las 2.000 frases revisadas por las academias ya se encontraban traducidas a más de 200 idiomas dentro de un conjunto de datos denominado FLORES+ que es muy utilizado para evaluar sistemas de traducción automática multilingües. “Ahora, el aragonés, el aranés y el asturiano se añadan a esa larga lista de idiomas”, ha añadido Juan Antonio Pérez Ortiz.

Las 2.000 frases en aragonés, aranés y asturiano se adecúan a los estándares lingüísticos de las respectivas lenguas, ya que en su obtención se ha contado con la ayuda de la Academia Aragonesa de la Lengua (Instituto de l’Aragonés), el Institut d’Estudis Aranesi y la Academia de la Llingua Asturiana. Además de coordinar la traducción de FLORES+, los investigadores de la UA descargaron de internet y curaron un corpus abierto de textos en estos idiomas que han llamado PILAR (Pan-Iberian Language Archival Resource).

Además, el investigador de la UA ha señalado que “los 17 sistemas de traducción automática presentados a la competición desde países de todo el mundo representan un paso significativo para garantizar que estas lenguas se incluyan en el panorama digital global, contribuyendo así a su preservación y desarrollo en el contexto tecnológico actual”. “Con esta iniciativa, hemos conseguido que el aragonés, el aranés y el asturiano pasen a formar parte del vocabulario de investigación de científicos de todo el mundo que trabajan en inteligencia artificial”, concluye.

La Universidad de Alicante y la Universitat Oberta de Catalunya han podido llevar adelante esta competición gracias a los proyectos PID2021-127999NB-I00 (LiLowLa: Lightweight neural translation technologies for low-resource languages) y PID2021-124663OB-I00 (TAN-IBE: Neural machine translation for the Romance languages of the Iberian Peninsula), ambos financiados por el Ministerio de Ciencia e Innovación de España (MCIN), la Agencia Española de Investigación (AEI/10.13039/501100011033) y el Fondo Europeo de Desarrollo Regional, Una Manera de Hacer Europa. En el equipo de la Universidad de Alicante también han participado Aarón Galiano Jiménez, Miquel Esplà Gomis y Víctor Manuel Sánchez Cartagena. Las principales conclusiones de la competición se encuentran recogidas en el artículo Findings of the WMT 2024 Shared Task Translation into Low-Resource Languages of Spain Blending Rule-Based and Neural Systems.

Fuente: UA