La mayoría de las conversaciones sobre el rendimiento de la IA en el procesamiento del lenguaje siguen centrándose en el inglés. Un modelo que obtiene una buena puntuación en una prueba de referencia estándar, se elogia como de última generación y se implementa para su uso global. Sin embargo, un creciente conjunto de pruebas, más recientemente el nuevo conjunto de datos EU MMLU de la Comisión Europea, demuestra que un buen rendimiento en inglés dice muy poco sobre cómo un modelo maneja el francés, el húngaro o el maltés. Para cualquiera que dependa de la traducción simultánea por IA en eventos internacionales, esta diferencia no es una simple nota a pie de página académica. Es la diferencia entre que un asistente entienda una ponencia o no la entienda en absoluto.
Esto es importante porque los parámetros de referencia utilizados para evaluar los modelos de lenguaje a gran escala (LLM, por sus siglas en inglés) determinan qué sistemas se implementan y se consideran fiables. Si dichos parámetros se basan casi exclusivamente en inglés, no nos permiten saber cómo se desempeña un modelo en otros idiomas, incluidos los que hablan las audiencias a las que está destinada la traducción automática en tiempo real.
EU MMLU es un nuevo conjunto de datos de referencia multilingüe publicado por la Dirección General de Traducción de la Comisión Europea (DG Translation). Se basa en Massive Multitask Language Understanding (MMLU), uno de los marcos más utilizados para evaluar modelos de lenguaje natural (LLM), que pone a prueba los modelos con miles de preguntas de opción múltiple que abarcan 57 materias, desde ciencia y derecho hasta ética y asuntos públicos.
EU MMLU adapta este marco específicamente al contexto de la UE. Se centra en 7 áreas temáticas elegidas por su relevancia para las instituciones europeas y actualmente abarca 16 idiomas oficiales de la UE, incluidos el croata, el checo, el neerlandés, el francés, el alemán, el griego, el húngaro, el irlandés, el italiano, el lituano, el polaco, el portugués, el rumano, el eslovaco y el esloveno, con planes de añadir más. En lugar de simplemente traducir preguntas existentes en inglés, el proyecto se propuso preservar el mismo significado, dificultad y valor de evaluación en todas las versiones lingüísticas, de modo que una puntuación en polaco signifique lo mismo que una puntuación en francés.
La mayoría de los conjuntos de datos para la evaluación de la IA se crearon en inglés y reflejan contextos educativos, culturales y sociales angloparlantes. Un modelo entrenado y probado principalmente con datos en inglés puede parecer muy eficaz, mientras que su rendimiento real en otros idiomas permanece en gran medida sin medir.
Esta es precisamente la brecha que la DG Traducción se propuso cerrar. Como indica el anuncio del MMLU de la UE, un modelo puede obtener buenos resultados en inglés, pero un rendimiento significativamente inferior en francés, húngaro o maltés. El problema de fondo no radica en que los modelos no puedan procesar otros idiomas, sino en que las pruebas de referencia estándar rara vez los evalúan con la suficiente rigurosidad como para revelar sus deficiencias. Por ello, las carencias en gramática, matices o terminología específica de cada materia pasan desapercibidas hasta que un público real depende del resultado.
En el caso específico de la traducción automática en tiempo real, este rendimiento irregular tiene consecuencias directas. Un sistema puede procesar correctamente un texto original en inglés sencillo, pero luego introducir errores, frases poco fluidas o perder significado al traducir ese mismo contenido a un idioma de destino menos probado, precisamente cuando la precisión es crucial para un oyente que sigue la conversación en tiempo real.
Las deficiencias en el rendimiento lingüístico son solo una parte del problema. La DG Traducción también ha publicado criterios de calidad para la evaluación comparativa multilingüe que van más allá de la precisión de la traducción y evalúan hasta qué punto un modelo de IA refleja los valores de la UE y maneja contenido culturalmente específico, incluyendo modismos, humor, referencias, formatos de fecha y número, y diferencias en el tono o la cortesía esperados.
Estos son precisamente los elementos que dificultan enormemente la traducción en directo. Un ponente que utiliza expresiones regionales, referencias culturales específicas o un nivel de formalidad propio de las convenciones locales requiere algo más que una traducción literal. Un sistema de IA sin experiencia en este tipo de matices lingüísticos puede traducir correctamente las palabras, pero perder por completo el significado o el tono original. En un evento multilingüe, esta discrepancia puede influir en la recepción del mensaje por parte del público, incluso cuando nadie percibe ningún error técnico.
Uno de los aspectos más destacables del EU MMLU es su metodología. A diferencia de la mayoría de las pruebas de referencia multilingües, que se basan principalmente en la traducción automática para generar preguntas en idiomas distintos del inglés, el EU MMLU empleó un enfoque centrado en el ser humano. La DG Traducción colaboró con cerca de 250 estudiantes traductores y gestores de proyectos de la red del Máster Europeo en Traducción (EMT), procedentes de 21 universidades europeas, para traducir y revisar más de 1000 preguntas de referencia.
Esta distinción es más importante de lo que parece a primera vista. Un sistema de referencia basado en la traducción automática corre el riesgo de heredar las mismas debilidades que pretende revelar, al comparar el resultado de un modelo con el de otro en lugar de con un estándar humano real. La revisión humana fundamenta la evaluación en cómo las personas usan el lenguaje en la práctica, que es también el estándar más relevante para la traducción en directo en eventos reales, donde el público es humano y la tolerancia a errores sutiles es baja.
La DG Traducción define claramente su objetivo a largo plazo: establecer un nuevo estándar para la evaluación de la IA multilingüe en Europa, de modo que los sistemas de IA funcionen de forma consistente en distintos idiomas y culturas, en lugar de hacerlo principalmente en entornos angloparlantes. Si se logra este objetivo, los beneficios prácticos se extenderán mucho más allá de los laboratorios de investigación.
Para las organizaciones que organizan conferencias internacionales, reuniones institucionales o eventos corporativos globales, una mejor evaluación comparativa multilingüe ofrece una visión más clara de qué sistemas de IA son fiables para cada idioma, en lugar de descubrir a mitad del evento que una herramienta en particular tiene un rendimiento inferior fuera del inglés. Esto permite tomar decisiones más informadas sobre cuándo la traducción en directo exclusivamente con IA es fiable y cuándo un enfoque híbrido que combine IA con interpretación humana protege mejor el significado y los matices para un idioma o público específico.
Los estándares de referencia como EU MMLU no resolverán todas las deficiencias de la IA multilingüe de la noche a la mañana, pero representan un cambio significativo en la forma en que se mide y comunica el rendimiento. A medida que estos estándares de evaluación maduran, ofrecen a los organizadores de eventos, instituciones y equipos de comunicación una base más clara para elegir soluciones de traducción en vivo con IA adecuadas para audiencias verdaderamente multilingües. Para ver cómo Interprefy aborda la traducción en vivo con IA en diferentes idiomas, explore nuestra plataforma de traducción de voz con IA.