PLANA

Actualidad de
inteligencia artificial

La IA, en claro.

Qwen quiere traducir conversaciones sin que todos suenen igual: así conserva las voces y el contexto

Qwen3.8-LiveTranslate identifica a los interlocutores y genera traducción hablada en 29 idiomas. Las demos muestran por qué traducir palabras es solo una parte del problema.

Demostración oficial de Qwen LiveTranslate con varios interlocutores

En una conversación, saber quién ha dicho algo importa casi tanto como entender las palabras. Una voz grave, una respuesta rápida o un cambio de interlocutor ayudan a seguir el hilo. Qwen3.8-LiveTranslate intenta trasladar esa información a la traducción: distinguir hablantes, mantener rasgos de su voz y aprovechar lo que ya se ha dicho.

Qwen presentó el sistema el 18 de septiembre. Admite 60 idiomas de entrada de audio y salida de texto, con voz traducida en 29, entre ellos el español. No significa que todas las combinaciones tengan la misma calidad ni que desaparezca el retraso; define la cobertura que anuncia la compañía.

Tres hablantes, tres voces

Una de las demos utiliza una escena de ficción con varios personajes. La pantalla los identifica por separado y coloca junto al vídeo el texto original y su traducción. La intención es que los cambios de voz y las etiquetas ayuden a conservar el reparto de la conversación.

Demo de Qwen que diferencia a tres personajes y muestra la traducción
Identificación de hablantes en la demostración de Qwen.

El ejemplo permite observar un problema concreto: traducir todo con una misma voz puede volver confusa una discusión, incluso si cada oración es correcta. Mantener quién responde a quién ayuda a reconstruir la escena. Aun así, una demostración seleccionada no dice cómo responderá el sistema ante personas que se interrumpen o voces difíciles de distinguir.

También hay una diferencia entre conservar el timbre y entender bien una frase. Una salida que suene natural puede resultar muy convincente aunque haya cambiado un nombre o una negación. Escuchar el audio y revisar el texto son comprobaciones complementarias.

El contexto evita traducir cada frase como una isla

La segunda demo mantiene una escena más larga y destaca expresiones que dependen de lo ocurrido antes. El objetivo es evitar que cada intervención se procese como si empezara una conversación nueva. Un nombre propio, una referencia a un lugar o una palabra con varios sentidos pueden necesitar ese contexto.

Demostración de traducción de Qwen con contexto de una conversación
La demo de contexto conserva referencias entre intervenciones. Qwen.

Es una mejora con una utilidad fácil de imaginar en reuniones o entrevistas: no basta con traducir la última oración si el sujeto se mencionó varios turnos atrás. Para comprobarla de verdad, habría que seguir también los errores acumulados. Si el sistema interpreta mal un nombre al principio, interesa saber si lo corrige cuando recibe más información.

Cuando dos palabras suenan igual, la imagen puede ayudar

El tercer ejemplo compara una traducción basada solo en audio con otra que recibe una pista visual. Utiliza palabras que suenan igual o de forma similar en inglés, como pair y pear. Ver el objeto al que se refiere el hablante puede reducir la ambigüedad.

Comparación de traducción con una pista visual y solo con audio en la demo de Qwen
Ejemplo ilustrativo de desambiguación visual. Qwen.

La propia pieza advierte que los resultados se han dispuesto junto al vídeo para explicar la comparación. Por tanto, no permite medir el tiempo real de respuesta viendo cuándo aparece una palabra. Es una ilustración del caso de uso, no un cronómetro de rendimiento.

Dónde se puede probar y qué merece una prueba propia

El anuncio enlaza una demo de Live Translate y una interfaz para desarrolladores en QwenCloud. El acceso al ejemplo público y la integración en una aplicación son vías distintas; disponibilidad y condiciones deben comprobarse en cada servicio.

Una prueba útil tendría dos personas, cambios de turno y algunos datos fáciles de verificar: una fecha, una cifra y un nombre. Después se puede comparar qué se conserva, cuánto se espera y si resulta sencillo detectar un error. Probar únicamente frases sueltas y pronunciadas despacio deja fuera buena parte de lo difícil.

El interés de Qwen3.8-LiveTranslate está en tratar la conversación como algo más que una sucesión de palabras. Los ejemplos muestran una dirección prometedora: mantener voces, referencias y pistas visuales. La pregunta para el uso cotidiano es cuánto de esa estructura conserva cuando la conversación deja de parecer una demo.

La conversación continúa en Instagram ↗