Serie de modelos de traducción de código abierto: Hunyuan-MT de Tencent

La compañía de tecnología china Tencent ha publicado una nueva serie de modelos de idiomas que se han optimizado para las tareas de traducción ayer como código abierto. Según la información compartida; Hunyuan-mt Esta serie, una traducción popular de inteligencia artificial de algoritmos en la comparación de Google Translate de huelas significativamente.

Los dos buques insignia de la serie Hunyuan-MT, que consta de cuatro modelos, tienen 7 mil millones de parámetros de Hunyuan-MT-7B y Hunyuan-MT-Chimera-7b. También hay dos algoritmos comprimidos para el uso de memoria inferior. Sin embargo, estas versiones se comprometen a la calidad de la salida.

Ambos modelos admiten traducciones de dos vías en 33 idiomas. Los idiomas compatibles incluyen idiomas comúnmente utilizados como chino, inglés y japonés, así como idiomas menos ampliamente digitalizados como checo, marathi, estonca e islandés. De hecho, Tencent se centra más en la traducción entre idiomas minoritarios en chino y China. Los modelos pueden traducirse entre chino y kazajos, uigures, mongoles y tibetanos.

Proceso de educación de la serie Hunyuan-MT

El primer entrenamiento de los modelos se realizó utilizando cuatro conjuntos de datos diferentes. Aunque los dos primeros conjuntos de datos contienen partículas de texto escritas en 33 idiomas, no contiene ninguna información sobre cómo hacer la traducción. Los otros dos conjuntos de datos contienen unos pocos millones de pares de datos. Es posible definir estos pares de datos como registros de cada uno de ellos como una partícula de texto y una traducción.

Según la información compartida por Tencent, el flujo de negocios de capacitación se agregó a los modelos Hunyuan-MT, así como una cantidad significativa de información general. En el criterio de información general MMLU-Prro, Hunyuan-MT dejó el modelo LLAMA-3-8B-base con un parámetro de 8 mil millones con una diferencia significativa.

Tencent, después de la primera capacitación, pasó la etapa de aprendizaje reforzado. Dentro del alcance del aprendizaje reforzado, la compañía ha otorgado una serie de tareas de capacitación a los modelos Hunyuan-MT y le dieron comentarios sobre la calidad de sus respuestas. Los modelos utilizaron estos comentarios para mejorar la calidad de la calidad de la salida.

Hunyuan-MT-7B, el primer modelo de inteligencia artificial de la serie Hunyuan-MT, se basa en una arquitectura de modelo de lenguaje estándar. Hunyuan-MT-Chimera-7b utiliza el aprendizaje del conjunto como enfoque de procesamiento. El algoritmo de aprendizaje del conjunto consta de múltiples redes neuronales, al igual que los modelos de mezcla de expertos. Sin embargo, la mezcla de expertos usa todas las redes neuronales para procesar el comando del usuario, mientras que Learning Ensemble las usa a todos. Este enfoque, que produce una respuesta múltiple al comando, combina estas respuestas en una sola respuesta de alta calidad.

Mientras tanto, es posible comparar Hunyuan-MT con Google Translate utilizando el criterio de traducción de inteligencia artificial de Tencent llamado WMT25. Según la compañía, la serie de modelos Hunyuan-MT funcionó mejor en 30 de 31 pares de idiomas evaluados en la prueba y, en algunos casos, recibió puntos 65 por ciento más altos. Además, según Tencent; En el criterio WMT25, Hunyuan-MT obtuvo un puntaje más alto que el soneto GPT-4.1 y Claude 4 para la mayoría de los pares de idiomas.

We use cookies in order to give you the best possible experience on our website. By continuing to use this site, you agree to our use of cookies.
Accept