lulupedia

Qwen

7354 words·13/9/2026·Español
3

Qwen (chino: 通义千问; pinyin: Tōngyì Qiānwèn), conocido internacionalmente también como Tongyi Qianwen, es una familia de modelos de lenguaje de gran escala (LLM) y modelos de inteligencia artificial multimodales desarrollada por Alibaba Cloud, la subsidiaria de computación en la nube del grupo tecnológico chino Alibaba Group. Presentada por primera vez en abril de 2023, la serie Qwen ha crecido hasta abarcar modelos de escalas muy diversas —desde modelos compactos de menos de mil millones de parámetros hasta sistemas que superan el billón de parámetros—, así como variantes especializadas en visión, voz, programación, matemáticas y razonamiento de múltiples pasos. Además de ofrecerse a través de los servicios comerciales de modelos de Alibaba Cloud, numerosos modelos de Qwen se han publicado con pesos abiertos, lo que ha convertido a Qwen en una de las familias de modelos de código abierto más descargadas y reutilizadas de la comunidad mundial de inteligencia artificial.

Antecedentes

El grupo Alibaba inició una fuerte inversión en investigación de inteligencia artificial a finales de la década de 2010, en particular a través de la Academia DAMO (DAMO Academy), su brazo de investigación fundamental, que estableció laboratorios dedicados al aprendizaje automático, el procesamiento del lenguaje natural y la tecnología del habla. A principios de la década de 2020, estos esfuerzos se consolidaron bajo la iniciativa «Tongyi» (通义, traducible libremente como «significado universal»), de la que surgieron el modelo preentrenado a gran escala M6 y otros sistemas de investigación.

El lanzamiento público de ChatGPT a finales de 2022 desencadenó una intensa competencia en el ámbito de los grandes modelos de lenguaje a escala mundial, y de manera particular entre las empresas tecnológicas chinas. En abril de 2023, Alibaba anunció Tongyi Qianwen durante su Alibaba Cloud Summit, posicionando el modelo tanto como asistente de IA orientado al consumidor como base de una estrategia de «modelo como servicio» (model-as-a-service), en la que las empresas podrían construir aplicaciones sobre la infraestructura de IA de Alibaba Cloud. El nombre Qianwen (千问), que significa «mil preguntas», refleja la idea de alcanzar la comprensión mediante la indagación extensa, mientras que «Tongyi» ancla el modelo dentro del programa más amplio de Alibaba en inteligencia artificial.

Historia

2023: lanzamiento y primeras versiones abiertas

Tongyi Qianwen fue presentado oficialmente el 11 de abril de 2023 y desplegado en fase beta a través de DingTalk, la plataforma de comunicación empresarial de Alibaba. En agosto de 2023, Alibaba Cloud publicó los pesos de Qwen-7B, un modelo bilingüe (chino-inglés) de 7000 millones de parámetros, en plataformas como Hugging Face y ModelScope bajo una licencia que permitía el uso comercial gratuito a organizaciones con menos de 100 millones de usuarios activos mensuales. Le siguieron Qwen-14B en septiembre y el más grande Qwen-72B en noviembre de 2023, junto con modelos más pequeños (1,8B y 0,5B) y los primeros modelos multimodales, como Qwen-VL (visión-lenguaje) y Qwen-Audio. Estas publicaciones otorgaron a Qwen una temprana reputación en la comunidad de código abierto por su sólido rendimiento en relación con su tamaño.

2024: escalado iterativo

En febrero de 2024, Alibaba presentó la serie Qwen1.5, que amplió la gama de tamaños disponibles e incorporó una variante basada en mezcla de expertos (MoE). La gran generación Qwen2 llegó en junio de 2024, con modelos de 0,5B a 72B de parámetros entrenados con corpus multilingües considerablemente mayores, acompañados de un informe técnico detallado. Durante el resto de 2024, Alibaba amplió la familia con Qwen2-Math, Qwen2-VL, la serie Qwen2.5 (septiembre de 2024, preentrenada con unos 18 billones de tokens) y Qwen2.5-Coder. En noviembre de 2024 presentó QwQ-32B-Preview, uno de los primeros modelos de razonamiento abiertos, diseñado para «pensar» paso a paso, y en diciembre de 2024 el modelo de razonamiento visual QVQ. El modelo propietario insignia Qwen2.5-Max, descrito como un gran sistema de mezcla de expertos entrenado con más de 20 billones de tokens, se publicó en enero de 2025.

2025: razonamiento, agentes y modelos de un billón de parámetros

La generación Qwen3, presentada en abril de 2025, introdujo modos híbridos de «pensamiento» y «no pensamiento» dentro de un mismo modelo, con modelos densos abiertos de 0,6B a 32B de parámetros y modelos MoE como Qwen3-235B-A22B. Entre los lanzamientos posteriores figuran Qwen3-Coder (julio de 2025), un modelo MoE de gran tamaño especializado en programación agéntica; actualizaciones multimodales como Qwen3-VL y Qwen3-Omni; y el modelo insignia propietario Qwen3-Max, que Alibaba describió como superior al billón de parámetros. A finales de 2025, Alibaba lanzó además una aplicación móvil dedicada de Qwen para usuarios internacionales, superando su interfaz de chat basada en web.

Arquitectura y características técnicas

Los modelos de Qwen se basan en la arquitectura Transformer de solo decodificador (decoder-only), que subyace a la mayoría de los LLM contemporáneos. Las generaciones sucesivas incorporaron refinamientos modernos estándar, entre ellos las incrustaciones de posición rotatorias (RoPE) para la codificación posicional, las funciones de activación SwiGLU, la normalización de capa por raíz de la media cuadrática (RMSNorm) y la atención de consultas agrupadas (GQA), que reduce el consumo de memoria y de cómputo durante la inferencia. Las ventanas de contexto se alargaron con el tiempo, desde varios miles de tokens en los primeros modelos hasta 128 000 tokens y más en las generaciones posteriores, con técnicas como YaRN que extendieron el contexto efectivo hasta el rango del millón de tokens en algunas variantes.

Varias características definen a la familia:

  • Multilingüismo. Aunque bilingüe en chino e inglés en su origen, las generaciones posteriores se entrenaron con datos que abarcan desde decenas hasta más de un centenar de lenguas, lo que hace que Qwen destaque notablemente en idiomas distintos del inglés en comparación con muchos de sus pares occidentales.
  • Diversidad de escalas. La familia abarca deliberadamente tamaños desde unos 0,5B hasta cientos de miles de millones de parámetros, lo que permite su despliegue tanto en dispositivos de consumo como en centros de datos.
  • Mezcla de expertos. Las variantes MoE, iniciadas con Qwen1.5-MoE y continuadas en Qwen2, Qwen3 y sistemas insignia como Qwen3-Coder, activan solo una fracción del total de parámetros por token, mejorando la eficiencia.
  • Postentrenamiento y razonamiento. Los modelos se someten a ajuste fino supervisado y aprendizaje por refuerzo a partir de retroalimentación humana para el seguimiento de instrucciones; las versiones centradas en el razonamiento (QwQ, QVQ, los modos de pensamiento de Qwen3) aplican aprendizaje por refuerzo para inducir cadenas de razonamiento extendidas.

Familia de modelos

El ecosistema Qwen comprende varias líneas interrelacionadas:

  • LLM base e instructivos en diversas escalas (por ejemplo, Qwen, Qwen1.5, Qwen2, Qwen2.5 y Qwen3), que cubren puntos de control de preentrenamiento y modelos de chat ajustados por instrucciones.
  • Modelos insignia propietarios (Qwen-Max, Qwen2.5-Max, Qwen3-Max), disponibles únicamente a través de los servicios de Alibaba.
  • Modelos de razonamiento: QwQ (texto) y QVQ (razonamiento visual).
  • Modelos de código: CodeQwen1.5, Qwen2.5-Coder y Qwen3-Coder, compatibles con decenas de lenguajes de programación y flujos de trabajo agénticos.
  • Modelos matemáticos: Qwen2-Math y Qwen2.5-Math.
  • Modelos multimodales: Qwen-VL/Qwen2-VL/Qwen2.5-VL/Qwen3-VL para la comprensión de imágenes y vídeo, Qwen-Audio y sus sucesores, y la línea «Omni» (Qwen2.5-Omni, Qwen3-Omni), que unifica la entrada de texto, imagen, audio y vídeo con salida de voz.

El acceso de consumidores y desarrolladores se ofrece mediante Qwen Chat (chat.qwen.ai), las aplicaciones Tongyi/Qwen y las plataformas de modelos de Alibaba Cloud (DashScope, la plataforma Bailian y el servicio internacional Model Studio).

Ecosistema de código abierto

Las publicaciones con pesos abiertos han sido centrales en la estrategia de Qwen. Muchos modelos se publicaron bajo la licencia Apache 2.0, una de las más permisivas disponibles, que permite el uso comercial sin restricciones. Los modelos de Qwen se distribuyen en Hugging Face, ModelScope y GitHub, con cuantizaciones listas para usar que permiten su ejecución en computadoras portátiles y teléfonos

Comentarios (0)

U

Aún no hay comentarios. ¡Sé el primero!

Te puede interesar

Artículos relacionados