lulupedia

Qwen(通义千问)

3764 words·2026/9/13·中文
3

Qwen(中文:通义千问;拼音:Tōngyì Qiānwèn),国际上也称“Tongyi Qianwen",是阿里巴巴集团旗下云计算业务阿里云开发的大型语言模型(LLM)与多模态人工智能模型系列。该系列于2023年4月首次发布,此后发展为覆盖从不足十亿参数的轻量模型到超过一万亿参数的超大规模模型的完整产品线,并衍生出面向视觉、语音、代码、数学和多步推理等任务的专门变体。除通过阿里云的商用模型服务提供外,众多Qwen模型以开放权重形式发布,使Qwen成为全球人工智能社区中下载量最大、复用最广的开放模型系列之一。

背景

阿里巴巴集团自2010年代后期开始大规模投入人工智能研究,其基础研究机构达摩院设立了专注于机器学习、自然语言处理和语音技术的多个实验室。2020年代初,这些研究力量被整合到“通义”(取“通晓广义”之意)计划之下,产出M6大规模预训练模型等研究系统。

2022年底ChatGPT的公开发布在全球范围内、尤其是中国科技企业之间引发了大型语言模型的激烈竞争。2023年4月,阿里巴巴在阿里云峰会上发布通义千问,将其同时定位为面向消费者的AI助手和“模型即服务”(MaaS)战略的基础——企业可以在阿里云的人工智能基础设施之上构建应用。“千问”之名寓意“以千般追问求索真知”,“通义”则将该模型锚定于阿里巴巴更广泛的人工智能计划之中。

历史沿革

2023年:发布与首批开放权重。 通义千问于2023年4月11日正式发布,并通过阿里巴巴的企业协作平台钉钉以测试形式向用户提供。2023年8月,阿里云在Hugging Face和魔搭社区等平台开放了70亿参数的中英双语模型Qwen-7B的权重,所采用的许可协议允许月活跃用户数低于1亿的机构免费商用。同年9月和11月,140亿参数的Qwen-14B与720亿参数的Qwen-72B相继发布,同期还推出了更小规模的模型(1.8B、0.5B)以及Qwen-VL(视觉—语言)、Qwen-Audio等早期多模态模型。这些发布使Qwen在开源社区中很早便赢得了“同规模模型中性能强劲”的声誉。

2024年:迭代与规模扩展。 2024年2月,阿里巴巴发布Qwen1.5系列,将覆盖范围扩展至更广泛的模型规模,并加入混合专家(MoE)变体。主要的Qwen2代于2024年6月发布,包含从0.5B到72B参数的多款模型,训练语料规模显著扩大且更具多语言性,并配有详细的技术报告。2024年下半年,阿里巴巴持续扩展产品线,先后推出Qwen2-Math、Qwen2-VL、Qwen2.5系列(2024年9月,预训练语料约18万亿词元)以及Qwen2.5-Coder。2024年11月,其发布了QwQ-32B-Preview——一款旨在逐步“思考”的早期开放推理模型;同年12月推出视觉推理模型QVQ。旗舰专有模型Qwen2.5-Max被描述为在超过20万亿词元上训练的大型混合专家系统,于2025年1月发布。

2025年:推理、智能体与万亿参数模型。 2025年4月发布的Qwen3代在单一模型中引入了可切换的“思考”与“非思考”混合模式,开放密集模型覆盖0.6B至32B参数,混合专家模型包括Qwen3-235B-A22B。后续发布包括Qwen3-Coder(2025年7月)——一款专门面向智能体编程的超大规模MoE模型,以及Qwen3-VL、Qwen3-Omni等多模态更新,还有被阿里巴巴描述为参数规模超过一万亿的专有旗舰Qwen3-Max。2025年下半年,阿里巴巴还面向国际用户推出了独立的Qwen移动应用,超越了此前基于网页的聊天界面。

模型架构与技术特点

Qwen模型基于当代大语言模型普遍采用的仅解码器(decoder-only)Transformer架构。历代模型融入了多项现代改进,包括用于位置编码的旋转位置编码(RoPE)、SwiGLU激活函数、均方根层归一化(RMSNorm),以及可降低推理阶段内存与计算开销的分组查询注意力(GQA)。上下文窗口随时间不断加长,从早期模型的数千词元扩展到后续世代的12.8万词元以上,部分变体借助YaRN等技术将有效上下文扩展至百万词元级别。

该系列具有以下几方面的鲜明特点:

  • 多语言能力。 发布之初为中文—英文双语,后续世代的训练数据覆盖数十种乃至一百余种语言,使Qwen在非英语语言上的表现相对于许多西方模型尤为突出。
  • 规模多样。 该系列刻意覆盖从约0.5B到数千亿参数的规模区间,既可部署于消费级设备,也可部署于数据中心。
  • 混合专家架构。 自Qwen1.5-MoE起,历经Qwen2、Qwen3及Qwen3-Coder等旗舰系统,MoE变体在每个词元上仅激活总参数的一小部分,从而提升效率。
  • 后训练与推理。 模型经过监督微调与基于人类反馈的强化学习以实现指令遵循;面向推理的版本(QwQ、QVQ以及Qwen3思考模式)运用强化学习引出更长的思维链。

模型家族

Qwen生态系统由若干相互关联的产品线构成:

  • 基座与指令微调大语言模型: 覆盖多种规模的Qwen、Qwen1.5、Qwen2、Qwen2.5、Qwen3等系列,包含预训练检查点与指令微调的对话模型。
  • 专有旗舰模型: Qwen-Max、Qwen2.5-Max、Qwen3-Max,仅通过阿里巴巴的服务提供。
  • 推理模型: 面向文本的QwQ与面向视觉推理的QVQ。
  • 代码模型: CodeQwen1.5、Qwen2.5-Coder和Qwen3-Coder,支持数十种编程语言及智能体工作流。
  • 数学模型: Qwen2-Math与Qwen2.5-Math。
  • 多模态模型: 面向图像与视频理解的Qwen-VL/Qwen2-VL/Qwen2.5-VL/Qwen3-VL系列,Qwen-Audio及其后继型号,以及统一文本、图像、音频、视频输入并支持语音输出的"Omni"系列(Qwen2.5-Omni、Qwen3-Omni)。

消费者和开发者可通过Qwen Chat(chat.qwen.ai)、通义/Qwen应用,以及阿里云的模型平台(灵积DashScope、百炼平台和面向国际市场的Model Studio服务)使用相关模型。

开源生态

开放权重发布是Qwen战略的核心。许多模型采用Apache 2.0许可证发布——这是现存最宽松的开源许可证之一,允许不受限制的商业使用。Qwen模型通过Hugging Face、魔搭社区和GitHub分发,并配有现成的量化版本,可在笔记本电脑和智能手机上运行。截至2025年,据阿里巴巴披露,该系列累计下载数亿次,第三方基于其创建的衍生模型超过10万个,这些数据使Qwen按采用量计位居开放大语言模型生态的前列。

该系列还成为众多重要第三方研究工作的基座。一个突出的例子是2025年1月发布的DeepSeek-R1-Distill系列:DeepSeek以其R1模型蒸馏出的推理数据对Qwen模型(及其他模型)进行微调,产出了获得广泛采用的小型推理系统。社区排行榜上针对微调模型和专门化模型的大量参赛作品同样基于Qwen权重构建。

性能与评价

根据阿里巴巴公布的评测结果,历代Qwen旗舰模型均与领先的前沿模型具有竞争力。Qwen2.5-72B与同期同规模的其他领先开放模型表现相当;据报道,Qwen2.5-Max在部分基准测试上达到或超过DeepSeek-V3、GPT-4o和Claude 3.5 Sonnet等同期系统;Qwen3-235B-A22B在推理、数学和代码评测中取得接近前沿的成绩。Qwen3-Coder在SWE-bench Verified等智能体软件工程基准上报告了强劲结果。独立评测普遍证实Qwen系列在开放模型领域处于领先地位,尤其在多语言、数学和代码任务上表现突出,不过前沿专有模型在部分智能体和长程任务中仍常保持优势。

评论也指出了在中国境内开发的模型所共有的一些特征:基于Qwen的聊天服务在面对政治敏感提示时被观察到拒绝回答或给出受限回答,这反映了中国对人工智能服务适用的监管要求。此外,部分早期Qwen权重曾被第三方修改为“去审查”变体,这一现象在各开放模型中普遍存在。

影响与意义

Qwen对全球人工智能格局产生了重大影响。对阿里巴巴而言,它支撑着将人工智能研究与云服务相结合的战略,帮助阿里云在企业级人工智能市场竞争;据2025年媒体报道,Qwen还成为阿里巴巴与苹果公司合作、为中国大陆销售的iPhone提供人工智能功能的基础。对开源社区而言,Qwen宽松的许可证和广泛的规模选择使其成为全球研究、微调和端侧应用的默认基座,尤其惠及那些被以英语为中心的模型服务不足的亚洲、中东和欧洲语言。在中国国内,Qwen被视为与DeepSeek、字节跳动、智谱、月之暗面等公司的模型并列的最具影响力的模型家族之一,其开放发布被认为是大型模型能力在中国国内产业乃至全球南方快速扩散的因素之一。

截至2020年代中期,Qwen仍处于积极开发之中:阿里巴巴承诺对人工智能基础设施和研究进行多年期的大规模投资,该系列也持续在模型规模、模态覆盖和智能体能力等方向上不断扩展。

评论区 (0)

U

还没有评论,来抢沙发!

你感兴趣的百科

相关百科