HelloAI
📄 论文精读 🏆 必读经典 · 2024 · Alibaba 2024-2025

Qwen 技术报告(Qwen 2.5 / Qwen 3)

Qwen Team (Alibaba)
📖 如果你只读一段,读这段
阿里通义千问开源系列 —— 0.5B 到 72B 全规格、多模态、长上下文 128k、Apache 2.0。2024 年中国开源 LLM 的代表,国际排行榜常年 Top 5。
#Qwen#开源#中文#L4

为什么这篇重要

阿里通义千问(Qwen)系列是中国开源 LLM 的标杆

  • 完整规格:0.5B / 1.5B / 3B / 7B / 14B / 32B / 72B
  • 多模态:Qwen-VL、Qwen-Audio、Qwen2.5-VL
  • 长上下文:128k tokens
  • 协议:Apache 2.0(部分大模型例外)
  • 中文 + 英文 + 多语言:训练语料覆盖 29 种语言

Qwen 2.5 / Qwen 3 在国际开源排行榜上经常 Top 5 —— 跟 LLaMA、Mistral、DeepSeek 同档。

训练 pipeline

Qwen 走的是经典 LLM 三阶段 + 一些工程优化:

1. 预训练

  • 18T tokens(Qwen 2.5)
  • 数据混合:网页、代码、书籍、论文、多语言
  • 上下文:原训 8k,后扩展到 128k(YaRN 等技术)

2. SFT(监督微调)

  • 100 万 + 高质量指令数据
  • 涵盖:对话、代码、数学、推理

3. RLHF(人类反馈强化学习)

  • DPO 优化(不是经典 PPO)
  • 数据来源:人类标注 + 模型自蒸馏

架构细节

Decoder-only Transformer,标准配方 + 一些优化:

- Multi-Head Attention with GQA
- RMSNorm(不是 LayerNorm)
- SwiGLU 激活(不是 ReLU)
- RoPE 位置编码
- 训练精度:BF16

跟 LLaMA-3 / Mistral 大同小异 —— 架构层面区分度有限,关键看数据

性能 highlights

Qwen2.5-72B 对比同档:

模型MMLUGSM8KHumanEval中文 (CMMLU)
LLaMA-3.1 70B79.59280.567
Mistral Large 2 (123B)849392
Qwen2.5 72B86958689
GPT-4o88.795.890.287

中文任务上常常超过国际模型——这是 Qwen 的差异化优势。

Qwen2.5-VL(多模态)

2024 末发布的视觉版:

  • 输入:图像 + 视频 + 文档 + 表格
  • 能 OCR、能理解 GUI 界面
  • 能从视频里抽取信息

能直接看截图改 Bug —— 用户体验跟 GPT-4V / Claude 3.5 Sonnet 接近。

Qwen 3(2025)

2025 年 4 月发布。重大改进:

  • 混合架构:部分模型加 Mamba 类 SSM 提速
  • 思维链增强:默认会”先思考再回答”
  • 更长上下文:256k tokens
  • 更小模型也能干活:3B 已经能解高考数学题

中国大厂在 LLM 上实质性追上国际前沿—— Qwen 3 / DeepSeek R1 / Kimi 1.5 是这个判断的关键证据。

工业采用

Qwen 是国内大厂 / 国外开发者默认开源选项之一:

  • 中国厂商:阿里云大量产品 + 第三方推理服务
  • 国外:HuggingFace 上下载量 Top 10
  • Edge AI:1.5B / 3B 跑手机、嵌入式设备
  • 企业内部:金融 / 政府 / 法律行业,因为可私有部署

与其他开源 LLM 对比

维度QwenLLaMAMistralDeepSeek
中文极强一般一般
代码极强(V3/R1)
数学极强(R1)
多模态强(Qwen-VL)
小模型强(0.5B 起)中(8B 起)
协议Apache 2.0Llama licenseApache 2.0MIT

不同场景选不同的:中文 → Qwen;代码/推理 → DeepSeek;通用 → LLaMA / Mistral。

推荐配套阅读

  • HelloAI: L4-01 LLM 训练 + L4-05 LoRA 微调
  • Qwen 技术报告 v2.5(2412.15115)
  • DeepSeek V3 论文 —— 国内另一极
  • LLaMA 3 论文 —— 对比国外
💡 一个观点

2023-2024 围绕”中国 vs 国际 LLM”的争论很多。 2025 看回来:

Qwen / DeepSeek / Kimi 等已经达到国际开源前沿水平—— 同时在中文 + 部分专业任务上反超

但要清醒:

  • 闭源前沿(GPT-5、Claude Opus 4.6、Gemini 2.5)仍领先 3-6 个月
  • 训练成本国内仍受 GPU 出口限制约束
  • 生态英文世界仍占主导(论文 / 工具 / 社区)

但差距在缩小。

📬

想要更多论文精读

订阅每周精选 —— 下一篇论文笔记直接送邮箱。

💬

讨论区

· 用 GitHub 账号登录评论
⚠️ Giscus 评论未配置 —— 在 src/components/Comments.astro 顶部填入 仓库 ID 和分类 ID(见组件注释里的配置步骤)。