📄 论文精读 🏆 必读经典 · 2024 · Alibaba 2024-2025
Qwen 技术报告(Qwen 2.5 / Qwen 3)
Qwen Team (Alibaba)
📖 如果你只读一段,读这段
阿里通义千问开源系列 —— 0.5B 到 72B 全规格、多模态、长上下文 128k、Apache 2.0。2024 年中国开源 LLM 的代表,国际排行榜常年 Top 5。
#Qwen#开源#中文#L4
为什么这篇重要
阿里通义千问(Qwen)系列是中国开源 LLM 的标杆:
- 完整规格:0.5B / 1.5B / 3B / 7B / 14B / 32B / 72B
- 多模态:Qwen-VL、Qwen-Audio、Qwen2.5-VL
- 长上下文:128k tokens
- 协议:Apache 2.0(部分大模型例外)
- 中文 + 英文 + 多语言:训练语料覆盖 29 种语言
Qwen 2.5 / Qwen 3 在国际开源排行榜上经常 Top 5 —— 跟 LLaMA、Mistral、DeepSeek 同档。
训练 pipeline
Qwen 走的是经典 LLM 三阶段 + 一些工程优化:
1. 预训练
- 18T tokens(Qwen 2.5)
- 数据混合:网页、代码、书籍、论文、多语言
- 上下文:原训 8k,后扩展到 128k(YaRN 等技术)
2. SFT(监督微调)
- 100 万 + 高质量指令数据
- 涵盖:对话、代码、数学、推理
3. RLHF(人类反馈强化学习)
- DPO 优化(不是经典 PPO)
- 数据来源:人类标注 + 模型自蒸馏
架构细节
Decoder-only Transformer,标准配方 + 一些优化:
- Multi-Head Attention with GQA
- RMSNorm(不是 LayerNorm)
- SwiGLU 激活(不是 ReLU)
- RoPE 位置编码
- 训练精度:BF16
跟 LLaMA-3 / Mistral 大同小异 —— 架构层面区分度有限,关键看数据。
性能 highlights
Qwen2.5-72B 对比同档:
| 模型 | MMLU | GSM8K | HumanEval | 中文 (CMMLU) |
|---|---|---|---|---|
| LLaMA-3.1 70B | 79.5 | 92 | 80.5 | 67 |
| Mistral Large 2 (123B) | 84 | 93 | 92 | — |
| Qwen2.5 72B | 86 | 95 | 86 | 89 |
| GPT-4o | 88.7 | 95.8 | 90.2 | 87 |
中文任务上常常超过国际模型——这是 Qwen 的差异化优势。
Qwen2.5-VL(多模态)
2024 末发布的视觉版:
- 输入:图像 + 视频 + 文档 + 表格
- 能 OCR、能理解 GUI 界面
- 能从视频里抽取信息
能直接看截图改 Bug —— 用户体验跟 GPT-4V / Claude 3.5 Sonnet 接近。
Qwen 3(2025)
2025 年 4 月发布。重大改进:
- 混合架构:部分模型加 Mamba 类 SSM 提速
- 思维链增强:默认会”先思考再回答”
- 更长上下文:256k tokens
- 更小模型也能干活:3B 已经能解高考数学题
中国大厂在 LLM 上实质性追上国际前沿—— Qwen 3 / DeepSeek R1 / Kimi 1.5 是这个判断的关键证据。
工业采用
Qwen 是国内大厂 / 国外开发者默认开源选项之一:
- 中国厂商:阿里云大量产品 + 第三方推理服务
- 国外:HuggingFace 上下载量 Top 10
- Edge AI:1.5B / 3B 跑手机、嵌入式设备
- 企业内部:金融 / 政府 / 法律行业,因为可私有部署
与其他开源 LLM 对比
| 维度 | Qwen | LLaMA | Mistral | DeepSeek |
|---|---|---|---|---|
| 中文 | 极强 | 一般 | 一般 | 强 |
| 代码 | 强 | 中 | 中 | 极强(V3/R1) |
| 数学 | 强 | 中 | 中 | 极强(R1) |
| 多模态 | 强(Qwen-VL) | 弱 | 弱 | 中 |
| 小模型 | 强(0.5B 起) | 中(8B 起) | 中 | 弱 |
| 协议 | Apache 2.0 | Llama license | Apache 2.0 | MIT |
不同场景选不同的:中文 → Qwen;代码/推理 → DeepSeek;通用 → LLaMA / Mistral。
推荐配套阅读
- HelloAI: L4-01 LLM 训练 + L4-05 LoRA 微调
- Qwen 技术报告 v2.5(2412.15115)
- DeepSeek V3 论文 —— 国内另一极
- LLaMA 3 论文 —— 对比国外
💡 一个观点
2023-2024 围绕”中国 vs 国际 LLM”的争论很多。 2025 看回来:
Qwen / DeepSeek / Kimi 等已经达到国际开源前沿水平—— 同时在中文 + 部分专业任务上反超。
但要清醒:
- 闭源前沿(GPT-5、Claude Opus 4.6、Gemini 2.5)仍领先 3-6 个月
- 训练成本国内仍受 GPU 出口限制约束
- 生态英文世界仍占主导(论文 / 工具 / 社区)
但差距在缩小。
📬
想要更多论文精读
订阅每周精选 —— 下一篇论文笔记直接送邮箱。
💬
讨论区
· 用 GitHub 账号登录评论
⚠️ Giscus 评论未配置 ——
在
src/components/Comments.astro 顶部填入
仓库 ID 和分类 ID(见组件注释里的配置步骤)。