2505.09388-qwen3-technical-report
Qwen3 Technical Report
Qwen3 把 dense / MoE (Mixture of Experts,混合专家) 开源模型族、thinking / non-thinking 双模式、thinking budget、36T token 多语预训练、四阶段后训练和 strong-to-weak distillation 组织成一套可发布模型体系,使 Qwen3-235B-A22B、Qwen3-32B 与小模型在数学、代码、agent、多语和长上下文任务上成为强开源基线;关键训练数据、RL (Reinforcement Learning,强化学习) 配置、内部 reward 与统计复验细节仍主要依赖技术报告叙述。
Source
- Title: Qwen3 Technical Report
- arXiv: https://arxiv.org/abs/2505.09388
- HTML: https://arxiv.org/html/2505.09388v1
- PDF: https://arxiv.org/pdf/2505.09388
- TeX Source: https://arxiv.org/e-print/2505.09388
- Code/Project: https://github.com/QwenLM/Qwen3
- Blog: https://qwenlm.github.io/blog/qwen3/
- Model collection: https://huggingface.co/collections/Qwen/qwen3
- OpenReview / Review page: OpenReview CoRR / DBLP metadata;该页为 CoRR/DBLP 索引页,Last Modified 2026-01-15,未发现 official reviews。
- Authors: An Yang and 59 other authors;本地核心跟踪作者包括 An Yang, Binyuan Hui, Bo Zheng, Bowen Yu, Dayiheng Liu, Fei Huang, Jianwei Zhang, Jianxin Yang, Jingren Zhou, Junyang Lin, Rui Men。
- Organization: Qwen Team / Alibaba Cloud;arXiv metadata lists An Yang, Anfeng Li, Baosong Yang, Beichen Zhang, Binyuan Hui, Bo Zheng, Bowen Yu and others.
- Submitted: 2025-05-14
- Current version read: v1
- arXiv DOI: https://doi.org/10.48550/arXiv.2505.09388
- Subjects: Computation and Language (cs.CL)
作者与关系
- Qwen Team / Alibaba Cloud: Qwen Team / Alibaba Cloud.
- Binyuan Hui: Qwen Team.
- 作者组织:正文区分 Core Contributors 与 Contributors;标题页不拆逐作者机构。
阅读目标与判断边界
归档关注:
- Qwen3 如何统一 thinking 和 non-thinking 两种使用模式。
- Qwen3 的 dense/MoE 模型族和 strong-to-weak distillation 如何组织。
- Qwen3 和 Bebop、STV、Qwen2.5、DeepSeek-R1/V3 的关系。
- 它的实验设置、baseline 和版本边界。
判断边界:
- arXiv v1 对应 2025-05 版本;后续 Qwen3-2507 系列已经更新,不能回填为当前 v1 结论。
- General RL 的 20+ task reward 和内部 benchmark 复现性有限。
- 闭源 baseline 的采样、prompt 和隐藏系统策略无法完全对齐。
术语预备
CoT (Chain of Thought,链式思考): 生成显式中间推理过程。SFT (Supervised Fine-Tuning,监督微调): 监督指令微调。GRPO (Group Relative Policy Optimization,组相对策略优化): 使用同 prompt group reward baseline 的 RL 方法。KL (Kullback-Leibler divergence,分布距离约束): 用于约束策略偏移或蒸馏。GQA (Grouped Query Attention,分组查询注意力): 降低注意力 KV cache 的结构。RoPE (Rotary Positional Embedding,旋转位置编码): 位置编码方法。BFCL (Berkeley Function Calling Leaderboard,函数调用评测): 工具/函数调用 benchmark。RULER: 长上下文检索 benchmark。YaRN: RoPE 外推方法。
论文脉络
1. 研究问题、背景和价值
开源 LLM 同时需要强 reasoning model、低延迟普通对话、工具调用能力和小模型继承能力。Qwen2.5 与 QwQ-32B 分别覆盖通用和推理能力,Qwen3 试图用同一模型族同时覆盖这些部署模式。
2. 已有解决方案与不足
此前路线通常把 chat model、reasoning model、小模型蒸馏和 MoE 规模化分开处理。缺口集中在模式切换成本、推理 token 预算控制、小模型复训成本、多语覆盖、长上下文评测,以及 agent/tool-use 后训练稳定性。
3. 作者可能的思考路径
Qwen3 面对的是 Qwen2.5 和 QwQ 之后的产品张力:用户既需要长推理模型的高上限,也需要普通 chat 的低延迟和稳定格式;生态又需要从 0.6B 到 235B-A22B 的完整模型族。如果把 thinking model 和 non-thinking model 分开维护,训练、部署和用户接口都会变复杂;如果让所有请求默认长思考,token 成本和响应时间会失控。
这会把作者推向一个统一模型、显式模式控制的方向:先训练强 thinking teacher,证明高难推理上限;再通过 mode fusion 把 non-thinking response 合入同一模型;最后把 /think、/no_think 和 thinking budget 放进 chat template,让 test-time compute 成为可控接口。
小模型又带来第二层压力。让每个尺寸都完整走一遍 long-CoT RL 成本太高,且探索效率低;强 teacher 已经搜索到高质量 reasoning 分布,把 logits 和 responses 转移给学生更经济。于是 off-policy response distillation 和 on-policy logits KL distillation 成为 Qwen3 的核心路线:用大模型承担探索成本,让小模型继承可用的 reasoning policy。
4. 核心假设或切入点
同一模型可以通过模式控制覆盖长推理和低延迟对话;strong-to-weak logits distillation 可以比直接 RL 更高效地把大模型 reasoning 能力迁移到小模型;thinking budget 是开放模型可控 test-time compute 的实用接口。
5. 方法 / 系统 / 理论框架
Qwen3 的底座延续 Qwen2.5 的 dense/MoE 模型族路线,并扩大到 6 个 dense 模型和 2 个 MoE 模型:0.6B、1.7B、4B、8B、14B、32B,外加 30B-A3B 和 235B-A22B。旗舰 MoE 是 235B total / 22B active,94 layers,128 experts,每 token 激活 8 experts。架构侧沿用 GQA、SwiGLU、RoPE、RMSNorm 等成熟组件,并加入 QK-Norm 稳定 attention logits;主要方法创新集中在预训练数据分阶段、thinking control 和 strong-to-weak distillation。
预训练分三段。S3 后继续沿用 YaRN / DCA (Dual Chunk Attention,双块注意力) 做 4x 推理外推;DCA 的机制边界可参考 Qwen2.5-1M 线索,即通过重映射相对位置降低 RoPE 在超长距离上的外推压力。
| 阶段 | 数据规模 | Sequence length | 目标 |
|---|---|---|---|
| S1 general stage | > 30T tokens | 4K | 通用知识、多语、代码和基础能力 |
| S2 reasoning stage | ~5T tokens | 未完整披露 | STEM、code、reasoning 高质量数据,推动可推理任务分布 |
| S3 long-context stage | 数千亿 tokens | 32K | 长上下文数据,并通过 YaRN / DCA 做 4x 推理外推 |
| 维度 | 公开情况 |
|---|---|
| 总训练数据 | 36T tokens |
| 模型族 | dense / MoE family;旗舰 Qwen3-235B-A22B |
| 训练硬件 | 未完整公开 |
| 并行方式 | 未完整公开 |
| 训练时间 / 成本 | 主训练 GPU hours、wall-clock 和美元成本未完整公开;distillation vs RL 对照单独报告 GPU hours |
后训练第一步是 Long-CoT cold start。Qwen3 先用经过筛选的长推理样本训练 thinking model,让模型学会在 <think>...</think> 内生成可展开的 reasoning trace。这个阶段提供可读的推理格式和初始 reasoning 行为,减少后续 RL 在稀疏 reward 下从零探索的成本。
第二步是 Reasoning RL。Qwen3 收集 3,995 个 query-verifier pairs,用 GRPO (Group Relative Policy Optimization,组相对策略优化) 更新 thinking model;GRPO 的基本思想与 DeepSeek-R1 一致,用同一 prompt 下多条 rollout 的相对 reward 估计 advantage,省去 value model。这里的 verifier 让数学、代码、逻辑和 STEM 任务具备可训练的 outcome reward。报告中的关键现象是 Qwen3-235B-A22B 在 AIME'24 上从 70.1 提升到 85.1,训练 170 RL steps。
第三步是 Thinking Mode Fusion。前两步得到的是强 thinking model,但产品上还需要低延迟的 non-thinking response。Qwen3 通过继续 SFT 把 thinking 和 non-thinking 样本合入同一个模型,并在 chat template 里加入 /think、/no_think 和空 <think></think> block。这样用户或系统可以通过模板选择显式思考、直接回答,或者设置 thinking budget。budget 用完后,模型停止继续生成 thinking trace,转入最终答案,从而把 test-time compute 变成可控接口。
第四步是 General RL。它覆盖 20+ tasks,包括 instruction following、format following、preference alignment、agent ability、RAG 等。reward 分三类:rule-based reward 处理可验证格式和硬规则;带参考答案的 model-based reward 判断接近标准答案的任务;无参考答案 reward model 处理开放式 helpfulness、harmlessness 和偏好。这一步的作用是补回 mode fusion 后可能牺牲的通用 chat、工具和格式能力。
Strong-to-Weak Distillation 把完整后训练流程的成本从小模型上拿掉。Qwen3 先完整训练旗舰 235B-A22B 和 32B,再把这些 teacher 的能力迁移给 0.6B、1.7B、4B、8B、14B 和 30B-A3B。off-policy response distillation 先让学生模仿 teacher 生成的高质量 responses;on-policy logits KL distillation 再让学生在自己采样到的状态上对齐 teacher logits,缓解只学离线 teacher response 带来的 distribution mismatch。这个设计解释了为什么 Qwen3-8B 的 distillation 实验能用更少 GPU hours 超过直接 RL baseline。
6. 结论链条
Qwen3 将 Qwen2.5 的通用能力和 QwQ 式 reasoning 能力统一到一组模型和一套 chat template 中;通过大模型 teacher logits 蒸馏小模型;通过 mode fusion 和 General RL 增强 agent/tool-use 能力;用 YaRN/DCA 扩展长上下文。
关键实验/定理
结果 1:base model scaling
- 设置:Qwen3-235B-A22B-Base vs Qwen2.5-72B/Plus, Llama-4-Maverick, DeepSeek-V3。
- Baseline:强开放 base models。
- 指标:15 个 general/math/code/multilingual benchmarks。
- 结果:Qwen3-235B-A22B-Base 在 14/15 项超过 DeepSeek-V3-Base;MATH 71.84,EvalPlus 77.60。
- 解读:MoE 架构、数据规模和训练策略共同提升 base 能力。
结果 2:thinking flagship
- 设置:Qwen3-235B-A22B thinking vs OpenAI-o1, DeepSeek-R1, Grok-3 Think, Gemini 2.5 Pro。
- Baseline:推理型闭源和开放模型。
- 指标:AIME、LiveCodeBench、BFCL、CodeForces。
- 结果:AIME'24 85.7,AIME'25 81.5,LiveCodeBench v5 70.7,BFCL v3 70.8,CodeForces 2056。
- 解读:开源 reasoning 能力很强;闭源模型比较受采样预算和 harness 影响。
结果 3:non-thinking flagship
- 设置:Qwen3-235B-A22B non-thinking vs GPT-4o, DeepSeek-V3, Qwen2.5-72B, Llama-4-Maverick。
- Baseline:通用 chat models。
- 指标:AIME、Arena-Hard、CodeForces 等。
- 结果:AIME'24 40.1,Arena-Hard 96.1,CodeForces 1387。
- 解读:同一模型在低推理预算下仍保留通用和 agent 能力。
结果 4:distillation vs RL
- 设置:Qwen3-8B,从同一 off-policy distilled checkpoint 出发。
- Baseline:直接 RL。
- 指标:AIME pass@1/pass@64、LiveCodeBench、GPU hours。
- 解读:teacher logits distillation 同时提高效率和探索覆盖。
结果:
| 方法 | AIME'24 pass@1 | AIME'24 pass@64 | GPU hours |
|---|---|---|---|
| on-policy distillation | 74.4 | 93.3 | 1,800 |
| direct RL | 67.6 | 90.0 | 17,920 |
结果 5:mode fusion / General RL
- 设置:Qwen3-32B Stage 2/3/4 ablation。
- Baseline:不同后训练阶段。
- 指标:ThinkFollow、ToolUse、AIME、LiveCodeBench。
- 解读:模式控制和 agent 能力增强,同时高难数学/代码 thinking 分数略降。
结果:
| 指标 | Stage 2 | Stage 4 |
|---|---|---|
| ThinkFollow | 88.7 | 98.9 |
| ToolUse thinking | 70.4 | 85.5 |
| AIME thinking | 83.8 | 81.4 |
实验设置与 baseline 审计
| 维度 | 记录 |
|---|---|
| 模型与初始化 | Qwen3 dense/MoE family;235B-A22B flagship |
| 数据与任务 | 36T tokens;S1 general >30T;S2 STEM/code/reasoning ~5T;S3 数千亿 long-context tokens |
| RL / 训练配置 | GRPO reasoning RL;General RL 多任务 reward;distillation 使用 off-policy response + on-policy logits KL;batch、rollout、KL、reward weights 披露有限 |
| 系统配置 | 训练集群、GPU 型号、GPU 数和并行方式未完整公开 |
| 技术报告训练配置 | Reasoning RL 使用 3,995 query-verifier pairs,Qwen3-235B-A22B AIME'24 70.1 -> 85.1,训练 170 RL steps;distillation vs RL 对照报告 1,800 vs 17,920 GPU hours |
| 未披露项 | 主训练硬件、并行方式、pretraining wall-clock / GPU hours / 成本、General RL reward weights、完整 rollout 配置 |
| 评测协议 | 公开 benchmark + in-house task |
| 统计报告 | 多数主表没有 seed、误差线、置信区间 |
| Baseline 强度 | 覆盖强,但 compute / implementation matching 不完全 |
| 结论边界 | distillation vs RL 是最接近可审计的训练效率对照;General RL 和内部 benchmark 需要谨慎 |
证据链强度评估
强证据
- 模型权重、GitHub、Hugging Face collection、模型卡和技术报告公开。
- 架构规格、预训练阶段、后训练阶段和主要 benchmark 数值完整。
- distillation vs RL 报告 GPU hours 和 pass@64。
中等强度证据
- thinking budget scaling、mode fusion、General RL 和 long-context RULER 结果方向一致,但依赖内部环境。
需要谨慎的推论
- SOTA 类表述会随模型更新快速变化。
- Qwen3-2507 后续模型不应回填到当前 v1 条目。
- 闭源 baseline 的采样和 prompt 设置无法完全复核。
OpenReview / 审稿意见吸收
- Venue status: CoRR / arXiv technical report;OpenReview forum
t5aja6RImK是 DBLP/CoRR 索引页。 - Public reviews: API 返回 replyCount 0,未发现 official review。
- Ratings / confidence: 未发现。
- Reviewer consensus: 未发现。
- Main criticisms: 无公开 reviewer comments;本地审计聚焦版本边界、内部 benchmark 和 reward 细节。
- Author response: 未发现。
- 对可信度的影响: 可作为 Qwen3 v1 技术路线来源;正式 peer review 信号缺失。
本地讨论补充
1. 讨论收敛点
Qwen3 是 Qwen-family 从 Qwen2.5/QwQ 到 Bebop/Qwen3.7 的中轴节点。它不仅是模型报告,也是 thinking control 与 strong-to-weak distillation 的系统化接口。
2. 修正后的理解
Qwen3 的核心价值在于模式控制和模型族组织。它给后续 verifier、自训练、agentic RL 和 MTP rollout acceleration 提供了统一底座。
3. 后续复验指标
- thinking / non-thinking 切换稳定性。
- thinking budget 和 performance/cost 曲线。
- distillation vs RL 在其他模型尺寸上的可复验性。
- General RL 对 agent/tool-use 的单独贡献。
主要启发
- open-weight reasoning model 需要明确模式控制,否则长推理能力和低延迟使用会互相干扰。
- teacher logits distillation 可能比小模型直接 RL 更省算力、更高 pass@k。
- 长上下文 retrieval 任务中 non-thinking 模式可能更稳,thinking tokens 会干扰检索。
局限
- 训练数据、过滤、合成比例、RL batch/rollout/off-policy 细节公开粒度有限。
- 多数主表没有 seed、误差线、置信区间或第三方复现。
- General RL 与内部 benchmark 可复现性较弱。
- Thinking Mode Fusion 和 General RL 可能牺牲部分高难 math/code thinking 分数。
- 2025-07 后 Qwen3-2507 系列更新,需要标注版本边界。
跨论文关系
- 与 2412.15115 Qwen2.5:Qwen3 承接 Qwen2.5 与 QwQ-32B,将 chat / reasoning / small-model distillation 合入一个 release。
- 与 2606.12370 Bebop:作者和组织直接重叠;Qwen3 是 Qwen 模型族基础节点,Bebop 是后续 Qwen 内部 RL rollout / MTP acceleration 方法节点。
- 与 2605.30290 STV:STV 使用 Qwen3-8B;Qwen3 提供 verifier/self-improvement 研究常用 base 与 thinking 控制接口。
- 与 2026-04-24 DeepSeek-V4、2602.15763 GLM-5:共同构成国产前沿模型报告中的 effort/control、long-context 和 MoE 对照。
- 与 2606.04101 UltraEP:Qwen3 MoE serving 与 expert routing 可作为后续系统优化对象。
Reference Intake Brief
Target
- Intended target system: 新增 Qwen3 独立论文笔记。
- Existing related assets: 2412.15115 Qwen2.5, 2606.12370 Bebop, 2605.30290 STV,
content/utility/papers-index.md。 - Proposed form: 新建独立 Markdown 文档。
Reusable Elements
- thinking / non-thinking mode control。
- strong-to-weak logits distillation vs direct RL。
- Qwen3 model family as RL/agentic base。
Risks
- Copyright/over-copying: 只记录关键指标。
- Unsourced or unverifiable claims: 内部 benchmark 按报告处理。
- Tone/brand mismatch: 技术归档语气。
- Safety/compliance issues: 不沉淀滥用细节。
- Overlap with existing assets: 和 Qwen2.5/Bebop/STV 强重叠,本条定位为 Qwen3 foundation 与模式控制节点。
Skipped
| Material | Reason |
|---|---|
| 公开 reviewer comments | OpenReview 仅 CoRR/DBLP 索引来源,无 official reviews。 |
Recommendation
Decision: merge
Why: Qwen3 是 Qwen 系列 reasoning/control/agentic base 的关键节点,补齐 Qwen2.5 到 Bebop 的中间层。