2505.09388-qwen3-technical-report

Qwen3 Technical Report

Qwen3 把 dense / MoE (Mixture of Experts,混合专家) 开源模型族、thinking / non-thinking 双模式、thinking budget、36T token 多语预训练、四阶段后训练和 strong-to-weak distillation 组织成一套可发布模型体系,使 Qwen3-235B-A22B、Qwen3-32B 与小模型在数学、代码、agent、多语和长上下文任务上成为强开源基线;关键训练数据、RL (Reinforcement Learning,强化学习) 配置、内部 reward 与统计复验细节仍主要依赖技术报告叙述。

Authors An Yang and 59 other authors;本地核心跟踪作者包括 An Yang, Binyuan Hui, Bo Zheng, Bowen Yu, Dayiheng Liu, Fei Huang, Jianwei Zhang, Jianxin Yang, Jingren Zhou, Junyang Lin, Rui Men。

已审阅 Archived 2026-06-23 18:28 Updated 2026-06-24 20:20 Reviewed 2026-07-18 17:42 Source

Source

作者与关系

  • Qwen Team / Alibaba Cloud: Qwen Team / Alibaba Cloud.
  • Binyuan Hui: Qwen Team.
  • 作者组织:正文区分 Core Contributors 与 Contributors;标题页不拆逐作者机构。

阅读目标与判断边界

归档关注:

  1. Qwen3 如何统一 thinking 和 non-thinking 两种使用模式。
  2. Qwen3 的 dense/MoE 模型族和 strong-to-weak distillation 如何组织。
  3. Qwen3 和 Bebop、STV、Qwen2.5、DeepSeek-R1/V3 的关系。
  4. 它的实验设置、baseline 和版本边界。

判断边界:

  • arXiv v1 对应 2025-05 版本;后续 Qwen3-2507 系列已经更新,不能回填为当前 v1 结论。
  • General RL 的 20+ task reward 和内部 benchmark 复现性有限。
  • 闭源 baseline 的采样、prompt 和隐藏系统策略无法完全对齐。

术语预备

  • CoT (Chain of Thought,链式思考): 生成显式中间推理过程。
  • SFT (Supervised Fine-Tuning,监督微调): 监督指令微调。
  • GRPO (Group Relative Policy Optimization,组相对策略优化): 使用同 prompt group reward baseline 的 RL 方法。
  • KL (Kullback-Leibler divergence,分布距离约束): 用于约束策略偏移或蒸馏。
  • GQA (Grouped Query Attention,分组查询注意力): 降低注意力 KV cache 的结构。
  • RoPE (Rotary Positional Embedding,旋转位置编码): 位置编码方法。
  • BFCL (Berkeley Function Calling Leaderboard,函数调用评测): 工具/函数调用 benchmark。
  • RULER: 长上下文检索 benchmark。
  • YaRN: RoPE 外推方法。

论文脉络

1. 研究问题、背景和价值

开源 LLM 同时需要强 reasoning model、低延迟普通对话、工具调用能力和小模型继承能力。Qwen2.5 与 QwQ-32B 分别覆盖通用和推理能力,Qwen3 试图用同一模型族同时覆盖这些部署模式。

2. 已有解决方案与不足

此前路线通常把 chat model、reasoning model、小模型蒸馏和 MoE 规模化分开处理。缺口集中在模式切换成本、推理 token 预算控制、小模型复训成本、多语覆盖、长上下文评测,以及 agent/tool-use 后训练稳定性。

3. 作者可能的思考路径

Qwen3 面对的是 Qwen2.5 和 QwQ 之后的产品张力:用户既需要长推理模型的高上限,也需要普通 chat 的低延迟和稳定格式;生态又需要从 0.6B 到 235B-A22B 的完整模型族。如果把 thinking model 和 non-thinking model 分开维护,训练、部署和用户接口都会变复杂;如果让所有请求默认长思考,token 成本和响应时间会失控。

这会把作者推向一个统一模型、显式模式控制的方向:先训练强 thinking teacher,证明高难推理上限;再通过 mode fusion 把 non-thinking response 合入同一模型;最后把 /think/no_think 和 thinking budget 放进 chat template,让 test-time compute 成为可控接口。

小模型又带来第二层压力。让每个尺寸都完整走一遍 long-CoT RL 成本太高,且探索效率低;强 teacher 已经搜索到高质量 reasoning 分布,把 logits 和 responses 转移给学生更经济。于是 off-policy response distillation 和 on-policy logits KL distillation 成为 Qwen3 的核心路线:用大模型承担探索成本,让小模型继承可用的 reasoning policy。

4. 核心假设或切入点

同一模型可以通过模式控制覆盖长推理和低延迟对话;strong-to-weak logits distillation 可以比直接 RL 更高效地把大模型 reasoning 能力迁移到小模型;thinking budget 是开放模型可控 test-time compute 的实用接口。

5. 方法 / 系统 / 理论框架

Qwen3 的底座延续 Qwen2.5 的 dense/MoE 模型族路线,并扩大到 6 个 dense 模型和 2 个 MoE 模型:0.6B、1.7B、4B、8B、14B、32B,外加 30B-A3B 和 235B-A22B。旗舰 MoE 是 235B total / 22B active,94 layers,128 experts,每 token 激活 8 experts。架构侧沿用 GQA、SwiGLU、RoPE、RMSNorm 等成熟组件,并加入 QK-Norm 稳定 attention logits;主要方法创新集中在预训练数据分阶段、thinking control 和 strong-to-weak distillation。

预训练分三段。S3 后继续沿用 YaRN / DCA (Dual Chunk Attention,双块注意力) 做 4x 推理外推;DCA 的机制边界可参考 Qwen2.5-1M 线索,即通过重映射相对位置降低 RoPE 在超长距离上的外推压力。

阶段 数据规模 Sequence length 目标
S1 general stage > 30T tokens 4K 通用知识、多语、代码和基础能力
S2 reasoning stage ~5T tokens 未完整披露 STEM、code、reasoning 高质量数据,推动可推理任务分布
S3 long-context stage 数千亿 tokens 32K 长上下文数据,并通过 YaRN / DCA 做 4x 推理外推
维度 公开情况
总训练数据 36T tokens
模型族 dense / MoE family;旗舰 Qwen3-235B-A22B
训练硬件 未完整公开
并行方式 未完整公开
训练时间 / 成本 主训练 GPU hours、wall-clock 和美元成本未完整公开;distillation vs RL 对照单独报告 GPU hours

后训练第一步是 Long-CoT cold start。Qwen3 先用经过筛选的长推理样本训练 thinking model,让模型学会在 <think>...</think> 内生成可展开的 reasoning trace。这个阶段提供可读的推理格式和初始 reasoning 行为,减少后续 RL 在稀疏 reward 下从零探索的成本。

第二步是 Reasoning RL。Qwen3 收集 3,995 个 query-verifier pairs,用 GRPO (Group Relative Policy Optimization,组相对策略优化) 更新 thinking model;GRPO 的基本思想与 DeepSeek-R1 一致,用同一 prompt 下多条 rollout 的相对 reward 估计 advantage,省去 value model。这里的 verifier 让数学、代码、逻辑和 STEM 任务具备可训练的 outcome reward。报告中的关键现象是 Qwen3-235B-A22B 在 AIME'24 上从 70.1 提升到 85.1,训练 170 RL steps。

第三步是 Thinking Mode Fusion。前两步得到的是强 thinking model,但产品上还需要低延迟的 non-thinking response。Qwen3 通过继续 SFT 把 thinking 和 non-thinking 样本合入同一个模型,并在 chat template 里加入 /think/no_think 和空 <think></think> block。这样用户或系统可以通过模板选择显式思考、直接回答,或者设置 thinking budget。budget 用完后,模型停止继续生成 thinking trace,转入最终答案,从而把 test-time compute 变成可控接口。

第四步是 General RL。它覆盖 20+ tasks,包括 instruction following、format following、preference alignment、agent ability、RAG 等。reward 分三类:rule-based reward 处理可验证格式和硬规则;带参考答案的 model-based reward 判断接近标准答案的任务;无参考答案 reward model 处理开放式 helpfulness、harmlessness 和偏好。这一步的作用是补回 mode fusion 后可能牺牲的通用 chat、工具和格式能力。

Strong-to-Weak Distillation 把完整后训练流程的成本从小模型上拿掉。Qwen3 先完整训练旗舰 235B-A22B 和 32B,再把这些 teacher 的能力迁移给 0.6B、1.7B、4B、8B、14B 和 30B-A3B。off-policy response distillation 先让学生模仿 teacher 生成的高质量 responses;on-policy logits KL distillation 再让学生在自己采样到的状态上对齐 teacher logits,缓解只学离线 teacher response 带来的 distribution mismatch。这个设计解释了为什么 Qwen3-8B 的 distillation 实验能用更少 GPU hours 超过直接 RL baseline。

6. 结论链条

Qwen3 将 Qwen2.5 的通用能力和 QwQ 式 reasoning 能力统一到一组模型和一套 chat template 中;通过大模型 teacher logits 蒸馏小模型;通过 mode fusion 和 General RL 增强 agent/tool-use 能力;用 YaRN/DCA 扩展长上下文。

关键实验/定理

结果 1:base model scaling

  • 设置:Qwen3-235B-A22B-Base vs Qwen2.5-72B/Plus, Llama-4-Maverick, DeepSeek-V3。
  • Baseline:强开放 base models。
  • 指标:15 个 general/math/code/multilingual benchmarks。
  • 结果:Qwen3-235B-A22B-Base 在 14/15 项超过 DeepSeek-V3-Base;MATH 71.84,EvalPlus 77.60。
  • 解读:MoE 架构、数据规模和训练策略共同提升 base 能力。

结果 2:thinking flagship

  • 设置:Qwen3-235B-A22B thinking vs OpenAI-o1, DeepSeek-R1, Grok-3 Think, Gemini 2.5 Pro。
  • Baseline:推理型闭源和开放模型。
  • 指标:AIME、LiveCodeBench、BFCL、CodeForces。
  • 结果:AIME'24 85.7,AIME'25 81.5,LiveCodeBench v5 70.7,BFCL v3 70.8,CodeForces 2056。
  • 解读:开源 reasoning 能力很强;闭源模型比较受采样预算和 harness 影响。

结果 3:non-thinking flagship

  • 设置:Qwen3-235B-A22B non-thinking vs GPT-4o, DeepSeek-V3, Qwen2.5-72B, Llama-4-Maverick。
  • Baseline:通用 chat models。
  • 指标:AIME、Arena-Hard、CodeForces 等。
  • 结果:AIME'24 40.1,Arena-Hard 96.1,CodeForces 1387。
  • 解读:同一模型在低推理预算下仍保留通用和 agent 能力。

结果 4:distillation vs RL

  • 设置:Qwen3-8B,从同一 off-policy distilled checkpoint 出发。
  • Baseline:直接 RL。
  • 指标:AIME pass@1/pass@64、LiveCodeBench、GPU hours。
  • 解读:teacher logits distillation 同时提高效率和探索覆盖。

结果:

方法 AIME'24 pass@1 AIME'24 pass@64 GPU hours
on-policy distillation 74.4 93.3 1,800
direct RL 67.6 90.0 17,920

结果 5:mode fusion / General RL

  • 设置:Qwen3-32B Stage 2/3/4 ablation。
  • Baseline:不同后训练阶段。
  • 指标:ThinkFollow、ToolUse、AIME、LiveCodeBench。
  • 解读:模式控制和 agent 能力增强,同时高难数学/代码 thinking 分数略降。

结果:

指标 Stage 2 Stage 4
ThinkFollow 88.7 98.9
ToolUse thinking 70.4 85.5
AIME thinking 83.8 81.4

实验设置与 baseline 审计

维度 记录
模型与初始化 Qwen3 dense/MoE family;235B-A22B flagship
数据与任务 36T tokens;S1 general >30T;S2 STEM/code/reasoning ~5T;S3 数千亿 long-context tokens
RL / 训练配置 GRPO reasoning RL;General RL 多任务 reward;distillation 使用 off-policy response + on-policy logits KL;batch、rollout、KL、reward weights 披露有限
系统配置 训练集群、GPU 型号、GPU 数和并行方式未完整公开
技术报告训练配置 Reasoning RL 使用 3,995 query-verifier pairs,Qwen3-235B-A22B AIME'24 70.1 -> 85.1,训练 170 RL steps;distillation vs RL 对照报告 1,800 vs 17,920 GPU hours
未披露项 主训练硬件、并行方式、pretraining wall-clock / GPU hours / 成本、General RL reward weights、完整 rollout 配置
评测协议 公开 benchmark + in-house task
统计报告 多数主表没有 seed、误差线、置信区间
Baseline 强度 覆盖强,但 compute / implementation matching 不完全
结论边界 distillation vs RL 是最接近可审计的训练效率对照;General RL 和内部 benchmark 需要谨慎

证据链强度评估

强证据

  • 模型权重、GitHub、Hugging Face collection、模型卡和技术报告公开。
  • 架构规格、预训练阶段、后训练阶段和主要 benchmark 数值完整。
  • distillation vs RL 报告 GPU hours 和 pass@64。

中等强度证据

  • thinking budget scaling、mode fusion、General RL 和 long-context RULER 结果方向一致,但依赖内部环境。

需要谨慎的推论

  • SOTA 类表述会随模型更新快速变化。
  • Qwen3-2507 后续模型不应回填到当前 v1 条目。
  • 闭源 baseline 的采样和 prompt 设置无法完全复核。

OpenReview / 审稿意见吸收

  • Venue status: CoRR / arXiv technical report;OpenReview forum t5aja6RImK 是 DBLP/CoRR 索引页。
  • Public reviews: API 返回 replyCount 0,未发现 official review。
  • Ratings / confidence: 未发现。
  • Reviewer consensus: 未发现。
  • Main criticisms: 无公开 reviewer comments;本地审计聚焦版本边界、内部 benchmark 和 reward 细节。
  • Author response: 未发现。
  • 对可信度的影响: 可作为 Qwen3 v1 技术路线来源;正式 peer review 信号缺失。

本地讨论补充

1. 讨论收敛点

Qwen3 是 Qwen-family 从 Qwen2.5/QwQ 到 Bebop/Qwen3.7 的中轴节点。它不仅是模型报告,也是 thinking control 与 strong-to-weak distillation 的系统化接口。

2. 修正后的理解

Qwen3 的核心价值在于模式控制和模型族组织。它给后续 verifier、自训练、agentic RL 和 MTP rollout acceleration 提供了统一底座。

3. 后续复验指标

  • thinking / non-thinking 切换稳定性。
  • thinking budget 和 performance/cost 曲线。
  • distillation vs RL 在其他模型尺寸上的可复验性。
  • General RL 对 agent/tool-use 的单独贡献。

主要启发

  • open-weight reasoning model 需要明确模式控制,否则长推理能力和低延迟使用会互相干扰。
  • teacher logits distillation 可能比小模型直接 RL 更省算力、更高 pass@k。
  • 长上下文 retrieval 任务中 non-thinking 模式可能更稳,thinking tokens 会干扰检索。

局限

  1. 训练数据、过滤、合成比例、RL batch/rollout/off-policy 细节公开粒度有限。
  2. 多数主表没有 seed、误差线、置信区间或第三方复现。
  3. General RL 与内部 benchmark 可复现性较弱。
  4. Thinking Mode Fusion 和 General RL 可能牺牲部分高难 math/code thinking 分数。
  5. 2025-07 后 Qwen3-2507 系列更新,需要标注版本边界。

跨论文关系

  • 2412.15115 Qwen2.5:Qwen3 承接 Qwen2.5 与 QwQ-32B,将 chat / reasoning / small-model distillation 合入一个 release。
  • 2606.12370 Bebop:作者和组织直接重叠;Qwen3 是 Qwen 模型族基础节点,Bebop 是后续 Qwen 内部 RL rollout / MTP acceleration 方法节点。
  • 2605.30290 STV:STV 使用 Qwen3-8B;Qwen3 提供 verifier/self-improvement 研究常用 base 与 thinking 控制接口。
  • 2026-04-24 DeepSeek-V42602.15763 GLM-5:共同构成国产前沿模型报告中的 effort/control、long-context 和 MoE 对照。
  • 2606.04101 UltraEP:Qwen3 MoE serving 与 expert routing 可作为后续系统优化对象。

Reference Intake Brief

Target

Reusable Elements

  1. thinking / non-thinking mode control。
  2. strong-to-weak logits distillation vs direct RL。
  3. Qwen3 model family as RL/agentic base。

Risks

  • Copyright/over-copying: 只记录关键指标。
  • Unsourced or unverifiable claims: 内部 benchmark 按报告处理。
  • Tone/brand mismatch: 技术归档语气。
  • Safety/compliance issues: 不沉淀滥用细节。
  • Overlap with existing assets: 和 Qwen2.5/Bebop/STV 强重叠,本条定位为 Qwen3 foundation 与模式控制节点。

Skipped

Material Reason
公开 reviewer comments OpenReview 仅 CoRR/DBLP 索引来源,无 official reviews。

Recommendation

Decision: merge

Why: Qwen3 是 Qwen 系列 reasoning/control/agentic base 的关键节点,补齐 Qwen2.5 到 Bebop 的中间层。