2412.15115-qwen2-5-technical-report
Qwen2.5 Technical Report
Qwen2.5 展示了一条面向通用、代码、数学、结构化数据和长上下文场景的 LLM (Large Language Model,大语言模型) 工程路线:用 18T token 预训练、统一 tokenizer、百万级 SFT (Supervised Fine-Tuning,监督微调)、DPO (Direct Preference Optimization,直接偏好优化)、GRPO (Group Relative Policy Optimization,组相对策略优化) 和 YARN / Dual Chunk Attention 长上下文扩展,把 Qwen2 系列推进成后续 Qwen2.5-Math、Qwen2.5-Coder、QwQ 和 Qwen 系 RL 系统论文的基础节点。
Source
- Title: Qwen2.5 Technical Report
- arXiv: https://arxiv.org/abs/2412.15115
- PDF: https://arxiv.org/pdf/2412.15115
- TeX Source: https://arxiv.org/e-print/2412.15115
- Code/Project: https://github.com/QwenLM/Qwen2.5
- Official blog: https://qwenlm.github.io/blog/qwen2.5/
- Hugging Face paper page: https://huggingface.co/papers/2412.15115
- OpenReview / Review page: 未发现可可靠匹配当前技术报告的公开 review forum。
- Authors: An Yang, Binyuan Hui, Bo Zheng, Bowen Yu, Dayiheng Liu, Fei Huang, Jianwei Zhang, Jianxin Yang, Jingren Zhou, Junyang Lin, Rui Men
- Organization: Qwen Team / Alibaba;arXiv metadata lists An Yang and 42 other authors.
- Submitted: 2024-12-19
- Current version read: v2, last revised 2025-01-03
- Subjects: Computation and Language (cs.CL)
作者与关系
- Qwen Team / Alibaba: 团队型技术报告;论文未拆分个人机构。
- Binyuan Hui: Qwen Team.
- Core contributors and contributors: TeX 中另列 core contributors 与 contributors。
阅读目标与判断边界
归档关注:
- Qwen2.5 如何组织 dense/API MoE、数学、代码、工具调用和长上下文能力。
- 它和 DAPO、Bebop、OTB、VIMPO 等 Qwen-family RL 论文的关系。
- 技术报告中实验设置和 baseline 强度的边界。
判断边界:
- 训练 token、GPU hours、optimizer、数据比例和 API MoE 规格公开粒度有限。
- 多数 baseline 没有 compute-matched / implementation-matched 细节。
- in-house benchmark 可提供方向性信息,但外部难复查样本、判题器和污染控制。
术语预备
MoE (Mixture-of-Experts,混合专家模型): 每个 token 只激活部分专家,以扩大 total 参数并控制 active compute。GQA (Grouped Query Attention,分组查询注意力): 多个 query heads 共享 key/value group,降低 KV cache。RoPE (Rotary Positional Embedding,旋转位置编码): 位置编码方法。RMSNorm (Root Mean Square Layer Normalization,均方根归一化): 归一化层。BBPE (Byte-level Byte-Pair Encoding,字节级 BPE): tokenizer 编码方案。YARN: RoPE 外推 / 扩展方法。DCA (Dual Chunk Attention,双块注意力): Qwen2.5 长上下文推理扩展方案之一。
论文脉络
1. 研究问题、背景和价值
Qwen2.5 要把开源 dense 模型、API MoE、代码/数学专长、工具调用、长上下文和偏好对齐统一到一个可发布模型族。它服务的目标覆盖不同尺寸、不同领域和不同部署方式,评测分数只是这条产品线的外部信号之一。
2. 已有解决方案与不足
Qwen2 在模型尺寸覆盖、长输出、结构化输入输出、工具调用、数学/代码专长和长上下文 API 上仍有缺口。Qwen2.5 通过扩展预训练数据、加入专门领域数据和增强后训练流程来提升能力密度。
3. 作者可能的思考路径
Qwen2.5 面对的核心问题在于模型族如何同时覆盖小模型、本地部署、API 服务、数学、代码、工具调用和长上下文,而单个 72B 模型分数只能呈现其中一部分。若只扩大参数,大尺寸模型会提升,但小尺寸模型、专门领域模型和产品接口仍会割裂;若只靠后训练补能力,数学和代码先验不足的问题会继续限制上限。
因此更合理的入口是把能力密度前移到预训练数据:把数学、代码、结构化和合成数据放进通用底座,让不同尺寸模型共享更强的 base prior。随后,SFT/DPO/GRPO 才负责把 instruction following、偏好、reasoning 和结构化输出整理成可交互能力。
长上下文又带来产品层面的分叉:open-weight dense family 需要稳定的 128K 边界,Turbo/API 线则需要走向 1M context。训练长度、RoPE 外推和推理系统不能混在一个结论里读,所以 YaRN + DCA 更像是 Qwen2.5 产品形态扩展的一层,服务范围超出单纯 benchmark 技巧。
4. 核心假设或切入点
数据质量、数据 mixture、领域专家数据和后训练流程协同,比单纯扩大参数更能提升不同尺寸模型的能力密度。统一 tokenizer 和工具 control tokens 可以让模型族共享更多基础设施。
5. 方法 / 系统 / 理论框架
Qwen2.5 的方法重点落在一条连续工程线:模型族覆盖、数据扩展、后训练和长上下文产品形态共同推进。open-weight 部分是 dense decoder-only Transformer,覆盖 0.5B、1.5B、3B、7B、14B、32B、72B;API 部分另有 proprietary MoE 模型 Qwen2.5-Turbo 和 Qwen2.5-Plus,报告只给能力和服务定位,没有公开完整专家数、active 参数和训练成本,因此 MoE 结论需要和开源 dense family 分开读。
dense 架构沿用 Qwen2 系列的主干:GQA (Grouped Query Attention,分组查询注意力) 降低 KV cache,SwiGLU 提供 FFN 非线性,RoPE (Rotary Position Embedding,旋转位置编码) 编码位置,QKV bias 和 pre-norm RMSNorm (Root Mean Square Layer Normalization,均方根归一化) 稳定训练。这些属于成熟组件,报告没有把它们作为算法贡献;真正变化来自规模覆盖、数据 mixture 和 post-training recipe。tokenizer 仍是 BBPE (Byte-level Byte-Pair Encoding,字节级 BPE),regular tokens 为 151,643,control tokens 从 3 扩展到 22。这个扩展服务结构化输入输出、工具调用和 chat template,使 Qwen2.5-Math、Qwen2.5-Coder、QwQ 以及后续 Qwen3 / Bebop 生态能共享更多接口约定。
预训练从 Qwen2 的 7T tokens 扩到 18T tokens,并且采用分阶段 mixture。第一层收益来自更大的通用、多语和知识数据;第二层收益来自数学、代码、结构化数据和合成数据的占比调整;第三层收益来自针对数据质量的过滤和重采样。报告特别强调 Qwen2.5-Math 与 Qwen2.5-Coder 的数据进入通用模型预训练,这意味着后续 RLVR 论文在 Qwen2.5 / Qwen2.5-Math 上看到的 code reasoning prior 和 math prior,有相当一部分来自 base model 阶段,不能直接归因到 RL 算法本身。
训练相关公开信息如下。Qwen2.5 报告更像模型族发布报告,训练系统账本没有达到 DeepSeek-V3 那种可成本复查粒度。
| 维度 | 配置 |
|---|---|
| 模型族 | open-weight dense decoder-only family:0.5B / 1.5B / 3B / 7B / 14B / 32B / 72B;API 侧另有 proprietary MoE Plus / Turbo |
| Tokenizer | BBPE;151,643 regular tokens;control tokens 从 3 扩到 22 |
| Pretraining data | 18T tokens;相对 Qwen2 的 7T tokens 增加通用、多语、数学、代码、结构化和合成数据 |
| Post-training | SFT、DPO、GRPO;offline RL 偏 reasoning / factuality / instruction-following,online RL 偏 helpfulness / truthfulness / conciseness / safety / readability |
| Long context | open-weight dense models 从 4K 扩到 32K;Qwen2.5-Turbo 逐级训练到 32K / 64K / 128K / 262K,并通过 YaRN + DCA 外推到 1M |
| 未披露项 | 训练 GPU 数、硬件型号、并行方式、训练 wall-clock、GPU hours、美元成本、API MoE expert/active 参数、完整 RL 超参 |
后训练采用多阶段组合。SFT (Supervised Fine-Tuning,监督微调) 处理 instruction following、长输出、数学 CoT、代码、多语和结构化输出;DPO (Direct Preference Optimization,直接偏好优化) 用偏好对比更新模型,使 chosen response 相对 rejected response 的 log probability 更高;GRPO (Group Relative Policy Optimization,组相对策略优化) 沿用 DeepSeekMath / DeepSeek-R1 系谱,用同一 prompt 下多条采样的相对 reward 估计 advantage,省去 value model。报告还区分 offline RL 和 online RL:offline RL 更偏 reasoning、factuality 和 instruction-following 等 reward model 难判的能力;online RL 更依赖 reward model 判断 helpfulness、truthfulness、conciseness、safety 和 readability。
长上下文分两层。训练层先把 open-weight dense models 从 4K context 扩到 32K,RoPE base frequency 用 ABF 调整;Qwen2.5-Turbo 采用 progressive context expansion,按 32K、64K、128K、262K 逐级训练,并在每阶段混入当前最大长度和较短样本。推理层再使用 YaRN 和 DCA (Dual Chunk Attention,双块注意力) 做外推。YaRN 负责 RoPE scaling,DCA 则把很大的相对位置重映射到更小的可见距离,减少模型在推理时遇到训练中未见过的大相对距离。报告中的 128K open-weight context 和 Turbo / Qwen2.5-1M 的 1M context 应分开记:前者是 Qwen2.5 dense family 的主要公开边界,后者依赖 Turbo / Qwen2.5-1M 的长上下文训练、DCA 和推理系统。
6. 结论链条
Qwen2.5 的结论来自模型族整体提升:base model 能力提升,instruct model 数学/代码/偏好增强,reward model 支撑后续 RL,长上下文系统把上下文长度推到 128K/1M。它在本地 archive 中应视为 Qwen-family 后续 RL 和系统论文的基础模型节点。
关键实验/定理
结果 1:base 70B+ 模型
- 设置:Qwen2.5-72B / Qwen2.5-Plus vs Llama-3-70B、Mixtral-8x22B、Llama-3-405B、Qwen2-72B。
- Baseline:主流大尺寸开放模型和前代 Qwen2。
- 指标:MMLU、MATH、GSM8K、HumanEval、MBPP 等。
- 解读:72B dense 接近或超过更大开放基线的多项指标;Plus 展示 API MoE 的效率潜力,但 closed specs 限制复验。
结果:
| 模型 | MMLU | MMLU-Pro | MATH | GSM8K |
|---|---|---|---|---|
| Qwen2.5-72B | 86.1 | 未列出 | 62.1 | 91.5 |
| Qwen2.5-Plus | 未列出 | 64.0 | 64.4 | 93.0 |
结果 2:instruct 70B+ 模型
- 设置:Qwen2.5-72B-Instruct / Plus vs Llama-3.1-70B/405B、Qwen2-72B。
- Baseline:同尺寸和更大 chat models。
- 指标:MMLU-Pro、MATH、LiveCodeBench、IFEval、Arena-Hard、MT-Bench。
- 解读:后训练显著增强数学、代码和偏好对齐。
结果:
| 模型 | MATH | LiveCodeBench | IFEval | Arena-Hard | MT-Bench |
|---|---|---|---|---|---|
| Qwen2.5-72B-Instruct | 83.1 | 55.5 | 未列出 | 81.2 | 9.35 |
| Qwen2.5-Plus | 84.7 | 未列出 | 86.3 | 81.4 | 未列出 |
结果 3:reward model
- 设置:Qwen2.5-RM-72B vs Nemotron / Athene reward models。
- Baseline:公开 reward models。
- 指标:RewardBench、RMB、PPE、Chinese human preference。
- 解读:reward model 本身很强;论文也提醒 RM benchmark 与 RL 后模型表现相关性有限。
结果:
| 指标 | Qwen2.5-RM-72B |
|---|---|
| RewardBench | 91.59 |
| RMB | 68.71 |
| PPE objective avg | 69.85 |
| Chinese preference | 61.27 |
结果 4:long context
- 设置:RULER、LV-Eval、LongBench-Chat;with / without YARN + DCA;Turbo 1M passkey。
- Baseline:无 DCA/YARN 和其他长上下文模型。
- 指标:RULER、LV-Eval、passkey、attention compute、TTFT。
- 解读:长上下文证据较强,含 w/o DCA+YARN ablation;Turbo 的 1M 与 sparse attention 仍依赖内部系统细节。
结果:
| 模型 / 设置 | 指标 | 结果 |
|---|---|---|
| Qwen2.5-72B-Instruct | RULER avg | 95.1 |
| Qwen2.5-72B-Instruct | RULER 128K | 88.4 |
| Qwen2.5-72B-Instruct | LV-Eval 128K | 50.9 |
| Qwen2.5-72B-Instruct | LV-Eval 256K | 45.2 |
| Qwen2.5-Turbo | RULER avg | 93.1 |
| Qwen2.5-Turbo | 1M passkey | 100% |
| Qwen2.5-1M system | attention compute reduction | 12.5x |
| Qwen2.5-1M system | TTFT speedup | 3.2-4.3x |
实验设置与 baseline 审计
| 维度 | 记录 |
|---|---|
| 模型与初始化 | Qwen2.5 dense family;Qwen2.5-Plus API MoE;Qwen2.5-RM |
| 数据与任务 | 18T pretraining tokens;数学、代码、结构化数据、工具调用、长上下文数据 |
| RL / 训练配置 | SFT、DPO、GRPO;具体 KL/entropy、rollout group、reward mix 未完整披露 |
| 系统配置 | 长上下文推理含 YaRN + DCA;Turbo API 含 1M context 相关系统优化 |
| 技术报告训练配置 | 公开 token budget 与长上下文阶段;未公开训练硬件、并行方式、GPU hours、wall-clock 和成本 |
| 未披露项 | 训练 GPU 数、硬件型号、并行方式、训练时间、成本、API MoE expert/active 参数、完整 RL 超参 |
| 评测协议 | 公开 benchmark + in-house benchmark |
| 统计报告 | 未见多 seed、置信区间或显著性检验 |
| Baseline 强度 | 覆盖广,但 compute / implementation / decoding matching 不充分 |
| 结论边界 | 作为模型族报告可信度高;作为算法结论需要谨慎 |
证据链强度评估
强证据
- 公开 benchmark 覆盖通用、数学、代码、多语、偏好和长上下文。
- 报告数据污染过滤规则。
- Qwen2.5 生态后续被 DAPO、OTB、Bebop 等广泛复用。
中等强度证据
- API MoE Plus 的规格不完全公开。
- in-house benchmark 与长上下文 Turbo 系统细节需要外部复验。
需要谨慎的推论
- Qwen2.5 的高分不应直接解释为某个后训练算法单独贡献。
- RM benchmark 高分和 RL 后模型表现的关系需要单独验证。
OpenReview / 审稿意见吸收
- Venue status: arXiv technical report;未发现可靠公开审稿页。
- Public reviews: 未发现 official review。
- Ratings / confidence: 未发现。
- Reviewer consensus: 未发现。
- Main criticisms: 无公开 reviewer comments;本地审计聚焦实验可复查性和 baseline matching。
- Author response: 未发现。
- 对可信度的影响: 可作为 Qwen-family 基础模型来源;正式审稿信号缺失。
本地讨论补充
1. 讨论收敛点
Qwen2.5 应作为本地 archive 的 Qwen-family foundation 节点。许多后续 RLVR 论文使用 Qwen2.5 或 Qwen2.5-Math,理解它的 tokenizer、long-context 和 post-training 背景能避免把 base prior 误读为 RL 方法收益。
2. 修正后的理解
Qwen2.5 的价值在于模型族工程,而非单一模型榜单。它支撑 Qwen2.5-Math、Qwen2.5-Coder、QwQ、Bebop 和 Qwen3 等后续节点。
3. 后续复验指标
- Qwen2.5-Math / Coder 与通用 Qwen2.5 的 base prior 差异。
- GRPO/DPO 后训练的 reward mix 和 KL/entropy。
- 长上下文任务中的 DCA/YARN 实际延迟和准确率。
主要启发
- 模型族报告要和后续方法论文一起读:base model prior 会进入 RLVR 结论。
- reward model benchmark 与 RL 后能力之间存在落差,读 RL 论文时不能只看 RM score。
- 长上下文扩展需要区分 model context capability 和 serving-side attention optimization。
局限
- 训练数据、MoE 规格、GPU hours 和后训练超参公开粒度有限。
- 多数 baseline 无 compute-matched / implementation-matched 细节。
- in-house eval 样本和判题器不可完全复查。
- 缺少多 seed 和置信区间。
- 公开 reviewer comments 缺失。
跨论文关系
- 与 2606.12370 Bebop:直接作者重叠;Qwen2.5 的 tokenizer、post-training、long-context 与后续 Qwen MTP / RL rollout acceleration 形成组织和系统前置。
- 与 2503.14476 DAPO:DAPO 以 Qwen2.5-32B base 做 long-CoT RL recipe。
- 与 2504.13837 RLVR boundary 和 2506.10947 Spurious Rewards:两者都把 Qwen2.5 / Qwen2.5-Math 作为分析 RLVR prior、pass@k 和 code reasoning prior 的关键对象。
- 与 2505.22617 Entropy Mechanism、2602.07078 OTB、2606.20008 VIMPO:Qwen2.5/Qwen3 family 是后续 token-level RL、variance reduction、critic-free value signal 的主要实验底座。
- 与 2026-04-24 DeepSeek-V4、2602.15763 GLM-5、2511.02749 Span Query:Qwen2.5 的长上下文路线构成国产模型长上下文系统对照。
Reference Intake Brief
Target
- Intended target system: 新增 Qwen2.5 独立论文笔记。
- Existing related assets: 2606.12370 Bebop, 2503.14476 DAPO, 2602.07078 OTB,
content/utility/papers-index.md。 - Proposed form: 新建独立 Markdown 文档。
Reusable Elements
- Qwen tokenizer / control tokens 背景。
- Qwen2.5 后训练和 reward model 基础。
- YARN + DCA 长上下文系统线索。
Risks
- Copyright/over-copying: 不复制长表。
- Unsourced or unverifiable claims: in-house benchmark 只按报告记录。
- Tone/brand mismatch: 保持技术归档语气。
- Safety/compliance issues: 代码/数学能力只记录机制与评估边界。
- Overlap with existing assets: 和 Qwen3/Bebop 强重叠,本条定位为 Qwen2.5 foundation。
Skipped
| Material | Reason |
|---|---|
| 公开 reviewer comments | 未发现可靠匹配的 OpenReview/ARR/会议公开审稿页。 |
Recommendation
Decision: merge
Why: Qwen2.5 是本地多篇 RLVR / Qwen 系统论文的基础模型节点。