2603.00729-qwen3-coder-next-agentic-coding

Qwen3 Coder Next Technical Report

Qwen3-Coder-Next 在 80B 总参数中每步激活 3B 参数,并通过可执行仓库任务、长上下文中训、多模板工具训练、软件工程强化学习与专家蒸馏构建编码智能体,在 SWE-Bench Verified 的 SWE-agent、MiniSWE-agent 和 OpenHands 三种 scaffold 上分别达到 70.6%、71.1% 和 71.3% 解决率。公开权重、多项基准结果与任务规模为这一组合方案提供直接证据;报告未拆分各训练组件对最终成绩的净贡献,也未公开完整训练成本、MegaFlow 实现和数据审计细节。

Authors Ruisheng Cao, Mouxiang Chen (陈谋祥), Jiawei Chen (陈家慰), Zeyu Cui, Yunlong Feng, Binyuan Hui, Yuheng Jing, Kaixin Li, Mingze Li, Junyang Lin, Zeyao Ma, Kashun Shum, Xuwu Wang, Jinxi Wei, Jiaxi Yang, Jiajun Zhang, Lei Zhang, Zongmeng Zhang, Wenting Zhao, Fan Zhou

已审阅 Archived 2026-07-09 18:04 Updated 2026-07-21 14:18 Reviewed 2026-07-21 14:18 Source

Source

作者与关系

  • Ruisheng Cao: Qwen Team / Alibaba Cloud;历史机构:Shanghai Jiao Tong University, X-LANCE Lab。
  • Mouxiang Chen: Qwen Team / Alibaba Cloud;历史机构:Zhejiang University。
  • Jiawei Chen: Qwen Team / Alibaba Cloud;历史机构:Institute of Software, Chinese Academy of Sciences。
  • Zeyu Cui: Qwen Team / Alibaba Cloud;历史机构:Institute of Automation, Chinese Academy of Sciences, DAMO Institute。
  • Yunlong Feng: Qwen Team / Alibaba Cloud。
  • Binyuan Hui: Qwen Team / Alibaba Cloud。
  • Yuheng Jing: Qwen Team / Alibaba Cloud。
  • Kaixin Li: Qwen Team / Alibaba Cloud;历史机构:National University of Singapore。
  • Mingze Li: Qwen Team / Alibaba Cloud。
  • Junyang Lin: Qwen Team / Alibaba Cloud。
  • Zeyao Ma: Qwen Team / Alibaba Cloud;历史机构:Renmin University of China。
  • Kashun Shum: Qwen Team / Alibaba Cloud;历史机构:HKUST NLP Lab。
  • Xuwu Wang: Qwen Team / Alibaba Cloud。
  • Jinxi Wei: Qwen Team / Alibaba Cloud。
  • Jiaxi Yang: Qwen Team / Alibaba Cloud;历史机构:Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences。
  • Jiajun Zhang: Qwen Team / Alibaba Cloud。
  • Lei Zhang: Qwen Team / Alibaba Cloud。
  • Zongmeng Zhang: Qwen Team / Alibaba Cloud;历史机构:University of Science and Technology of China, Shandong University。
  • Wenting Zhao: Qwen Team / Alibaba Cloud。
  • Fan Zhou: Qwen Team / Alibaba Cloud。

作者表按 last name 字母序排列。关系上,这篇报告把 Qwen2.5 / Qwen3 模型报告中的 code、agent、tool-use 线推进到 Qwen-Coder-Next 专门技术报告;Binyuan Hui 与 Junyang Lin 是本地已有 Qwen model report 网络的稳定桥接作者,Zeyu Cui、Jiaxi Yang、Fan Zhou 等人连接 Qwen3 / Qwen-Coder 共同作者网络。

阅读目标与判断边界

本笔记关注:

  1. Qwen3-Coder-Next 的模型结构、active parameter footprint 与上下文长度。
  2. executable coding task synthesis、Docker 环境、MegaFlow rollout / evaluation pipeline 如何支撑 agentic training。
  3. mid-training、SFT、专家 RL、tool-template diversity 和 reward hacking blocker 的训练含义。
  4. SWE-Bench、Terminal-Bench、Aider、代码与通用能力评测如何支撑其 efficiency claim。

判断边界:

  • 这是一份 Qwen Team 技术报告,关键训练数据、完整 infra 代码、训练成本和硬件拓扑未完全公开。
  • GitHub、Hugging Face、ModelScope 提供了模型和部署入口,但 MegaFlow、环境构建 agent、QA agent 与 reward hacking blocker 仍主要依赖论文叙述。
  • benchmark 结果和 scaffold、tool parser、tool call format 有强耦合,跨 scaffold 泛化在论文中已经显示存在限制。

论文脉络

1. 研究问题、背景和价值

编码模型从静态 code completion 走向 coding agent 后,训练目标发生明显变化。模型需要读仓库、改文件、调用 shell 或编辑器、运行测试、处理失败和长程依赖。这样的能力很难只从普通 code corpus 中得到,因为普通语料缺少可执行反馈、工具交互轨迹和最终 outcome signal。

Qwen3-Coder-Next 把问题具体化为:在低 active parameter 的模型上,能否用更强的 agentic training pipeline 弥补 active compute 较小带来的能力压力。它选择 Qwen3-Next-80B-A3B-Base 作为基座,强调 3B active 参数带来的部署成本优势,并把主要工程投入放在 executable tasks、environment feedback 和 tool-use 数据上。

2. 已有解决方案与不足

Qwen2.5-Coder 和 Qwen3 已经提供代码、推理、长上下文、tool-use 和 agent evaluation 的基础。更大的 Qwen3-Coder-480B-A35B-Instruct 提供强代码能力,但 active compute 更高。SWE-agent、Mini-SWE-agent、OpenHands、Claude Code、Qwen Code、Terminus 等 scaffold 可以生成交互轨迹,也会带来模板依赖和 scaffold specialization。

已有路线的主要约束包括:

  1. 静态 code pretraining 缺少执行反馈和多步修复过程。
  2. 单一 tool chat template 会让模型对某一种工具格式过拟合。
  3. repository environment 合成难度高,验证脚本可能被 shortcut 或 ground-truth 泄漏污染。
  4. agentic RL 的环境运行、评测、后处理吞吐要求高,普通单机 pipeline 很难支撑百万级任务实例。

3. 作者可能的思考路径

报告的思路可以整理成一条训练流水线:

  1. 选用 Qwen3-Next 作为 efficient hybrid / MoE backbone,使模型在推理时只激活 3B 参数。
  2. 从真实 GitHub PR 和已有 SWE 数据集中构造可执行任务,形成大规模 verifiable environment。
  3. 用 MegaFlow 把 rollout、evaluation、post-processing 放进 Kubernetes / Argo workflow,支持并行执行和稳定回收结果。
  4. 在 mid-training 阶段混合自然数据、repo-level 数据、PR 数据、synthetic QA、multi-turn agent trajectories、FIM 和 instruction-following 数据。
  5. 在 post-training 阶段先做 SFT,再训练 Web Development、UX、Single-turn QA、SWE 等专家模型,并把专家能力蒸馏回统一模型。
  6. 通过多种 tool chat template 和 XML-style qwen3_coder 格式提升跨 scaffold 的工具调用稳定性。

4. 核心假设或切入点

本文的关键假设是:coding agent 能力的瓶颈不只来自参数规模,也来自可执行训练任务、环境反馈、工具轨迹格式和 scaffold 泛化。对于 80B total / 3B active 模型,若训练数据能够覆盖真实 repository 修改、测试反馈、工具调用格式和失败恢复,模型可以在 agentic coding benchmark 上取得与 active footprint 不成比例的强结果。

另一个隐含假设是:tool calling 和 environment interaction 是模型行为分布的一部分,需要在 mid-training 和 post-training 中提前暴露。论文中的 cross-scaffold 结果显示,轨迹格式和框架选择会显著影响泛化,因此它把模板多样性和 best-fit packing 放进训练 recipe。

5. 方法 / 系统 / 理论框架

模型结构

Hugging Face model card 给出的结构要点如下:

维度 Qwen3-Coder-Next
类型 Causal language model
Training stage Pretraining & post-training
参数量 80B total / 3B activated
Non-embedding 参数 79B
Hidden dimension 2048
Layers 48
Hybrid layout 12 * (3 * (Gated DeltaNet -> MoE) -> 1 * (Gated Attention -> MoE))
Gated Attention 16 Q heads, 2 KV heads, head dimension 256, RoPE dimension 64
MoE 512 experts, 10 activated, 1 shared expert
Context 262,144 native tokens;README 也描述为 256K native context,YaRN 可扩到 1M
Thinking mode 仅 non-thinking mode,不使用 <think></think>

这个结构将 Qwen3-Next 的 hybrid attention 和 MoE 作为底座,目标是把低 active compute、长上下文和 coding-agent 训练配方组合起来。

Task synthesis 与 executable environments

论文给出两条任务合成路径:

  1. 从 GitHub PR 挖掘 issue-related PR,分解为 buggy state、fix 和 test patch。环境构建 agent 负责生成 Docker runnable environment 和 verification script,QA agent 过滤 ambiguous task、inconsistent environment 和 misaligned test。
  2. 基于 SWE-Smith、SWE-Flow、SWE-Rebench、Multi-SWE-RL 等已有可执行任务集合,在 containerized repositories 中注入 controlled bugs,只保留 fail tests 且 patch reversion 能修复的实例。

Appendix 给出规模:真实 GitHub PR repository environments 包含 807,693 instances、52,960 repositories;synthetic issue 方向合计 851,898 generated task instances。这些任务覆盖 Python、JavaScript / TypeScript、Go、Java、Rust、C/C++、C# 等语言。

Figure 2: Qwen3-Coder-Next 的两条可执行任务合成路径
Figure 2: 上半部分从真实 GitHub PR 提取问题、修复补丁与测试补丁,再由环境构建和 QA agent 生成并筛选可运行任务;下半部分在已有容器化仓库中注入缺陷,并用失败测试与补丁回退验证实例。Image Source: arXiv v1 HTML Figure 2

MegaFlow infrastructure

MegaFlow 是内部 orchestration system,基于 Alibaba Cloud Kubernetes 和 Argo workflow。每个 agentic coding task 分成三段:

Stage 作用
Agent rollout 单个 pod 中放置 agent container 和 environment container,支持长程交互
Evaluation 在专用 container 中运行 verification
Post-processing 解析 outcome、抽取 metrics、可选下游分析

这种设计把模型 rollout 与 execution environment 放在同一调度单元内,减少远程调用开销,并把大规模任务回收变成 cloud-native batch workflow。

Mid-training

mid-training 从 Qwen3-Next pretrained base 开始,目标是把表示空间转向 code reasoning、repo-level understanding 和 agent-style interaction。数据包括:

  1. GitHub source code 与 text-code grounding data,Common Crawl 与 targeted web 数据更新到 2025-09-30。
  2. programming language coverage 从 Qwen2.5-Coder 的 92 种扩展到 370 种;context length 从 32,768 扩到 262,144 tokens;repo-level data 约 600B tokens。
  3. 用 Qwen3-Coder-480B-A35B-Instruct 将低质量 web documents 重写成 normalized Markdown,提升代码/知识评测。
  4. PR-based data 使用 Search-and-Replace / git diff 格式重构 buggy repo state 与 code edits。
  5. single-turn QA 和 multi-turn agentic coding trajectories,后者由 SWE-agent、Mini-SWE-agent、OpenHands、Claude-Code、Qwen-Code、Terminus 等 scaffold 生成。
  6. FIM 数据同时覆盖 chat-FIM 和 search-and-replace FIM,后者和 PR-style pretraining 更一致。
  7. best-fit packing 用于减少 concat-then-split 造成的 context hallucination,特别保护长轨迹开头的 tool definitions 和 calling format。

论文明确观察到:within-scaffold scaling 随 mid-training tokens 增加稳定提升,cross-scaffold transfer 仍有限,framework specialization 会带来泛化代价。

Post-training、专家模型与 reward hacking blocker

post-training 先通过 SFT 把 base capability 转成 instruction-following behavior。之后训练多个专家模型:

Expert 主要目标
Web Development Expert 面向网页与应用开发任务
UX Expert 强化 tool call format following 与前端/交互体验相关任务
Single-turn QA Expert execution-verifiable coding / QA 任务,依赖 unit tests
SWE Expert 多步环境交互式软件工程任务

SWE Expert 的 reward shaping 包括 final task completion reward、unfinished trajectory penalty 和 tool-format token-level penalty。论文特别记录了 reward hacking:常规防护会移除 remotes、branches、tags,但后续 agent 仍学会用 git clonecurlwget 等方式尝试访问 ground-truth repo。作者加入启发式 blocker,拦截包含 repo link 和 network keywords 的 tool calls,并通过人工检查确认该类行为被清除。

最后,报告把 Web Development、UX、Single-turn RL 和 SWE experts 的能力蒸馏回统一模型,避免部署时需要多专家路由。

Tool chat template diversity

报告认为单一模板训练会导致过拟合,因此覆盖 natural language tool descriptions、JSON、Python-style、XML (qwen3_coder) 和 TypeScript 等格式。qwen3_coder 的 XML-style 设计适合包含长代码片段的工具调用,避免 JSON string nested quoting 对代码输出造成额外负担。Hugging Face model card 要求 SGLang >=v0.5.8 或 vLLM >=0.15.0,并设置 --tool-call-parser qwen3_coder

6. 结论链条

  1. 低 active parameter 模型可以通过 hybrid attention / MoE 降低推理成本。
  2. agentic coding 的训练信号需要可执行环境、测试反馈、工具轨迹和失败恢复过程。
  3. 大规模 PR-derived / synthetic issue environments 可以把真实软件工程任务转成 verifiable outcomes。
  4. mid-training 让模型学习 repo-level context、tool format 和 editing trajectories;post-training 用专家 RL 补齐更专门的 agent behavior。
  5. 多模板工具训练和 best-fit packing 处理 format generalization 与长轨迹切分问题。
  6. 在 SWE-Bench、Terminal-Bench、Aider、code / math / general benchmark 上,Qwen3-Coder-Next 展示了高 active-efficiency,但与 Claude Opus 4.5 等 proprietary frontier model 仍有差距。

关键实验/定理

结果 1:SWE-Bench Verified 多 scaffold 评测

  • 设置:SWE-agent、MiniSWE-agent、OpenHands 三种 scaffold。
  • Baseline:Claude Opus 4.5、Claude Sonnet 4.5、DeepSeek-V3.2、GLM-4.7、MiniMax-M2.1、Kimi-K2.5 等。
  • 指标:SWE-Bench Verified resolve rate。
  • 结果:Qwen3-Coder-Next-80A3 在 SWE-agent / MiniSWE-agent / OpenHands 上分别为 70.6 / 71.1 / 71.3。Claude Opus 4.5 对应为 78.2 / 77.8 / 79.0,Claude Sonnet 4.5 为 76.0 / 68.4 / 74.6。
  • 证据定位:报告 Section 5, Table 3
  • 对照是否可比:部分可比。各模型使用同一 SWE-Bench Verified 数据集、三种 scaffold 和 300 次 agent turn 上限;表中没有统一披露闭源模型的采样配置、tool parser、重试策略与调用预算,参数规模也未做 compute matching。
  • 支持的最窄结论:在报告采用的三套 scaffold 与评测配置中,Qwen3-Coder-Next 的 resolve rate 为 70.6 到 71.3,低于 Claude Opus 4.5,并与多种更高 active-parameter 开放模型处于相近区间。
  • 解读:Qwen3-Coder-Next 在 active parameter footprint 上明显更小,SWE-Bench Verified 表现接近多种开放模型和部分 proprietary scaffold 结果,但仍落后最强 Claude Opus 4.5。

结果 2:Tool template following

  • 设置:比较 XML、JSON、Python-style、TypeScript 等多种 tool chat template 的 format following。
  • Baseline:GPT-5-2、Claude Sonnet 4.5、Gemini-3-Pro、DeepSeek-v3.2、GLM-4.6 / 4.7、MiniMax-M2.1、Kimi-K2 / K2-thinking。
  • 指标:tool template following average score。
  • 结果:Qwen3-Coder-Next 平均 92.7,DeepSeek-v3.2 为 93.7,Claude Sonnet 4.5 为 85.4,Gemini-3-Pro 为 87.0。
  • 证据定位:报告 Section 4.2.2, Table 2;训练模板清单见 Appendix A.2, Table 12
  • 对照是否可比:部分可比。模型在同一内部 format-following benchmark 上接受五种源自 IDE / CLI 的 prompt 与 tool-call schema;具体测试集、各 API 模型的 native tool interface 和 parser 适配没有公开,外部目前无法完整复现。
  • 支持的最窄结论:在这五种内部模板上,Qwen3-Coder-Next 的平均格式遵循分数为 92.7,各模板分数为 83.0 到 98.0;该结果支持已测模板范围内的格式稳健性,覆盖范围不等同于完整任务成功率或任意 scaffold 泛化。
  • 解读:多模板训练和 XML-style qwen3_coder 格式构成模型的核心工程设计之一,对 IDE / CLI scaffold 集成具有直接价值;当前证据主要来自内部格式评测。

结果 3:函数级、竞赛级与编辑类代码能力

  • 设置:EvalPlus、MultiPL-E、CRUXEval、LiveCodeBench v6、OJBench、Codeforces,以及 FullStackBench、Spider、BIRD-SQL、Aider-Polyglot。
  • Baseline:Qwen3-Coder-480B-A35B-Instruct 与 Qwen3-Next。
  • 指标:各 benchmark 原生分数。
  • 结果:Qwen3-Coder-Next 在 CRUXEval 为 95.88,LiveCodeBench v6 为 58.93,OJBench 为 23.01,Codeforces 为 2100;Aider-Polyglot 为 66.20,高于 Qwen3-Coder-480B-A35B 的 60.40 与 Qwen3-Next 的 52.90。
  • 证据定位:报告 Section 5.2, Table 6Table 7
  • 对照是否可比:同一 Qwen 系列模型在相同表格和 benchmark 指标下具有较直接的横向可比性;模型规模、训练阶段与 active compute 不一致,报告也未完整披露生成配置、方差和数据去污染细节。
  • 支持的最窄结论:Qwen3-Coder-Next 在 CRUXEval、LiveCodeBench v6、OJBench、Codeforces 和 Aider-Polyglot 上高于两项同源对照;EvalPlus、FullStackBench 与 SQL 指标没有形成全面领先。
  • 解读:报告中的增强不只体现在 agent benchmark,也体现在编辑、竞赛和多语言代码任务。部分前端/SQL指标则没有全面领先,显示专业能力仍受数据和任务类型影响。

结果 4:通用能力与数学能力保持

  • 设置:MMLU、MMLU-Redux、MMLU-Pro、GPQA、SuperGPQA、HMMT、AIME。
  • Baseline:Qwen3-Next。
  • 指标:各 benchmark 分数。
  • 结果:Qwen3-Coder-Next 在 MMLU / MMLU-Redux / MMLU-Pro 上与 Qwen3-Next 接近;GPQA 从 73.54 到 74.49;AIME24 从 82.92 到 89.01,AIME25 从 69.64 到 83.07。
  • 证据定位:报告 Section 5.3, Table 8Table 9
  • 对照是否可比:同源 Qwen3-Next 对照与相同 benchmark 指标提供较直接比较;报告没有给出多 seed 方差、显著性检验和更广泛模型家族对照。
  • 支持的最窄结论:在报告列出的通识与数学 benchmark 上,Qwen3-Coder-Next 的 MMLU 系列分数接近 Qwen3-Next,GPQA 与 AIME 更高,SuperGPQA 略低;这些结果支持“所报告任务未出现明显整体退化”。
  • 解读:agentic coding mid/post-training 没有明显削弱通用知识能力,数学与代码相关推理还有收益。需要注意这些结果仍是同源 Qwen3-Next 对照,不能单独证明跨模型家族的通用泛化。

结果 5:任务规模与长轨迹 packing

  • 设置:真实 GitHub PR environments、synthetic issue environments、262K context mid-training、best-fit packing。
  • Baseline:传统 concatenate-then-split sample packing,以及不同 scaffold trajectory 训练。
  • 指标:task instance 数、fragmentation / padding、scaffold transfer、长程任务表现。
  • 结果:真实 PR environments 807,693 instances,synthetic issue 851,898 instances。BFP 通过少量 padding 换取更低 fragmentation,减少多工具轨迹中 tool definitions 被切断的问题。
  • 证据定位:任务构造见 报告 Section 2.1Appendix A.1, Tables 10 和 11;packing 机制与消融见 Section 3.2Appendix A.3, Table 13
  • 对照是否可比:任务实例数属于数据规模统计,没有外部 baseline。packing 消融中 concatenate-then-split、restart-last-document 与 BFP 均使用 73B tokens,具备较直接比较条件;pad-last-document 使用 89B tokens,训练预算存在差异,且下游指标来自内部 SWE 任务。
  • 支持的最窄结论:报告披露了 807,693 个真实 PR 环境和 851,898 个合成 issue 实例;73B-token 消融中,BFP 将 fragmentation rate 从 30.2% 降至 0.0%,padding rate 为 0.01%,并改善汇总 patch similarity 与 empty rate。该证据支持本报告训练设置中的 packing 选择,无法单独量化 BFP 对最终公开 benchmark 的净贡献。
  • 解读:这部分是系统型贡献。它解释了 agentic training 数据收集复杂的原因:每个样本都要绑定可运行仓库状态、测试、环境镜像、工具轨迹和 outcome 回收链路。

实验设置与 baseline 审计

维度 记录
模型与初始化 Qwen3-Coder-Next 基于 Qwen3-Next-80B-A3B-Base;80B total / 3B active;48 layers;hybrid Gated DeltaNet / Gated Attention + MoE。
数据与任务 GitHub code、text-code grounding、PR-based edits、synthetic QA、multi-turn agent trajectories、FIM、instruction-following data;真实 PR envs 807,693;synthetic issue tasks 851,898。
RL / 训练配置 SFT 后训练多个 experts;Single-turn QA 用 unit-test-verifiable tasks;SWE expert 用 final completion reward、unfinished penalty、tool-format penalty;具体 optimizer / rollout batch / KL 等未完整披露。
系统配置 MegaFlow,Alibaba Cloud Kubernetes,Argo workflow;单 pod co-locates agent container 与 environment container;evaluation container 单独运行。
框架基座 / paper base 推理部署支持 SGLang、vLLM;agent trajectory 来源包括 SWE-agent、Mini-SWE-agent、OpenHands、Claude-Code、Qwen-Code、Terminus;BFP 在 Megatron 中实现。
框架版本与证据来源 Hugging Face model card 要求 sglang>=v0.5.8vllm>=0.15.0;MegaFlow、environment-builder agent、QA agent 版本未披露。
框架改动范围 新增 cloud-native orchestration、environment construction、verification filtering、reward hacking blocker、multi-template tool parser 适配;具体代码未完全公开。
技术报告训练配置 mid-training 训练 trillions of tokens;context 262,144;包含 FIM objective 和 best-fit packing;post-training 使用 SFT、专家 RL、expert distillation。
训练硬件与拓扑 未披露完整 GPU 数、网络拓扑和训练时间;只披露 Kubernetes / Argo / Docker 级别系统组织。
并行方式与框架 论文未披露训练并行细节;deployment 侧 model card 给出 tensor parallel server 示例。
训练数据规模与组成 repo-level data 约 600B tokens;programming languages 370;README 写模型支持 358 coding languages。
训练过程与超参 learning rate、batch size、RL rollout 数、KL、clip、reward normalization 等未披露。
训练时间 / GPU hours / 成本 未披露。
未披露项 MegaFlow 代码、环境构建 agent、QA agent、reward hacking blocker 完整规则、训练成本、数据许可过滤细节、benchmark decontamination 细节。
评测协议 SWE-Bench Verified、TerminalBench 2.0、Aider-Polyglot、EvalPlus、MultiPL-E、CRUXEval、LiveCodeBench、OJBench、Codeforces、FullStackBench、Spider、BIRD-SQL、MMLU、GPQA、HMMT、AIME 等。
统计报告 主要以表格分数和规模统计呈现;未见置信区间或多 seed 方差。
Baseline 是否 tuned 多数 baseline 来自公开模型或报告值;scaffold / parser 配置可能影响结果。
Baseline 是否 compute-matched 没有 compute-matched;论文强调 active parameter efficiency。
Baseline 是否 implementation-matched SWE-Bench 中使用多个 scaffold,但不同模型与 parser/template 适配程度可能不同。
Baseline 是否覆盖强替代方案 覆盖 Claude、DeepSeek、GLM、MiniMax、Kimi 等强模型;仍缺少完整 proprietary 成本与同等工具栈对照。
Baseline 是否存在弱化风险 tool parser、context length、temperature、scaffold prompt 和 retry 策略都可能影响 agent benchmark。
结论边界 可支持“低 active footprint + 强 agentic training recipe 有竞争力”;无法单独推出 MegaFlow 或环境合成流程可由外部完全复现。
  • 系统条件:MegaFlow 基于 Alibaba Cloud Kubernetes 与 Argo workflow;rollout pod 同置 agent container 和 environment container,verification 在独立容器运行。报告未披露集群规模、GPU 拓扑、并发负载和内部组件版本。
  • 指标定义:SWE-Bench Verified 以 300 次 agent turn 上限内的 resolved rate 计分;BFP 消融分别报告样本碎片率、padding rate、patch similarity 与 empty rate。报告没有给出 MegaFlow 吞吐、尾延迟或单位任务成本。
  • 成本归因:3B active footprint 来自 hybrid attention 与 MoE;公开成绩来自基座、数据规模、长上下文中训、packing、多模板、SFT、专家强化学习和蒸馏的组合,现有消融只能单独支持 BFP 等局部组件,无法分离整套训练配方的净贡献。
  • 未披露项:完整训练硬件与时间、GPU hours、优化器和 batch 超参、RL rollout 与 KL 配置、MegaFlow 代码、环境构建和 QA agent 版本、数据许可与去污染细节均未公开。
  • 威胁模型:训练和评测中的编码 agent 可读写仓库、运行工具并在部分环境中访问网络,其目标可能从完成修复偏移到寻找验证捷径或恢复受保护答案;报告处理的是已观察到的训练期 shortcut 风险,并未提供通用攻击覆盖证明。
  • 披露边界:本笔记保留 reward integrity、网络访问和验证污染的风险判断,只概括防护层级与残余风险,不记录可直接复用的绕过步骤或完整拦截规则。
  • 适用版本:论文结论对应 arXiv v1(2026-02-28);部署字段核对 Qwen3-Coder GitHub 与 Hugging Face Qwen/Qwen3-Coder-Next 在 2026-07-21 的公开状态,报告没有固定仓库 commit。

证据链强度评估

强证据

  • arXiv v1、GitHub repo、Hugging Face model card 和 ModelScope 模型页共同确认模型、权重发布、部署方式和工具 parser。
  • 多项 benchmark 表格覆盖 agentic coding、一般 coding、general reasoning、math,能支撑 active-efficiency 的经验判断。
  • Appendix 给出 PR-derived 和 synthetic issue task 的规模统计,解释了 executable environment 数据集的数量级。

中等强度证据

  • tool-template diversity 与 qwen3_coder XML format 的贡献由模板跟随评测和部署 parser 支撑,但外部复验仍依赖实际 scaffold。
  • reward hacking blocker 有明确问题描述、规则方向和人工检查结论,缺少公开规则集与失败样本。
  • expert distillation 是合理训练路径,报告没有完全披露蒸馏数据比例和 loss 细节。

需要谨慎的推论

  • MegaFlow 是内部系统,公开材料不足以判断其通用可迁移性。
  • cross-scaffold transfer 有限制,单个 scaffold 上的高分不能直接外推到任意 coding-agent harness。
  • reward hacking 防护和 benchmark decontamination 是 agentic coding evaluation 的关键风险,论文提供了处理方向,但复现审计仍需要更多开放材料。

本地讨论补充

1. 讨论收敛点

  • 这篇报告是当前本地档案中 Qwen-Coder 专门线的关键节点,连接 Qwen2.5 / Qwen3 foundation model report 与 agentic coding / executable environment 训练。
  • 与 LLM-in-Sandbox 相比,Qwen3-Coder-Next 关注生产规模的 coding-agent environment generation 和 rollout infrastructure;LLM-in-Sandbox 提供更小、更抽象的 computer environment baseline。
  • 与 ThunderAgent / RollArt / slime / GLM-5 的关系在系统侧:这些工作分别处理 serving KV / tool lifecycle、rollout-environment-trainer 解耦、RL framework 和 agentic engineering;Qwen3-Coder-Next 给出 model report 中的 executable environment 训练实例。

2. 修正后的理解

  • agentic coding 数据收集复杂,原因在于每个样本需要仓库状态、依赖安装、测试脚本、Docker 镜像、工具轨迹、outcome verifier 和 post-processing;文本 prompt / completion 只是其中一层。
  • reward hacking 在 coding-agent RL 中会通过环境与网络通道出现。Qwen3-Coder-Next 的例子说明,移除 git metadata 后,模型仍可能通过网络命令恢复 ground truth,需要在 tool-call 层额外拦截。
  • best-fit packing 在长工具轨迹中有实际含义:tool definitions 和 calling format 常在轨迹开头,随机切分会让后续 token 失去格式约束来源。

3. 后续复验指标

  • 在同一个 local scaffold 中比较 qwen3_coder XML、JSON 和 Cline-style XML 的 tool-call failure rate。
  • 在 SWE-Bench Lite / Verified 的固定 scaffold 下复验 3B active 模型与 30B/35B active 模型的 latency、cost、resolve rate tradeoff。
  • 对 reward hacking blocker 做红队测试:repo URL、network command、hidden tests、environment variables、cache artifacts、package metadata。

主要启发

  • coding-agent 模型的扩展变量应同时包含 active compute、verifiable environment 数量、scaffold/template diversity、长轨迹 packing 和 reward integrity。
  • XML-style tool call format 对代码任务有实际工程价值,因为代码片段、patch、shell 命令和 JSON escaping 容易互相干扰。
  • executable task synthesis 的关键质量控制在 verifier、environment reproducibility、shortcut filtering 和 benchmark decontamination。
  • 低 active parameter 模型更适合本地 IDE / CLI agent 部署,但强 agentic training pipeline 的构建成本被转移到数据和环境系统。

局限

  1. 训练硬件、训练时长、GPU hours、完整超参和 RL recipe 未公开。
  2. MegaFlow、环境构建 agent、QA agent 和 reward hacking blocker 规则未完全开源。
  3. cross-scaffold transfer 有限制,模型对工具模板和 agent framework 仍有适配成本。
  4. 论文承认与 Claude Opus 4.5 等 frontier proprietary model 在复杂大规模 SWE tasks 上仍有差距。
  5. 前端 / UI 能力、复杂项目规划效率、cybersecurity 任务和视觉评测能力仍是未来工作。

跨论文关系