tracked author

Bo Zheng

Recurring Qwen author across Qwen2.5, Qwen3 and Bebop; RollArt adds Alibaba ROLL / agentic RL infrastructure linkage. Scholar/Hugging Face and Qwen technical reports provide stable Qwen Team linkage, but public personal profile evidence is sparse. No high-confidence personal X account was found.

5 archived notes X: not-found Hugging Face

Related Notes

按论文归档时间排序,展示该作者在本站已经出现的材料。

归档

On the Design of Qwen3.8 Next Architecture: Evaluation, Efficiency, and Training Stability

Qwen3.8 Flash Next 将三层 Gated DeltaNet 与一层 Qwen Sparse Attention 交错,并用四分支门控残差、可卸载的 N gram Embedding 和重新拟合的 Muon 训练配方共同降低训练与长上下文推理成本;125B 主模型每个 token 激活约 6B 参数,在十四项预训练评测中有八项超过 397B A17B 的 Qwen3.7 Plus Base,同时使用约三分之一的训练 token 和约九分之一的训练 FLOPs,但报告没有披露完整数据账本、端到端服务测量或多随机种子复验。

待审阅 2026-08-26-qwen3-8-flash-next-architecture Sparse AttentionLinear AttentionTraining Stability
归档

Part I: Tricks or Traps? A Deep Dive into RL for LLM Reasoning

在同一训练框架下、覆盖范围并不完全重合的 Qwen3 4B/8B Base 与对齐后数学强化学习实验中分别检查优势归一化、概率比裁剪、损失聚合和超长过滤,并将组内均值—批级标准差归一化与 token 级损失组成不训练价值模型的 Lite PPO;OpenReview 补充的一个 Qwen3 8B Base 三随机种子设置仍优于 GRPO 与 DAPO,但奖励范围异常、计算量未对齐和有限模型任务覆盖限制普适结论。

待审阅 2508.08221-tricks-or-traps-lite-ppo RL AlgorithmReasoning RLTraining Stability