tracked author

Yancheng He (贺彦程)

Alibaba Group 大语言模型研究者,研究方向包括智能体智能、推理强化学习与后训练;Tricks or Traps 共同贡献作者、DeltaBench 第一作者。OpenReview 和哈尔滨工业大学记录确认其 2021–2023 年硕士学习经历,个人主页重点展示 ROLL、ROME 与 Agentic Learning Ecosystem。个人主页当前可见的社交链接与 `_data/social.yml` 指向 @helansydney;`_config.yml` 保留的 he_yancheng 是陈旧 SEO 字段。

1 archived notes X: high HomepageGitHubX

Representative Papers

来自作者已核验个人主页的重点论文;本站单篇归档见下方 Related Notes。

  1. 01 Let It Flow: Agentic Crafting on Rock and Roll, Building the ROME Model within an Open Agentic Learning Ecosystem arXiv
  2. 02 Tricks or Traps? A Deep Dive into RL for LLM Reasoning ICLR · 2026
  3. 03 Part II: ROLL Flash -- Accelerating RLVR and Agentic Training with Asynchrony arXiv · 2025
  4. 04 Asymmetric Proximal Policy Optimization: mini-critics boost LLM reasoning ICLR · 2026
  5. 05 Think-J: Learning to Think for Generative LLM-as-a-Judge AAAI · 2026
  6. 06 MuSC: Improving Complex Instruction Following with Multi-granularity Self-Contrastive Training ACL · 2025
  7. 07 Can Large Language Models Detect Errors in Long Chain-of-Thought Reasoning? ACL · 2025

Related Notes

按论文归档时间排序,展示该作者在本站已经出现的材料。

归档

Part I: Tricks or Traps? A Deep Dive into RL for LLM Reasoning

在同一训练框架下、覆盖范围并不完全重合的 Qwen3 4B/8B Base 与对齐后数学强化学习实验中分别检查优势归一化、概率比裁剪、损失聚合和超长过滤,并将组内均值—批级标准差归一化与 token 级损失组成不训练价值模型的 Lite PPO;OpenReview 补充的一个 Qwen3 8B Base 三随机种子设置仍优于 GRPO 与 DAPO,但奖励范围异常、计算量未对齐和有限模型任务覆盖限制普适结论。

待审阅 2508.08221-tricks-or-traps-lite-ppo RL AlgorithmReasoning RLTraining Stability