归档

EAGLE 3: Scaling up Inference Acceleration of Large Language Models via Training Time Test

EAGLE 3 去除特征回归约束,用多层目标特征融合和训练时多步自生成展开直接训练草稿 token 分布;LLaMA 3.1 8B 在 MT Bench 从 EAGLE 2 的 3.16 倍提高到 4.40 倍,6.47 倍是单批量研究原型峰值,SGLang 批量 64 为 1.38 倍。

Yuhui Li, Fangyun Wei, Chao Zhang, Hongyang Zhang

待审阅 2503.01840-eagle-3-training-time-test Speculative DecodingMulti-Token PredictionServing Runtime
归档

MoESD: Unveil Speculative Decoding's Potential for Accelerating Sparse MoE

在单步解码已使专家加载趋于饱和、模型仍受内存带宽限制的中等批量区间,用投机验证复用已加载专家;Qwen2 57B A14B 在两张 H800 上最高加速 2.29 倍,适用范围依赖路由均衡、MoE 前馈网络成本占比和具体硬件。

Zongle Huang, Lei Zhu (祝磊), Zongyuan Zhan, Ting Hu, Weikai Mao, Xianzhi Yu, Yongpan Liu (刘勇攀), Tianyu Zhang

待审阅 2505.19645-moesd-sparse-moe-speculative-decoding Speculative DecodingMoE SystemsServing Runtime
归档

SEED: Self Evolving On Policy Distillation for Agentic Reinforcement Learning

先用外部模型标注的轨迹—技能数据把策略训练成轨迹分析器,再让每轮最新策略从自身完整轨迹生成事后技能并对同批采样 token 做门控似然训练;三种小模型在 12 个汇总指标中取得 10 个最优或并列最优,但直接前作 OPID 未进入主表,且证据缺少多随机种子、技能正确性评测与总训练成本对齐。

Jinyang Wu, Shuo Yang, Zhengxi Lu, Fan Zhang, Yuhao Shen, Lang Feng, Haoran Luo, Zheng Lian, Shuai Zhang, Zhengqi Wen, +1 more

待审阅 2607.14777-seed-self-evolving-on-policy-distillation On-Policy DistillationAgent RLCredit Assignment
归档

Enhancing Rubric based RL via Self Distillation

把评分量规聚合后的学习信号丢失拆成当前采样未覆盖和已满足但整体优势非正两类,用评分项条件自教师注入缺失行为,并以反事实自教师定位 token 后局部改写优势;两种 Qwen3 小模型在五项裁判评测中较 GRPO 平均提高 3.2 和 1.4 分,证据缺少多随机种子与完整硬件条件。

Mingxuan Xia, Yuhang Yang, Chao Ye, Shuai Zhu, Shenzhi Yang, Guangcheng Zhu, Yuhang Zhang, Cheng Peng, Haobo Wang (王皓波), Siqing Wang

待审阅 2607.18082-cripo-rubric-rl-self-distillation Credit AssignmentOn-Policy DistillationRL Algorithm
归档

RubricEM: Meta RL with Rubric guided Policy Decomposition beyond Verifiable Rewards

把评分量规贯穿深度研究智能体的阶段化执行、分阶段裁判奖励和反思记忆,在作者的搜索与 LLM 裁判协议下将 8B 模型四项长文基准均值从 SFT 的 49.2 提高到 55.5。

Gaotang Li, Bhavana Dalvi Mishra, Zifeng Wang, Jun Yan, Yanfei Chen, Chun Liang Li, Long T. Le, Rujun Han, George Lee, Hanghang Tong, +2 more

待审阅 2605.10899-rubricem-rubric-guided-meta-rl Agent RLCredit AssignmentAgent Memory
归档

Beyond Trajectory Level Attribution: Graph Based Credit Assignment for Agentic Reinforcement Learning

将同一任务的分组轨迹合并为状态转移图,以后继状态到成功节点的最短路径构造逐步优势,并在状态可稳定合并、目标可验证的 ALFWorld、WebShop 和 Sokoban 设置中优于 GRPO 与 GiGPO。

Xin Cheng, Shuo He, Lang Feng, HaiYang Xu, Ming Yan, Lei Feng (冯磊), Bo An

待审阅 2605.26684-graphgpo-graph-credit-assignment-agentic-rl Credit AssignmentAgent RLRL Algorithm
归档

TacoMAS: Test Time Co Evolution of Topology and Capability in LLM based Multi Agent Systems

在单个查询内逐轮依据轨迹反馈改写代理能力,并每两轮按预算增删代理与重连通信图;四个工具基准相对各自最强基线平均提高 13.3 个准确率百分点,比较未统一推理预算。

Chen Xu, Yicheng Hu, Ruizi Wang, Xinyu Lin, Wenjie Wang (王文杰), Dongrui Liu, Fuli Feng

待审阅 2605.09539-tacomas-test-time-coevolution-mas Multi-Agent OrchestrationAgent WorkflowTest-Time Scaling
归档

TRACE: Turn level Reward Assignment via Credit Estimation for Long Horizon Agents

在已知短答案的长程搜索中,用冻结参考模型测量工具边界后的答案可预测性变化并把多步时序差信用混入终局优势,使两种 Qwen3 Thinking 模型在同设置下较 GRPO 的 BrowseComp Plus 分数分别提高 5.6 和 6.2 个百分点。

Leitian Tao, Baolin Peng, Wenlin Yao, Tao Ge (葛涛), Hao Cheng, Mike Hang Wang, Jianfeng Gao, Sharon Li

待审阅 2607.13988-trace-turn-level-reward-assignment Credit AssignmentAgent RLReward Modeling
归档

Towards Long Horizon Agents: A Survey

用基础策略与运行时 harness 的组合关系以及 H1/H2/H3 分层,将长程能力统一为运行时系统和模型内部优化共同作用的系统属性。

Guanting Dong (董冠霆), Xiaoshuai Song (宋晓帅), Yuyang Hu (扈煜阳), Jiajie Jin (金佳杰), Chenghao Zhang, Yifei Chen, Xiaoxi Li, Huaying Yuan, Xinyu Yang, Tongyu Wen, +10 more

待审阅 202607.1328-towards-long-horizon-agents-survey Agent WorkflowAgent MemoryAgent RL
归档

SmoothAgent: Efficient Long Horizon LLM Based Agent Serving with Lookahead Context Engineering

把可提前确定的 context transformation 移入异步 lookahead stream,并用 SLO aware scheduling 预建变换后 KV cache,降低 transform point TTFT。

Zaifeng Pan (潘再峰), Qianxu Wang, Zhengding Hu, Chang Chen, Yue Guan, Yanbo Zhou, Steven Swanson, Yufei Ding

已审阅 2607.00151-smoothagent-lookahead-context-engineering Agent MemoryKV CacheInference Scheduling
归档

A Survey of Reinforcement Learning for Large Language Models under Data Scarcity: Challenges and Solutions

把 LLM 强化学习中的高成本外部监督与有限内部生成经验统一到 data、training、framework 三层九类干预点,并组织为一份覆盖 125 条文献记录的设计地图。

Zhiyin Yu, Yuchen Mou, Juncheng Yan, Junyu Luo, Chunchun Chen, Xing Wei, Yunhui Liu, Hongru Sun, Yuxing Zhang, Jun Xu, +10 more

待审阅 2604.17312-rl-llm-data-scarcity-survey Reasoning RLRollout OptimizationReward Modeling
归档

IndexCache: Accelerating Sparse Attention via Cross Layer Index Reuse

用 loss guided layer search 或 multi layer distillation 划分 Full / Shared 层,跨层复用 top k positions 并跳过最多 75% 的 DSA indexer 计算。

Yushi Bai (白雨石), Qian Dong, Ting Jiang, Xin Lv (吕鑫), Zhengxiao Du, Aohan Zeng, Jie Tang (唐杰), Juanzi Li (李涓子)

已审阅 2603.12201-indexcache-cross-layer-index-reuse Sparse AttentionLong ContextServing Runtime
归档

CompactionRL: Reinforcement Learning with Context Compaction for Long Horizon Agents

在 SUPO 已覆盖摘要与执行联合训练的前提下,用支持单 rollout 的独立 critic 和跨 segment GAE 处理压缩轨迹;两个模型在 compacted coding 评测中均提高 Pass@1,但缺少与 SUPO 的直接对照。

Yujiang Li, Zhenyu Hou, Yi Jing, Jie Tang (唐杰), Yuxiao Dong

已审阅 2607.05378-compactionrl-context-compaction-agent-rl Agent MemoryAgent RLCredit Assignment
归档

Qwen3 Coder Next Technical Report

Qwen3 Coder Next 在 80B 总参数中每步激活 3B 参数,并用可执行仓库任务、长上下文中训、多模板工具训练、软件工程强化学习与专家蒸馏构建编码智能体,在三种 SWE Bench Verified scaffold 上达到 70.6% 至 71.3% 解决率,报告尚未拆分各训练组件的净贡献。

Ruisheng Cao, Mouxiang Chen (陈谋祥), Jiawei Chen (陈家慰), Zeyu Cui, Yunlong Feng, Binyuan Hui, Yuheng Jing, Kaixin Li, Mingze Li, Junyang Lin, +10 more

已审阅 2603.00729-qwen3-coder-next-agentic-coding Coding AgentAgent RLTool Use
归档

Computer Environments Elicit General Agentic Intelligence in LLMs

LLM in Sandbox 只给模型 shell、文件编辑和完成信号,使部分模型—任务组合获得最高 15.5 个百分点增益,并让 Qwen3 4B 经文件型通用任务强化学习后把平均交互轮次从 23.7 降到 7.0,这些数值来自允许联网的特定环境配置。

Daixuan Cheng (成岱璇), Shaohan Huang, Yuxian Gu, Huatong Song (宋华彤), Guoxin Chen, Li Dong (董力), Wayne Xin Zhao, Ji-Rong Wen, Furu Wei (韦福如)

已审阅 2601.16206-computer-environments-agentic-intelligence Tool UseAgent RLAgent Workflow
归档

Hierarchical Sparse Attention Done Right: Toward Infinite Context Modeling

HiLS Attention 用 landmark 压缩键、熵偏置与分层 softmax 训练 chunk 选择器,使 8K 训练的 345M 模型在 4M RULER 单针检索仍得 96 分,并在 512K 单 H800、batch size 1 的同 Triton 基线上将 prefill 与 decode 分别加速 13.5 倍和 15.7 倍。

Xiang Hu, Xinyu Wei, Hao Gu, Minshen Zhang, Tian Liang, Huayang Li, Lei Zhu (祝磊), Yan Wang (王琰), Sirui Han (韓斯睿), Yushi Bai (白雨石), +3 more

已审阅 2607.02980-hils-attention-infinite-context Sparse AttentionLong Context
归档

ThunderAgent: A Simple, Fast and Program Aware Agentic Inference System

把多轮 tool use 的 phase、KV footprint 与 backend placement 合并为 LLM Program,用 phase first pause / restore 和全局 waiting queue 控制工具等待期间的 KV working set。

Hao Kang, Ziyang Li, Weili Xu, Xinyu Yang, Yinfang Chen, Junxiong Wang, Beidi Chen, Tushar Krishna, Chenfeng Xu, Simran Arora

已审阅 2602.13692-thunderagent-program-aware-agentic-inference Agent WorkflowInference SchedulingKV Cache
归档

SPIRAL: Learning to Search and Aggregate

从 8 条搜索轨迹随机构造 4 个四元集合,以聚合成功率的参与集合均值更新搜索轨迹,并用同集合内中心化 reward 训练共享策略的聚合轨迹。

Jubayer Ibn Hamid, Ifdita Hasan Orney, Michael Y. Li, Omar Shaikh, Yoonho Lee, Dorsa Sadigh, Chelsea Finn, Noah Goodman

已审阅 2606.23595-spiral-learning-search-aggregate Test-Time ScalingCredit AssignmentRL Algorithm
归档

ECHO: Prune to act, trace to learn with selective turn memory in agentic RL

ECHO 为长程智能体保留带原始轮次标识的选择性记忆,用它重建有限上下文并将结果信用路由到被复用历史轮次及其选择动作,在 BrowseComp Plus 上同时提高一次通过率并减少滚动摘要造成的轨迹膨胀。

Zijun Xie, Binbin Zheng, Enlei Gong, Jihua Liu, Yuyang You, Lingfeng Liu, Jiayao Tang, Guanqun Zhao, Aoqi Hu, Zeyu Chen

已审阅 2606.31650-echo-selective-turn-memory-agentic-rl Agent MemoryAgent RLLong Context
归档

MOPD: Multi Teacher On Policy Distillation for Capability Integration in LLM Post Training

让 student 在自身轨迹上接受多个领域 teacher 的 token level reverse KL 信号,整合 RL teacher 能力。

Wenhan Ma, Jianyu Wei, Liang Zhao, Hailin Zhang (张海林), Bangjun Xiao, Lei Li, Qibin Yang, Bofei Gao, Yudong Wang, Rang Li, +3 more

已审阅 2606.30406-mopd-multi-teacher-on-policy-distillation On-Policy DistillationRL AlgorithmReasoning RL
归档

RollArt: Disaggregated Multi Task Agentic RL Training at Scale

用声明式 task domain 硬件亲和映射、轨迹级环境状态机和带起始版本年龄上限的异步换权,协调 H800/H20/CPU/serverless 上的多任务 agentic RL。

Wei Gao, Yuheng Zhao, Tianyuan Wu, Shaopan Xiong, Weixun Wang, Dakai An, Lunxi Cao, Dilxat Muhtar, Zichen Liu, Haizhou Zhao, +8 more

已审阅 2512.22560-rollart-disaggregated-agentic-rl-training RL InfrastructureRollout OptimizationDistributed Training
归档

DSpark: Confidence Scheduled Speculative Decoding with Semi Autoregressive Generation

用 Markov head、置信度校准和硬件感知前缀调度,把并行 drafter 推进生产 serving。

Xin Cheng, Xingkai Yu (俞星凯), Chenze Shao, Jiashi Li, Yunfan Xiong, Yi Qian, Jiaqi Zhu, Shirong Ma, Xiaokang Zhang, Jiasheng Ye, +23 more

已审阅 2026-06-27-dspark-confidence-scheduled-speculative-decoding Speculative DecodingMulti-Token PredictionServing Runtime
归档

Laminar: A Scalable Asynchronous RL Post Training Framework

让完成轨迹独立进入 experience buffer,并以 CPU/RDMA relay 和同版本 repack 解除全局 batch / 权重同步 barrier。

Guangming Sheng, Yuxuan Tong (童雨轩), Borui Wan, Wang Zhang, Chaobo Jia (贾超博), Xibin Wu, Yuqi Wu, Xiang Li, Chi Zhang, Yanghua Peng, +3 more

已审阅 2510.12633-laminar-asynchronous-rl-post-training RL InfrastructureRollout OptimizationDistributed Training
归档

MegaScale MoE: Large Scale Communication Efficient Training of Mixture of Experts Models in Production

围绕 attention SP、FFN EP、communication overlap 和 compressed communication 重构生产 MoE 训练路径。

Chao Jin, Ziheng Jiang, Zhihao Bai, Zheng Zhong, Juncai Liu, Xiang Li, Ningxin Zheng, Xi Wang, Cong Xie, Qi Huang, +9 more

已审阅 2505.11432-megascale-moe-communication-efficient-training MoE SystemsDistributed TrainingTraining Memory
归档

Conditional Memory via Scalable Lookup: A New Axis of Sparsity for Large Language Models

用 hashed N gram lookup 和 context aware gating 增加可离线扩展的 conditional memory。

Xin Cheng, Wangding Zeng, Damai Dai, Qinyu Chen, Bingxuan Wang, Zhenda Xie (解振达), Kezhao Huang, Xingkai Yu (俞星凯), Zhewen Hao, Yukun Li, +4 more

已审阅 2601.07372-conditional-memory-engram-scalable-lookup Memory ArchitectureMoE Architecture
归档

Kimi K2: Open Agentic Intelligence

用大规模 MoE、MuonClip、工具数据和 agentic RL 构建开放的软件工程智能体模型。

Kimi Team: Yifan Bai and 198 other authors;arXiv submitter: Yulun Du。

已审阅 2507.20534-kimi-k2-open-agentic-intelligence MoE ArchitectureOptimizerAgent RL
归档

Qwen3 Technical Report

用 thinking / non thinking 双模式、thinking budget 和 strong to weak distillation 统一推理与通用能力。

An Yang and 59 other authors;本地核心跟踪作者包括 An Yang, Binyuan Hui, Bo Zheng, Bowen Yu, Dayiheng Liu, Fei Huang, Jianwei Zhang, Jianxin Yang, Jingren Zhou, Junyang Lin, Rui Men。

已审阅 2505.09388-qwen3-technical-report Reasoning RLMoE ArchitectureOn-Policy Distillation
归档

Credit Assignment with Resets in Language Model Reasoning

从失败轨迹重置并重采样错误点后的 continuation,只更新后缀 token 以集中 credit assignment。

Ankur Samanta, Akshayaa Magesh, Ayush Jain, Youliang Yu, Daniel R. Jiang, Kavosh Asadi, Kaveh Hassani, Paul Sajda, Jalaj Bhandari, Yonathan Efroni

已审阅 2605.25507-credit-assignment-resets-language-model-reasoning Credit AssignmentReasoning RLRollout Optimization
归档

The Optimal Token Baseline: Variance Reduction for Long Horizon LLM RL

推导 token level variance minimizing baseline,并用 logit gradient proxy 近似长轨迹 policy gradient 权重。

Yingru Li (李英儒), Jiawei Xu, Ziniu Li (李子牛), Jiacai Liu (刘佳材), Wei Liu (刘威), Yuxuan Tong (童雨轩), Longtao Zheng (郑龙韬), Zhenghai Xue, Yaxiang Zhang, Tianle Cai (蔡天乐), +3 more

已审阅 2602.07078-optimal-token-baseline-long-horizon-llm-rl Credit AssignmentRL AlgorithmRL Theory
归档

The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models

把 RLVR 训练能力上限关联到 policy entropy 消耗,并分析 advantage update 的熵动力学。

Ganqu Cui, Yuchen Zhang, Jiacheng Chen, Lifan Yuan (袁立凡), Zhi Wang, Yuxin Zuo, Haozhan Li, Yuchen Fan, Huayu Chen (陈华玉), Weize Chen, +7 more

已审阅 2505.22617-entropy-mechanism-rl-reasoning-language-models Training StabilityReasoning RLRL Theory
归档

Breaking Entropy Bounds: Accelerating RL Training via MTP with Rejection Sampling

以 TV loss 训练 MTP heads,并用 probabilistic rejection sampling 提高 RL rollout 接受率。

Yucheng Li, Huiqiang Jiang, Yang Xu (徐旸), Jianxin Yang, Yi Zhang, Yizhong Cao, Yuhao Shen, Fan Zhou, Rui Men, Jianwei Zhang, +7 more

已审阅 2606.12370-bebop-mtp-rejection-sampling-rl-training Rollout OptimizationSpeculative DecodingMulti-Token Prediction
归档

Dynamic Linear Attention

用 representation drift 动态决定 state 边界,在固定 cache 内自适应合并 linear attention states。

Xin Wang, Hui Shen, Boyuan Zheng, Xueshen Liu, Minkyoung Cho, Zhongwei Wan, Zesen Zhao, Zhuoqing Mao, Shen Yan, Mi Zhang

已审阅 2606.10650-dynamic-linear-attention Linear AttentionLong ContextMemory Architecture
归档

UltraEP: Unleash MoE Training and Inference on Rack Scale Nodes with Near Optimal Load Balancing

基于 post gating exact load 逐 microbatch / layer 规划 expert replica 与 token reroute,统一 MoE 训练和 prefill 负载均衡。

Xinming Wei, Chao Jin, Tuo Dai, Yinmin Zhong, Shan Yu, Chengxu Yang, Bingyang Wu, Zili Zhang, Jing Mai, Qianchao Zhu, +3 more

已审阅 2606.04101-ultraep-rack-scale-moe-load-balancing MoE SystemsDistributed TrainingInference Scheduling
归档

Transformers are Inherently Succinct

证明某些语言族的 Transformer 表示只需多项式规模,而 LTL / RNN / automata 需要指数或双指数规模。

Pascal Bergsträßer, Ryan Cotterell, Anthony W. Lin

已审阅 2510.19315-transformers-inherently-succinct Formal Expressivity
归档
归档

Spurious Rewards: Rethinking Training Signals in RLVR

通过随机、格式和错误答案 reward 实验,揭示 pretrained prior 与 clipping bias 可产生伪 RLVR 增益。

Rulin Shao, Shuyue Stella Li, Rui Xin, Scott Geng, Yiping Wang, Sewoong Oh, Simon Shaolei Du, Nathan Lambert, Sewon Min, Ranjay Krishna, +4 more

已审阅 2506.10947-spurious-rewards-rethinking-rlvr Reward HackingReasoning RLReward Modeling
归档

DeepSeek R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

用 outcome based RL 从强 base model 诱导 long CoT、自验证与策略切换,再通过 SFT / RL / distillation 转为可用模型。

DeepSeek AI and 199 other authors. Core contributors listed in v2 source include Daya Guo, Dejian Yang, Haowei Zhang, Junxiao Song, Peiyi Wang, Qihao Zhu, Runxin Xu, Ruoyu Zhang, Shirong Ma, Xiao Bi, Xiaokang Zhang, Xingkai Yu, Yu Wu, Z.F. Wu, Zhibin Gou, Zhihong Shao, Zhuoshu Li, Ziyi Gao.

已审阅 2501.12948-deepseek-r1-rl-reasoning Reasoning RLReward ModelingRL Algorithm
归档

Training Compute Optimal Large Language Models

重新估计 compute optimal frontier,指出参数量和训练 token 应随算力近似等比例增长。

Jordan Hoffmann, Sebastian Borgeaud, Arthur Mensch, Elena Buchatskaya, Trevor Cai, Eliza Rutherford, Diego de Las Casas, Lisa Anne Hendricks, Johannes Welbl, Aidan Clark, +12 more

已审阅 2203.15556-training-compute-optimal-large-language-models Scaling Laws
归档

Scaling Laws for Neural Language Models

拟合 loss 对参数、数据与计算的 power law,建立早期 compute efficient pretraining scaling law。

Jared Kaplan, Sam McCandlish, Tom Henighan, Tom B. Brown, Benjamin Chess, Rewon Child, Scott Gray, Alec Radford, Jeffrey Wu, Dario Amodei

已审阅 2001.08361-scaling-laws-neural-language-models Scaling Laws