归档 Jul 24, 2026 更新 Jul 24, 2026
EAGLE 3 去除特征回归约束,用多层目标特征融合和训练时多步自生成展开直接训练草稿 token 分布;LLaMA 3.1 8B 在 MT Bench 从 EAGLE 2 的 3.16 倍提高到 4.40 倍,6.47 倍是单批量研究原型峰值,SGLang 批量 64 为 1.38 倍。
Yuhui Li , Fangyun Wei , Chao Zhang , Hongyang Zhang
归档 Jul 24, 2026 更新 Jul 24, 2026
在单步解码已使专家加载趋于饱和、模型仍受内存带宽限制的中等批量区间,用投机验证复用已加载专家;Qwen2 57B A14B 在两张 H800 上最高加速 2.29 倍,适用范围依赖路由均衡、MoE 前馈网络成本占比和具体硬件。
Zongle Huang , Lei Zhu (祝磊) , Zongyuan Zhan , Ting Hu , Weikai Mao , Xianzhi Yu , Yongpan Liu (刘勇攀) , Tianyu Zhang
归档 Jul 23, 2026 更新 Jul 23, 2026
先用外部模型标注的轨迹—技能数据把策略训练成轨迹分析器,再让每轮最新策略从自身完整轨迹生成事后技能并对同批采样 token 做门控似然训练;三种小模型在 12 个汇总指标中取得 10 个最优或并列最优,但直接前作 OPID 未进入主表,且证据缺少多随机种子、技能正确性评测与总训练成本对齐。
Jinyang Wu , Shuo Yang , Zhengxi Lu , Fan Zhang , Yuhao Shen , Lang Feng , Haoran Luo , Zheng Lian , Shuai Zhang , Zhengqi Wen , +1 more
归档 Jul 22, 2026 更新 Jul 22, 2026
把评分量规聚合后的学习信号丢失拆成当前采样未覆盖和已满足但整体优势非正两类,用评分项条件自教师注入缺失行为,并以反事实自教师定位 token 后局部改写优势;两种 Qwen3 小模型在五项裁判评测中较 GRPO 平均提高 3.2 和 1.4 分,证据缺少多随机种子与完整硬件条件。
Mingxuan Xia , Yuhang Yang , Chao Ye , Shuai Zhu , Shenzhi Yang , Guangcheng Zhu , Yuhang Zhang , Cheng Peng , Haobo Wang (王皓波) , Siqing Wang
归档 Jul 22, 2026 更新 Jul 22, 2026
把评分量规贯穿深度研究智能体的阶段化执行、分阶段裁判奖励和反思记忆,在作者的搜索与 LLM 裁判协议下将 8B 模型四项长文基准均值从 SFT 的 49.2 提高到 55.5。
Gaotang Li , Bhavana Dalvi Mishra , Zifeng Wang , Jun Yan , Yanfei Chen , Chun Liang Li , Long T. Le , Rujun Han , George Lee , Hanghang Tong , +2 more
归档 Jul 22, 2026 更新 Jul 22, 2026
将同一任务的分组轨迹合并为状态转移图,以后继状态到成功节点的最短路径构造逐步优势,并在状态可稳定合并、目标可验证的 ALFWorld、WebShop 和 Sokoban 设置中优于 GRPO 与 GiGPO。
Xin Cheng , Shuo He , Lang Feng , HaiYang Xu , Ming Yan , Lei Feng (冯磊) , Bo An
归档 Jul 22, 2026 更新 Jul 22, 2026
在单个查询内逐轮依据轨迹反馈改写代理能力,并每两轮按预算增删代理与重连通信图;四个工具基准相对各自最强基线平均提高 13.3 个准确率百分点,比较未统一推理预算。
Chen Xu , Yicheng Hu , Ruizi Wang , Xinyu Lin , Wenjie Wang (王文杰) , Dongrui Liu , Fuli Feng
归档 Jul 21, 2026 更新 Jul 21, 2026
DRPO 在正确 rollout 内部按长度奖励重加权、独立压低错误 rollout,使 7B 蒸馏推理模型平均生成长度减少 51% 时性能仅相对下降 2.6%;证据限于 8K 预算、每题 8 条采样和 token 长度效率口径。
Gang Li , Yan Chen , Ming Lin , Tianbao Yang
归档 Jul 21, 2026 更新 Jul 22, 2026
在已知短答案的长程搜索中,用冻结参考模型测量工具边界后的答案可预测性变化并把多步时序差信用混入终局优势,使两种 Qwen3 Thinking 模型在同设置下较 GRPO 的 BrowseComp Plus 分数分别提高 5.6 和 6.2 个百分点。
Leitian Tao , Baolin Peng , Wenlin Yao , Tao Ge (葛涛) , Hao Cheng , Mike Hang Wang , Jianfeng Gao , Sharon Li
归档 Jul 18, 2026 更新 Jul 23, 2026 审阅 Jul 23, 2026
归档 Jul 18, 2026 更新 Jul 21, 2026
用基础策略与运行时 harness 的组合关系以及 H1/H2/H3 分层,将长程能力统一为运行时系统和模型内部优化共同作用的系统属性。
Guanting Dong (董冠霆) , Xiaoshuai Song (宋晓帅) , Yuyang Hu (扈煜阳) , Jiajie Jin (金佳杰) , Chenghao Zhang , Yifei Chen , Xiaoxi Li , Huaying Yuan , Xinyu Yang , Tongyu Wen , +10 more
归档 Jul 17, 2026 更新 Jul 21, 2026 审阅 Jul 23, 2026
把可提前确定的 context transformation 移入异步 lookahead stream,并用 SLO aware scheduling 预建变换后 KV cache,降低 transform point TTFT。
Zaifeng Pan (潘再峰) , Qianxu Wang , Zhengding Hu , Chang Chen , Yue Guan , Yanbo Zhou , Steven Swanson , Yufei Ding
归档 Jul 17, 2026 更新 Jul 21, 2026 审阅 Jul 23, 2026
让 student 在自身轨迹上接受 query specific demonstration conditioned EMA 同模型的 token distribution,在提升新任务准确率时显著减少旧能力遗忘。
Idan Shenfeld , Mehul Damani , Jonas Hübotter , Pulkit Agrawal
归档 Jul 16, 2026 更新 Jul 23, 2026 审阅 Jul 23, 2026
归档 Jul 16, 2026 更新 Jul 16, 2026
把 LLM 强化学习中的高成本外部监督与有限内部生成经验统一到 data、training、framework 三层九类干预点,并组织为一份覆盖 125 条文献记录的设计地图。
Zhiyin Yu , Yuchen Mou , Juncheng Yan , Junyu Luo , Chunchun Chen , Xing Wei , Yunhui Liu , Hongru Sun , Yuxing Zhang , Jun Xu , +10 more
归档 Jul 14, 2026 更新 Jul 22, 2026 审阅 Jul 22, 2026
用 loss guided layer search 或 multi layer distillation 划分 Full / Shared 层,跨层复用 top k positions 并跳过最多 75% 的 DSA indexer 计算。
Yushi Bai (白雨石) , Qian Dong , Ting Jiang , Xin Lv (吕鑫) , Zhengxiao Du , Aohan Zeng , Jie Tang (唐杰) , Juanzi Li (李涓子)
归档 Jul 13, 2026 更新 Jul 22, 2026 审阅 Jul 22, 2026
在 SUPO 已覆盖摘要与执行联合训练的前提下,用支持单 rollout 的独立 critic 和跨 segment GAE 处理压缩轨迹;两个模型在 compacted coding 评测中均提高 Pass@1,但缺少与 SUPO 的直接对照。
Yujiang Li , Zhenyu Hou , Yi Jing , Jie Tang (唐杰) , Yuxiao Dong
归档 Jul 13, 2026 更新 Jul 15, 2026
把相依 LLM task 的已知 prompt、流式上游输出和 decode 拆成微任务,让下游在上游 decode 期间持续完成跨 task 增量 prefill。
当前匿名稿未披露完整作者列表;公开可确认关联作者为 Siqi Wang 和 Hailong Yang
归档 Jul 13, 2026 更新 Jul 21, 2026 审阅 Jul 21, 2026
把评分 token 的概率期望、重复评估与 criteria decomposition 组合成连续 verifier,再用概率 pivot tournament 扩展多轨迹选择。
Jacky Kwok , Shulu Li , Pranav Atreya , Yuejiang Liu , Yixing Jiang , Chelsea Finn , Marco Pavone , Ion Stoica , Azalia Mirhoseini
归档 Jul 11, 2026 更新 Jul 21, 2026 审阅 Jul 21, 2026
用每 prompt 单 rollout、强化 critic 与双侧 token mask 替代异步 GRPO 的组内等待和 group baseline。
Zhenyu Hou , Yujiang Li , Jie Tang (唐杰) , Yuxiao Dong
归档 Jul 10, 2026 更新 Jul 16, 2026 审阅 Jul 18, 2026
让目标模型从共享 KV prefix 自预测下一次工具调用,提前执行只读工具,并用 target verification 回收失败 probe 的 token 前缀。
Huajun Bai , Weiwei Lv , Huichuan Zheng , Youyou Lu , Jiwu Shu
归档 Jul 09, 2026 更新 Jul 21, 2026 审阅 Jul 21, 2026
Qwen3 Coder Next 在 80B 总参数中每步激活 3B 参数,并用可执行仓库任务、长上下文中训、多模板工具训练、软件工程强化学习与专家蒸馏构建编码智能体,在三种 SWE Bench Verified scaffold 上达到 70.6% 至 71.3% 解决率,报告尚未拆分各训练组件的净贡献。
Ruisheng Cao , Mouxiang Chen (陈谋祥) , Jiawei Chen (陈家慰) , Zeyu Cui , Yunlong Feng , Binyuan Hui , Yuheng Jing , Kaixin Li , Mingze Li , Junyang Lin , +10 more
归档 Jul 09, 2026 更新 Jul 21, 2026 审阅 Jul 21, 2026
LLM in Sandbox 只给模型 shell、文件编辑和完成信号,使部分模型—任务组合获得最高 15.5 个百分点增益,并让 Qwen3 4B 经文件型通用任务强化学习后把平均交互轮次从 23.7 降到 7.0,这些数值来自允许联网的特定环境配置。
Daixuan Cheng (成岱璇) , Shaohan Huang , Yuxian Gu , Huatong Song (宋华彤) , Guoxin Chen , Li Dong (董力) , Wayne Xin Zhao , Ji-Rong Wen , Furu Wei (韦福如)
归档 Jul 09, 2026 更新 Jul 21, 2026 审阅 Jul 21, 2026
HiLS Attention 用 landmark 压缩键、熵偏置与分层 softmax 训练 chunk 选择器,使 8K 训练的 345M 模型在 4M RULER 单针检索仍得 96 分,并在 512K 单 H800、batch size 1 的同 Triton 基线上将 prefill 与 decode 分别加速 13.5 倍和 15.7 倍。
Xiang Hu , Xinyu Wei , Hao Gu , Minshen Zhang , Tian Liang , Huayang Li , Lei Zhu (祝磊) , Yan Wang (王琰) , Sirui Han (韓斯睿) , Yushi Bai (白雨石) , +3 more
归档 Jul 05, 2026 更新 Jul 14, 2026 审阅 Jul 18, 2026
预测未来 token 的 KV chunk 需求,将冷 KV 移到 CPU 并按需预取,压缩物理 KV footprint。
归档 Jul 03, 2026 更新 Jul 18, 2026 审阅 Jul 18, 2026
把多轮 tool use 的 phase、KV footprint 与 backend placement 合并为 LLM Program,用 phase first pause / restore 和全局 waiting queue 控制工具等待期间的 KV working set。
Hao Kang , Ziyang Li , Weili Xu , Xinyu Yang , Yinfang Chen , Junxiong Wang , Beidi Chen , Tushar Krishna , Chenfeng Xu , Simran Arora
归档 Jul 03, 2026 更新 Jul 14, 2026 审阅 Jul 18, 2026
归档 Jul 03, 2026 更新 Jul 21, 2026 审阅 Jul 21, 2026
ECHO 为长程智能体保留带原始轮次标识的选择性记忆,用它重建有限上下文并将结果信用路由到被复用历史轮次及其选择动作,在 BrowseComp Plus 上同时提高一次通过率并减少滚动摘要造成的轨迹膨胀。
Zijun Xie , Binbin Zheng , Enlei Gong , Jihua Liu , Yuyang You , Lingfeng Liu , Jiayao Tang , Guanqun Zhao , Aoqi Hu , Zeyu Chen
归档 Jul 03, 2026 更新 Jul 17, 2026 审阅 Jul 18, 2026
让 student 在自生成轨迹上匹配 teacher 分布,缓解 teacher forcing 与部署时的分布偏移。
归档 Jul 03, 2026 更新 Jul 16, 2026 审阅 Jul 18, 2026
归档 Jul 02, 2026 更新 Jul 02, 2026 审阅 Jul 18, 2026
用 causal patching 找到 retrieval critical heads,只为这些 heads 保留 full attention。
Zhentao Tan , Wei Chen , Jingyi Shen , Yao Liu , Xu Shen , Yue Wu , Jieping Ye
归档 Jul 02, 2026 更新 Jul 16, 2026 审阅 Jul 18, 2026
让 student 在自身轨迹上接受多个领域 teacher 的 token level reverse KL 信号,整合 RL teacher 能力。
Wenhan Ma , Jianyu Wei , Liang Zhao , Hailin Zhang (张海林) , Bangjun Xiao , Lei Li , Qibin Yang , Bofei Gao , Yudong Wang , Rang Li , +3 more
归档 Jun 30, 2026 更新 Jul 16, 2026 审阅 Jul 18, 2026
用声明式 task domain 硬件亲和映射、轨迹级环境状态机和带起始版本年龄上限的异步换权,协调 H800/H20/CPU/serverless 上的多任务 agentic RL。
Wei Gao , Yuheng Zhao , Tianyuan Wu , Shaopan Xiong , Weixun Wang , Dakai An , Lunxi Cao , Dilxat Muhtar , Zichen Liu , Haizhou Zhao , +8 more
归档 Jun 28, 2026 更新 Jun 28, 2026 审阅 Jul 18, 2026
用 Markov head、置信度校准和硬件感知前缀调度,把并行 drafter 推进生产 serving。
Xin Cheng , Xingkai Yu (俞星凯) , Chenze Shao , Jiashi Li , Yunfan Xiong , Yi Qian , Jiaqi Zhu , Shirong Ma , Xiaokang Zhang , Jiasheng Ye , +23 more
归档 Jun 28, 2026 更新 Jul 16, 2026 审阅 Jul 18, 2026
把 block diffusion 用作 speculative drafter,并用 target hidden features 条件化整块候选生成。
Jian Chen , Yesheng Liang , Zhijian Liu
归档 Jun 28, 2026 更新 Jul 16, 2026 审阅 Jul 18, 2026
把 agent 自改进抽象为 trace to capability 流水线,覆盖 skills、memory、environment、model 与 meta layer。
Che Jiang , Jincheng Zhong , Yu Fu , Kai Tian , Junlin Yang , Kaikai Zhao , Yuchong Wang , Tianwei Luo , Weizhi Wang , Yuxin Zuo , +17 more
归档 Jun 28, 2026 更新 Jul 16, 2026 审阅 Jul 18, 2026
让完成轨迹独立进入 experience buffer,并以 CPU/RDMA relay 和同版本 repack 解除全局 batch / 权重同步 barrier。
Guangming Sheng , Yuxuan Tong (童雨轩) , Borui Wan , Wang Zhang , Chaobo Jia (贾超博) , Xibin Wu , Yuqi Wu , Xiang Li , Chi Zhang , Yanghua Peng , +3 more
归档 Jun 28, 2026 更新 Jul 16, 2026 审阅 Jul 18, 2026
用 split graph kernel fusion 与 multi adapter packing 同时减少 LoRA memory traffic 和 pipeline bubbles。
Zhanda Zhu , Qidong Su , Yaoyao Ding , Kevin Song , Shang Wang
归档 Jun 28, 2026 更新 Jun 28, 2026 审阅 Jul 18, 2026
围绕 attention SP、FFN EP、communication overlap 和 compressed communication 重构生产 MoE 训练路径。
Chao Jin , Ziheng Jiang , Zhihao Bai , Zheng Zhong , Juncai Liu , Xiang Li , Ningxin Zheng , Xi Wang , Cong Xie , Qi Huang , +9 more
归档 Jun 24, 2026 更新 Jul 16, 2026 审阅 Jul 18, 2026
用 draft model 生成候选、target model 并行验证,并以 rejection / residual correction 保持目标分布。
Yaniv Leviathan , Matan Kalman , Yossi Matias
归档 Jun 24, 2026 更新 Jul 17, 2026 审阅 Jul 18, 2026
用 DSA 降低 128K attention 成本,再以四层 GRPO consistency control 和 85,267 条真实/合成 agent tasks 扩展 reasoning 与 tool use。
DeepSeek AI
归档 Jun 24, 2026 更新 Jun 30, 2026 审阅 Jul 18, 2026
用 group aware index branch 选择 KV blocks,再对选中块执行精确 softmax attention。
Xunhao Lai (赖勋豪) , Weiqi Xu , Yufeng Yang , Qiaorui Chen , Yang Xu (徐旸) , Lunbin Zeng , Xiaolong Li , Haohai Sun , Haichao Zhu , Vito Zhang , +7 more
归档 Jun 24, 2026 更新 Jul 02, 2026 审阅 Jul 18, 2026
用细粒度专家切分和共享专家隔离提高 routed expert 的专门化程度。
Damai Dai , Chengqi Deng , Chenggang Zhao , Runxin Xu (许润昕) , Huazuo Gao , Deli Chen (陈德里) , Jiashi Li , Wangding Zeng , Xingkai Yu (俞星凯) , Yu Wu (吴俣) , +7 more
归档 Jun 24, 2026 更新 Jun 24, 2026 审阅 Jul 18, 2026
用 hashed N gram lookup 和 context aware gating 增加可离线扩展的 conditional memory。
Xin Cheng , Wangding Zeng , Damai Dai , Qinyu Chen , Bingxuan Wang , Zhenda Xie (解振达) , Kezhao Huang , Xingkai Yu (俞星凯) , Zhewen Hao , Yukun Li , +4 more
归档 Jun 23, 2026 更新 Jul 16, 2026 审阅 Jul 18, 2026
用大规模 MoE、MuonClip、工具数据和 agentic RL 构建开放的软件工程智能体模型。
Kimi Team: Yifan Bai and 198 other authors;arXiv submitter: Yulun Du。
归档 Jun 23, 2026 更新 Jul 16, 2026 审阅 Jul 18, 2026
把 long CoT、verifiable reward、partial rollout 与 long2short 组合为长上下文 reasoning RL recipe。
Kimi Team and 95 other authors;arXiv submitter: Flood Sung。
归档 Jun 23, 2026 更新 Jun 24, 2026 审阅 Jul 18, 2026
用 thinking / non thinking 双模式、thinking budget 和 strong to weak distillation 统一推理与通用能力。
An Yang and 59 other authors;本地核心跟踪作者包括 An Yang, Binyuan Hui, Bo Zheng, Bowen Yu, Dayiheng Liu, Fei Huang, Jianwei Zhang, Jianxin Yang, Jingren Zhou, Junyang Lin, Rui Men。
归档 Jun 23, 2026 更新 Jun 24, 2026 审阅 Jul 18, 2026
把 18T 预训练、SFT / DPO / GRPO 与长上下文扩展组织为通用、代码和数学模型族。
An Yang , Binyuan Hui , Bo Zheng , Bowen Yu (郁博文) , Dayiheng Liu (刘大一恒) , Fei Huang , Jianwei Zhang , Jianxin Yang , Jingren Zhou , Junyang Lin , +1 more
归档 Jun 23, 2026 更新 Jun 24, 2026 审阅 Jul 18, 2026
归档 Jun 23, 2026 更新 Jul 16, 2026 审阅 Jul 18, 2026
把 per head K/V cache 改成由 hidden state 下投影得到的共享 KV latent,并用 projection absorption 与 decoupled RoPE 避免恢复历史 K/V。
DeepSeek AI (group author);Appendix A 列出按三类角色分组的 156 位去重贡献者。
归档 Jun 23, 2026 更新 Jul 16, 2026 审阅 Jul 18, 2026
统一 reasoning 与 agentic RL 的 token / step / turn / trajectory credit assignment 问题。
Chenchen Zhang
归档 Jun 23, 2026 更新 Jun 23, 2026 审阅 Jul 18, 2026
证明在 coverage 条件下 outcome reward 可经 reward imputation 支持过程级学习,给出过程监督的优势边界。
Zeyu Jia (贾泽宇) , Alexander Rakhlin , Tengyang Xie
归档 Jun 23, 2026 更新 Jul 13, 2026 审阅 Jul 18, 2026
归档 Jun 23, 2026 更新 Jul 13, 2026 审阅 Jul 18, 2026
归档 Jun 23, 2026 更新 Jul 16, 2026 审阅 Jul 18, 2026
归档 Jun 22, 2026 更新 Jul 16, 2026 审阅 Jul 18, 2026
推导 token level variance minimizing baseline,并用 logit gradient proxy 近似长轨迹 policy gradient 权重。
Yingru Li (李英儒) , Jiawei Xu , Ziniu Li (李子牛) , Jiacai Liu (刘佳材) , Wei Liu (刘威) , Yuxuan Tong (童雨轩) , Longtao Zheng (郑龙韬) , Zhenghai Xue , Yaxiang Zhang , Tianle Cai (蔡天乐) , +3 more
归档 Jun 21, 2026 更新 Jul 16, 2026 审阅 Jul 18, 2026
从 policy / reference log ratio 构造隐式 value recurrence,省去独立 critic 并形成 token level PPO advantage。
Zhewei Kang , Aosong Feng , Sergey Levine , Dawn Song , Xuandong Zhao
归档 Jun 21, 2026 更新 Jun 21, 2026 审阅 Jul 18, 2026
用少量 beneficial trait RL data 强化诚实、纠错与风险意识,并测量跨域 alignment persistence。
Akshay V. Jagadeesh , Rahul K. Arora , Khaled Saab , Ali Malik , Mikhail Trofimov , Foivos Tsimpourlas , Johannes Heidecke , Karan Singhal
归档 Jun 21, 2026 更新 Jul 16, 2026 审阅 Jul 18, 2026
归档 Jun 21, 2026 更新 Jul 16, 2026 审阅 Jul 18, 2026
把 RLVR 训练能力上限关联到 policy entropy 消耗,并分析 advantage update 的熵动力学。
Ganqu Cui , Yuchen Zhang , Jiacheng Chen , Lifan Yuan (袁立凡) , Zhi Wang , Yuxin Zuo , Haozhan Li , Yuchen Fan , Huayu Chen (陈华玉) , Weize Chen , +7 more
归档 Jun 21, 2026 更新 Jul 16, 2026 审阅 Jul 18, 2026
给出 k1 / k2 / k3 KL estimators 的偏差、方差和控制变量关系,作为 RL drift 诊断基础。
John Schulman
归档 Jun 21, 2026 更新 Jul 17, 2026 审阅 Jul 18, 2026
用 sequence sharded 与 head sharded 之间的 all to all 布局转换扩展极长序列训练。
Sam Ade Jacobs , Masahiro Tanaka , Chengming Zhang , Minjia Zhang , Shuaiwen Leon Song , Samyam Rajbhandari , Yuxiong He
归档 Jun 19, 2026 更新 Jul 17, 2026 审阅 Jul 18, 2026
让 KV blocks 沿设备 ring 轮转,在保持 exact attention 的条件下把上下文扩展到多设备。
Hao Liu , Matei Zaharia , Pieter Abbeel
归档 Jun 19, 2026 更新 Jul 16, 2026 审阅 Jul 18, 2026
归档 Jun 18, 2026 更新 Jul 16, 2026 审阅 Jul 18, 2026
按 data parallel rank 分片 optimizer state、gradient 与 parameter,降低大模型训练的显存复制。
Samyam Rajbhandari , Jeff Rasley , Olatunji Ruwase , Yuxiong He
归档 Jun 18, 2026 更新 Jul 17, 2026 审阅 Jul 18, 2026
把 1M context、IndexShare / IndexCache 与 MTP speculative decoding 接入长程 coding agent。
Z.ai / GLM 5 Team
归档 Jun 10, 2026 更新 Jul 16, 2026 审阅 Jul 18, 2026
以 TV loss 训练 MTP heads,并用 probabilistic rejection sampling 提高 RL rollout 接受率。
Yucheng Li , Huiqiang Jiang , Yang Xu (徐旸) , Jianxin Yang , Yi Zhang , Yizhong Cao , Yuhao Shen , Fan Zhou , Rui Men , Jianwei Zhang , +7 more
归档 Jun 09, 2026 更新 Jun 09, 2026 审阅 Jul 18, 2026
用 representation drift 动态决定 state 边界,在固定 cache 内自适应合并 linear attention states。
Xin Wang , Hui Shen , Boyuan Zheng , Xueshen Liu , Minkyoung Cho , Zhongwei Wan , Zesen Zhao , Zhuoqing Mao , Shen Yan , Mi Zhang
归档 Jun 03, 2026 更新 Jul 02, 2026 审阅 Jul 18, 2026
将 Muon 相对 Adam 的训练优势归因于更低的 directional curvature penalty,step size 的解释力较弱。
Shuche Wang , Fengzhuo Zhang , Jiaxiang Li , Dirk Bergemann , Zhuoran Yang
归档 Jun 02, 2026 更新 Jun 02, 2026 审阅 Jul 18, 2026
基于 post gating exact load 逐 microbatch / layer 规划 expert replica 与 token reroute,统一 MoE 训练和 prefill 负载均衡。
Xinming Wei , Chao Jin , Tuo Dai , Yinmin Zhong , Shan Yu , Chengxu Yang , Bingyang Wu , Zili Zhang , Jing Mai , Qianchao Zhu , +3 more
归档 Jun 02, 2026 更新 Jul 16, 2026 审阅 Jul 18, 2026
把制度规则编码为 reward sandbox,验证 RL model 会发现形式合规但偏离制度意图的策略。
Wei Liu KCL , Xinyi Mou , Hanqi Yan , Zhongyu Wei , Yulan He
归档 Jun 01, 2026 更新 Jun 01, 2026 审阅 Jul 18, 2026
用 Age of Empires II 作为 substrate control,说明类人行为测试不足以支持类人内在属性归因。
Adrian de Wynter
归档 May 31, 2026 更新 Jul 13, 2026 审阅 Jul 18, 2026
把 reference solution 作为 verifier privileged signal,经 OPD + verdict RL 蒸馏到无 reference verifier,并用于训练与测试时自改进。
Chen Henry Wu , Aditi Raghunathan
归档 May 29, 2026 更新 Jul 16, 2026 审阅 Jul 18, 2026
量化 tool calling 评测协议漂移,并用近期 all correct 预测与 max variance update 子采样压缩 GRPO wall clock。
Tong Liu , Cheng Qian , Matej Cief , Yuan He (何源) , Daniele Dan , Nikolaos Aletras , Gabriella Kazai
归档 May 17, 2026 更新 May 17, 2026 审阅 Jul 18, 2026
构造 trainer / rollout bitwise aligned 基线,证明微小 logprob mismatch 可触发 RL collapse。
Tianle Zhong , Neiwen Ling , Yifan Pi , Zijun Wei , Tianshu Yu , Geoffrey Fox , Peng Wu , Xiao Yu
归档 May 16, 2026 更新 May 16, 2026 审阅 Jul 18, 2026
证明某些语言族的 Transformer 表示只需多项式规模,而 LTL / RNN / automata 需要指数或双指数规模。
Pascal Bergsträßer , Ryan Cotterell , Anthony W. Lin
归档 Apr 25, 2026 更新 Jul 14, 2026 审阅 Jul 18, 2026
以 CSA / HCA、MoE、MTP / OPD 和系统协同实现百万 token 训练、推理与 agent 能力。
DeepSeek AI and 318 other authors; arXiv submitter Wenfeng Liang.
归档 Apr 17, 2026 更新 Jul 13, 2026 审阅 Jul 18, 2026
用 reward feature prediction error 估计 OOD uncertainty,在 Best of N selection 时执行 pessimistic correction。
Zhuohao Yu , Zhiwei Steven Wu , Adam Block
归档 Apr 11, 2026 更新 Apr 11, 2026 审阅 Jul 18, 2026
构造 specification 与 tests 冲突的 coding tasks,用 cheating rate 测量 test case exploitation。
Ziqian Zhong , Aditi Raghunathan , Nicholas Carlini
归档 Apr 08, 2026 更新 Apr 08, 2026 审阅 Jul 18, 2026
把 RLVR scaling 轴扩展到 rollout width,并用 correct mass decomposition 解释宽采样收益。
Jian Hu , Mingjie Liu , Ximing Lu , Fang Wu , Zaid Harchaoui , Shizhe Diao , Yejin Choi , Pavlo Molchanov , Jun Yang , Jan Kautz , +1 more
归档 Apr 04, 2026 更新 Apr 04, 2026 审阅 Jul 18, 2026
归档 Mar 24, 2026 更新 Mar 24, 2026 审阅 Jul 18, 2026
用合成环境拆分 pre / mid / RL training,识别 primitive seed、edge of competence 与 bridge data 条件。
Charlie Zhang , Graham Neubig , Xiang Yue
归档 Mar 20, 2026 更新 Mar 20, 2026 审阅 Jul 18, 2026
在受控任务中证明 RL 可组合 base model 已掌握的 atomic skills,形成未见组合能力。
Lifan Yuan (袁立凡) , Weize Chen , Yuchen Zhang , Ganqu Cui , Hanbin Wang , Ziming You , Ning Ding (丁宁) , Zhiyuan Liu , Maosong Sun , Hao Peng
归档 Mar 17, 2026 更新 Jul 11, 2026 审阅 Jul 18, 2026
用 Lightning Attention、CISPO 和大规模 RL rollout 降低长 CoT 的 test time compute 成本。
MiniMax; arXiv title页显示 Aili Chen and 125 other authors,Appendix Contributors 按字母序列出完整贡献者。
归档 Mar 13, 2026 更新 Jul 13, 2026 审阅 Jul 18, 2026
证明 Best of n 会因 proxy winner's curse 出现先升后降,并提出 Best of Poisson / HedgeTune。
Hadi Khalaf , Claudio Mayrink Verdun , Alex Oesterling , Himabindu Lakkaraju , Flavio du Pin Calmon
归档 Mar 10, 2026 更新 Mar 10, 2026 审阅 Jul 18, 2026
用高温探索、动态采样、周期 reference / optimizer reset 延长 RL,测试 reasoning boundary 扩展。
Mingjie Liu , Shizhe Diao , Ximing Lu , Jian Hu , Xin Dong , Yejin Choi , Jan Kautz , Yi Dong
归档 Mar 06, 2026 更新 Mar 06, 2026 审阅 Jul 18, 2026
用 pass@k 区分 sampling efficiency 与新增 reasoning capacity,评估 RLVR 是否突破 base model 边界。
Yang Yue , Zhiqi Chen , Rui Lu , Andrew Zhao , Zhaokai Wang , Shiji Song , Gao Huang
归档 Mar 03, 2026 更新 Mar 03, 2026 审阅 Jul 18, 2026
用 Clip Higher、Dynamic Sampling、token level loss 与 overlong shaping 构成可复现 long CoT RL recipe。
Qiying Yu , Zheng Zhang , Ruofei Zhu , Yufeng Yuan , Xiaochen Zuo , Yu Yue , Weinan Dai , Tiantian Fan , Gaohong Liu , Lingjun Liu , +25 more
归档 Feb 26, 2026 更新 Feb 26, 2026 审阅 Jul 18, 2026
通过随机、格式和错误答案 reward 实验,揭示 pretrained prior 与 clipping bias 可产生伪 RLVR 增益。
Rulin Shao , Shuyue Stella Li , Rui Xin , Scott Geng , Yiping Wang , Sewoong Oh , Simon Shaolei Du , Nathan Lambert , Sewon Min , Ranjay Krishna , +4 more
归档 Feb 25, 2026 更新 Jul 14, 2026 审阅 Jul 18, 2026
把 DSA / MTP / Muon 模型栈、软件工程 mid training、agentic RL 与异步 rollout 组合为 agentic engineering pipeline。
GLM 5 Team: Aohan Zeng and 184 other authors
归档 Feb 17, 2026 更新 Feb 17, 2026 审阅 Jul 18, 2026
验证 CoT monitor 对 agent reward hacking 的检测优势,并量化直接训练规避 monitor 的 monitorability tax。
Bowen Baker , Joost Huizinga , Leo Gao , Zehao Dou , Melody Y. Guan , Aleksander Madry , Wojciech Zaremba , Jakub Pachocki , David Farhi
归档 Feb 13, 2026 更新 Feb 13, 2026 审阅 Jul 18, 2026
以 occupancy shift 定义 correlated proxy failure,并用 ORPO 约束策略访问分布。
Cassidy Laidlaw , Shivam Singhal , Anca Dragan
归档 Feb 10, 2026 更新 Feb 10, 2026 审阅 Jul 18, 2026
用 MMD independence regularization 削弱 reward model 对 length、sycophancy 等伪相关特征的依赖。
Chaoqi Wang , Zhuokai Zhao , Yibo Jiang , Zhaorun Chen , Chen Zhu , Yuxin Chen , Jiayi Liu , Lizhu Zhang , Xiangjun Fan , Hao Ma , +1 more
归档 Feb 06, 2026 更新 Jun 24, 2026 审阅 Jul 18, 2026
用 outcome based RL 从强 base model 诱导 long CoT、自验证与策略切换,再通过 SFT / RL / distillation 转为可用模型。
DeepSeek AI and 199 other authors. Core contributors listed in v2 source include Daya Guo, Dejian Yang, Haowei Zhang, Junxiao Song, Peiyi Wang, Qihao Zhu, Runxin Xu, Ruoyu Zhang, Shirong Ma, Xiao Bi, Xiaokang Zhang, Xingkai Yu, Yu Wu, Z.F. Wu, Zhibin Gou, Zhihong Shao, Zhuoshu Li, Ziyi Gao.
归档 Feb 03, 2026 更新 Jul 16, 2026 审阅 Jul 18, 2026
trainable orchestrator + frozen subagents,用 parallel / finish / performance reward 训练并行编排。
Kimi Team: Tongtong Bai and 324 other authors; appendix lists contributors alphabetically by last name.
归档 Jan 31, 2026 更新 Jul 15, 2026 审阅 Jul 18, 2026
让客户端声明可重排 message spans,以表达式树重写提升 KV cache 与 attention locality。
Paul Castro , Nick Mitchell , Nathan Ordonez , Thomas Parnell , Mudhakar Srivatsa , Antoni Viros i Martin
归档 Jan 30, 2026 更新 Jul 13, 2026 审阅 Jul 18, 2026
用 batch invariant RMSNorm、matmul 与 attention kernel 消除 temperature=0 推理的批次依赖漂移。
Horace He, in collaboration with others at Thinking Machines Lab
归档 Jan 27, 2026 更新 Jan 27, 2026 审阅 Jul 18, 2026
用跨模型 single controller 与模型内 multi controller 统一编排 RLHF dataflow 和并行执行。
Guangming Sheng , Chi Zhang , Zilingfeng Ye , Xibin Wu , Wang Zhang , Ru Zhang , Yanghua Peng , Haibin Lin , Chuan Wu
归档 Jan 23, 2026 更新 Jul 13, 2026 审阅 Jul 18, 2026
用 Semantic Variable 暴露 LLM application DAG、shared prompt 和性能目标,驱动应用级 serving 调度。
Chaofan Lin , Zhenhua Han , Chengruidong Zhang , Yuqing Yang , Fan Yang , Chen Chen , Lili Qiu
归档 Jan 20, 2026 更新 Jan 20, 2026 审阅 Jul 18, 2026
把 causal linear attention 拆成块内矩阵乘和块间 recurrent state,提供 IO aware GPU kernel。
Zhen Qin , Weigao Sun , Dong Li , Xuyang Shen , Weixuan Sun , Yiran Zhong
归档 Jan 16, 2026 更新 Jan 16, 2026 审阅 Jul 18, 2026
通过减少 non matmul FLOPs、提升 sequence parallelism 和调整 warp 分工提高 attention kernel 利用率。
Tri Dao
归档 Jan 13, 2026 更新 Jan 13, 2026 审阅 Jul 18, 2026
用 SRAM tiling、online softmax 与 backward recomputation 减少 exact attention 的 HBM traffic。
Tri Dao , Daniel Y. Fu , Stefano Ermon , Atri Rudra , Christopher Ré
归档 Jan 09, 2026 更新 Jan 09, 2026 审阅 Jul 18, 2026
重新估计 compute optimal frontier,指出参数量和训练 token 应随算力近似等比例增长。
Jordan Hoffmann , Sebastian Borgeaud , Arthur Mensch , Elena Buchatskaya , Trevor Cai , Eliza Rutherford , Diego de Las Casas , Lisa Anne Hendricks , Johannes Welbl , Aidan Clark , +12 more
归档 Jan 06, 2026 更新 Jan 06, 2026 审阅 Jul 18, 2026
拟合 loss 对参数、数据与计算的 power law,建立早期 compute efficient pretraining scaling law。
Jared Kaplan , Sam McCandlish , Tom Henighan , Tom B. Brown , Benjamin Chess , Rewon Child , Scott Gray , Alec Radford , Jeffrey Wu , Dario Amodei