归档

DeepSeek V4.1 Flash: Pushing the Limits of KV Cache Compression

DeepSeek V4.1 Flash 将因果编码器与解码器分工、跨层稀疏 KV 复用、四位全局缓存和近似窗口重放组合起来,把长输入的预填充主干计算近似减半、全局 KV 降至每 token 890 字节,并在发布方评测中显著提升多项 agent 能力;端到端服务收益和近似重放的极端条件可靠性仍缺少充分公开验证。

DeepSeek AI(团队署名);Appendix A 中已核验并复用已有档案的成员包括 Xin Cheng、Wangding Zeng、Damai Dai、Xingkai Yu、Zhenda Xie 和 Wenfeng Liang。完整名单见附录。

待审阅 2026-09-10-deepseek-v4-1-flash-kv-cache-compression KV CacheSparse AttentionMultimodal Model
归档

Towards a Statistical Understanding of Mixture of Experts

本文把 MoE 的预测误差分解为局部组合的逼近误差、专家学习误差和路由估计代价,在专家误差受控及路由正则条件下建立风险上界,为分析稀疏激活、路由几何和共享分解何时有益提供了条件性框架。

Siyuan He, Bokai Yang, Jie Hu, Ziwen Gao, Yuhong Yang

待审阅 2609.03501-statistical-understanding-mixture-of-experts MoE Architecture
归档

Scaling Latent Reasoning via Looped Language Models

Ouro 将同一 Transformer 层栈重复执行,并用熵正则化退出分布与冻结主模型后的专门门控训练分配 token 级计算深度;1.4B 和 2.6B 模型经过 7.7T token 训练后在 MATH500、OlympiadBench 等部分推理评测达到 4B 和 8B 对照的结果,但对照没有统一训练数据与总计算,固定四步之外的任务性能通常下降。

Rui Jie Zhu, Zixuan Wang, Kai Hua, Tianyu Zhang, Ziniu Li (李子牛), Haoran Que, Boyi Wei, Zixin Wen, Fan Yin, He Xing, +23 more

待审阅 2510.25741-scaling-latent-reasoning-looped-language-models Reasoning AnalysisScaling LawsTraining Stability
归档

SMELT: Scaling Laws for Compute Matched MoE Looped Transformers

SMELT 在近似匹配每 token FLOPs、非嵌入参数量与 KV cache 的 MoE 对照中,将中间一半层重复执行两次并以缩窄隐藏维度和增加专家数补偿预算;四规模三稀疏度的独立缩放面拟合估计,在拟合覆盖的十的二十次方至十的二十一次方 FLOPs 区间达到相同验证损失可节省 6.8% 至 18.0% 训练计算,但报告使用专有数据与训练栈且未验证实际时延。

Shaowen Wang, Ge Zhang, Kairong Luo, Yuhao Wu, Shaofan Liu, Jiaheng Liu, Wenhao Huang, Shen Yan, Jian Li

待审阅 2609.01343-smelt-compute-matched-moe-looped-transformers MoE ArchitectureScaling Laws
归档

On the Design of Qwen3.8 Next Architecture: Evaluation, Efficiency, and Training Stability

Qwen3.8 Flash Next 将三层 Gated DeltaNet 与一层 Qwen Sparse Attention 交错,并用四分支门控残差、可卸载的 N gram Embedding 和重新拟合的 Muon 训练配方共同降低训练与长上下文推理成本;125B 主模型每个 token 激活约 6B 参数,在十四项预训练评测中有八项超过 397B A17B 的 Qwen3.7 Plus Base,同时使用约三分之一的训练 token 和约九分之一的训练 FLOPs,但报告没有披露完整数据账本、端到端服务测量或多随机种子复验。

Qwen Team;Core Contributors: Zihan Qiu, Zekun Wang, Xiao Li, Yanpeng Li, Yang Xu, Yixuan Wang, Huaqing Zhang, Rui Men, Bo Zheng, Dayiheng Liu;Contributors: Bochao Mao, Chengruidong Zhang, Fan Zhou, Hao Luo, Haofeng Huang, Haoran Lian, Haoyan Huang, Hongqing Chen, Jianwei Zhang, Jing Xu, Junjie Wang, Langshi Chen, Liangyu Wang, Linlang Jiang, Man Yuan, Minmin Sun, Peng Jin, Siqi Zhang, Siyu Wang, Xingzhang Ren, Yakai Wang, Yi Zhang, Yiming Dong, Yizhong Cao, Yubo Ma, Yunfei Mao.

待审阅 2026-08-26-qwen3-8-flash-next-architecture Sparse AttentionLinear AttentionTraining Stability
归档

Part I: Tricks or Traps? A Deep Dive into RL for LLM Reasoning

在同一训练框架下、覆盖范围并不完全重合的 Qwen3 4B/8B Base 与对齐后数学强化学习实验中分别检查优势归一化、概率比裁剪、损失聚合和超长过滤,并将组内均值—批级标准差归一化与 token 级损失组成不训练价值模型的 Lite PPO;OpenReview 补充的一个 Qwen3 8B Base 三随机种子设置仍优于 GRPO 与 DAPO,但奖励范围异常、计算量未对齐和有限模型任务覆盖限制普适结论。

Zihe Liu (刘子贺), Jiashun Liu (刘嘉顺), Yancheng He (贺彦程), Weixun Wang, Jiaheng Liu, Ling Pan, Xinyu Hu, Shaopan Xiong, Ju Huang, Jian Hu, +6 more

待审阅 2508.08221-tricks-or-traps-lite-ppo RL AlgorithmReasoning RLTraining Stability
归档

Attention Residuals

AttnRes 用输入相关的深度 softmax 聚合替代 PreNorm 的单位权重累积,并以块级表示和系统调度控制跨层状态成本;五个 194M–528M 激活参数 Kimi Linear MoE 设置均降低单次报告验证损失,48B/3B 的块级变体十五项下游数值十四升一平,但缺少随机种子、大规模 Full 对照和完整系统测量条件。

Guangyu Chen, Yu Zhang (张宇), Jianlin Su (苏剑林), Weixin Xu, Siyuan Pan, Yaoyu Wang, Yucheng Wang, Guanduo Chen, Bohong Yin, Yutian Chen, +26 more

待审阅 2603.15031-attention-residuals Training StabilityTraining MemoryDistributed Training
归档

LatentMoE: Toward Optimal Accuracy per FLOP and Parameter in Mixture of Experts

LatentMoE 将路由专家移到低维潜空间,并把节省的权重读取与通信预算用于增加专家数和 Top k;准确率优先变体在相近参数的 95B Transformer 与 73B Mamba–Attention 设置中,全部已报下游指标均高于标准 MoE,但万亿参数服务优势仍是模拟结果。

Venmugil Elango, Nidhi Bhatia, Roger Waleffe, Rasoul Shafipour, Tomer Asida, Abhinav Khattar, Nave Assaf, Maximilian Golub, Joey Guman, Tiyasa Mitra, +6 more

已审阅 2601.18089-latentmoe-accuracy-per-flop-parameter MoE ArchitectureMoE SystemsServing Runtime
归档

Weak to Strong On Policy Distillation

W2S OPD 将较弱正负模型的 logits 差分叠加到冻结的强学生基座分布,再在学生自身轨迹上执行逐 token 反向 KL;Qwen3 8B 的强化学习前后对比设置相对直接 OPD 的数学与代码平均准确率分别提高 5.3 和 2.2 个百分点,跨模型家族与独立训练复验仍待验证。

Fangxu Yu, Weijia Xu, Michael Xu, Tianyi Zhou, Zinan Lin

待审阅 2607.26246-w2s-opd-weak-to-strong-distillation On-Policy DistillationReasoning RLTraining Stability
归档

Reinforcement Learning via Self Distillation

SDPO 在学生在线轨迹上用环境反馈条件化的 EMA 同模型重算下一词分布,将 Top K 分布差转成 logit 级信用;Qwen3 8B 在 LiveCodeBench v6 上达到 48.8%,高于强 GRPO 的 41.2%,但依赖模型回溯能力与反馈质量。

Jonas Hübotter, Frederike Lübeck, Lejs Behric, Anton Baumann, Marco Bagatella, Daniel Marta, Ido Hakimi, Idan Shenfeld, Thomas Kleine Buening, Carlos Guestrin, +1 more

已审阅 2601.20802-reinforcement-learning-via-self-distillation On-Policy DistillationCredit AssignmentRL Algorithm
归档

Self Distilled Reasoner: On Policy Self Distillation for Large Language Models

OPSD 让学生先在只看题目时采样自身轨迹,再用固定初始模型在参考解答上下文中对相同前缀给出的完整词表分布和逐词表项裁剪前向 KL 更新学生,在 Qwen3 1.7B/4B/8B 的三项数学平均分上高于基础模型、SFT 与 GRPO,但总计算、统计方差和领域外泛化仍未对齐。

Siyan Zhao, Zhihui Xie (谢知晖), Mengchen Liu, Jing Huang, Guan Pang, Feiyu Chen, Aditya Grover

已审阅 2601.18734-self-distilled-reasoner-opsd On-Policy DistillationReasoning RLTraining Stability
归档

Kimi K3: Open Frontier Intelligence

Kimi K3 将三层 KDA 与一层全局注意力交错、跨块 Attention Residuals 和每个 token 激活 16 个路由专家的 Stable LatentMoE 组合为 2.78 万亿总参数、1042 亿激活参数、百万 token 上下文的原生多模态模型;报告的缩放律拟合把架构、数据与训练配方的合并收益估计为相对 Kimi K2 约 2.5 倍,尚未拆分单个组件贡献。

Kimi Team

已审阅 2026-07-27-kimi-k3-open-frontier-intelligence MoE ArchitectureLinear AttentionLong Context
归档

Learning What Not to Forget: Long Horizon Agent Memory from a Few Kilobytes of Learning

LRE 用日志中的未来复用信号训练轻量逻辑回归,对历史单元做查询无关打分并按预算逐字保留;单随机种子 AppWorld 中以零压缩器调用得到 41.1% 任务目标完成率、接近全历史的 44.0%,LoCoMo 上也是最佳受预算策略,但 Hard 与 LongMemEval 结果显示它尚未跨域占优,2048 token 只约束较旧历史。

Nusrat Jahan Lia, Aritra Mazumder

已审阅 2606.20954-lre-learned-relevance-eviction Agent MemoryLong ContextAgent Workflow
归档

Less Experts, Faster Decoding: Cost Aware Speculative Decoding for Mixture of Experts

EcoSpec 用轻量路由预测器估计草稿候选会新增的专家集合,并优先选择复用已有专家的验证路径;在八张 H200、Hugging Face Transformers、主要批量为一的研究原型中,三个大规模 MoE 的贪心解码平均加速从对应投机基线相对自回归的一点一零至一点二二倍提高到一点一五至一点三六倍,HBM 流量来自估算且批量为八时投机吞吐低于自回归。

Jincheng Xie, Runheng Liu, Heyan Huang, Yawen Ling, Hanbin Dai, Yu Zheng, Wen Hu

已审阅 2607.12696-ecospec-cost-aware-moe-speculative-decoding Speculative DecodingMoE SystemsServing Runtime
归档

EAGLE 3: Scaling up Inference Acceleration of Large Language Models via Training Time Test

EAGLE 3 去除特征回归约束,用多层目标特征融合和训练时多步自生成展开直接训练草稿 token 分布;LLaMA 3.1 8B 在 MT Bench 从 EAGLE 2 的 3.16 倍提高到 4.40 倍,6.47 倍是单批量研究原型峰值,SGLang 批量 64 为 1.38 倍。

Yuhui Li, Fangyun Wei, Chao Zhang, Hongyang Zhang

待审阅 2503.01840-eagle-3-training-time-test Speculative DecodingMulti-Token PredictionServing Runtime
归档

MoESD: Unveil Speculative Decoding's Potential for Accelerating Sparse MoE

在单步解码已使专家加载趋于饱和、模型仍受内存带宽限制的中等批量区间,用投机验证复用已加载专家;Qwen2 57B A14B 在两张 H800 上最高加速 2.29 倍,适用范围依赖路由均衡、MoE 前馈网络成本占比和具体硬件。

Zongle Huang, Lei Zhu (祝磊), Zongyuan Zhan, Ting Hu, Weikai Mao, Xianzhi Yu, Yongpan Liu (刘勇攀), Tianyu Zhang

已审阅 2505.19645-moesd-sparse-moe-speculative-decoding Speculative DecodingMoE SystemsServing Runtime
归档

SEED: Self Evolving On Policy Distillation for Agentic Reinforcement Learning

先用外部模型标注的轨迹—技能数据把策略训练成轨迹分析器,再让每轮最新策略从自身完整轨迹生成事后技能并对同批采样 token 做门控似然训练;三种小模型在 12 个汇总指标中取得 10 个最优或并列最优,但直接前作 OPID 未进入主表,且证据缺少多随机种子、技能正确性评测与总训练成本对齐。

Jinyang Wu, Shuo Yang, Zhengxi Lu, Fan Zhang, Yuhao Shen, Lang Feng, Haoran Luo, Zheng Lian, Shuai Zhang, Zhengqi Wen, +1 more

待审阅 2607.14777-seed-self-evolving-on-policy-distillation On-Policy DistillationAgent RLCredit Assignment
归档

Enhancing Rubric based RL via Self Distillation

把评分量规聚合后的学习信号丢失拆成当前采样未覆盖和已满足但整体优势非正两类,用评分项条件自教师注入缺失行为,并以反事实自教师定位 token 后局部改写优势;两种 Qwen3 小模型在五项裁判评测中较 GRPO 平均提高 3.2 和 1.4 分,证据缺少多随机种子与完整硬件条件。

Mingxuan Xia, Yuhang Yang, Chao Ye, Shuai Zhu, Shenzhi Yang, Guangcheng Zhu, Yuhang Zhang, Cheng Peng, Haobo Wang (王皓波), Siqing Wang

待审阅 2607.18082-cripo-rubric-rl-self-distillation Credit AssignmentOn-Policy DistillationRL Algorithm
归档

RubricEM: Meta RL with Rubric guided Policy Decomposition beyond Verifiable Rewards

把评分量规贯穿深度研究智能体的阶段化执行、分阶段裁判奖励和反思记忆,在作者的搜索与 LLM 裁判协议下将 8B 模型四项长文基准均值从 SFT 的 49.2 提高到 55.5。

Gaotang Li, Bhavana Dalvi Mishra, Zifeng Wang, Jun Yan, Yanfei Chen, Chun Liang Li, Long T. Le, Rujun Han, George Lee, Hanghang Tong, +2 more

待审阅 2605.10899-rubricem-rubric-guided-meta-rl Agent RLCredit AssignmentAgent Memory
归档

Beyond Trajectory Level Attribution: Graph Based Credit Assignment for Agentic Reinforcement Learning

将同一任务的分组轨迹合并为状态转移图,以后继状态到成功节点的最短路径构造逐步优势,并在状态可稳定合并、目标可验证的 ALFWorld、WebShop 和 Sokoban 设置中优于 GRPO 与 GiGPO。

Xin Cheng, Shuo He, Lang Feng, HaiYang Xu, Ming Yan, Lei Feng (冯磊), Bo An

待审阅 2605.26684-graphgpo-graph-credit-assignment-agentic-rl Credit AssignmentAgent RLRL Algorithm
归档

TacoMAS: Test Time Co Evolution of Topology and Capability in LLM based Multi Agent Systems

在单个查询内逐轮依据轨迹反馈改写代理能力,并每两轮按预算增删代理与重连通信图;四个工具基准相对各自最强基线平均提高 13.3 个准确率百分点,比较未统一推理预算。

Chen Xu, Yicheng Hu, Ruizi Wang, Xinyu Lin, Wenjie Wang (王文杰), Dongrui Liu, Fuli Feng

待审阅 2605.09539-tacomas-test-time-coevolution-mas Multi-Agent OrchestrationAgent WorkflowTest-Time Scaling
归档

TRACE: Turn level Reward Assignment via Credit Estimation for Long Horizon Agents

在已知短答案的长程搜索中,用冻结参考模型测量工具边界后的答案可预测性变化并把多步时序差信用混入终局优势,使两种 Qwen3 Thinking 模型在同设置下较 GRPO 的 BrowseComp Plus 分数分别提高 5.6 和 6.2 个百分点。

Leitian Tao, Baolin Peng, Wenlin Yao, Tao Ge (葛涛), Hao Cheng, Mike Hang Wang, Jianfeng Gao, Sharon Li

待审阅 2607.13988-trace-turn-level-reward-assignment Credit AssignmentAgent RLReward Modeling
归档

Towards Long Horizon Agents: A Survey

用基础策略与运行时 harness 的组合关系以及 H1/H2/H3 分层,将长程能力统一为运行时系统和模型内部优化共同作用的系统属性。

Guanting Dong (董冠霆), Xiaoshuai Song (宋晓帅), Yuyang Hu (扈煜阳), Jiajie Jin (金佳杰), Chenghao Zhang, Yifei Chen, Xiaoxi Li, Huaying Yuan, Xinyu Yang, Tongyu Wen, +10 more

待审阅 202607.1328-towards-long-horizon-agents-survey Agent WorkflowAgent MemoryAgent RL
归档

SmoothAgent: Efficient Long Horizon LLM Based Agent Serving with Lookahead Context Engineering

把可提前确定的 context transformation 移入异步 lookahead stream,并用 SLO aware scheduling 预建变换后 KV cache,降低 transform point TTFT。

Zaifeng Pan (潘再峰), Qianxu Wang, Zhengding Hu, Chang Chen, Yue Guan, Yanbo Zhou, Steven Swanson, Yufei Ding

已审阅 2607.00151-smoothagent-lookahead-context-engineering Agent MemoryKV CacheInference Scheduling
归档

A Survey of Reinforcement Learning for Large Language Models under Data Scarcity: Challenges and Solutions

把 LLM 强化学习中的高成本外部监督与有限内部生成经验统一到 data、training、framework 三层九类干预点,并组织为一份覆盖 125 条文献记录的设计地图。

Zhiyin Yu, Yuchen Mou, Juncheng Yan, Junyu Luo, Chunchun Chen, Xing Wei, Yunhui Liu, Hongru Sun, Yuxing Zhang, Jun Xu, +10 more

待审阅 2604.17312-rl-llm-data-scarcity-survey Reasoning RLRollout OptimizationReward Modeling
归档

IndexCache: Accelerating Sparse Attention via Cross Layer Index Reuse

用 loss guided layer search 或 multi layer distillation 划分 Full / Shared 层,跨层复用 top k positions 并跳过最多 75% 的 DSA indexer 计算。

Yushi Bai (白雨石), Qian Dong, Ting Jiang, Xin Lv (吕鑫), Zhengxiao Du, Aohan Zeng, Jie Tang (唐杰), Juanzi Li (李涓子)

已审阅 2603.12201-indexcache-cross-layer-index-reuse Sparse AttentionLong ContextServing Runtime
归档

CompactionRL: Reinforcement Learning with Context Compaction for Long Horizon Agents

CompactionRL 用独立 critic 和按后续 token 数折扣的跨段优势训练上下文压缩轨迹;两个模型在启用压缩的 coding 评测中提高 Pass@1,但 SUPO 已覆盖摘要—执行联合训练与全 token 归一化,且论文未报告直接对照或总计算。

Yujiang Li, Zhenyu Hou, Yi Jing, Jie Tang (唐杰), Yuxiao Dong

已审阅 2607.05378-compactionrl-context-compaction-agent-rl Agent MemoryAgent RLCredit Assignment
归档

Qwen3 Coder Next Technical Report

Qwen3 Coder Next 在 80B 总参数中每步激活 3B 参数,并用可执行仓库任务、长上下文中训、多模板工具训练、软件工程强化学习与专家蒸馏构建编码智能体,在三种 SWE Bench Verified scaffold 上达到 70.6% 至 71.3% 解决率,报告尚未拆分各训练组件的净贡献。

Ruisheng Cao, Mouxiang Chen (陈谋祥), Jiawei Chen (陈家慰), Zeyu Cui, Yunlong Feng, Binyuan Hui, Yuheng Jing, Kaixin Li, Mingze Li, Junyang Lin, +10 more

已审阅 2603.00729-qwen3-coder-next-agentic-coding Coding AgentAgent RLTool Use
归档

Computer Environments Elicit General Agentic Intelligence in LLMs

LLM in Sandbox 只给模型 shell、文件编辑和完成信号,使部分模型—任务组合获得最高 15.5 个百分点增益,并让 Qwen3 4B 经文件型通用任务强化学习后把平均交互轮次从 23.7 降到 7.0,这些数值来自允许联网的特定环境配置。

Daixuan Cheng (成岱璇), Shaohan Huang, Yuxian Gu, Huatong Song (宋华彤), Guoxin Chen, Li Dong (董力), Wayne Xin Zhao, Ji-Rong Wen, Furu Wei (韦福如)

已审阅 2601.16206-computer-environments-agentic-intelligence Tool UseAgent RLAgent Workflow
归档

Hierarchical Sparse Attention Done Right: Toward Infinite Context Modeling

HiLS Attention 用 landmark 压缩键、熵偏置与分层 softmax 训练 chunk 选择器,使 8K 训练的 345M 模型在 4M RULER 单针检索仍得 96 分,并在 512K 单 H800、batch size 1 的同 Triton 基线上将 prefill 与 decode 分别加速 13.5 倍和 15.7 倍。

Xiang Hu, Xinyu Wei, Hao Gu, Minshen Zhang, Tian Liang, Huayang Li, Lei Zhu (祝磊), Yan Wang (王琰), Sirui Han (韓斯睿), Yushi Bai (白雨石), +3 more

已审阅 2607.02980-hils-attention-infinite-context Sparse AttentionLong Context
归档

ThunderAgent: A Simple, Fast and Program Aware Agentic Inference System

把多轮 tool use 的 phase、KV footprint 与 backend placement 合并为 LLM Program,用 phase first pause / restore 和全局 waiting queue 控制工具等待期间的 KV working set。

Hao Kang, Ziyang Li, Weili Xu, Xinyu Yang, Yinfang Chen, Junxiong Wang, Beidi Chen, Tushar Krishna, Chenfeng Xu, Simran Arora

已审阅 2602.13692-thunderagent-program-aware-agentic-inference Agent WorkflowInference SchedulingKV Cache
归档

SPIRAL: Learning to Search and Aggregate

从 8 条搜索轨迹随机构造 4 个四元集合,以聚合成功率的参与集合均值更新搜索轨迹,并用同集合内中心化 reward 训练共享策略的聚合轨迹。

Jubayer Ibn Hamid, Ifdita Hasan Orney, Michael Y. Li, Omar Shaikh, Yoonho Lee, Dorsa Sadigh, Chelsea Finn, Noah Goodman

已审阅 2606.23595-spiral-learning-search-aggregate Test-Time ScalingCredit AssignmentRL Algorithm
归档

ECHO: Prune to act, trace to learn with selective turn memory in agentic RL

ECHO 为长程智能体保留带原始轮次标识的选择性记忆,用它重建有限上下文并将结果信用路由到被复用历史轮次及其选择动作,在 BrowseComp Plus 上同时提高一次通过率并减少滚动摘要造成的轨迹膨胀。

Zijun Xie, Binbin Zheng, Enlei Gong, Jihua Liu, Yuyang You, Lingfeng Liu, Jiayao Tang, Guanqun Zhao, Aoqi Hu, Zeyu Chen

已审阅 2606.31650-echo-selective-turn-memory-agentic-rl Agent MemoryAgent RLLong Context
归档

MOPD: Multi Teacher On Policy Distillation for Capability Integration in LLM Post Training

让 student 在自身轨迹上接受多个领域 teacher 的 token level reverse KL 信号,整合 RL teacher 能力。

Wenhan Ma, Jianyu Wei, Liang Zhao, Hailin Zhang (张海林), Bangjun Xiao, Lei Li, Qibin Yang, Bofei Gao, Yudong Wang, Rang Li, +3 more

已审阅 2606.30406-mopd-multi-teacher-on-policy-distillation On-Policy DistillationRL AlgorithmReasoning RL
归档

RollArt: Disaggregated Multi Task Agentic RL Training at Scale

用声明式 task domain 硬件亲和映射、轨迹级环境状态机和带起始版本年龄上限的异步换权,协调 H800/H20/CPU/serverless 上的多任务 agentic RL。

Wei Gao, Yuheng Zhao, Tianyuan Wu, Shaopan Xiong, Weixun Wang, Dakai An, Lunxi Cao, Dilxat Muhtar, Zichen Liu, Haizhou Zhao, +8 more

已审阅 2512.22560-rollart-disaggregated-agentic-rl-training RL InfrastructureRollout OptimizationDistributed Training
归档

DSpark: Confidence Scheduled Speculative Decoding with Semi Autoregressive Generation

用 Markov head、置信度校准和硬件感知前缀调度,把并行 drafter 推进生产 serving。

Xin Cheng, Xingkai Yu (俞星凯), Chenze Shao, Jiashi Li, Yunfan Xiong, Yi Qian, Jiaqi Zhu, Shirong Ma, Xiaokang Zhang, Jiasheng Ye, +23 more

已审阅 2026-06-27-dspark-confidence-scheduled-speculative-decoding Speculative DecodingMulti-Token PredictionServing Runtime
归档

Laminar: A Scalable Asynchronous RL Post Training Framework

让完成轨迹独立进入 experience buffer,并以 CPU/RDMA relay 和同版本 repack 解除全局 batch / 权重同步 barrier。

Guangming Sheng, Yuxuan Tong (童雨轩), Borui Wan, Wang Zhang, Chaobo Jia (贾超博), Xibin Wu, Yuqi Wu, Xiang Li, Chi Zhang, Yanghua Peng, +3 more

已审阅 2510.12633-laminar-asynchronous-rl-post-training RL InfrastructureRollout OptimizationDistributed Training
归档

MegaScale MoE: Large Scale Communication Efficient Training of Mixture of Experts Models in Production

围绕 attention SP、FFN EP、communication overlap 和 compressed communication 重构生产 MoE 训练路径。

Chao Jin, Ziheng Jiang, Zhihao Bai, Zheng Zhong, Juncai Liu, Xiang Li, Ningxin Zheng, Xi Wang, Cong Xie, Qi Huang, +9 more

已审阅 2505.11432-megascale-moe-communication-efficient-training MoE SystemsDistributed TrainingTraining Memory
归档

Conditional Memory via Scalable Lookup: A New Axis of Sparsity for Large Language Models

用 hashed N gram lookup 和 context aware gating 增加可离线扩展的 conditional memory。

Xin Cheng, Wangding Zeng, Damai Dai, Qinyu Chen, Bingxuan Wang, Zhenda Xie (解振达), Kezhao Huang, Xingkai Yu (俞星凯), Zhewen Hao, Yukun Li, +4 more

已审阅 2601.07372-conditional-memory-engram-scalable-lookup Memory ArchitectureMoE Architecture
归档

Kimi K2: Open Agentic Intelligence

用大规模 MoE、MuonClip、工具数据和 agentic RL 构建开放的软件工程智能体模型。

Kimi Team: Yifan Bai and 198 other authors;arXiv submitter: Yulun Du。

已审阅 2507.20534-kimi-k2-open-agentic-intelligence MoE ArchitectureOptimizerAgent RL
归档

Qwen3 Technical Report

用 thinking / non thinking 双模式、thinking budget 和 strong to weak distillation 统一推理与通用能力。

An Yang and 59 other authors;本地核心跟踪作者包括 An Yang, Binyuan Hui, Bo Zheng, Bowen Yu, Dayiheng Liu, Fei Huang, Jianwei Zhang, Jianxin Yang, Jingren Zhou, Junyang Lin, Rui Men。

已审阅 2505.09388-qwen3-technical-report Reasoning RLMoE ArchitectureOn-Policy Distillation
归档

Credit Assignment with Resets in Language Model Reasoning

从失败轨迹重置并重采样错误点后的 continuation,只更新后缀 token 以集中 credit assignment。

Ankur Samanta, Akshayaa Magesh, Ayush Jain, Youliang Yu, Daniel R. Jiang, Kavosh Asadi, Kaveh Hassani, Paul Sajda, Jalaj Bhandari, Yonathan Efroni

已审阅 2605.25507-credit-assignment-resets-language-model-reasoning Credit AssignmentReasoning RLRollout Optimization
归档

The Optimal Token Baseline: Variance Reduction for Long Horizon LLM RL

推导 token level variance minimizing baseline,并用 logit gradient proxy 近似长轨迹 policy gradient 权重。

Yingru Li (李英儒), Jiawei Xu, Ziniu Li (李子牛), Jiacai Liu (刘佳材), Wei Liu (刘威), Yuxuan Tong (童雨轩), Longtao Zheng (郑龙韬), Zhenghai Xue, Yaxiang Zhang, Tianle Cai (蔡天乐), +3 more

已审阅 2602.07078-optimal-token-baseline-long-horizon-llm-rl Credit AssignmentRL AlgorithmRL Theory
归档

The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models

把 RLVR 训练能力上限关联到 policy entropy 消耗,并分析 advantage update 的熵动力学。

Ganqu Cui, Yuchen Zhang, Jiacheng Chen, Lifan Yuan (袁立凡), Zhi Wang, Yuxin Zuo, Haozhan Li, Yuchen Fan, Huayu Chen (陈华玉), Weize Chen, +7 more

已审阅 2505.22617-entropy-mechanism-rl-reasoning-language-models Training StabilityReasoning RLRL Theory
归档

Breaking Entropy Bounds: Accelerating RL Training via MTP with Rejection Sampling

以 TV loss 训练 MTP heads,并用 probabilistic rejection sampling 提高 RL rollout 接受率。

Yucheng Li, Huiqiang Jiang, Yang Xu (徐旸), Jianxin Yang, Yi Zhang, Yizhong Cao, Yuhao Shen, Fan Zhou, Rui Men, Jianwei Zhang, +7 more

已审阅 2606.12370-bebop-mtp-rejection-sampling-rl-training Rollout OptimizationSpeculative DecodingMulti-Token Prediction
归档

Dynamic Linear Attention

用 representation drift 动态决定 state 边界,在固定 cache 内自适应合并 linear attention states。

Xin Wang, Hui Shen, Boyuan Zheng, Xueshen Liu, Minkyoung Cho, Zhongwei Wan, Zesen Zhao, Zhuoqing Mao, Shen Yan, Mi Zhang

已审阅 2606.10650-dynamic-linear-attention Linear AttentionLong ContextMemory Architecture
归档

UltraEP: Unleash MoE Training and Inference on Rack Scale Nodes with Near Optimal Load Balancing

基于 post gating exact load 逐 microbatch / layer 规划 expert replica 与 token reroute,统一 MoE 训练和 prefill 负载均衡。

Xinming Wei, Chao Jin, Tuo Dai, Yinmin Zhong, Shan Yu, Chengxu Yang, Bingyang Wu, Zili Zhang, Jing Mai, Qianchao Zhu, +3 more

已审阅 2606.04101-ultraep-rack-scale-moe-load-balancing MoE SystemsDistributed TrainingInference Scheduling
归档

Transformers are Inherently Succinct

证明某些语言族的 Transformer 表示只需多项式规模,而 LTL / RNN / automata 需要指数或双指数规模。

Pascal Bergsträßer, Ryan Cotterell, Anthony W. Lin

已审阅 2510.19315-transformers-inherently-succinct Formal Expressivity
归档
归档

DAPO: An Open Source LLM Reinforcement Learning System at Scale

在 Qwen2.5 32B 与 AIME 2024 设置中,用解耦裁剪、动态采样、token 级损失和超长奖励整形将朴素 GRPO 的 avg@32 从 30 提高到 50,并开源代码、数据与模型。

Qiying Yu (禹棋赢), Zheng Zhang, Ruofei Zhu, Yufeng Yuan, Xiaochen Zuo, Yu Yue, Weinan Dai, Tiantian Fan, Gaohong Liu, Juncai Liu, +26 more

已审阅 2503.14476-dapo-long-cot-rl-system RL AlgorithmReasoning RLRL Infrastructure
归档

Spurious Rewards: Rethinking Training Signals in RLVR

通过随机、格式和错误答案 reward 实验,揭示 pretrained prior 与 clipping bias 可产生伪 RLVR 增益。

Rulin Shao, Shuyue Stella Li, Rui Xin, Scott Geng, Yiping Wang, Sewoong Oh, Simon Shaolei Du, Nathan Lambert, Sewon Min, Ranjay Krishna, +4 more

已审阅 2506.10947-spurious-rewards-rethinking-rlvr Reward HackingReasoning RLReward Modeling
归档

DeepSeek R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

用 outcome based RL 从强 base model 诱导 long CoT、自验证与策略切换,再通过 SFT / RL / distillation 转为可用模型。

DeepSeek AI and 199 other authors. Core contributors listed in v2 source include Daya Guo, Dejian Yang, Haowei Zhang, Junxiao Song, Peiyi Wang, Qihao Zhu, Runxin Xu, Ruoyu Zhang, Shirong Ma, Xiao Bi, Xiaokang Zhang, Xingkai Yu, Yu Wu, Z.F. Wu, Zhibin Gou, Zhihong Shao, Zhuoshu Li, Ziyi Gao.

已审阅 2501.12948-deepseek-r1-rl-reasoning Reasoning RLReward ModelingRL Algorithm
归档

Training Compute Optimal Large Language Models

重新估计 compute optimal frontier,指出参数量和训练 token 应随算力近似等比例增长。

Jordan Hoffmann, Sebastian Borgeaud, Arthur Mensch, Elena Buchatskaya, Trevor Cai, Eliza Rutherford, Diego de Las Casas, Lisa Anne Hendricks, Johannes Welbl, Aidan Clark, +12 more

已审阅 2203.15556-training-compute-optimal-large-language-models Scaling Laws
归档

Scaling Laws for Neural Language Models

拟合 loss 对参数、数据与计算的 power law,建立早期 compute efficient pretraining scaling law。

Jared Kaplan, Sam McCandlish, Tom Henighan, Tom B. Brown, Benjamin Chess, Rewon Child, Scott Gray, Alec Radford, Jeffrey Wu, Dario Amodei

已审阅 2001.08361-scaling-laws-neural-language-models Scaling Laws