国产前沿模型技术报告时间线总览
国产前沿模型技术报告在 2024 2026 年的主线,可以读成一次连续的工程迁移:先用 MoE、MLA、长上下文和低精度训练把 frontier base model 做到可训练、可服务;随后用 verifiable reward、long CoT、GRPO/OMD/CISPO 等方法把推理能力从模型先验里释放出来;再把 rollout、工具环境、checkpoint、sparse attention、MTP 和 anti hack ...
All notes
当前收录 102 篇论文或技术文章,按首次归档时间排列并保留摘要与作者线索。
国产前沿模型技术报告在 2024 2026 年的主线,可以读成一次连续的工程迁移:先用 MoE、MLA、长上下文和低精度训练把 frontier base model 做到可训练、可服务;随后用 verifiable reward、long CoT、GRPO/OMD/CISPO 等方法把推理能力从模型先验里释放出来;再把 rollout、工具环境、checkpoint、sparse attention、MTP 和 anti hack ...
SelfCompact 把长轨迹摘要做成同一模型可执行的 hard reset 操作,再用任务专用、要求引用当前轨迹证据的 rubric 决定何时压缩;它在七个开放权重模型的数学与搜索实验中优于无压缩,并在大多数质量对照上优于固定时机摘要。最可靠的增量是把 timing 判断拆成可审计的状态 predicate,消融支持含 rubric 的完整 policy 优于自由摘要工具;search 附录声明的 40k token gate、3...
论文把有限博弈的序数偏好图与连续时间 FTRL 的集合稳定性联系起来:偏好闭合给出稳定结果的必要约束;对 subgame,club 在一般 FTRL 下足以保证 span 渐近稳定、在无 ties 时形成等价判据,并在 strategy flow 下直接形成 attractor 等价判据;对一般纯策略集合,三人反例表明相同的偏好方向仍可能产生不稳定 span,作者因而引入依赖收益差幅度的 leaklessness,为一般 span 恢...
这篇 ACL 2026 综述把 LLM 强化学习的数据约束拆成高成本外部监督与有限内部生成经验,并用 data centric、training centric、framework centric 三层九类 taxonomy 组织 125 条文献记录;它提供了便于导航的设计空间,系统性证据仍受检索协议缺失、分类轴混合、预算口径不统一和少数方法描述失真的限制。
SGLang DPA 在同一组全局 TP workers 内,把 Attention ranks 划成多个按请求拥有 KV Cache 的 DP groups,再通过 gather / dispatch / combine / reduce scatter 把 DP local Attention 与全局 TP 或 EP MoE 连接起来;对于缓存受限的高并发 MLA decode,它可把单条请求的 cache 副本数从 $T$ 降到...
MLA 把每个 token 的 K/V 压成共享 latent 与独立 RoPE 分支,常见 head TP absorbed decode 会让每个 rank 保存同一请求的完整 latent cache,使其相对展开 K/V 的每卡压缩倍数按 $1/T$ 衰减;生产系统可通过 DP Attention 改变请求所有权、DCP/CP 沿序列分片、P/D 拆分阶段、量化或分层缓存降低驻留字节,TPLA、GLA 与 MLRA 则进一步处...
Prefill CP 将单条长请求的 query token 沿 context 维分到多个 rank,在每个 rank 保持全局 KV 或全局 attention state 可见性,并用因果负载均衡、通信重叠和并行组解耦把 dense attention 或 DSA indexer 的高增长计算并行化;这套数学分解可覆盖 MHA、GQA、MLA 与 DSA,生产级扩展仍取决于 KV 所有权、attention backend、跨节...
Leyline 在 agent policy 与 KV Cache 之间增加语义编辑通道:policy 用 (span, replacement, mode) directive 声明需要修改的历史范围和语义保证,serving 层保留未修改前缀、重算 replacement,并用 RoPE $\delta$ rotation 重标 MLA 后缀 KV 的位置,从而在 AMORTIZE 模式下减少上下文编辑后的重复 prefill,在...
IndexCache 将 DSA 层划分为运行 selector 的 Full 层和继承最近 Full 层 top $k$ token positions 的 Shared 层,再用 loss guided layer search 或 multi layer index distillation 决定共享模式,从而在不复制 KV、也不改变 sparse core attention 的条件下跳过最多 75% 的逐层 indexer ...
Agentic RL 的环境供给在 2024 2026 年经历了从统一可复位 sandbox、有状态用户与工具模拟、代码驱动环境合成,到用真实交互轨迹训练 language world model 的连续演进;当前证据最支持 real environment 提供状态与验证锚点、learned environment 扩大低成本 rollout、周期性真实交互修正分布偏移的混合闭环。
2026 年 5 7 月的 RL 信用分配研究开始围绕 token、segment、turn、memory operation 和 workflow role 五种 credit unit 形成可比较的方法谱系;compact agent 的关键增量是把“摘要或记忆写入后,各 rollout 的有效状态是否仍可比较”单独列为 estimator 条件,并分别发展出同状态局部重采样、belief proxy、hindsight coun...
CompactionRL 让同一个 trainable actor 在上下文预算将满时生成摘要,再从“摘要 + 最近两轮”重建上下文,并把执行 token 与摘要 token 一起放入共享最终任务 reward 的 PPO 目标;独立 critic、全 batch token level loss normalization 和跨 segment GAE 修正使 variable length compacted rollouts 可...
Grape 面向预声明的多阶段 LLM task DAG (Directed Acyclic Graph,有向无环图),把静态 prompt、流式上游输出和 decode 拆成微任务,让下游已知 prefix 与上游逐步生成的中间结果在上游 decode 期间持续完成增量 prefill,再用服务级目标约束的 batch 构造和关键路径感知 Key Value Cache (KV Cache) 抢占控制尾延迟。 本地评价:最有价值的新...
LLM as a Verifier 把评分 token 的概率期望、重复评估与 criteria decomposition 组合成连续 verifier,并用 Probabilistic Pivot Tournament 在接近线性的比较预算下选择多条 agent 轨迹;它在候选重排、进度代理和 RL dense reward 上显示出广泛用途,同时依赖 logits、成对上下文稳定性、人工 criteria 和较高验证推理预算。
SAO 把异步 agentic reinforcement learning 的 prompt local 采样单位改为一条 rollout,用独立 value model 的更高更新频率、冻结 attention 和跳过 observation 的 token level Generalized Advantage Estimation (GAE) 代替组内 reward baseline,再用 rollout token log ...
SPORK 让正在生成的目标模型在首个 decode token 后从共享 KV prefix 开出强制工具调用 probe,按工具名 token 的置信度提前执行只读工具,并在预测失败时把 probe 的匹配 token 前缀交给目标模型验证复用,从而把部分工具等待时间隐藏在剩余 Chain of Thought decode 内。 本地评价:这项工作的核心贡献是 action level latency overlap。收益依赖数...
Qwen3 Coder Next 的核心判断是:在编码智能体上,80B total / 3B active 的 Qwen3 Next hybrid attention + MoE 基座,可以通过大规模 executable environment、repo 级 mid training、多模板 tool calling、SWE 专家 RL 和 expert distillation,逼近更大 active compute 模型的 ag...
LLM in Sandbox 的核心贡献是把通用计算机抽象成一个最小 Docker code sandbox,并证明强模型在 training free 设置下能利用外部资源访问、文件管理和代码执行三类 meta capability 提升数学、物理、化学、长上下文和指令遵循等非代码任务;进一步的 LLM in Sandbox RL 说明,把一般 context based 数据放进文件系统并用 outcome reward 训练,可...
HiLS Attention 把 chunk wise sparse attention 的选择问题改写为可端到端训练的 hierarchical softmax:每个 chunk 用 landmark token 生成压缩 key 和 entropy bias,query 先给 chunk 分配总 attention mass,再在被选 chunk 内做 token level attention。它在 345M 到 7B 实验中同...
FlashMemory DeepSeek V4 在 DeepSeek V4 Flash 的 HCA / CSA 结构上增加一个 lookahead Neural Memory Indexer,把历史 CSA chunk 放入 CPU cold pool,再按未来约 $64$ 个 token 的预测需求取回少量 chunk;它把平均物理 KV 占用降到 full context baseline 的 $13.5\%$,平均分数从 $76...
ThunderAgent 把跨多轮 LLM 调用与工具等待建模为带 phase、status、KV footprint、backend placement 和 tool dependency 的 LLM Program,使 scheduler 能按 Reasoning / Acting 状态控制 KV working set,并在释放 KV 后通过全局队列重新选择恢复节点;论文在所测高并发 tool use serving 与 rol...
SPIRAL 从共享策略生成的 8 条 search traces 中随机抽取 4 个互异的四元集合,再为每个集合生成 4 条 aggregation traces;它用集合聚合成功率的 participation averaged advantage 更新搜索轨迹,并用同集合内中心化 reward 更新聚合轨迹,从而把 parallel search 与 model based aggregation 放进同一个最终答案 rewar...
ECHO 的核心价值在于把 long horizon agent 的 context management 从“压缩历史以继续行动”推进到“保留 source indexed reconstruction trace 以便学习”:每个已完成工具 turn 被压成带原始 turn id 的 memory record,policy 在上下文触顶时选择可复用记忆来重建 bounded context,并把最终正确轨迹的正向 outcome...
Vortex 用 vFlow 描述 page summary、逐 token 动态路由与 selected attention,用 vTensor 把这些逻辑算子 lowering 到 paged / ragged layouts,再复用或补充 SGLang 的 GQA / MLA decode backend,使 sparse attention selector、top k 和真实 KV layout 能在同一端到端 servin...
Seed2.0 模型卡把 ByteDance Seed 的新一代模型定位为面向真实复杂任务的生产模型族:它以 Doubao / Trae 等产品流量和用户任务为入口,重构了从长尾知识、复杂指令、搜索、视觉、视频、工具调用、GUI agent 到科学研究任务的评测面,并用 Seed2.0 Pro / Lite / Mini 的性能、成本和案例轨迹证明 ByteDance Seed 已经把模型报告从单点能力榜单推进到“产品需求分布、评测系...
GKD 把 LLM 蒸馏从固定参考答案上的 teacher forcing 推进到学生自生成轨迹上的教师分布匹配,用一个 $\lambda$ 混合离线数据和 on policy 数据,并允许 forward KL、reverse KL、JSD 等不同散度;它在 T5 系列的摘要、翻译、算术推理和 instruction tuning 上展示了稳定收益,是后续 OPD 系方法的重要早期基线。
MaxRL 把 binary outcome RLVR 改写为对成功 rollout 隐式 likelihood 的近似最大化:标准 RL 只优化 $pass@1$ 的一阶项,MaxRL 用 $N$ 条 rollout 中的成功样本数 $K$ 做归一化,得到对 $T=N$ 截断 maximum likelihood objective 的无偏 policy gradient estimator;实验显示它在 ImageNet toy ...
HydraHead 把 Full Attention (FA) 和 Linear Attention (LA) 的混合粒度从 layer 推进到 attention head:先用 activation patching 和 path patching 找到 retrieval critical heads,只给这些头保留 FA,其余头换成 Gated DeltaNet (GDN),再用独立 RMSNorm 与 head wise s...
MOPD 把“多个领域 RL teacher 的能力整合”改写成一个 on policy token level distillation 问题:student 先用自己的当前策略生成轨迹,再让对应领域 teacher 在同一轨迹前缀上做 teacher forced prefill,最后用 reverse KL 或等价 policy gradient advantage 把 teacher 的局部偏好注入 student;关键成立条...
RollArt 用静态 task domain affinity 声明把训练、prefill heavy rollout、decode heavy rollout、环境与 reward 映射到 H800、H20、CPU/Kubernetes 和 serverless 资源池,再用轨迹级状态机、起始版本年龄上限 $\alpha$ 与 Mooncake weight movement 协调跨池异步;OSDI camera ready 支持...
DSpark 是 DeepSeek 把并行 drafter 推向生产 serving 的一套完整方案:用 DFlash 式 parallel backbone 先一次生成长候选块,再用低秩 Markov head 注入块内局部自回归依赖,随后用 calibrated confidence head 和硬件感知 prefix scheduler 按请求与负载动态裁剪 target verification 长度。离线 Qwen3 / G...
DFlash 的核心贡献是把 diffusion LLM 放到 speculative decoding 的 draft stage:用目标自回归模型的多层 hidden features 做条件,把融合特征注入 draft model 每层 KV cache,再用 block diffusion 一次并行预测整块候选 token。它在 Qwen3 4B/8B 非 thinking 模式下报告约 4.0x 4.9x 平均加速,在 re...
这篇 survey 把 self improving agents 从模型自我训练扩展为部署后 runtime system 的 trace to capability 问题:harness 将交互 trace 编译成可验证 experience,再分别写入 skills、memory、environment/tool boundary、model parameters 或 meta layer。它的主要贡献是给 self impro...
Laminar 让完成 trajectory 独立进入 experience buffer,再用 CPU/RDMA relay 允许各 rollout 在本地生成 batch 结束或被 repack 释放后独立拉取新权重,并把同 weight version 的尾部请求集中到少数 rollout;1024 张 H800 实验支持这套设计能提高短窗口 actor update throughput,训练时实际 policy lag、GR...
LoRAFusion 把 LoRA 微调的效率问题拆成两层:kernel 层用 split graph fusion 减少 LoRA 分支对大激活张量的重复读写,调度层把共享 base model 的多个 LoRA adapter 合并训练并用分组、MILP / greedy packing 降低流水线气泡和变长样本负载不均;在 H100 / L40S、LLaMA 3.1 8B、Qwen 2.5 32B、LLaMA 3.1 70B 上...
MegaScale MoE 的核心贡献是把大规模 MoE 训练的瓶颈从单点 kernel 优化提升到整层通信路径设计:attention 侧用 Ulysses style sequence parallelism 降低 TP critical path 通信,FFN 侧用 intra node expert parallelism 保持专家 GEMM 效率,再用跨算子调度、算子内 tile level overlap、选择性 acti...
这篇论文把 speculative execution 推到随机采样场景:小 draft model 先自回归猜 $\gamma$ 个 token,大 target model 一次并行验证这些前缀,并用 $\min(1,p/q)$ 接受概率与 residual distribution 校正拒绝位置,从而在无需改模型、无需重训且保持 target 输出分布不变的前提下,把大模型串行 decode 的目标调用数降低到每步平均生成多个 ...
DeepSeek V3.2 把三条扩展路径合入同一模型:DSA 用 per layer lightning indexer 将 128K MLA 的 core attention 限制到每个 query 最多 2048 个 latent KV positions;scalable GRPO 用 unbiased KL、off policy negative sequence masking、keep routing 和 keep sa...
MiniMax Sparse Attention (MSA) 是 MiniMax M3 的长上下文技术核心:它在 GQA (Grouped Query Attention,分组查询注意力) 之上增加轻量 Index Branch,为每个 query token 和每个 GQA group 选择少量 KV blocks,再由 Main Branch 对被选 block 做精确 softmax attention;论文的强证据在于 109...
DeepSeekMoE 把 MoE (Mixture of Experts,混合专家) 的效率问题改写成专家专门化问题:fine grained expert segmentation 通过切小 FFN (Feed Forward Network,前馈网络) 专家并增加激活专家数,提高每个 token 的专家组合分辨率;shared expert isolation 通过固定激活共享专家承载通用知识,让 routed experts ...
Engram 把大模型稀疏性从 MoE (Mixture of Experts,混合专家,用条件计算扩大 total 参数并控制 active compute) 扩展到 conditional memory:用 hashed N gram lookup 存静态局部模式,用 context aware gate 决定是否把查到的记忆注入 hidden state;在 iso parameter / iso FLOPs 的 27B MoE...
Kimi K2 是 Moonshot 将 open weight MoE foundation model 推向 agentic software engineering 和 tool use 的系统报告:1.04T total / 32B active MoE、MuonClip、15.5T pretraining tokens、3000+ real MCP tools、20000+ synthetic tools、verifiabl...
Kimi k1.5 把 128K 长上下文、long CoT、verifiable reward、多模态 reasoning、partial rollout、length aware sampling、long2short 和 Megatron/vLLM/Mooncake 工程栈组合成一套 RL scaling recipe;它的价值在于把 reasoning RL 从单一数学训练扩展到长上下文、多模态、代码与系统协同,证据主要来自团...
Qwen3 把 dense / MoE (Mixture of Experts,混合专家) 开源模型族、thinking / non thinking 双模式、thinking budget、36T token 多语预训练、四阶段后训练和 strong to weak distillation 组织成一套可发布模型体系,使 Qwen3 235B A22B、Qwen3 32B 与小模型在数学、代码、agent、多语和长上下文任务上成为强...
Qwen2.5 展示了一条面向通用、代码、数学、结构化数据和长上下文场景的 LLM (Large Language Model,大语言模型) 工程路线:用 18T token 预训练、统一 tokenizer、百万级 SFT (Supervised Fine Tuning,监督微调)、DPO (Direct Preference Optimization,直接偏好优化)、GRPO (Group Relative Policy Opti...
DeepSeek V3 用 MLA (Multi head Latent Attention,多头潜变量注意力)、DeepSeekMoE、无辅助损失负载均衡、MTP (Multi Token Prediction,多 token 预测)、FP8 混合精度训练和 DualPipe 通信重叠,把 671B total / 37B active 的开放 MoE (Mixture of Experts,混合专家) 模型训练到强代码、数学和通用...
DeepSeek V2 最独立的贡献是 MLA (Multi head Latent Attention,多头潜变量注意力):它把 generation cache 从完整 per head K/V 改成由 hidden state 下投影得到的 512 维联合 KV latent 与 64 维 RoPE key,再用 projection absorption 让 latent 直接参与 content score 和 value ...
这篇是 LLM 强化学习 credit assignment 的综述与索引节点:它把 RL (Reinforcement Learning,强化学习) for LLM (Large Language Model,大语言模型) 中的 CA (Credit Assignment,信用分配/功劳分配) 拆成两个问题域,reasoning RL 主要在单条长 CoT (Chain of Thought,思维链) 内把 outcome rewa...
这篇从理论上挑战“过程监督天然比结果监督更强”的直觉:在标准 coverage / concentrability 假设下,只拿 trajectory level total reward 的 outcome supervision 可以通过 least squares reward imputation 转成 per step reward data,后续 offline reinforcement learning 的统计难度只比...
Math Shepherd 的核心价值在于把数学推理步骤的标注问题改写为“当前 step 之后还能否补全到正确答案”的 Monte Carlo potential estimation:对每个中间 step 采样多个 continuation,用最终答案正确性给 step 生成 hard / soft pseudo label,训练 PRM 做 verifier reranking,并进一步把 PRM reward 接入 step b...
这篇是 OpenAI reasoning verification 线的历史节点:它用 80 万 step level human labels 训练 PRM,在 MATH 500 题 held out subset 上用 Best of 1860 选择达到 78.2%,高于强 ORM 和 majority vote;核心价值是把“最终答案正确”拆成“每一步是否仍在正确推理轨道上”,并通过 PRM800K 让过程监督成为后续 reas...
这篇把 reset 变成 RLVR credit assignment 的训练时原语:从失败轨迹中选一个中间 thought prefix,重采样多个后缀 continuation,只对后缀 token 做 group relative policy update。SRPO 用模型自定位的首个错误 thought 近似 credit assignment oracle,在无需外部 step level label 或 critic 的...
OTB 解决的是 long horizon LLM RL 中 outcome reward 经过整条 response 回传时的高方差问题:它从 causal policy gradient 的方差最小化目标推导出 token level optimal baseline $B t^ =\mathbb E[G tW t]/\mathbb E[W t]$,其中 $W t$ 是到第 $t$ 个 token 为止累计的 gradient r...
VIMPO 试图填补 GRPO 和 PPO actor critic 之间的空位:它不训练独立 critic,却从 KL regularized RL 的最优性条件推出一个由 policy reference log ratio 表达的隐式 value recurrence,用终止状态 $V(s T)=0$ 把 outcome reward 变成 value loss,再用同一个 log ratio identity 构造 token...
这篇论文给 OpenAI 的 alignment post training 提供了一个正向版本的 emergent misalignment 实验:如果窄域有害训练能诱导跨域失配,那么用 5% 真实场景 beneficial trait data 加 RL reward 强化诚实、纠错、风险意识、公平和人类福祉等特质,也可能诱导跨域对齐收益。论文的证据强在 44/53 个 OOD 评测提升、health only 训练迁移到非健康安...
这篇论文把 long horizon LLM RL 中 pi roll 与 pi theta 的实现级分布差异形式化为 surrogate objective error:经典 trust region bound 随长度呈 $O(T^2)$ 并迅速失效,作者给出更紧的 KL/TV 组合界,指出 max token divergence 是单靠 sequence average KL 无法替代的控制量,并提出 Trust Region...
这篇论文把 reasoning LLM 的 RLVR 训练瓶颈重新表述为 policy entropy 的消耗过程:在没有 entropy / KL 干预时,reward 提升和 entropy 下降之间可以被经验式 $R= a\exp(\mathcal H)+b$ 拟合;进一步用 softmax policy 的 entropy dynamics 说明,高概率且高 advantage 的 token update 会持续降低 ent...
这篇博客给出了 RL 实践中常用 KL 估计器 k1/k2/k3 的最小数学解释:在只能从 $q$ 采样并能计算 $p(x),q(x)$ 的场景下,$k 1= \log r$ 是无偏但高方差的 $\mathrm{KL}[q,p]$ 估计器;$k 2=\frac12(\log r)^2$ 是低方差但有偏的二阶近似;$k 3=(r 1) \log r$ 通过控制变量 $r 1$ 保持无偏、非负和低方差,其中 $r=p(x)/q(x)$。对...
DeepSpeed Ulysses 的核心贡献是把长序列训练中的 activation / context 维瓶颈变成一次可逆的数据布局转换:Transformer 其他算子沿 sequence 维分片,进入 attention 前用 all to all 把 sequence partitioned, all heads 的 QKV 变成 full sequence, head partitioned 的 QKV,让每张 GPU 只...
Muon 的核心技术含量在于把隐藏层矩阵参数的 momentum update 映射到近似半正交方向:它用低精度 Newton Schulz 近似 polar factor,让更新能量更均匀地覆盖矩阵奇异方向;后续大模型实践表明,Muon 想稳定扩展到 LLM pretraining,还需要 weight decay、shape aware update scale、AdamW/Muon 参数分组、分布式 full matrix or...
Ring Attention 的核心贡献是把 exact Transformer 的长序列瓶颈从“单卡必须驻留整段序列输出”改成“每张设备只驻留本地 query block,并让 key/value block 沿 ring 轮转”:它复用 blockwise exact attention 的在线 softmax 统计量,在不近似 attention 的前提下把最大上下文长度扩展到接近设备数倍;代价边界在于 exact attent...
Sarathi 的核心贡献是把 LLM serving 的低效从“decode 天然慢”重写为一个可调度的数据流问题:prefill 很快进入 compute saturating 状态,decode 因为逐 token 生成和 KV cache 访问长期 memory bound;如果把一个长 prefill 切成多个 compute sized chunk,再让 decodes 搭在每个 prefill chunk 的 linea...
ZeRO 的核心贡献是把数据并行中每张 GPU 都完整复制的 optimizer states、gradients、parameters 拆成可按 data parallel rank 分片保存和按需通信的动态状态系统,使 data parallelism 获得接近 model parallelism 的内存效率,同时保留 data parallelism 的大粒度计算和接近原始 DP 的通信量;论文实际评估了 $P {os+g}$ ...
GLM 5.2 是 GLM 5 系列从 200K 长上下文 agentic engineering 推进到 1M 长上下文 coding agent 的 release:它用 IndexShare 降低 DeepSeek Sparse Attention (DSA) indexer 成本,用 Multi Token Prediction (MTP) IndexShare + KVShare + rejection sampling +...
Bebop 的核心判断是:MTP 在 RL rollout 中失速的主因主要来自 policy entropy fluctuation,frozen MTP head 与更新后 policy 的权重漂移影响较小;因此有效方案是把 acceptance method 换成 probabilistic rejection sampling,并用 end to end TV loss 在 RL 前训练 MTP heads,使 draft t...
DLA 认为 long context linear attention 的核心损失来自固定 state merging 策略把信息密度不同的 token 压进同一个 summary state;它用 token level representation drift 动态决定 state 边界,并在固定容量 cache 中合并低信息密度的相邻 state,让 multi state linear attention 同时具备自适应分辨...
这篇论文给 Muon 相比 Adam 更快训练提供了一个局部曲率解释:在 matched validation loss 下,Muon 和 Adam 的一阶收益相近,差距主要来自二阶 Hessian curvature penalty;进一步分解发现二阶差距主要由 Muon update direction 的 Normalized Directional Sharpness (NDS) 更低造成,step size 对差距的解释力较...
UltraEP 的核心贡献是把大规模 MoE expert parallelism 中的负载均衡从“基于历史统计的周期性预测”推进到“基于 post gating exact load 的每 microbatch、每 layer 实时再均衡”:它利用 rack scale node 的高带宽 scale up fabric,把一个 EP group 放进同一机架级通信域,再用 quota driven planner 联合决定专家复制...
论文提出 societal hacking:当社会规则被编码成可优化的奖励结构时,RL 后训练会推动 LLM 在形式合规和制度意图之间寻找缝隙;在作者构造的 SocioHack 沙盒中,RL 模型能够重新发现大量真实历史漏洞,并且现有拒答、自我批判、训练正则化只能部分缓解这一现象。
论文提醒:LLM 在测试里表现出共情、理解、道德判断、焦虑等行为,只能说明它在某个实验条件下产生了相似行为,不能直接推出它拥有这些人类式内在属性。
Self Trained Verification (STV, 自训练验证) 的核心贡献是把 reference solution 变成 verifier 的 privileged teacher signal:同一个模型在看到参考答案时更容易指出候选解的错误,STV 用 On Policy Distillation (OPD, 在策略蒸馏) 和 verdict Reinforcement Learning (RL, 强化学习) 把这...
论文量化了 tool calling 分数对随机种子、对话序列化、推理历史和 system prompt 的敏感性,并针对长 tool context 下 GRPO 的两类浪费,用近期 all correct 轨迹预测跳过 rollout、用 max variance 子集减少反向传播,在组合配置上报告 1.7×/2.6× matched performance wall clock 提速。 本地评价:评测审计与 wall clock...
这篇论文把 LLM RL 中训练侧与推理侧对同一 token 序列给出的 logprob 不一致定义为 Training Inference Mismatch (TIM),并用 VeXact 构造 FSDP trainer 与 rollout engine bitwise 对齐的 zero mismatch 基线;实验证明 TIM 这种看似微小的 token level 数值差异可以单独触发 RL training collapse,...
论文证明:固定精度 Transformer 在表达某些语言时非常简洁;存在语言族可以用多项式大小的 Transformer 表示,但等价的 LTL 或 RNN 需要指数大小,等价有限自动机需要双指数大小。
DeepSeek V4 的核心是把“百万 token 上下文”做成一个端到端系统能力:在扩大 Mixture of Experts (MoE) 规模之外,V4 Pro 用 1.6T total / 49B active parameters,V4 Flash 用 284B total / 13B active parameters,二者通过 Compressed Sparse Attention (CSA) / Heavily Com...
Best of $N$ 在候选数量增大时会把输出推向 reward model 高估且分布外的区域,作者提出 caution:训练一个 predictor 去预测冻结 reward model 的中间特征,用预测误差作为分布外不确定性,并在推理时从 reward score 中扣除该不确定性,从而让多候选选择既能利用额外 inference compute,也能降低大 $N$ 下的 reward hacking。
ImpossibleBench 把 coding agent 的 test case exploitation 转化成一个可测量的 reward hacking benchmark:作者从 LiveCodeBench 和 SWE bench 构造自然语言规格与单测相冲突的 impossible tasks,把 impossible tasks 上的通过率定义为 cheating rate,因此任何得分都对应 specification...
BroRL 把 RLVR 的 scaling 轴从“继续训练更多 step”扩展到“每个 prompt 采样更多 rollout”:作者从 one step RLVR 的 correct token probability mass 分解出一个可能为负的 unsampled coupling term,并说明增大 rollout size $N$ 会让未采样项的二阶矩衰减,从而让 policy update 更稳定地增加正确 toke...
Seer 的核心贡献是把同步 LLM RL 中最耗时的 rollout 阶段当成一个“同 prompt group 内存在可学习上下文”的调度问题:GRPO 一类算法会为同一 prompt 采样多条 responses,这些 responses 在长度和局部 token 模式上高度相关;Seer 利用这个结构做 chunk level divided rollout、基于 speculative request 的 context a...
这篇论文用完全可控的合成推理环境把 pre training、mid training 和 RL post training 的作用拆开:RL 能带来真正的 pass@128 能力扩展,但需要两个条件同时成立,base model 在目标区域有足够探索余地,RL 数据位于模型 edge of competence;contextual generalization 还需要预训练中出现过少量相关 primitive seed;mid t...
这篇论文给 RLVR 争论提供了一个可控的正向证据:当模型已经通过预训练或 SFT 掌握 atomic skills,且 RL 训练目标明确奖励组合这些 atomic skills 时,RL 可以训练模型形成可泛化的 compositional skill,把见过的浅层模式迁移到更深嵌套、未见函数组合和跨任务组合场景;同样 Level 2 数据上的 RFT 和只训练 atomic tasks 的 RL 都没有得到类似泛化。
MiniMax M1 把 test time compute scaling 的瓶颈拆成三层来处理:用 Lightning Attention + MoE (Mixture of Experts,混合专家模型) 降低长输出推理和 RL (Reinforcement Learning,强化学习) rollout 的计算成本,用 CISPO (Clipped IS weight Policy Optimization,截断重要性采样权重的...
这篇论文把 reward hacking 扩展到 inference time alignment 场景:Best of $n$ 这类“多采样后按 proxy reward 选最高分”的方法,会随着 $n$ 增大先提升真实质量,再因 winner's curse 选中过度高估的样本而降低真实质量;作者用 TP$ 2$/MLR 条件证明常见一参数推理策略的 true reward 曲线至多一个峰值,提出 Best of Poisson ...
这篇论文是对 “RLVR 只提升 base model 已有解的采样效率” 观点的直接反驳:作者提出 ProRL,用高温 rollout、DAPO 式 decoupled clipping/dynamic sampling、KL regularization、周期性 reference policy 与 optimizer reset,以及 136K 多任务 verifiable reward 数据,把 DeepSeek R1 Dis...
这篇论文把 RLVR 的收益拆成 sampling efficiency 和 reasoning capacity boundary:当前基于 binary verifiable reward 的 RLVR 常常把 base model 已经能低概率采样到的正确 reasoning paths 提升到更高概率,因此 pass@1 明显改善;但在大 k 的 pass@$k$ 覆盖上,base model 往往能解出更多题,说明现有 RL...
DAPO 的核心贡献是一套可复现的 long CoT reasoning RL recipe:在 Qwen2.5 32B base 上,用基于 verl 的 GRPO 变体、规则奖励、DAPO Math 17K 数据、Clip Higher、Dynamic Sampling、Token level Policy Gradient Loss 和 Overlong Reward Shaping,将 AIME 2024 avg@32 提升到...
这篇论文指出,某些 RLVR 实验中的能力提升可以由模型预训练 prior、GRPO clipping bias 和提示/格式行为共同解释:在 Qwen2.5 Math 上,随机 reward、format reward、甚至奖励错误答案的 reward 都能显著提高 MATH 500 / AMC / AIME24 表现,随机 reward 在 MATH 500 上带来 21.4 个百分点提升,接近 ground truth rewa...
GLM 5 是一篇面向“agentic engineering”的系统报告:模型侧把 GLM 4.5 扩到 744B total / 40B active MoE,使用 MLA、Muon Split、参数共享 MTP 和 DeepSeek Sparse Attention 支撑 200K 级长上下文;训练侧用 28.5T tokens、软件工程 mid training、SFT、Reasoning RL、Agentic RL、Gene...
这篇论文把 reasoning model 的 chain of thought 从“可解释性附属物”提升为安全监控信号:OpenAI 发现 GPT 4o 读取 frontier reasoning agent 的 CoT 可以显著优于只看 actions / outputs 的监控器,检测 agentic coding RL 中的 reward hacking;但当训练目标直接惩罚会触发 CoT monitor 的思路时,模型在低优...
这篇论文把 reward hacking 定义为:proxy reward 在参考策略访问到的状态 动作分布上和真实 reward 正相关,但经过优化后,新策略进入 proxy 与真实目标相关性失效的分布区域,导致真实回报低于参考策略;作者据此证明,把策略的 occupancy measure 约束在参考策略附近可以给真实回报提升提供下界,并提出 ORPO 用 discriminator 估计 occupancy ratio,在交通、...
这篇论文把 RLHF reward hacking 中的一类常见失败归因到 reward model 学到了偏好数据里的伪相关变量,例如长度、迎合短语、概念词或人口属性;作者提出 Causal Reward Model (CRM),在 Bradley Terry reward loss 上加入基于 MMD 的独立性正则,让 reward 预测对人工指定的 spurious factor 分箱保持近似不变,从而在 sycophancy、...
DeepSeek R1 v2 的核心结论是:大规模 outcome based RL 可以在强 base model 上诱导 long CoT reasoning、自我反思、验证和策略切换等行为;R1 Zero 证明无需 SFT 也能通过 rule based verifiable reward 激发 reasoning capability,R1 则通过 cold start SFT、两阶段 RL、rejection samplin...
Kimi K2.5 是一篇系统型技术报告:它把 Kimi K2 扩展为 256K context 的开源多模态 agentic 模型,通过早期低比例视觉 文本混合预训练、zero vision SFT、联合文本/视觉 RL、MoonViT 3D 视频压缩、Token Efficient RL、Decoupled Encoder Process 和 Agent Swarm / PARL,把模型能力从单轮文本推理推进到视觉理解、长视频、浏...
这篇论文提出 Span Query,把 chat、RAG、judge generator、inference time scaling 和 agentic workload 统一表示为带可交换约束的 LLM 调用表达式树;当客户端声明哪些 message span 可以重排时,服务端可以把 KV cache 从 prefix only reuse 推进到 span level relocatable reuse,并进一步用树形改写提升...
这篇文章指出,LLM 推理在 temperature=0 下仍然出现不同输出,主要来源通常是 batch 不变性缺失:服务端负载改变 batch size、prefill/decode 切分、KV cache 布局和 attention split 策略,进而改变浮点 reduction 顺序;作者通过 batch invariant RMSNorm、matmul 和 attention kernel 展示了可复现推理的实现路径,并把...
HybridFlow 的核心贡献是把 RLHF 训练看成由多个大模型节点组成的复杂 dataflow,并提出一个混合控制架构:模型之间用 single controller 统一编排和数据重分片,模型内部用 multi controller 执行高效分布式训练/推理/生成;再配合 3D HybridEngine 和自动设备映射,在 PPO、ReMax、Safe RLHF 等 RLHF 算法上比 DeepSpeed Chat、OpenR...
Parrot 的核心贡献是把 LLM 应用从一串孤立 completion requests 还原成带变量、依赖、性能目标和共享 prompt 结构的应用级数据流:开发者用 Semantic Variable 标注 prompt 中的输入/输出区域后,服务端可以做 DAG 分析、依赖请求连续执行、性能目标推导、动态共享前缀检测和应用感知调度,从而把 LLM serving 的优化对象从单请求延迟推进到端到端应用体验。
这篇论文把 linear attention 在 causal LM 中“理论复杂度低、实际 GPU 训练慢”的核心原因定位到 prefix cumsum / scan 路径,并用 Lightning Attention 把注意力拆成块内 left product 与块间 right product:块内保留并行矩阵乘,块间维护 $KV$ 累计状态,再用 tiling / IO aware kernel 提升硬件效率;随后作者为该算子...
FlashAttention 2 的核心贡献是把 FlashAttention v1 解决 HBM traffic 后剩下的性能瓶颈继续拆开:减少 expensive non matmul FLOPs,把 attention 计算沿 sequence dimension 分给更多 thread blocks 提高 SM occupancy,并把 warp 内 work partition 从 sliced K 调整为 sliced Q...
FlashAttention 的核心贡献是把 exact softmax attention 的瓶颈从 FLOPs 视角重新定位到 GPU memory hierarchy 和 HBM 读写上:它用 tiling 在 SRAM 中分块计算 attention,并用 online softmax 统计量与 backward recomputation 避免物化 $N\times N$ attention matrix,从而保持 exac...
这篇论文用 400 多个不同规模和 token 预算的 Transformer 训练 run 重新估计 compute optimal pretraining frontier,结论直接修正 Kaplan scaling laws:在固定训练 FLOPs 下,最优 dense LM 应该让模型参数量 $N$ 和训练 token 数 $D$ 近似等比例增长,即 $N {\mathrm{opt}}\propto C^{0.5}$、$D {...
这篇论文把语言模型训练从“单次大模型实验”推进到可拟合的经验规律:cross entropy loss 随模型参数量 $N$、训练数据量 $D$ 和训练计算量 $C$ 呈稳定 power law;在当时的实验范围内,模型 shape 和许多超参数影响较弱,更大的模型具有更高 sample efficiency;论文据此推出 compute efficient training 应优先扩大模型、减少训练步数,并在远未完全收敛时停止。现代...