国产前沿模型技术报告时间线总览
国产前沿模型技术报告在 2024 2026 年的主线,可以读成一次连续的工程迁移:先用 MoE、MLA、长上下文和低精度训练把 frontier base model 做到可训练、可服务;随后用 verifiable reward、long CoT、GRPO/OMD/CISPO 等方法把推理能力从模型先验里释放出来;再把 rollout、工具环境、checkpoint、sparse attention、MTP 和 anti hack ...
papers.chlience.com
面向训练、推理、架构、Agent、评测、安全与理论的论文阅读档案。每篇笔记保留来源、作者关系、证据边界、局限,以及它和其它论文的连接。
每篇笔记都把论文主张、本地判断和后续讨论分开记录。
最近首次归档的论文和技术文章,后续补充不会改变这里的顺序。
国产前沿模型技术报告在 2024 2026 年的主线,可以读成一次连续的工程迁移:先用 MoE、MLA、长上下文和低精度训练把 frontier base model 做到可训练、可服务;随后用 verifiable reward、long CoT、GRPO/OMD/CISPO 等方法把推理能力从模型先验里释放出来;再把 rollout、工具环境、checkpoint、sparse attention、MTP 和 anti hack ...
SelfCompact 把长轨迹摘要做成同一模型可执行的 hard reset 操作,再用任务专用、要求引用当前轨迹证据的 rubric 决定何时压缩;它在七个开放权重模型的数学与搜索实验中优于无压缩,并在大多数质量对照上优于固定时机摘要。最可靠的增量是把 timing 判断拆成可审计的状态 predicate,消融支持含 rubric 的完整 policy 优于自由摘要工具;search 附录声明的 40k token gate、3...
论文把有限博弈的序数偏好图与连续时间 FTRL 的集合稳定性联系起来:偏好闭合给出稳定结果的必要约束;对 subgame,club 在一般 FTRL 下足以保证 span 渐近稳定、在无 ties 时形成等价判据,并在 strategy flow 下直接形成 attractor 等价判据;对一般纯策略集合,三人反例表明相同的偏好方向仍可能产生不稳定 span,作者因而引入依赖收益差幅度的 leaklessness,为一般 span 恢...
这篇 ACL 2026 综述把 LLM 强化学习的数据约束拆成高成本外部监督与有限内部生成经验,并用 data centric、training centric、framework centric 三层九类 taxonomy 组织 125 条文献记录;它提供了便于导航的设计空间,系统性证据仍受检索协议缺失、分类轴混合、预算口径不统一和少数方法描述失真的限制。
SGLang DPA 在同一组全局 TP workers 内,把 Attention ranks 划成多个按请求拥有 KV Cache 的 DP groups,再通过 gather / dispatch / combine / reduce scatter 把 DP local Attention 与全局 TP 或 EP MoE 连接起来;对于缓存受限的高并发 MLA decode,它可把单条请求的 cache 副本数从 $T$ 降到...
MLA 把每个 token 的 K/V 压成共享 latent 与独立 RoPE 分支,常见 head TP absorbed decode 会让每个 rank 保存同一请求的完整 latent cache,使其相对展开 K/V 的每卡压缩倍数按 $1/T$ 衰减;生产系统可通过 DP Attention 改变请求所有权、DCP/CP 沿序列分片、P/D 拆分阶段、量化或分层缓存降低驻留字节,TPLA、GLA 与 MLRA 则进一步处...
Prefill CP 将单条长请求的 query token 沿 context 维分到多个 rank,在每个 rank 保持全局 KV 或全局 attention state 可见性,并用因果负载均衡、通信重叠和并行组解耦把 dense attention 或 DSA indexer 的高增长计算并行化;这套数学分解可覆盖 MHA、GQA、MLA 与 DSA,生产级扩展仍取决于 KV 所有权、attention backend、跨节...
Leyline 在 agent policy 与 KV Cache 之间增加语义编辑通道:policy 用 (span, replacement, mode) directive 声明需要修改的历史范围和语义保证,serving 层保留未修改前缀、重算 replacement,并用 RoPE $\delta$ rotation 重标 MLA 后缀 KV 的位置,从而在 AMORTIZE 模式下减少上下文编辑后的重复 prefill,在...
主题入口用于快速进入同一问题域,数量来自当前归档。