papers.chlience.com

Chlience Paper Archive

面向训练、推理、架构、Agent、评测、安全与理论的论文阅读档案。每篇笔记保留来源、作者关系、证据边界、局限,以及它和其它论文的连接。

Reading Contract

每篇笔记都把论文主张、本地判断和后续讨论分开记录。

102 notes
独立 Markdown 档案
44 routes
主题入口
360 authors
作者档案
2026-07-16
最近构建

Latest Archived Notes

最近首次归档的论文和技术文章,后续补充不会改变这里的顺序。

View all
Jun 23, 2026

国产前沿模型技术报告时间线总览

国产前沿模型技术报告在 2024 2026 年的主线,可以读成一次连续的工程迁移:先用 MoE、MLA、长上下文和低精度训练把 frontier base model 做到可训练、可服务;随后用 verifiable reward、long CoT、GRPO/OMD/CISPO 等方法把推理能力从模型先验里释放出来;再把 rollout、工具环境、checkpoint、sparse attention、MTP 和 anti hack ...

Jul 16, 2026

Self Compacting Language Model Agents

SelfCompact 把长轨迹摘要做成同一模型可执行的 hard reset 操作,再用任务专用、要求引用当前轨迹证据的 rubric 决定何时压缩;它在七个开放权重模型的数学与搜索实验中优于无压缩,并在大多数质量对照上优于固定时机摘要。最可靠的增量是把 timing 判断拆成可审计的状态 predicate,消融支持含 rubric 的完整 policy 优于自由摘要工具;search 附录声明的 40k token gate、3...

Tianjian Li, Jingyu Zhang (张景昱), William Jurayj, Xi Wang, Chuanyang Jin, Mehrdad Farajtabar, Eric Nalisnick, Daniel Khashabi

Jul 16, 2026

What Preferences Can—and Cannot—Predict in Multi Agent Online Learning

论文把有限博弈的序数偏好图与连续时间 FTRL 的集合稳定性联系起来:偏好闭合给出稳定结果的必要约束;对 subgame,club 在一般 FTRL 下足以保证 span 渐近稳定、在无 ties 时形成等价判据,并在 strategy flow 下直接形成 attractor 等价判据;对一般纯策略集合,三人反例表明相同的偏好方向仍可能产生不稳定 span,作者因而引入依赖收益差幅度的 leaklessness,为一般 span 恢...

Omar Abbadi, Rida Laraki, Panayotis Mertikopoulos

Jul 16, 2026

A Survey of Reinforcement Learning for Large Language Models under Data Scarcity: Challenges and Solutions

这篇 ACL 2026 综述把 LLM 强化学习的数据约束拆成高成本外部监督与有限内部生成经验,并用 data centric、training centric、framework centric 三层九类 taxonomy 组织 125 条文献记录;它提供了便于导航的设计空间,系统性证据仍受检索协议缺失、分类轴混合、预算口径不统一和少数方法描述失真的限制。

Zhiyin Yu, Yuchen Mou, Juncheng Yan, Junyu Luo, Chunchun Chen, Xing Wei, Yunhui Liu, Hongru Sun, Yuxing Zhang, Jun Xu, +10 more

Jul 16, 2026

MLA 在张量并行下的缓存复制:从压缩收益到可分片 Latent

MLA 把每个 token 的 K/V 压成共享 latent 与独立 RoPE 分支,常见 head TP absorbed decode 会让每个 rank 保存同一请求的完整 latent cache,使其相对展开 K/V 的每卡压缩倍数按 $1/T$ 衰减;生产系统可通过 DP Attention 改变请求所有权、DCP/CP 沿序列分片、P/D 拆分阶段、量化或分层缓存降低驻留字节,TPLA、GLA 与 MLRA 则进一步处...

Jul 14, 2026

推理侧 Prefill Context Parallelism:为何有效,以及 CP / SP / UP 的边界

Prefill CP 将单条长请求的 query token 沿 context 维分到多个 rank,在每个 rank 保持全局 KV 或全局 attention state 可见性,并用因果负载均衡、通信重叠和并行组解耦把 dense attention 或 DSA indexer 的高增长计算并行化;这套数学分解可覆盖 MHA、GQA、MLA 与 DSA,生产级扩展仍取决于 KV 所有权、attention backend、跨节...

Jul 14, 2026

Leyline: KV Cache Directives for Agentic Inference

Leyline 在 agent policy 与 KV Cache 之间增加语义编辑通道:policy 用 (span, replacement, mode) directive 声明需要修改的历史范围和语义保证,serving 层保留未修改前缀、重算 replacement,并用 RoPE $\delta$ rotation 重标 MLA 后缀 KV 的位置,从而在 AMORTIZE 模式下减少上下文编辑后的重复 prefill,在...

Bole Ma, Jan Eitzinger, Harald Köstler

Research Routes

主题入口用于快速进入同一问题域,数量来自当前归档。

View all topics

Training

14 routes

模型训练、后训练、优化信号与训练基础设施。

Inference

7 routes

在线推理、请求调度、缓存与 test-time compute。

Architecture

9 routes

模型结构、attention、MoE 与长上下文机制。

Agents

5 routes

Agent 程序、工具、记忆、协作与软件工程。

Evaluation

4 routes

验证器、过程监督、基准与能力边界分析。

Safety

2 routes

奖励攻击、对齐、监控与高风险行为。

Theory

3 routes

学习目标、复杂性与缩放规律的形式化结果。