papers.chlience.com

Chlience Paper Archive

面向训练、推理、架构、Agent、评测、安全与理论的论文阅读档案。每篇笔记保留来源、作者关系、证据边界、局限,以及它和其它论文的连接。

Reading Contract

每篇笔记都把论文主张、本地判断和后续讨论分开记录。

111 notes
独立 Markdown 档案
42 routes
主题入口
420 authors
作者档案
2026-08-06
最近构建

Research Mainlines

跨材料问题的长期分析入口。每条主线保留自己的检索窗口、分类框架和逐结论证据强度。

View all mainlines

Latest Reviewed Notes

置顶条目优先,其余按审阅时间列出最近完成本地审阅的论文和技术文章。

审阅

LatentMoE: Toward Optimal Accuracy per FLOP and Parameter in Mixture of Experts

LatentMoE 将路由专家移到低维潜空间,并把节省的权重读取与通信预算用于增加专家数和 Top k;准确率优先变体在相近参数的 95B Transformer 与 73B Mamba–Attention 设置中,全部已报下游指标均高于标准 MoE,但万亿参数服务优势仍是模拟结果。

Venmugil Elango, Nidhi Bhatia, Roger Waleffe, Rasoul Shafipour, Tomer Asida, Abhinav Khattar, Nave Assaf, Maximilian Golub, Joey Guman, Tiyasa Mitra, +6 more

审阅

Learning What Not to Forget: Long Horizon Agent Memory from a Few Kilobytes of Learning

LRE 用日志中的未来复用信号训练轻量逻辑回归,对历史单元做查询无关打分并按预算逐字保留;单随机种子 AppWorld 中以零压缩器调用得到 41.1% 任务目标完成率、接近全历史的 44.0%,LoCoMo 上也是最佳受预算策略,但 Hard 与 LongMemEval 结果显示它尚未跨域占优,2048 token 只约束较旧历史。

Nusrat Jahan Lia, Aritra Mazumder

审阅

Less Experts, Faster Decoding: Cost Aware Speculative Decoding for Mixture of Experts

EcoSpec 用轻量路由预测器估计草稿候选会新增的专家集合,并优先选择复用已有专家的验证路径;在八张 H200、Hugging Face Transformers、主要批量为一的研究原型中,三个大规模 MoE 的贪心解码平均加速从对应投机基线相对自回归的一点一零至一点二二倍提高到一点一五至一点三六倍,HBM 流量来自估算且批量为八时投机吞吐低于自回归。

Jincheng Xie, Runheng Liu, Heyan Huang, Yawen Ling, Hanbin Dai, Yu Zheng, Wen Hu

审阅

MoESD: Unveil Speculative Decoding's Potential for Accelerating Sparse MoE

在单步解码已使专家加载趋于饱和、模型仍受内存带宽限制的中等批量区间,用投机验证复用已加载专家;Qwen2 57B A14B 在两张 H800 上最高加速 2.29 倍,适用范围依赖路由均衡、MoE 前馈网络成本占比和具体硬件。

Zongle Huang, Lei Zhu (祝磊), Zongyuan Zhan, Ting Hu, Weikai Mao, Xianzhi Yu, Yongpan Liu (刘勇攀), Tianyu Zhang

审阅

Reinforcement Learning via Self Distillation

SDPO 在学生在线轨迹上用环境反馈条件化的 EMA 同模型重算下一词分布,将 Top K 分布差转成 logit 级信用;Qwen3 8B 在 LiveCodeBench v6 上达到 48.8%,高于强 GRPO 的 41.2%,但依赖模型回溯能力与反馈质量。

Jonas Hübotter, Frederike Lübeck, Lejs Behric, Anton Baumann, Marco Bagatella, Daniel Marta, Ido Hakimi, Idan Shenfeld, Thomas Kleine Buening, Carlos Guestrin, +1 more

审阅

Self Distilled Reasoner: On Policy Self Distillation for Large Language Models

OPSD 让学生先在只看题目时采样自身轨迹,再用固定初始模型在参考解答上下文中对相同前缀给出的完整词表分布和逐词表项裁剪前向 KL 更新学生,在 Qwen3 1.7B/4B/8B 的三项数学平均分上高于基础模型、SFT 与 GRPO,但总计算、统计方差和领域外泛化仍未对齐。

Siyan Zhao, Zhihui Xie (谢知晖), Mengchen Liu, Jing Huang, Guan Pang, Feiyu Chen, Aditya Grover

审阅

Kimi K3: Open Frontier Intelligence

Kimi K3 将三层 KDA 与一层全局注意力交错、跨块 Attention Residuals 和每个 token 激活 16 个路由专家的 Stable LatentMoE 组合为 2.78 万亿总参数、1042 亿激活参数、百万 token 上下文的原生多模态模型;报告的缩放律拟合把架构、数据与训练配方的合并收益估计为相对 Kimi K2 约 2.5 倍,尚未拆分单个组件贡献。

Kimi Team

Research Routes

主题入口用于快速进入同一问题域,数量来自当前归档。

View all topics

Training

13 routes

模型训练、后训练、优化信号与训练基础设施。

Inference

6 routes

在线推理、请求调度、缓存与 test-time compute。

Architecture

9 routes

模型结构、attention、MoE 与长上下文机制。

Agents

5 routes

Agent 程序、工具、记忆、协作与软件工程。

Evaluation

4 routes

验证器、过程监督、基准与能力边界分析。

Safety

2 routes

奖励攻击、对齐、监控与高风险行为。

Theory

3 routes

学习目标、复杂性与缩放规律的形式化结果。