2601.07372-conditional-memory-engram-scalable-lookup
Conditional Memory via Scalable Lookup: A New Axis of Sparsity for Large Language Models
Engram 把大模型稀疏性从 MoE (Mixture of Experts,混合专家,用条件计算扩大 total 参数并控制 active compute) 扩展到 conditional memory:用 hashed N-gram lookup 存静态局部模式,用 context-aware gate 决定是否把查到的记忆注入 hidden state;在 iso-parameter / iso-FLOPs 的 27B MoE 对照下,它把一部分 routed expert 参数换成 5.7B lookup memory,在知识、推理、代码、数学和 32K 长上下文任务上整体优于纯 MoE baseline,但证据仍主要来自 DeepSeek 内部训练管线、单 token budget 和预印本实验。
Source
- Title: Conditional Memory via Scalable Lookup: A New Axis of Sparsity for Large Language Models
- arXiv: https://arxiv.org/abs/2601.07372
- HTML: https://arxiv.org/html/2601.07372v1
- PDF: https://arxiv.org/pdf/2601.07372
- Code/Project: https://github.com/deepseek-ai/Engram
- OpenReview / Review page: 未发现可靠公开审稿页
- Authors: Xin Cheng, Wangding Zeng, Damai Dai, Qinyu Chen, Bingxuan Wang, Zhenda Xie, Kezhao Huang, Xingkai Yu, Zhewen Hao, Yukun Li, Han Zhang, Huishuai Zhang, Dongyan Zhao, Wenfeng Liang
- Submitted: 2026-01-12
- Current version read: v1, submitted 2026-01-12
- Subjects: Computation and Language (cs.CL), Artificial Intelligence (cs.AI)
作者与关系
- Xin Cheng: Peking University / DeepSeek-AI.
- Wangding Zeng: DeepSeek-AI.
- Damai Dai: DeepSeek-AI / Peking University;已在 Math-Shepherd、DeepSeekMoE、DeepSeek-V3 等条目中建档。
- Qinyu Chen, Bingxuan Wang, Zhenda Xie, Kezhao Huang, Xingkai Yu, Zhewen Hao, Yukun Li, Han Zhang: DeepSeek-AI。
- Huishuai Zhang, Dongyan Zhao: Peking University.
- Wenfeng Liang: DeepSeek-AI.
阅读目标与判断边界
这份记录关注:
- Engram 的条件记忆机制到底在做什么,它和 MoE 条件计算、传统 N-gram embedding、retrieval memory 的关系是什么。
- 论文的 scaling law / allocation 证据能否支持“conditional memory 是新的 sparse axis”。
- 这篇文章和 DeepSeek-V2/V3/V4、Muon、mHC、长上下文系统之间的工程关系。
判断边界:
- 这篇论文是 2026-01-12 arXiv v1,未发现公开 peer review;结论可信度主要来自作者报告的 controlled pretraining / ablation / system prototype。
- Engram-27B 的核心对照较强,因为和 MoE-27B 同 total params、同 activated params、同 token budget;Engram-40B 属于额外 memory scaling,不再 iso-parameter。
- 论文没有给出多 seed、完整数据 mixture、训练成本细分、真实 production serving 集群验证,也没有证明外部团队可以稳定复现同样收益。
论文脉络
1. 研究问题、背景和价值
MoE 已经成为 frontier LLM 扩大 total 参数的主流方式:每个 token 只激活少数专家,所以模型容量可以大幅增加,训练和推理 FLOPs 增幅相对可控。MoE 解决的是 conditional computation,即让不同 token 走不同 FFN expert。
这篇论文指出另一个问题:语言建模里有一大类局部、静态、重复的模式,例如固定实体名、惯用短语、公式化表达、局部 N-gram 依赖。Transformer 没有原生 lookup primitive,只能用多层 attention / FFN 逐步重建这些静态模式。这样会消耗 early layers 的计算深度,使后面的层可用于组合推理和全局上下文建模的余量变少。
Engram 的价值主张是:把静态局部模式交给可扩展 lookup memory,把动态组合推理继续交给 MoE / Transformer backbone。若这个拆分成立,模型容量扩展就多了一条轴:除 MoE 的 conditional computation 之外,还可以用 conditional memory 增加“几乎不增加 per-token FLOPs 的静态记忆容量”。
2. 已有解决方案与不足
传统 N-gram 模型和 N-gram embedding 能直接捕获局部模式,但表达能力弱,无法根据当前全局上下文动态决定是否使用某条记忆。非参数检索方法如 RETRO / REALM 把外部文本片段作为 memory,容量和可编辑性强,但检索、索引、跨文档召回和上下文融合会引入系统与训练复杂度。参数化 memory 方法如 PKM / PEER / UltraMem 在网络内部加入 sparse key-value store,但常依赖动态 query routing,和 MoE 一样需要处理路由、负载、近似搜索或额外计算。
Engram 选择一个更硬件友好的约束:key 来自 token suffix N-gram,lookup address 由 deterministic hash 决定。这样它牺牲了一部分动态检索自由度,换来 O(1) 地址计算、可预取、可 CPU offload、可缓存的系统性质。论文的核心赌注是:大量语言静态模式足够局部、足够重复,值得用这种确定性 memory 去承接。
3. 作者可能的思考路径
DeepSeek 线已经有三条上游经验:
- DeepSeek-V2 用 MLA (Multi-head Latent Attention,多头潜变量注意力) 压低 KV cache,用 DeepSeekMoE 扩大 total 参数并控制 active compute。
- DeepSeek-V3 进一步证明大 MoE 训练需要同时处理 expert balance、FP8、DualPipe、MTP 和训练经济性。
- DeepSeek-V4 与 mHC / Muon 线索显示,下一步瓶颈会落在 million-token context、优化器效率、残差流信息混合和 serving memory hierarchy 上。
在这个背景下,Engram 的直觉可以自然收敛为:如果 MoE 已经把“动态计算容量”做稀疏化,下一步可以把“静态记忆容量”也做稀疏化;如果 lookup 地址可由 token 本身提前确定,它就比 MoE routing 更容易做 prefetch 和 offload。
4. 核心假设或切入点
这篇论文的核心假设有三层:
- 语言中的局部静态模式足够重要,Transformer 当前用多层动态计算去重建它们,存在结构性浪费。
- 静态 lookup memory 和 MoE expert computation 是互补关系;在固定 total 参数与 active 参数下,把一部分 sparse capacity 从 routed experts 挪给 Engram 会优于纯 MoE。
- N-gram memory 的 deterministic addressing 会带来系统优势:索引可提前计算,CPU / host DRAM prefetch 可以和前面层计算重叠,total memory capacity 不必全部放在 GPU HBM 中。
5. 方法 / 系统 / 理论框架
Engram 是插入在 Transformer block 内的条件记忆模块。它不替代 token embedding,也不替代 LM head,而是在指定层把一个 retrieved memory vector 以 residual 形式加到 hidden state 上,然后继续执行标准 attention 和 MoE。
第一步是 sparse retrieval。对位置
第二步是 context-aware gating。N-gram lookup 本身只看局部 token,无法知道当前语境是否真的需要这条记忆。Engram 用当前 hidden state 作为 dynamic query,把 retrieved memory 投影成 key/value。query 和 key 经过 RMSNorm (Root Mean Square Layer Normalization,均方根归一化) 后做点积,再过 sigmoid 得到 gate
第三步是 multi-branch integration。论文默认使用 mHC (Manifold-Constrained Hyper-Connections,流形约束超连接) 这类 multi-branch backbone。Engram 在多个 branch 间共享 sparse embedding table 和 value projection,但为不同 branch 使用独立 key projection,使各 branch 可以有不同 gate 行为。作者还指出这些 key/value projection 可以 fused 成一个 dense FP8 matrix multiplication,以提高 GPU 利用率。
第四步是 system co-design。训练时,大 embedding tables 按 model parallelism 切到不同 GPU,通过 all-to-all gather active rows 并在 backward dispatch gradients。推理时,Engram address 只由输入 token 序列决定,所以系统能在执行 Engram 所在层前提前从 host DRAM 取 embedding,并用前面层的计算窗口隐藏 PCIe 传输。由于 N-gram frequency 服从 Zipf 分布,作者进一步提出 multi-level cache hierarchy:高频 memory rows 放 GPU HBM 或 host DRAM,长尾放 NVMe 等更大容量介质。
6. 结论链条
论文的结论链条是:局部静态模式可以用 deterministic lookup 表示;lookup memory 和 MoE expert computation 在 sparse capacity 上互补;在 5.7B / 9.9B proxy scale 上,固定
关键实验/定理
结果 1:MoE 与 Engram 的 sparse capacity allocation 呈 U-shaped law
- 设置:两个 proxy compute regimes,分别约
FLOPs / 5.7B total / 568M active,以及 FLOPs / 9.9B total / 993M active;固定 total params、activated params 和 training pipeline,只改变 routed experts 数量与 Engram embedding slots。 - Baseline:
的 pure MoE,其中 表示 inactive sparse parameter budget 中分给 MoE experts 的比例;OverEncoding 用于 infinite-memory scaling 对照。 - 指标:validation loss。
- 结果:两种 compute regimes 都出现 U-shaped curve;10B regime 中 validation loss 从
的 1.7248 降到 附近的 1.7109;最佳区间稳定在 ,相当于把约 20%--25% sparse capacity 分给 Engram。 - 解读:这支持“memory 不能替代 computation,但纯 computation 也不是最优”的互补判断。需要谨慎的是,law 只在作者选定的 sparsity ratio、模型族、数据和 training budget 上验证。
结果 2:Engram-27B 对 iso-parameter / iso-FLOPs MoE-27B 的主实验
- 设置:Dense-4B、MoE-27B、Engram-27B、Engram-40B 都训练 262B tokens;主干是 30-layer Transformer,hidden size 2560,MLA attention,mHC expansion rate 4,DeepSeek-V3 tokenizer,sequence length 4096,batch size 1280,50000 steps;active params 都是 3.8B。
- Baseline:Dense-4B 是 dense iso-active baseline;MoE-27B 是主 baseline,26.7B total、72 routed experts、2 shared experts、top-6 active;Engram-27B 把 routed experts 从 72 减到 55,并把释放参数分给 5.7B Engram memory,total params 仍为 26.7B;Engram-40B 增加到 18.5B Engram memory、39.5B total,用于额外 memory scaling。
- 指标:Pile loss、validation loss、MMLU、CMMLU、BBH、ARC-Challenge、DROP、HumanEval、GSM8K、MATH 等。
- 结果:Engram-27B 相比 MoE-27B,Pile loss 1.960 -> 1.950,validation loss 1.634 -> 1.622;MMLU 57.4 -> 60.4,CMMLU 57.9 -> 61.9,BBH 50.9 -> 55.9,ARC-Challenge 70.1 -> 73.8,DROP 55.7 -> 59.0,HumanEval 37.8 -> 40.8,GSM8K 58.4 -> 60.6,MATH 28.3 -> 30.7。
- 解读:这是论文最强证据,因为 total 参数、active 参数、token budget 和训练管线都对齐。收益不局限于知识题,reasoning / code / math 也提升,支持作者关于 early-layer static reconstruction 被卸载的解释。
结果 3:32K long-context extension
- 设置:继预训练后进行 32,768 context extension,使用 YaRN,训练 5,000 steps / 30B high-quality long-context tokens;对 MoE-27B 50k step、Engram-27B 41k / 46k / 50k checkpoints 使用相同长上下文扩展流程。
- Baseline:MoE-27B 50k;Engram-27B 46k 被选为 iso-pretraining-loss 对照,Engram-27B 50k 是 iso-pretraining-FLOPs 对照,Engram-27B 41k 是约 82% pretraining FLOPs 的 early-stop 对照。
- 指标:LongPPL 32K 的 book / paper / code / long-CoT perplexity;RULER 32K 的 Single/Multi-key/Multi-value/Multi-query NIAH、Variable Tracking、Common/Frequent Words Extraction、QA。
- 结果:在 iso-loss setting 下,Engram-27B 46k 相比 MoE-27B 50k,Multi-Query NIAH 84.2 -> 97.0,Variable Tracking 77.0 -> 87.2;在 iso-FLOPs setting 下,Engram-27B 50k 的 LongPPL 全部更低,MQ NIAH 仍为 97.0,VT 达到 89.0,FWE 达到 99.3。41k early-stop Engram 已能接近 baseline LongPPL,并在多项 RULER 任务上超过 baseline。
- 解读:长上下文表现同时受 attention 机制和 base model pretraining quality 影响。论文较好地用 iso-loss / iso-FLOPs 拆掉这个 confound;仍需更多长上下文任务和真实 agent workload 复验。
结果 4:mechanistic analysis 与结构消融
- 设置:LogitLens 用 intermediate hidden states 经过 final LM head 后与 final output distribution 计算 KL divergence;CKA (Centered Kernel Alignment,表征相似性度量) 在 Few-NERD named entities 上比较 Engram 和 MoE layer representations;结构消融使用 12-layer 3B MoE / 0.56B active backbone,训练 100B tokens,reference Engram memory 为 1.6B。
- Baseline:MoE baseline;结构消融包括 single-layer insertion sweep、去掉 multi-branch integration、去掉 tokenizer compression、去掉 context-aware gating、去掉 convolution、加入 4-grams 等。
- 指标:layer-wise LogitLens KL、CKA alignment、validation loss。
- 结果:Engram early layers 的 LogitLens KL 更低;CKA 显示 Engram 的浅层表示更接近 MoE 的更深层,例如 Engram layer 5 接近 MoE layer 12;结构消融中 reference Engram loss 1.768,MoE baseline 1.808,单层插入以 layer 2 最优,layer 2 + 6 双插入更好;multi-branch、tokenizer compression、context-aware gating 是最重要组件。
- 解读:这些证据支持“Engram 增加 effective depth”的机制解释,但 LogitLens/CKA 仍是相关性分析,不能单独证明 causal path。post-hoc suppress Engram 输出会造成 training-inference inconsistency,所以 sensitivity analysis 只能作为功能定位参考。
结果 5:100B table CPU offload 的 inference prototype
- 设置:nano-vLLM inference harness;H800;512 sequences;sequence length uniform(100, 1024);在 4B-Dense / 8B-Dense 的第二个 block 插入 100B-parameter Engram layer,embedding table 全部在 host DRAM,通过 PCIe prefetch,并和第一层计算重叠。
- Baseline:同 dense backbone without Engram;作者刻意不用 MoE baseline,以避免 expert parallel communication confound。
- 指标:end-to-end inference throughput tok/s。
- 结果:4B baseline 9031.62 tok/s,+100B Engram offload 为 8858.28 tok/s;8B baseline 6315.52 tok/s,+100B Engram offload 为 6140.02 tok/s,最大吞吐损失约 2.8%。
- 解读:确定性地址让 prefetch 成立,这一系统性质是 Engram 区别于动态 routing memory 的关键。局限在于 prototype workload 简化,未覆盖 MoE expert parallel、长上下文 KV pressure、batching 变化、cache hierarchy miss rate 和生产级 scheduler。
实验设置与 baseline 审计
- 模型与初始化:Dense-4B、MoE-27B、Engram-27B、Engram-40B;30 layers,hidden 2560,MLA,mHC expansion 4,DeepSeekMoE,loss-free load balancing;active params 3.8B;Engram layers
[2,15],N-gram[2,3],memory dim 1280,8 heads。 - 数据与任务:262B pretraining tokens;DeepSeek-V3 tokenizer;long-context extension 使用 30B high-quality long-context tokens;benchmark 覆盖 Pile、MMLU family、CMMLU、C-Eval、ARC、TriviaQA、BBH、DROP、HumanEval、GSM8K、MATH、LongPPL、RULER。
- RL / 训练配置:这篇论文不涉及 RL;pretraining 使用 Muon backbone optimizer,Engram embedding 使用 Adam,base LR 4e-4,step decay,weight decay 0.1;Engram embedding LR multiplier x5,weight decay 0。
- 系统配置:H800 inference prototype;训练阶段 embedding table sharding + all-to-all;推理阶段 host DRAM offload + asynchronous prefetch;未给完整训练 GPU 数、wall-clock、通信拓扑和 fault tolerance。
- 评测协议:多 benchmark 使用标准 few-shot / zero-shot 设置;long-context 使用 LongPPL 和 RULER 32K;推理 throughput 使用 512 sequences、100-1024 长度均匀分布。
- 统计报告:未见多 seed、误差线、显著性检验;Engram-40B under-training 判断来自 training loss gap trajectory。
- Baseline 强度:
- 是否 tuned:MoE baseline 与 Engram 使用同一训练 pipeline;但 Engram 本身的 placement、N-gram、gating、optimizer multiplier 已调过,baseline 是否有同等 architecture search 未完全公开。
- 是否 compute-matched:Engram-27B vs MoE-27B 是 iso-parameter / iso-FLOPs / iso-active / iso-token;Engram-40B 不是 iso-parameter。
- 是否 implementation-matched:主实验基本 implementation-matched;system prototype 刻意使用 dense baseline,不能代表 MoE serving 全量对照。
- 是否覆盖强替代方案:包含 Dense、MoE、OverEncoding;未覆盖 RETRO/REALM 类非参数检索、PKM/PEER/UltraMem 等强 memory architectures 的同管线复现。
- 是否存在弱化风险:MoE routed expert 数从 72 降到 55 后仍 active top-6,Engram 改变了模型结构和 optimizer 分组;若 MoE baseline 有更强 expert count / active expert / mHC 配置,结论边界可能变化。
- 结论边界:可以较强支持“在 DeepSeek 当前 MoE backbone 和 262B token 设置下,Engram-27B 优于同参数同 FLOPs MoE-27B”;暂不能直接推出“conditional memory 普遍优于其他 memory / retrieval 路线”。
证据链强度评估
强证据
- Engram-27B 与 MoE-27B 的 iso-parameter / iso-FLOPs 对照清楚,benchmark 覆盖较广。
- sparse capacity allocation 的 U-shaped curve 在两个 compute regimes 上稳定出现。
- long-context 部分专门做了 iso-loss 和 iso-FLOPs 对照,避免把 base quality 误读成架构收益。
- inference prototype 把 deterministic addressing 的系统优势具体量化到 throughput。
中等强度证据
- LogitLens / CKA 支持 effective depth 解释,但属于表征相关证据。
- gating visualization 说明模块确实对实体、短语和中文固定表达激活,但样本选择带有展示性。
- Engram-40B 显示 memory scaling 仍有收益,但 under-training 与非 iso-parameter 让结论更偏趋势判断。
需要谨慎的推论
- “Engram 是下一代 sparse model 必备 primitive”仍是方向判断,需要跨模型、跨数据、跨实现复验。
- CPU / host offload 的 2.8% penalty 来自简化 prototype,生产环境中 cache miss、PCIe / CXL topology、MoE communication 和 batching 可能改变结果。
- 将 factual knowledge collapse 解释为“Engram 是主要知识仓库”时要注意:抑制 Engram 输出引入了 training-inference inconsistency。
- 论文没有公开完整训练数据、训练成本细分、多 seed 和第三方复现,工程可迁移性仍待验证。
OpenReview / 审稿意见吸收
- Venue status: arXiv preprint,2026-01-12 v1;观察日期 2026-06-24。
- Public reviews: 未发现可靠匹配的 OpenReview / ARR / 会议公开审稿页。
- Ratings / confidence: 无公开 reviewer rating。
- Reviewer consensus: 无公开 reviewer consensus。
- Main criticisms: 无公开 reviewer comments;本地可信度校准主要来自实验设置和 baseline 审计。
- Author response: 无公开 rebuttal。
- 对可信度的影响: 不能把这篇论文写成已被会议审稿认可;可以把它作为 DeepSeek-AI 官方技术报告和开源 demo 支撑的 architecture / systems proposal。
本地讨论补充
1. 讨论收敛点
- 当前暂无用户后续讨论。
2. 修正后的理解
- 当前暂无。
3. 后续复验指标
- 在非 DeepSeek backbone 上复现实验:GQA/MQA/MLA、dense/MoE、single-stream/mHC 分别测试。
- 对比 PKM / PEER / UltraMem / retrieval-augmented approaches 的同 compute setting。
- 报告 table lookup 的 cache hit rate、PCIe/CXL bandwidth、prefetch failure、batching 对延迟的影响。
- 分离 factual memorization、local syntax、entity resolution、long-context retrieval 和 reasoning task 的收益来源。
主要启发
- MoE 之外还有一条 sparse scaling axis:把 inactive parameter budget 分给静态 memory,而每 token 只查少数 rows。
- “可预取”本身可以成为模型结构约束。Engram 的 deterministic addressing 让系统层能提前搬运 memory,这是动态 routing memory 很难直接获得的性质。
- 长上下文能力同时取决于 attention pattern 和 early-layer 表示负担。若 early layers 减少局部实体和短语重建的 capacity 消耗,attention 可能更容易服务全局依赖。
- 读 model report 时要把 iso-parameter、iso-FLOPs、iso-active、iso-loss、iso-token 分开记录;这篇文章在主对照上做得相对清楚。
局限
- 公开版本缺少多 seed、误差线、完整数据 mixture、训练预算和外部复现。
- 对强 memory / retrieval baselines 的同管线比较不足,尤其是可编辑非参数 memory、learned memory routing 和高阶 N-gram / byte-level memory。
- Engram 的收益可能依赖 DeepSeek tokenizer、MLA、mHC、DeepSeekMoE、Muon 和内部数据分布,迁移到其他架构需要实测。
- Deterministic N-gram hash 存在 collision、polysemy 和 adversarial pattern 风险;context-aware gate 可以缓解,但不能保证完全解决。
- System prototype 尚未覆盖 production MoE serving、long context agent workload、KV cache pressure、cache hierarchy 和多节点 offload。
跨论文关系
- 与已有论文的作者关系:Damai Dai 已在 Math-Shepherd / DeepSeekMoE / DeepSeek-V3 线索中建档;Wangding Zeng、Xingkai Yu、Wenfeng Liang 与 DeepSeek 系列存在强重叠。
- 与已有论文的主题关系:这篇论文补齐 DeepSeek efficient sparse foundation model 系谱中的 conditional memory 节点,位于 DeepSeek-V3 与 DeepSeek-V4 之间。
- 与已有论文的方法或系统关系:继承 DeepSeek-V2 的 MLA / DeepSeekMoE 效率路线,Muon 背景可连接 2606.04662;长上下文收益与 Dynamic Linear Attention、MiniMax-M1 和 DeepSeek-V4 构成长上下文架构对照。
- 跨论文关系定位:记录 DeepSeek Engram / Conditional Memory 节点,并连接 DeepSeek-V2/V3/V4、MoE expert parallelism、pretraining scaling、long-context architecture 和 memory hierarchy。
Reference Intake Brief
Target
- Intended target system: 新增 Engram / conditional memory 独立论文笔记。
- Existing related assets:
content/utility/papers-index.md;DeepSeek-V2、DeepSeek-V3、DeepSeek-V4、Muon theory。 - Proposed form: 新建独立 Markdown 文档,并更新
content/utility/papers-index.md。
Reusable Elements
- Conditional memory vs conditional computation 的 sparse scaling 语言。
- Hashed N-gram lookup + context-aware gating + deterministic prefetch 的模型/系统协同设计。
- iso-parameter / iso-FLOPs / iso-active / iso-loss 的实验审计框架。
Risks
- Copyright/over-copying: 只保留核心机制、表格数值和本地分析,不复制长段原文。
- Unsourced or unverifiable claims: 所有关键数值来自 arXiv v1 / TeX source / official GitHub;外部影响判断只作本地关系分析。
- Tone/brand mismatch: 避免把 DeepSeek 官方 claim 写成行业定论。
- Safety/compliance issues: 这是一篇模型架构与系统效率论文,无直接双用途操作细节。
- Overlap with existing assets: 与 DeepSeek-V2/V3/V4、Muon、长上下文系统强重叠,本条定位为 conditional memory 专门节点。
Skipped
| Material | Reason |
|---|---|
| 公开 reviewer comments | 未发现 OpenReview/ARR/会议公开审稿页,无法可靠匹配公开 review。 |
| 全量作者建档 | 多数作者缺少稳定个人 profile / X 交叉证据;本轮只复用 Damai Dai 既有档案,其余记录为 needs-follow-up。 |
| 第三方复现 | 官方仓库提供 demo 代码,未发现完整第三方复现主结果。 |
Recommendation
Decision: merge
Why: 这是 DeepSeek efficient sparse architecture 系谱中的关键方法节点,把 MoE 条件计算扩展到可 offload / prefetch 的条件记忆;即使结论仍需外部复验,也值得纳入本地模型架构、长上下文和系统效率图谱。