2601.07372-conditional-memory-engram-scalable-lookup

Conditional Memory via Scalable Lookup: A New Axis of Sparsity for Large Language Models

Engram 把大模型稀疏性从 MoE (Mixture of Experts,混合专家,用条件计算扩大 total 参数并控制 active compute) 扩展到 conditional memory:用 hashed N-gram lookup 存静态局部模式,用 context-aware gate 决定是否把查到的记忆注入 hidden state;在 iso-parameter / iso-FLOPs 的 27B MoE 对照下,它把一部分 routed expert 参数换成 5.7B lookup memory,在知识、推理、代码、数学和 32K 长上下文任务上整体优于纯 MoE baseline,但证据仍主要来自 DeepSeek 内部训练管线、单 token budget 和预印本实验。

Authors Xin Cheng, Wangding Zeng, Damai Dai, Qinyu Chen, Bingxuan Wang, Zhenda Xie (解振达), Kezhao Huang, Xingkai Yu (俞星凯), Zhewen Hao, Yukun Li, Han Zhang, Huishuai Zhang, Dongyan Zhao (赵东岩), Wenfeng Liang (梁文锋)

已审阅 Archived 2026-06-24 09:26 Updated 2026-06-24 17:18 Reviewed 2026-07-18 17:42 Source

Source

作者与关系

阅读目标与判断边界

这份记录关注:

  1. Engram 的条件记忆机制到底在做什么,它和 MoE 条件计算、传统 N-gram embedding、retrieval memory 的关系是什么。
  2. 论文的 scaling law / allocation 证据能否支持“conditional memory 是新的 sparse axis”。
  3. 这篇文章和 DeepSeek-V2/V3/V4、Muon、mHC、长上下文系统之间的工程关系。

判断边界:

  • 这篇论文是 2026-01-12 arXiv v1,未发现公开 peer review;结论可信度主要来自作者报告的 controlled pretraining / ablation / system prototype。
  • Engram-27B 的核心对照较强,因为和 MoE-27B 同 total params、同 activated params、同 token budget;Engram-40B 属于额外 memory scaling,不再 iso-parameter。
  • 论文没有给出多 seed、完整数据 mixture、训练成本细分、真实 production serving 集群验证,也没有证明外部团队可以稳定复现同样收益。

论文脉络

1. 研究问题、背景和价值

MoE 已经成为 frontier LLM 扩大 total 参数的主流方式:每个 token 只激活少数专家,所以模型容量可以大幅增加,训练和推理 FLOPs 增幅相对可控。MoE 解决的是 conditional computation,即让不同 token 走不同 FFN expert。

这篇论文指出另一个问题:语言建模里有一大类局部、静态、重复的模式,例如固定实体名、惯用短语、公式化表达、局部 N-gram 依赖。Transformer 没有原生 lookup primitive,只能用多层 attention / FFN 逐步重建这些静态模式。这样会消耗 early layers 的计算深度,使后面的层可用于组合推理和全局上下文建模的余量变少。

Engram 的价值主张是:把静态局部模式交给可扩展 lookup memory,把动态组合推理继续交给 MoE / Transformer backbone。若这个拆分成立,模型容量扩展就多了一条轴:除 MoE 的 conditional computation 之外,还可以用 conditional memory 增加“几乎不增加 per-token FLOPs 的静态记忆容量”。

2. 已有解决方案与不足

传统 N-gram 模型和 N-gram embedding 能直接捕获局部模式,但表达能力弱,无法根据当前全局上下文动态决定是否使用某条记忆。非参数检索方法如 RETRO / REALM 把外部文本片段作为 memory,容量和可编辑性强,但检索、索引、跨文档召回和上下文融合会引入系统与训练复杂度。参数化 memory 方法如 PKM / PEER / UltraMem 在网络内部加入 sparse key-value store,但常依赖动态 query routing,和 MoE 一样需要处理路由、负载、近似搜索或额外计算。

Engram 选择一个更硬件友好的约束:key 来自 token suffix N-gram,lookup address 由 deterministic hash 决定。这样它牺牲了一部分动态检索自由度,换来 O(1) 地址计算、可预取、可 CPU offload、可缓存的系统性质。论文的核心赌注是:大量语言静态模式足够局部、足够重复,值得用这种确定性 memory 去承接。

3. 作者可能的思考路径

DeepSeek 线已经有三条上游经验:

  1. DeepSeek-V2 用 MLA (Multi-head Latent Attention,多头潜变量注意力) 压低 KV cache,用 DeepSeekMoE 扩大 total 参数并控制 active compute。
  2. DeepSeek-V3 进一步证明大 MoE 训练需要同时处理 expert balance、FP8、DualPipe、MTP 和训练经济性。
  3. DeepSeek-V4 与 mHC / Muon 线索显示,下一步瓶颈会落在 million-token context、优化器效率、残差流信息混合和 serving memory hierarchy 上。

在这个背景下,Engram 的直觉可以自然收敛为:如果 MoE 已经把“动态计算容量”做稀疏化,下一步可以把“静态记忆容量”也做稀疏化;如果 lookup 地址可由 token 本身提前确定,它就比 MoE routing 更容易做 prefetch 和 offload。

4. 核心假设或切入点

这篇论文的核心假设有三层:

  1. 语言中的局部静态模式足够重要,Transformer 当前用多层动态计算去重建它们,存在结构性浪费。
  2. 静态 lookup memory 和 MoE expert computation 是互补关系;在固定 total 参数与 active 参数下,把一部分 sparse capacity 从 routed experts 挪给 Engram 会优于纯 MoE。
  3. N-gram memory 的 deterministic addressing 会带来系统优势:索引可提前计算,CPU / host DRAM prefetch 可以和前面层计算重叠,total memory capacity 不必全部放在 GPU HBM 中。

5. 方法 / 系统 / 理论框架

Engram 是插入在 Transformer block 内的条件记忆模块。它不替代 token embedding,也不替代 LM head,而是在指定层把一个 retrieved memory vector 以 residual 形式加到 hidden state 上,然后继续执行标准 attention 和 MoE。

第一步是 sparse retrieval。对位置 tt,先把原始 token ID 经过 tokenizer compression 映射到 canonical ID。这个映射使用 NFKC normalization、lowercasing 等规则,把语义上相近但 tokenizer ID 不同的符号合并;论文报告 128K tokenizer 的 effective vocabulary 大约减少 23%。随后取 suffix N-gram,例如 2-gram 和 3-gram,用 multiplicative-XOR hash 映射到 embedding table 的行。为降低 hash collision,Engram 对每个 N-gram order 使用多个 hash heads,并把这些 heads 的 embedding 拼接成 memory vector。

第二步是 context-aware gating。N-gram lookup 本身只看局部 token,无法知道当前语境是否真的需要这条记忆。Engram 用当前 hidden state 作为 dynamic query,把 retrieved memory 投影成 key/value。query 和 key 经过 RMSNorm (Root Mean Square Layer Normalization,均方根归一化) 后做点积,再过 sigmoid 得到 gate αt\alpha_t。若当前上下文和 retrieved memory 对齐,gate 变大;若存在 polysemy 或 hash collision,gate 可以压低。随后 memory value 经过 gate、depthwise causal convolution 和 residual connection 注入 backbone。

第三步是 multi-branch integration。论文默认使用 mHC (Manifold-Constrained Hyper-Connections,流形约束超连接) 这类 multi-branch backbone。Engram 在多个 branch 间共享 sparse embedding table 和 value projection,但为不同 branch 使用独立 key projection,使各 branch 可以有不同 gate 行为。作者还指出这些 key/value projection 可以 fused 成一个 dense FP8 matrix multiplication,以提高 GPU 利用率。

第四步是 system co-design。训练时,大 embedding tables 按 model parallelism 切到不同 GPU,通过 all-to-all gather active rows 并在 backward dispatch gradients。推理时,Engram address 只由输入 token 序列决定,所以系统能在执行 Engram 所在层前提前从 host DRAM 取 embedding,并用前面层的计算窗口隐藏 PCIe 传输。由于 N-gram frequency 服从 Zipf 分布,作者进一步提出 multi-level cache hierarchy:高频 memory rows 放 GPU HBM 或 host DRAM,长尾放 NVMe 等更大容量介质。

6. 结论链条

论文的结论链条是:局部静态模式可以用 deterministic lookup 表示;lookup memory 和 MoE expert computation 在 sparse capacity 上互补;在 5.7B / 9.9B proxy scale 上,固定 PtotP_{\mathrm{tot}}PactP_{\mathrm{act}} 后,validation loss 随 MoE allocation ratio 呈 U-shaped curve;按这个比例扩展到 Engram-27B 后,模型在 iso-parameter / iso-FLOPs MoE-27B baseline 上取得更低 loss 和更高 benchmark;mechanistic analysis 显示 Engram early layers 更快接近 final prediction,且 CKA 上对应 MoE baseline 的更深层;长上下文实验说明 attention capacity 被释放后,全局检索任务也受益;system prototype 显示 100B Engram table offload 到 host memory 只带来小吞吐损失。

关键实验/定理

结果 1:MoE 与 Engram 的 sparse capacity allocation 呈 U-shaped law

  • 设置:两个 proxy compute regimes,分别约 2×10202\times 10^{20} FLOPs / 5.7B total / 568M active,以及 6×10206\times 10^{20} FLOPs / 9.9B total / 993M active;固定 total params、activated params 和 training pipeline,只改变 routed experts 数量与 Engram embedding slots。
  • Baseline:ρ=100%\rho=100\% 的 pure MoE,其中 ρ\rho 表示 inactive sparse parameter budget 中分给 MoE experts 的比例;OverEncoding 用于 infinite-memory scaling 对照。
  • 指标:validation loss。
  • 结果:两种 compute regimes 都出现 U-shaped curve;10B regime 中 validation loss 从 ρ=100%\rho=100\% 的 1.7248 降到 ρ80%\rho\approx80\% 附近的 1.7109;最佳区间稳定在 ρ75%80%\rho\approx75\%\text{--}80\%,相当于把约 20%--25% sparse capacity 分给 Engram。
  • 解读:这支持“memory 不能替代 computation,但纯 computation 也不是最优”的互补判断。需要谨慎的是,law 只在作者选定的 sparsity ratio、模型族、数据和 training budget 上验证。

结果 2:Engram-27B 对 iso-parameter / iso-FLOPs MoE-27B 的主实验

  • 设置:Dense-4B、MoE-27B、Engram-27B、Engram-40B 都训练 262B tokens;主干是 30-layer Transformer,hidden size 2560,MLA attention,mHC expansion rate 4,DeepSeek-V3 tokenizer,sequence length 4096,batch size 1280,50000 steps;active params 都是 3.8B。
  • Baseline:Dense-4B 是 dense iso-active baseline;MoE-27B 是主 baseline,26.7B total、72 routed experts、2 shared experts、top-6 active;Engram-27B 把 routed experts 从 72 减到 55,并把释放参数分给 5.7B Engram memory,total params 仍为 26.7B;Engram-40B 增加到 18.5B Engram memory、39.5B total,用于额外 memory scaling。
  • 指标:Pile loss、validation loss、MMLU、CMMLU、BBH、ARC-Challenge、DROP、HumanEval、GSM8K、MATH 等。
  • 结果:Engram-27B 相比 MoE-27B,Pile loss 1.960 -> 1.950,validation loss 1.634 -> 1.622;MMLU 57.4 -> 60.4,CMMLU 57.9 -> 61.9,BBH 50.9 -> 55.9,ARC-Challenge 70.1 -> 73.8,DROP 55.7 -> 59.0,HumanEval 37.8 -> 40.8,GSM8K 58.4 -> 60.6,MATH 28.3 -> 30.7。
  • 解读:这是论文最强证据,因为 total 参数、active 参数、token budget 和训练管线都对齐。收益不局限于知识题,reasoning / code / math 也提升,支持作者关于 early-layer static reconstruction 被卸载的解释。

结果 3:32K long-context extension

  • 设置:继预训练后进行 32,768 context extension,使用 YaRN,训练 5,000 steps / 30B high-quality long-context tokens;对 MoE-27B 50k step、Engram-27B 41k / 46k / 50k checkpoints 使用相同长上下文扩展流程。
  • Baseline:MoE-27B 50k;Engram-27B 46k 被选为 iso-pretraining-loss 对照,Engram-27B 50k 是 iso-pretraining-FLOPs 对照,Engram-27B 41k 是约 82% pretraining FLOPs 的 early-stop 对照。
  • 指标:LongPPL 32K 的 book / paper / code / long-CoT perplexity;RULER 32K 的 Single/Multi-key/Multi-value/Multi-query NIAH、Variable Tracking、Common/Frequent Words Extraction、QA。
  • 结果:在 iso-loss setting 下,Engram-27B 46k 相比 MoE-27B 50k,Multi-Query NIAH 84.2 -> 97.0,Variable Tracking 77.0 -> 87.2;在 iso-FLOPs setting 下,Engram-27B 50k 的 LongPPL 全部更低,MQ NIAH 仍为 97.0,VT 达到 89.0,FWE 达到 99.3。41k early-stop Engram 已能接近 baseline LongPPL,并在多项 RULER 任务上超过 baseline。
  • 解读:长上下文表现同时受 attention 机制和 base model pretraining quality 影响。论文较好地用 iso-loss / iso-FLOPs 拆掉这个 confound;仍需更多长上下文任务和真实 agent workload 复验。

结果 4:mechanistic analysis 与结构消融

  • 设置:LogitLens 用 intermediate hidden states 经过 final LM head 后与 final output distribution 计算 KL divergence;CKA (Centered Kernel Alignment,表征相似性度量) 在 Few-NERD named entities 上比较 Engram 和 MoE layer representations;结构消融使用 12-layer 3B MoE / 0.56B active backbone,训练 100B tokens,reference Engram memory 为 1.6B。
  • Baseline:MoE baseline;结构消融包括 single-layer insertion sweep、去掉 multi-branch integration、去掉 tokenizer compression、去掉 context-aware gating、去掉 convolution、加入 4-grams 等。
  • 指标:layer-wise LogitLens KL、CKA alignment、validation loss。
  • 结果:Engram early layers 的 LogitLens KL 更低;CKA 显示 Engram 的浅层表示更接近 MoE 的更深层,例如 Engram layer 5 接近 MoE layer 12;结构消融中 reference Engram loss 1.768,MoE baseline 1.808,单层插入以 layer 2 最优,layer 2 + 6 双插入更好;multi-branch、tokenizer compression、context-aware gating 是最重要组件。
  • 解读:这些证据支持“Engram 增加 effective depth”的机制解释,但 LogitLens/CKA 仍是相关性分析,不能单独证明 causal path。post-hoc suppress Engram 输出会造成 training-inference inconsistency,所以 sensitivity analysis 只能作为功能定位参考。

结果 5:100B table CPU offload 的 inference prototype

  • 设置:nano-vLLM inference harness;H800;512 sequences;sequence length uniform(100, 1024);在 4B-Dense / 8B-Dense 的第二个 block 插入 100B-parameter Engram layer,embedding table 全部在 host DRAM,通过 PCIe prefetch,并和第一层计算重叠。
  • Baseline:同 dense backbone without Engram;作者刻意不用 MoE baseline,以避免 expert parallel communication confound。
  • 指标:end-to-end inference throughput tok/s。
  • 结果:4B baseline 9031.62 tok/s,+100B Engram offload 为 8858.28 tok/s;8B baseline 6315.52 tok/s,+100B Engram offload 为 6140.02 tok/s,最大吞吐损失约 2.8%。
  • 解读:确定性地址让 prefetch 成立,这一系统性质是 Engram 区别于动态 routing memory 的关键。局限在于 prototype workload 简化,未覆盖 MoE expert parallel、长上下文 KV pressure、batching 变化、cache hierarchy miss rate 和生产级 scheduler。

实验设置与 baseline 审计

  • 模型与初始化:Dense-4B、MoE-27B、Engram-27B、Engram-40B;30 layers,hidden 2560,MLA,mHC expansion 4,DeepSeekMoE,loss-free load balancing;active params 3.8B;Engram layers [2,15],N-gram [2,3],memory dim 1280,8 heads。
  • 数据与任务:262B pretraining tokens;DeepSeek-V3 tokenizer;long-context extension 使用 30B high-quality long-context tokens;benchmark 覆盖 Pile、MMLU family、CMMLU、C-Eval、ARC、TriviaQA、BBH、DROP、HumanEval、GSM8K、MATH、LongPPL、RULER。
  • RL / 训练配置:这篇论文不涉及 RL;pretraining 使用 Muon backbone optimizer,Engram embedding 使用 Adam,base LR 4e-4,step decay,weight decay 0.1;Engram embedding LR multiplier x5,weight decay 0。
  • 系统配置:H800 inference prototype;训练阶段 embedding table sharding + all-to-all;推理阶段 host DRAM offload + asynchronous prefetch;未给完整训练 GPU 数、wall-clock、通信拓扑和 fault tolerance。
  • 评测协议:多 benchmark 使用标准 few-shot / zero-shot 设置;long-context 使用 LongPPL 和 RULER 32K;推理 throughput 使用 512 sequences、100-1024 长度均匀分布。
  • 统计报告:未见多 seed、误差线、显著性检验;Engram-40B under-training 判断来自 training loss gap trajectory。
  • Baseline 强度:
    • 是否 tuned:MoE baseline 与 Engram 使用同一训练 pipeline;但 Engram 本身的 placement、N-gram、gating、optimizer multiplier 已调过,baseline 是否有同等 architecture search 未完全公开。
    • 是否 compute-matched:Engram-27B vs MoE-27B 是 iso-parameter / iso-FLOPs / iso-active / iso-token;Engram-40B 不是 iso-parameter。
    • 是否 implementation-matched:主实验基本 implementation-matched;system prototype 刻意使用 dense baseline,不能代表 MoE serving 全量对照。
    • 是否覆盖强替代方案:包含 Dense、MoE、OverEncoding;未覆盖 RETRO/REALM 类非参数检索、PKM/PEER/UltraMem 等强 memory architectures 的同管线复现。
    • 是否存在弱化风险:MoE routed expert 数从 72 降到 55 后仍 active top-6,Engram 改变了模型结构和 optimizer 分组;若 MoE baseline 有更强 expert count / active expert / mHC 配置,结论边界可能变化。
    • 结论边界:可以较强支持“在 DeepSeek 当前 MoE backbone 和 262B token 设置下,Engram-27B 优于同参数同 FLOPs MoE-27B”;暂不能直接推出“conditional memory 普遍优于其他 memory / retrieval 路线”。

证据链强度评估

强证据

  • Engram-27B 与 MoE-27B 的 iso-parameter / iso-FLOPs 对照清楚,benchmark 覆盖较广。
  • sparse capacity allocation 的 U-shaped curve 在两个 compute regimes 上稳定出现。
  • long-context 部分专门做了 iso-loss 和 iso-FLOPs 对照,避免把 base quality 误读成架构收益。
  • inference prototype 把 deterministic addressing 的系统优势具体量化到 throughput。

中等强度证据

  • LogitLens / CKA 支持 effective depth 解释,但属于表征相关证据。
  • gating visualization 说明模块确实对实体、短语和中文固定表达激活,但样本选择带有展示性。
  • Engram-40B 显示 memory scaling 仍有收益,但 under-training 与非 iso-parameter 让结论更偏趋势判断。

需要谨慎的推论

  • “Engram 是下一代 sparse model 必备 primitive”仍是方向判断,需要跨模型、跨数据、跨实现复验。
  • CPU / host offload 的 2.8% penalty 来自简化 prototype,生产环境中 cache miss、PCIe / CXL topology、MoE communication 和 batching 可能改变结果。
  • 将 factual knowledge collapse 解释为“Engram 是主要知识仓库”时要注意:抑制 Engram 输出引入了 training-inference inconsistency。
  • 论文没有公开完整训练数据、训练成本细分、多 seed 和第三方复现,工程可迁移性仍待验证。

OpenReview / 审稿意见吸收

  • Venue status: arXiv preprint,2026-01-12 v1;观察日期 2026-06-24。
  • Public reviews: 未发现可靠匹配的 OpenReview / ARR / 会议公开审稿页。
  • Ratings / confidence: 无公开 reviewer rating。
  • Reviewer consensus: 无公开 reviewer consensus。
  • Main criticisms: 无公开 reviewer comments;本地可信度校准主要来自实验设置和 baseline 审计。
  • Author response: 无公开 rebuttal。
  • 对可信度的影响: 不能把这篇论文写成已被会议审稿认可;可以把它作为 DeepSeek-AI 官方技术报告和开源 demo 支撑的 architecture / systems proposal。

本地讨论补充

1. 讨论收敛点

  • 当前暂无用户后续讨论。

2. 修正后的理解

  • 当前暂无。

3. 后续复验指标

  • 在非 DeepSeek backbone 上复现实验:GQA/MQA/MLA、dense/MoE、single-stream/mHC 分别测试。
  • 对比 PKM / PEER / UltraMem / retrieval-augmented approaches 的同 compute setting。
  • 报告 table lookup 的 cache hit rate、PCIe/CXL bandwidth、prefetch failure、batching 对延迟的影响。
  • 分离 factual memorization、local syntax、entity resolution、long-context retrieval 和 reasoning task 的收益来源。

主要启发

  • MoE 之外还有一条 sparse scaling axis:把 inactive parameter budget 分给静态 memory,而每 token 只查少数 rows。
  • “可预取”本身可以成为模型结构约束。Engram 的 deterministic addressing 让系统层能提前搬运 memory,这是动态 routing memory 很难直接获得的性质。
  • 长上下文能力同时取决于 attention pattern 和 early-layer 表示负担。若 early layers 减少局部实体和短语重建的 capacity 消耗,attention 可能更容易服务全局依赖。
  • 读 model report 时要把 iso-parameter、iso-FLOPs、iso-active、iso-loss、iso-token 分开记录;这篇文章在主对照上做得相对清楚。

局限

  1. 公开版本缺少多 seed、误差线、完整数据 mixture、训练预算和外部复现。
  2. 对强 memory / retrieval baselines 的同管线比较不足,尤其是可编辑非参数 memory、learned memory routing 和高阶 N-gram / byte-level memory。
  3. Engram 的收益可能依赖 DeepSeek tokenizer、MLA、mHC、DeepSeekMoE、Muon 和内部数据分布,迁移到其他架构需要实测。
  4. Deterministic N-gram hash 存在 collision、polysemy 和 adversarial pattern 风险;context-aware gate 可以缓解,但不能保证完全解决。
  5. System prototype 尚未覆盖 production MoE serving、long context agent workload、KV cache pressure、cache hierarchy 和多节点 offload。

跨论文关系

  • 与已有论文的作者关系:Damai Dai 已在 Math-Shepherd / DeepSeekMoE / DeepSeek-V3 线索中建档;Wangding ZengXingkai YuWenfeng Liang 与 DeepSeek 系列存在强重叠。
  • 与已有论文的主题关系:这篇论文补齐 DeepSeek efficient sparse foundation model 系谱中的 conditional memory 节点,位于 DeepSeek-V3DeepSeek-V4 之间。
  • 与已有论文的方法或系统关系:继承 DeepSeek-V2 的 MLA / DeepSeekMoE 效率路线,Muon 背景可连接 2606.04662;长上下文收益与 Dynamic Linear AttentionMiniMax-M1 和 DeepSeek-V4 构成长上下文架构对照。
  • 跨论文关系定位:记录 DeepSeek Engram / Conditional Memory 节点,并连接 DeepSeek-V2/V3/V4、MoE expert parallelism、pretraining scaling、long-context architecture 和 memory hierarchy。

Reference Intake Brief

Target

  • Intended target system: 新增 Engram / conditional memory 独立论文笔记。
  • Existing related assets: content/utility/papers-index.mdDeepSeek-V2DeepSeek-V3DeepSeek-V4Muon theory
  • Proposed form: 新建独立 Markdown 文档,并更新 content/utility/papers-index.md

Reusable Elements

  1. Conditional memory vs conditional computation 的 sparse scaling 语言。
  2. Hashed N-gram lookup + context-aware gating + deterministic prefetch 的模型/系统协同设计。
  3. iso-parameter / iso-FLOPs / iso-active / iso-loss 的实验审计框架。

Risks

  • Copyright/over-copying: 只保留核心机制、表格数值和本地分析,不复制长段原文。
  • Unsourced or unverifiable claims: 所有关键数值来自 arXiv v1 / TeX source / official GitHub;外部影响判断只作本地关系分析。
  • Tone/brand mismatch: 避免把 DeepSeek 官方 claim 写成行业定论。
  • Safety/compliance issues: 这是一篇模型架构与系统效率论文,无直接双用途操作细节。
  • Overlap with existing assets: 与 DeepSeek-V2/V3/V4、Muon、长上下文系统强重叠,本条定位为 conditional memory 专门节点。

Skipped

Material Reason
公开 reviewer comments 未发现 OpenReview/ARR/会议公开审稿页,无法可靠匹配公开 review。
全量作者建档 多数作者缺少稳定个人 profile / X 交叉证据;本轮只复用 Damai Dai 既有档案,其余记录为 needs-follow-up。
第三方复现 官方仓库提供 demo 代码,未发现完整第三方复现主结果。

Recommendation

Decision: merge

Why: 这是 DeepSeek efficient sparse architecture 系谱中的关键方法节点,把 MoE 条件计算扩展到可 offload / prefetch 的条件记忆;即使结论仍需外部复验,也值得纳入本地模型架构、长上下文和系统效率图谱。