阅读笔记
Scaling Latent Reasoning via Looped Language Models
Ouro 将同一 Transformer 层栈重复执行,并用熵正则化退出分布与冻结主模型后的专门门控训练分配 token 级计算深度;1.4B 和 2.6B 模型经过 7.7T token 训练后在 MATH500、OlympiadBench 等部分推理评测达到 4B 和 8B 对照的结果,但这些对照没有统一训练数据与总计算,固定四步之外的任务性能通常下降,现有证据主要支持参数量与解码 KV cache 效率。
所读版本 v5, revised 2026 07 01
Source
- Workflow version: v2.1
- Material type: research-paper
- Analysis modules: experiment, system, theory, model-report, safety
- Canonical source: https://arxiv.org/abs/2510.25741v5
- Title: Scaling Latent Reasoning via Looped Language Models
- Authors: Rui-Jie Zhu, Zixuan Wang, Kai Hua, Tianyu Zhang, Ziniu Li, Haoran Que, Boyi Wei, Zixin Wen, Fan Yin, He Xing, Lu Li, Jiajun Shi, Kaijing Ma, Shanda Li, Taylor Kergan, Andrew Smith, Xingwei Qu, Mude Hui, Bohong Wu, Qiyang Min, Hongzhi Huang, Xun Zhou, Wei Ye, Jiaheng Liu, Jian Yang, Yunfeng Shi, Chenghua Lin, Enduo Zhao, Tianle Cai, Ge Zhang, Wenhao Huang, Yoshua Bengio, Jason Eshraghian
- Responsible organization: ByteDance Seed, UC Santa Cruz, Princeton University, Mila - Quebec AI Institute, University of Montreal, Peking University, Carnegie Mellon University, University of Pennsylvania, Conscium, University of Manchester, M-A-P
- arXiv: https://arxiv.org/abs/2510.25741v5
- PDF: https://arxiv.org/pdf/2510.25741v5
- TeX source: https://arxiv.org/src/2510.25741v5
- Code/Project: https://ouro-llm.github.io
- Submitted: 2025-10-29
- Published / updated: arXiv v5, 2026-07-01
- Current version read: arXiv v5
- Version / revision read: v5, revised 2026-07-01
- Accessed: 2026-09-04
- Key figure decision: omit
- Key figure rationale: 共享层栈、退出分布、两阶段门控目标和训练阶段可以由公式与表格逐项复述;总览图没有提供不可替代的实验数值或成立边界。
- Review status: page-type=not-found; match-confidence=high; observed-at=2026-09-04; venue-status=unknown
- Subjects: Computation and Language (cs.CL)
论文作者块以 * 标出十位核心贡献者,以 † 标出 Rui-Jie Zhu、Ge Zhang、Wenhao Huang 和 Jason Eshraghian 四位通讯作者;贡献声明另将 Rui-Jie Zhu、Zixuan Wang、Kai Hua 和 Ge Zhang 列为项目负责人。本文按作者块记录逐人机构,不用贡献声明推断额外机构。
作者与关系
- Rui-Jie Zhu:ByteDance Seed、UC Santa Cruz;核心贡献者、项目负责人、通讯作者。
- Zixuan Wang:ByteDance Seed、Princeton University;核心贡献者、项目负责人。
- Kai Hua:ByteDance Seed;核心贡献者、项目负责人。
- Tianyu Zhang:Mila - Quebec AI Institute、University of Montreal;核心贡献者。本地存在同名作者档案,机构不一致且该档案要求显式匹配,因此不建立链接。
- Ziniu Li:ByteDance Seed;核心贡献者。
- Haoran Que:ByteDance Seed、Peking University;核心贡献者。
- Boyi Wei:Princeton University;核心贡献者。
- Zixin Wen:ByteDance Seed、Carnegie Mellon University;核心贡献者。
- Fan Yin:ByteDance Seed;核心贡献者。
- He Xing:M-A-P;核心贡献者。本地已有档案将
He Xing记作另一作者的别名,本文缺少身份合并证据,因此不建立链接。 - Lu Li:University of Pennsylvania。
- Jiajun Shi:ByteDance Seed。
- Kaijing Ma:ByteDance Seed。
- Shanda Li:ByteDance Seed、Carnegie Mellon University。
- Taylor Kergan:UC Santa Cruz、Conscium。
- Andrew Smith:UC Santa Cruz、Conscium。
- Xingwei Qu:ByteDance Seed、University of Manchester。
- Mude Hui:UC Santa Cruz。
- Bohong Wu:ByteDance Seed。
- Qiyang Min:ByteDance Seed。
- Hongzhi Huang:ByteDance Seed。
- Xun Zhou:ByteDance Seed。
- Wei Ye:Peking University。
- Jiaheng Liu:M-A-P。本地存在同名作者条目,本文机构与已有记录不同,因此不建立链接。
- Jian Yang:M-A-P。
- Yunfeng Shi:M-A-P。
- Chenghua Lin:University of Manchester。
- Enduo Zhao:M-A-P。
- Tianle Cai:ByteDance Seed。
- Ge Zhang:ByteDance Seed;核心贡献者、项目负责人、通讯作者。
- Wenhao Huang:ByteDance Seed;通讯作者。
- Yoshua Bengio:Mila - Quebec AI Institute、University of Montreal。
- Jason Eshraghian:UC Santa Cruz;通讯作者。
archive-core 复用 Ziniu Li、Tianle Cai 和 Ge Zhang 的已有 profile,没有新建或扩充作者档案。
论文脉络
1. 研究问题、背景和价值
显式思维链通过生成更多 token 增加测试时计算,标准 Transformer 则主要通过增加独立层和参数获得更深计算。论文研究另一条路径:在不随执行深度增加参数量的条件下,重复使用同一个 Transformer 层栈,让隐藏状态在潜空间中迭代更新;同时学习不同 token 所需的执行次数。这个问题同时涉及模型参数占用、训练稳定性、推理缓存和“重复计算究竟增加知识存储还是改善已有知识的组合”四个层面。
2. 已有解决方案与不足
Universal Transformer、recurrent-depth Transformer、PonderNet 和连续潜在思维方法已经证明共享权重的重复执行可以增加有效深度。已有研究多集中于小规模模型、固定循环次数或偏向较早退出的先验,缺少万亿 token 级预训练、token 级自适应深度以及与知识存储和知识组合相关的受控证据。参数相同的循环模型还会执行更多 FLOPs,因此仅按参数量比较不能判断架构是否具有计算效率优势。
3. 作者可能的思考路径
以下为本地分析。若重复执行同一组参数,模型的权重容量保持不变,但隐藏状态可以多次经过同一变换;由此可以把模型能力拆成“参数保存多少原子事实”和“推理时如何检索、组合这些事实”。训练层面随之出现两个问题:各循环步都要收到足够监督,退出门又不能集中到最后一步;部署层面则需要避免为每个循环步长期保存一套 KV cache。论文据此把模型、门控、训练配方、受控任务与缓存策略组成一条验证链。
4. 核心假设或切入点
核心假设是,权重共享允许模型以更多顺序计算换取更深的隐藏状态更新,因而可以在固定参数量下改善知识组合;不同 token 的边际收益不同,退出概率可以从各步预测损失和相邻步损失改善中学习。该判断要求各循环步的表示保持可训练,运行深度与训练深度相容,并且额外 FLOPs、串行时延和缓存成本在目标部署中可以接受。
5. 贡献全景与方法总览
首要贡献是将整组因果 Transformer 层作为共享计算块重复执行,并为每个 token 学习离散退出深度。辅助贡献包括 7.7T token 的分阶段稳定训练、冻结语言模型后的专门退出门训练、解码期 KV cache 压缩,以及关于知识容量、知识组合、缩放规律、图可达性和潜在状态一致性的分析。
端到端执行链如下:
- 输入与共享层栈:token embedding 进入包含 24 或 48 个物理层的稠密 Transformer;同一完整层栈依次执行最多四次,每次接收上一步隐藏状态并产生一组中间 logits。
- Stage I 联合预训练:语言模型参数与退出门共同更新;各步交叉熵按退出分布加权,熵正则维持多个深度的训练信号。Stage 1a 曾使用八步,出现 loss spike 和梯度振荡后,后续阶段固定为四步。
- 模型分支与能力训练:24 层路径形成 Ouro-1.4B;另一条路径把层复制到 48 层形成 Ouro-2.6B。两者依次完成稳定预训练、持续训练退火、64K 长上下文训练和中期训练,累计约 7.7T token;随后用 830 万条样本执行推理 SFT,得到对应的 Ouro-Thinking。
- Stage II 专门门控:冻结语言模型,用相邻循环步的逐 token 预测损失改善生成继续/退出软标签,只更新退出门;输出是更集中于有效停止点的退出分布。
- 推理与缓存:Q-exit 根据退出概率累计值选择首个越过阈值的循环步;prefill 仍需各步独立 KV,decode 可以只保存最后一步 KV,把四步缓存缩减为一份。
- 证据链:通用与推理基准检验模型结果;Capo、Mano 和合成多跳问答区分知识存储与知识组合;小规模缩放实验测量共享参数的损失;图可达性定理给出表达能力上界;HEx-PHI 和 Quora probing 检查安全与中间决策变化。
这里的 Ouro Base 是 7.7T token 预训练后的基础模型,Ouro-Thinking 是其推理 SFT 版本;物理层数 是参数中独立层的数量,有效执行深度 是物理层数乘实际循环次数。以四步推理计,1.4B 与 2.6B 分别执行 96 和 192 次 Transformer block,但参数仍只保存 24 和 48 个物理层。这个统计是依据论文结构的本地计算,不代表论文测得的时延或 FLOPs。
模型摘要如下:
| Field | Value |
|---|---|
| Architecture | 稠密 decoder-only Looped Language Model;完整 Transformer 层栈共享权重并重复执行 |
| Total Parameters | Ouro-1.4B:1.4B;Ouro-2.6B:2.6B |
| Activated Parameters | 未单独披露;稠密结构在每个循环步执行完整层栈 |
| Number of Layers | Ouro-1.4B:24;Ouro-2.6B:48 |
| Number of Dense Layers | Ouro-1.4B:24;Ouro-2.6B:48 |
| Attention-Layer Composition | 每层使用 MHA |
| Model Hidden Dimension | 2048 |
| Attention Hidden Dimension | 未单独披露 |
| Number of Attention Heads | 未披露 |
| FFN | SwiGLU;隐藏维度未披露 |
| Vocabulary Size | 49,152,复用 SmolLM2 tokenizer |
| Context Length | 训练序列长度依次为 4K、16K、64K 和 32K;部署最大上下文未单独披露 |
| Attention Mechanism | MHA、RoPE、sandwich RMSNorm |
| Quantization | 未披露 |
| Modality | 文本 |
6. 共享层栈把参数深度转换为重复执行深度
对输入序列嵌入,论文先定义由
7. 两阶段目标先维持深度覆盖,再学习停止位置
每个循环步的线性门从最终隐藏状态生成瞬时退出概率
由此得到第一次在第
Stage I 要解决退出分布集中到最后一步后,浅层循环失去训练信号的问题。它最小化各步语言模型损失的期望,并奖励较高的退出分布熵:
Stage II 要把“更多循环是否仍能降低预测损失”转成门控标签。语言模型被冻结,相邻步的 detached 逐 token 损失改善定义为:
推理时,Q-exit 选择累计退出概率首次达到阈值
减小
8. 分阶段训练解决深循环稳定性并形成两个模型规模
Stage 1a 用 24 个物理层和最多八次循环训练 3T token,出现 loss spike 与梯度振荡。Stage 1b 将循环上限降到四步,再训练 3T token;1.4B 路径保留 24 层,2.6B 路径通过层复制扩展到 48 层。后续 CT annealing、LongCT 和 mid-training 分别使用 1.4T、20B 和 300B token,序列长度从 16K 扩到 64K 后在中期训练设为 32K。训练同时把门控正则系数从 0.1 降至 0.05,并把 batch 从 400 万 token 增至 800 万 token。
Stage 1 数据以 Nemotron-CC 和 MAP-CC 为主,并加入代码、数学和中文数据;SmolLM2 tokenizer 缺少中文词表,论文从 Stage 2 起移除中文。Stage 4 的 300B 有效 token 由 182B 问答/思维链混合中抽样 90B,加上 Stage 1 的 30B replay 和 Stage 2 的 180B replay 构成。推理 SFT 使用约 830 万条数学、代码、科学与对话样本,训练两轮。训练语料均来自公开数据集,但论文没有披露训练硬件、总 FLOPs、去重实现和全部数据处理代码。
论文还尝试在 DAPO-17K 上使用 DAPO 与 GRPO。动态退出与 vLLM/SGLang 固定执行路径不相容;用四步生成 token、再按较早深度计算更新损失会产生 off-policy 深度错配。固定四步 RL 可以稳定训练,但没有超过 SFT checkpoint。现有 Ouro-Thinking 结果因此来自 SFT,不包含已证明有效的 RLVR 增益。
9. 受控任务把知识容量与知识组合分开
Capo 合成传记实验用 1M–40M 参数模型记忆 2 万至 50 万人的五项属性,并在 1000 次数据暴露后估计每个参数保存的知识位数。循环与未循环模型都约为每参数 2 bit,支持“增加循环次数不会增加参数中的事实存储容量”这一窄结论。
Mano 模运算任务要求模型组合模 23 的加减乘规则与表达式树结构。相同参数下,2、3、6 层循环模型在三个表达式长度上均高于各自未循环版本;部分设置达到或超过 12 层等 FLOPs 对照。合成三跳问答进一步固定训练 token,并改变唯一问答样本比例;6 层、2 或 4 次循环的模型通常以更少唯一样本达到较高准确率。两项实验共同支持循环结构在这些合成分布上提供知识组合和样本效率归纳偏置。Mano 的超参数扫描报告最佳结果,合成多跳实验存在随机波动,二者不能直接解释开放域基准差异。
理论部分给出一个存在性构造:把上下文图邻接矩阵作为输入,在隐藏维度
10. 结论链条
论文从“固定参数可以重复执行”出发,用退出分布和两阶段门控把循环深度变成 token 级变量;7.7T token 分阶段训练证明这一结构可以扩展到 1.4B 和 2.6B 稠密模型。基准结果显示四步模型在数学与部分通用任务上达到更大对照的分数,受控合成任务进一步把收益收窄到知识组合与样本效率。与此同时,等设置小模型中未共享参数的 Transformer 始终更高、四步之外多数任务下降、硬件时延未测,因此最稳健的结论是:循环提供了参数量—顺序计算的交换机制,并在已测任务上改善参数效率;它尚未建立相同训练计算下的普遍优势或稳定的训练深度外扩展。
关键实验/定理
结果 1:四步 Ouro 在部分推理任务达到 4B 与 8B 对照
- 设置:Ouro Base 经过 7.7T token 训练;Ouro-Thinking 再用 830 万条样本执行两轮 SFT。Base 使用 lm-eval-harness/evalplus;Thinking 使用统一的内部 harness、LLM 裁判、
temperature=1.0和top_p=0.7。 - Baseline:Qwen2.5、Qwen3、Gemma3、Llama3 系列 Base,以及 Qwen3 与 DeepSeek-Distill-Qwen Thinking 模型。
- 指标:多项选择准确率、代码 pass rate、AIME pass@1/pass@10 和推理基准裁判分数。
- 结果:Ouro-1.4B Base 的 GSM8K/MATH500 为 78.92/82.40,Qwen3-4B 为 72.86/59.60;Ouro-2.6B Base 的 MMLU-Pro/MATH500 为 55.73/90.85,Qwen3-8B 为 53.72/62.30。Ouro-2.6B-Thinking 的 OlympiadBench/BeyondAIME 为 76.4/39.0,Qwen3-8B 为 75.3/38.0;其 AIME25 pass@1/GPQA 为 50.3/52.7,低于 Qwen3-8B 的 66.7/59.1。
- 对照是否可比:同类评测尽量使用统一 harness,但模型训练 token、数据配方、tokenizer、后训练和总 FLOPs 均不同;参数量对齐,训练计算未对齐。
- 未披露项:训练硬件、总训练 FLOPs、置信区间、多随机种子和内部裁判的完整实现。
- 证据定位:Sections 5.1–5.2, Tables 7–9; Appendix C, Tables 15–16, https://arxiv.org/pdf/2510.25741v5
- 支持的最窄结论:四步 Ouro 在已报数学与部分通用、科学推理指标上达到或超过 4B/8B 对照,同时在知识、代码和其它推理指标上仍有差距。
- 解读:结果证明大型 LoopLM 可以训练并具备较高参数效率;跨配方比较不能把差值单独归因于循环结构。
结果 2:收益集中在训练深度附近,专门退出门改善平均步数—准确率曲线
- 设置:Base 与 Thinking 模型固定执行 1–8 步;训练最大深度为四步。MMLU 另比较固定深度、隐藏状态差阈值、Stage I 门和 Stage II 专门门。
- Baseline:同一 checkpoint 的不同固定深度及三种早退策略。
- 指标:任务准确率,以及 MMLU 在不同平均退出步数下的准确率。
- 结果:Ouro-1.4B Base 的 MMLU 从一步 41.21 提高到四步 67.45,八步降至 64.49;Ouro-2.6B-Thinking 的 AIME24 在三步为 70.33、四步 64.70、八步 39.00。MMLU 平均约 2.5 步时,专门门约为 66%,Stage I 门约为 64%;隐藏状态差启发式通常落后专门门约 1–2 个百分点。
- 对照是否可比:深度曲线复用相同权重,能够隔离执行步数;早退实验只有 MMLU,且横轴是平均步数而非硬件成本。
- 系统条件:未报告 batch、硬件、kernel、吞吐、时延或门控开销。
- 证据定位:Sections 5.3–5.4.1, Tables 10–13, Figure 4, https://arxiv.org/pdf/2510.25741v5
- 支持的最窄结论:四步训练的模型从一步增加到三至五步通常获益,继续增加到六至八步时多数任务下降;专门门在 MMLU 上优于已测早退基线。
- 解读:自适应退出能够减少平均 block 执行次数,训练深度之外的测试时计算扩展尚不稳定。
结果 3:解码只保留最后一步 KV 可将四份缓存缩减为一份
- 设置:四步 Ouro-1.4B Base 在 GSM8K 与 MATH500 上比较完整四步 KV、第一步 KV、最后一步 KV 和四步平均 KV;论文另测试 prefill 跨步复用。
- Baseline:每个循环步保留独立 KV 的完整缓存。
- 对照是否可比:各策略复用同一模型、任务和四步解码设置,只改变持久化的 KV 内容;论文没有说明数值是否来自多次独立运行。
- 指标:任务准确率与缓存份数折算的内存缩减倍数。
- 指标定义:内存缩减倍数按四步各存一份 KV 的完整缓存归一化;它不是端到端峰值显存或硬件实测值。
- 结果:完整缓存为 78.92/82.40;仅最后一步为 78.85/80.40,缓存内存缩减四倍;平均 KV 为 78.73/78.52;仅第一步降至 18.73/8.43。prefill 复用导致 GSM8K 下降超过 10 分,因此仍需四份步级缓存。
- 系统条件:结果属于解码期 KV 内容复用;没有报告绝对显存、端到端峰值内存、吞吐或时延。
- 成本归因:内存收益来自只持久化最后循环步的 decode KV;参数显存和每 token 四次共享层栈计算保持不变。
- 证据定位:Section 5.4.2, Table 14, https://arxiv.org/pdf/2510.25741v5
- 支持的最窄结论:在两个数学基准的四步解码中,最后一步 KV 能以小幅准确率变化替代四份步级缓存;该结论不覆盖 prefill 和完整服务成本。
- 解读:缓存实验补足了一个明确部署问题,同时也显示循环步的 KV 表示不可任意互换。
结果 4:合成任务支持知识组合归纳偏置,知识容量保持约每参数 2 bit
- 设置:Capo 用 1M–40M 参数模型、2 万至 50 万组合成人物、1000 次暴露测量事实记忆;Mano 比较不同物理深度与循环次数的模运算表达式;三跳问答改变唯一训练样本比例并固定总训练 token。
- Baseline:Capo 为等参数未循环模型;Mano 与多跳问答同时包含等参数和等 FLOPs 深层 Transformer。
- 指标:每参数知识 bit、Mano 准确率、多跳问答留出准确率和达到完全泛化所需唯一样本量。
- 结果:Capo 中循环与未循环模型均约为每参数 2 bit;Mano 中各等参数循环模型均更高,并在多个设置达到或超过 12 层等 FLOPs 对照;三跳问答中更多循环通常减少所需唯一样本并加快学习。
- 对照是否可比:任务、参数或 token 预算受控;Mano 超参数扫描报告最佳配置,多跳问答四个随机种子的均值仍出现一个等 FLOPs 对照异常。
- 证据定位:Sections 6.1–6.2, Figures 5–6; Appendix B.1–B.5, https://arxiv.org/pdf/2510.25741v5
- 支持的最窄结论:在这些合成分布中,循环没有提高事实存储容量,但改善了规则组合和多跳关系学习的参数或样本效率。
- 解读:这是论文关于“知识组合”最具区分性的证据;它没有控制大型模型基准的数据配方,也没有建立真实任务上的因果中介。
结果 5:小规模缩放实验同时显示可拟合趋势与权重共享损失
- 设置:53M、134M、374M、778M、1.36B 模型分别使用 1、2、4、8 个最大循环步,在 FineWeb-Edu 上训练 20B token;另用约 170M–1.3B 等有效深度模型比较共享与不共享参数。
- Baseline:相同物理宽度、有效深度和训练数据下的标准未共享 Transformer。
- 指标:六项基准平均分、标准模型减循环模型的性能差、总损失和逐步损失的幂律拟合
。 - 结果:所有已测等设置下,标准未共享模型分数更高;性能差随循环步数通常增大,并随模型规模通常缩小。总损失拟合的
为 0.9596;最大步数 2/4/8 的逐步损失拟合分别为 0.8898/0.8146/0.795,部分异常点被排除。 - 对照是否可比:共享与未共享对照使用相同数据和有效深度,适合测量参数共享代价;20B token 与小模型网格不能直接替代 Ouro 主模型训练配方。
- 证据定位:Appendices D–E, Figures 15–24 and Table 17, https://arxiv.org/pdf/2510.25741v5
- 支持的最窄结论:论文给出的幂律在已测网格内能拟合 loss 趋势,同时参数共享相对同深度独立参数模型存在稳定性能损失。
- 解读:缩放律的 subset 检查仍在全部点上计算
,初始拟合值经过调整;它支持局部趋势,不足以预测新的前沿规模或计算最优配置。
用于描述总损失的经验式为:
结果 6:图可达性定理证明表达能力,前提与实际 Ouro 存在明显距离
- 设置:上下文提供邻接矩阵和查询节点;参数保存固定图;构造单层单头循环 Transformer,通过布尔矩阵重复平方更新可达关系。
- 对照是否可比:复杂度表只比较顺序计算步数;各方法的宽度、每步并行工作量和输入表示不同,不能视为总计算量对齐。
- 假设:最大图规模为
,隐藏维度为 ,采用特殊硬阈值归一化,注意力尺度趋于无穷,并预先把图结构编码到权重。 - 结果:直径为
的组合图可达性在 次循环内完成;每轮把可覆盖路径长度从 扩展到 。 - 适用域:这是有限图上的存在性表达构造;不覆盖有限尺度 softmax、参数学习、语言建模分布或每轮全局注意力成本。
- 证据定位:Section 6.3, Theorem 1; Appendix B.6, Theorem 2 and proof, https://arxiv.org/pdf/2510.25741v5
- 支持的最窄结论:共享单层 Transformer 在所列假设下能用对数次循环实现并行可达性闭包。
- 解读:定理解释重复关系组合为何具有表达潜力,不能作为 Ouro 大模型基准收益的直接因果证明。
结果 7:安全与中间决策实验属于窄范围行为证据
- 设置:HEx-PHI 含 330 条、11 类禁止内容,由 GPT-4o 给出 1–5 harmfulness;另在 1000 条 Quora 问题对上训练线性 probe,读取各循环步的二分类决定。
- Baseline:HEx-PHI 比较不同循环步及 Qwen3 Thinking;Quora 比较 Qwen3-4B-Thinking 的早期表示与 Ouro 的跨步表示。
- 对照是否可比:同一数据集内使用共同评价口径;模型规模、后训练数据和生成长度不同,PCA、probe 与最终行为也不是同一指标。
- 指标:最高 harmfulness 等级占比、PCA 可分性、probe ROC AUC 和不同循环步标签一致数量。
- 结果:四步 Ouro-1.4B/2.6B-Thinking 的 harmful rate 为 0.009/0.003,Qwen3-4B-Thinking 为 0.009;在 Quora 中,Ouro 第二步与第四步仅 361/1000 个标签一致,第二步与第三步为 551/1000,而 Qwen3-4B-Thinking 的早期 probe 对最终答案 ROC AUC 达 0.99。
- 威胁模型:只覆盖 HEx-PHI 提示攻击与 GPT-4o 裁判定义的直接有害输出,不覆盖越狱适应性、工具调用或真实部署行为。
- 披露边界:论文明确说明不能干预潜在推理过程,因此 faithfulness 使用观测代理;本文不保存有害操作细节。
- 证据定位:Section 7, Figures 7–8, https://arxiv.org/pdf/2510.25741v5
- 支持的最窄结论:已测 HEx-PHI 上更深循环与较低有害率相关,Quora 中训练深度内的中间决定会改变;这些结果不证明潜在过程具有因果或程序正确性。
- 解读:PCA 和 probe 说明表示与输出之间存在可预测关系;因果忠实性仍需隐藏状态干预实验。
局限
- 主表按参数量比较模型,训练 token 从 2T 到 36T 不等,数据质量、tokenizer、架构、后训练和总 FLOPs 均未统一。Ouro 每 token 重复执行完整层栈,参数优势不能直接转换为训练计算或时延优势。
- 主模型只进行一次大规模训练,论文没有报告多随机种子、置信区间、完整训练硬件、总 FLOPs 和消融后的独立大规模复验。较小学习率、较大 batch、层复制和数据阶段与循环结构共同变化。
- Stage 1a 的八步训练出现 loss spike 和梯度振荡,最终模型在四步附近达到任务峰值;六至八步普遍下降。训练深度外的额外计算不是稳定的能力扩展轴。
- 自适应退出只在 MMLU 上给出准确率—平均步数曲线,没有真实时延、吞吐、尾延迟和按 token 动态执行的 runtime 测量。RLVR 与现有 vLLM/SGLang 执行路径的冲突仍未解决。
- 四倍 KV cache 缩减只适用于 decode 阶段;prefill 仍需每步缓存。论文没有报告完整峰值显存,也没有验证长上下文和大 batch 下的收益。
- “知识组合优于知识存储”主要来自 Capo、Mano、合成多跳问答和事后划分的 MMLU 类别。Mano 取超参数扫描最佳值,多跳实验存在随机异常,结果尚未在真实知识图谱或受控自然语言分布上复验。
- 缩放律主要拟合 20B token 小模型网格,subset 外推的评价口径包含拟合点,逐步损失还排除了异常值;它没有给出计算最优前沿或主模型规模外的可靠预测区间。
- 图可达性定理依赖邻接矩阵输入、宽度随图规模增长、硬阈值归一化和无限注意力尺度;顺序复杂度没有包含每轮注意力的二次工作量。该构造与可学习的有限精度 Ouro 之间缺少映射实验。
- HEx-PHI 只有 330 条提示并依赖 GPT-4o 裁判;Quora probing 没有对潜在状态做干预。安全改进、潜在决策变化与因果忠实性之间的关系尚未验证。
- 论文提出内建投机解码、预先安全检查和 anytime generation 等部署方向,但没有报告接受率、回滚开销、端到端加速或干预实验;逐步期望损失单调下降也没有由训练目标直接保证。
跨论文关系
- 与已有论文的作者或机构关系:Ziniu Li、Tianle Cai 和 Ge Zhang 也是 OTB 作者;Ge Zhang、Jiaheng Liu 与 Wenhao Huang 也参与 SMELT。Ouro 与 SMELT 均包含 ByteDance Seed 和 M-A-P 作者关系。
- 与已有论文的主题关系:与 SMELT 都研究共享权重的重复深度。Ouro 聚焦稠密整栈循环、token 级早退和推理行为;SMELT 使用 MoE 补偿循环造成的参数预算变化,并在近似匹配 FLOPs、参数量与 KV cache 的条件下拟合缩放面。
- 与已有论文的方法或系统关系:Ouro Appendix D 延续 Kaplan Scaling Laws 与 Chinchilla 的幂律形式,把最大循环步数加入 loss 模型;它没有像 SMELT 那样使用实测每 token FLOPs 建立计算坐标,因此两者回答的是局部 loss 趋势与计算匹配效率两个不同问题。
主要启发
1. 共享参数的收益需要分开报告参数容量、顺序计算和硬件成本
Capo 显示循环与未循环模型都约为每参数 2 bit,Mano 和三跳问答则显示同一参数经过重复执行后能够更有效地组合已存信息;Appendix D 同时显示,相同有效深度下,独立层参数的标准 Transformer 始终高于共享参数模型。这组三向证据把循环结构的作用限定为参数容量、有效深度和训练归纳偏置之间的交换关系,并说明“参数更少达到相近分数”只覆盖其中一个资源维度。
可迁移关系是:共享模块重复执行的系统需要分别测量静态参数、每次调用成本、顺序依赖、状态缓存和任务结果。应用到循环视觉网络、迭代检索或共享专家时,可证伪预测是:按参数量观察到的优势会在固定总 FLOPs 或真实时延后缩小,而需要重复组合同一规则的任务仍可能保留样本效率优势。该判断的边界来自 Ouro 的合成任务和 SMELT 以外尚缺少同数据、同计算的大规模比较。
2. 动态深度的训练目标需要与运行时执行路径共同设计
Ouro 的 Stage I 用熵正则保持各深度可用,Stage II 冻结主模型并按边际 loss 改善训练退出门;Section 5.4 的 Figure 4 显示专门门可以在相同 MMLU 平均步数下提高准确率,Section 4.5 记录的 RLVR 实验则显示固定深度生成与较早深度更新之间会出现 off-policy 错配,现有 serving runtime 的固定执行路径也无法直接承载 token 级动态深度。门控目标、rollout、缓存和 batch 调度因此共同决定自适应计算是否可用。
抽象关系是:条件计算策略只有在训练采样、损失归因和部署执行使用同一个条件路径时,才形成一致的优化对象。迁移到早退网络、MoE 动态路由或分层 speculative decoding 时,可证伪预测是:若训练更新所对应的路径与实际生成路径不同,离线门控质量可能提高而端到端任务结果不改善;统一动态路径后,这一差距应缩小。Ouro 目前只验证了 SFT 后的 MMLU 平均深度曲线,尚未完成 RLVR 与实际 runtime 的联合验证。