recurring author

Jiaheng Liu

3 archived notes

Related Notes

按论文归档时间排序,展示该作者在本站已经出现的材料。

归档

Scaling Latent Reasoning via Looped Language Models

Ouro 将同一 Transformer 层栈重复执行,并用熵正则化退出分布与冻结主模型后的专门门控训练分配 token 级计算深度;1.4B 和 2.6B 模型经过 7.7T token 训练后在 MATH500、OlympiadBench 等部分推理评测达到 4B 和 8B 对照的结果,但对照没有统一训练数据与总计算,固定四步之外的任务性能通常下降。

待审阅 2510.25741-scaling-latent-reasoning-looped-language-models Reasoning AnalysisScaling LawsTraining Stability
归档

SMELT: Scaling Laws for Compute Matched MoE Looped Transformers

SMELT 在近似匹配每 token FLOPs、非嵌入参数量与 KV cache 的 MoE 对照中,将中间一半层重复执行两次并以缩窄隐藏维度和增加专家数补偿预算;四规模三稀疏度的独立缩放面拟合估计,在拟合覆盖的十的二十次方至十的二十一次方 FLOPs 区间达到相同验证损失可节省 6.8% 至 18.0% 训练计算,但报告使用专有数据与训练栈且未验证实际时延。

待审阅 2609.01343-smelt-compute-matched-moe-looped-transformers MoE ArchitectureScaling Laws
归档

Part I: Tricks or Traps? A Deep Dive into RL for LLM Reasoning

在同一训练框架下、覆盖范围并不完全重合的 Qwen3 4B/8B Base 与对齐后数学强化学习实验中分别检查优势归一化、概率比裁剪、损失聚合和超长过滤,并将组内均值—批级标准差归一化与 token 级损失组成不训练价值模型的 Lite PPO;OpenReview 补充的一个 Qwen3 8B Base 三随机种子设置仍优于 GRPO 与 DAPO,但奖励范围异常、计算量未对齐和有限模型任务覆盖限制普适结论。

待审阅 2508.08221-tricks-or-traps-lite-ppo RL AlgorithmReasoning RLTraining Stability